analyzer는 텍스트를 token으로 바꿔 검색을 준비합니다. token은 나중에 일치 여부를 검사할 단위이며, 흔히 단어입니다.
변환 단계 살펴보기
HTML 제거, 단어 분리, 소문자 변환을 의도적으로 설정한 pipeline이라면 다음과 같습니다.
text
<b>Blue Shoes</b>
-> Blue Shoes
-> [Blue, Shoes]
-> [blue, shoes]
- character filter가 분리 전에 HTML을 제거합니다.
- tokenizer가 텍스트를 단어로 나눕니다.
- token filter가 그 단어를 소문자로 바꿉니다.
최종 token을 보면 소문자 shoes가 원래 입력과 일치할 수 있는 이유를 알 수 있습니다. 이는 사용자 지정 예제이며 모든 analyzer가 HTML을 제거하지는 않습니다.
