analyzerはテキストをtokenへ変換し、検索に備えます。tokenは後で一致判定できる単位で、多くの場合は単語です。
各変換を見る
HTML除去、単語分割、小文字化を意図的に設定したパイプラインでは、次のようになります。
text
<b>Blue Shoes</b>
-> Blue Shoes
-> [Blue, Shoes]
-> [blue, shoes]
- character filterが分割前にHTMLを除去します。
- tokenizerがテキストを単語に分割します。
- token filterがその単語を小文字化します。
最終tokenを見れば、小文字のshoesが元の入力と一致する理由が分かります。これはカスタム例です。すべてのanalyzerがHTMLを除去するわけではありません。
推測せずに調べる
Kibana Dev Toolsで次のリクエストを実行すると、このパイプラインのtokenが分かります。
