Analyzer 把文本转换为 token,为搜索做准备。Token 是之后可以匹配的单位,通常是一个词。
观察每一步转换
对于明确配置为去除 HTML、分词并转小写的处理流程:
text
<b>Blue Shoes</b>
-> Blue Shoes
-> [Blue, Shoes]
-> [blue, shoes]
- Character filter 在分词前移除 HTML。
- Tokenizer 把文本拆成词。
- Token filter 把这些词转为小写。
最终 token 解释了为什么小写 shoes 能匹配原始输入。这是自定义示例,并非每个 analyzer 都会去掉 HTML。
实际检查,不要猜测
在 Kibana Dev Tools 中,以下请求会显示该流程生成的 token:
