Analyzer เตรียมข้อความโดยเปลี่ยนเป็น token ซึ่งเป็นหน่วยที่มักเป็นคำและใช้จับคู่ภายหลังได้
ดูแต่ละการแปลง
สำหรับ pipeline ที่ตั้งใจให้ลบ HTML แยกคำและเปลี่ยนเป็นตัวพิมพ์เล็ก:
text
<b>Blue Shoes</b>
-> Blue Shoes
-> [Blue, Shoes]
-> [blue, shoes]
- Character filter ลบ HTML ก่อนแยกคำ
- Tokenizer แยกข้อความเป็นคำ
- Token filter เปลี่ยนคำเป็นตัวพิมพ์เล็ก
Token สุดท้ายอธิบายว่าทำไม ตัวพิมพ์เล็กจึงจับคู่ข้อมูลเดิมได้ นี่คือตัวอย่างปรับแต่ง ไม่ใช่ analyzer ทุกตัวลบ HTML
