À des centaines de millions d'événements/jour (~quelques milliers/sec, davantage aux pics), le bon choix est de découpler l'ingestion du serving : absorber les écritures dans un log durable, traiter le stream une seule fois, et le distribuer vers deux stores optimisés pour des tâches opposées — pré-agrégé pour les parents (lectures rapides), brut et en pleine fidélité pour le ML.
une salle de courrier — le collecteur reçoit le courrier, Kafka est le tapis roulant, et chaque objet est copié sur deux étagères : un que les parents consultent d'un coup d'œil, et une que l'équipe ML fouille.
