A centinaia di milioni di eventi/giorno (~qualche migliaio/sec, di più nei picchi) la mossa vincente è disaccoppiare l'ingestione dal serving: assorbi le scritture in un log durevole, elabora lo stream una volta e distribuisci verso due store ottimizzati per lavori opposti — pre-aggregato per i genitori (letture veloci), grezzo e a piena fedeltà per l'ML.
una sala posta — il collector riceve la posta, Kafka è il nastro trasportatore, e ogni elemento viene copiato su due scaffali: una che i genitori scorrono, e un che il team ML scava.
