p99 = Tail Latency: Das langsamste 1 % der Requests braucht 3s. Der erste Zug ist, zu messen und aufzuschlüsseln, nicht zu raten. Vergleiche p50 vs. p99 — wenn p50 schnell ist, aber p99 bei 3s liegt, ist der Pfad nicht gleichmäßig langsam; etwas beißt nur unter Last oder in Edge Cases zu (Pool-Sättigung, GC-Pausen, N+1, kalter Cache, ein ungetimeter externer Call).
p99 ist die , nicht die durchschnittliche Wartezeit — den Durchschnitt zu beschleunigen bringt dem Kunden, der ganz hinten feststeckt, gar nichts.
