p99 = tail latency: de traagste 1% van de requests duurt 3s. De eerste zet is om te meten en op te splitsen, niet te gokken. Vergelijk p50 met p99 — als p50 snel is maar p99 3s is, is het pad niet uniform traag; iets bijt alleen onder belasting of in edge cases (pool-verzadiging, GC-pauzes, N+1, cold cache, een niet-getimede externe call).
p99 is de , niet de gemiddelde wachttijd — het gemiddelde versnellen doet niets voor de klant die achteraan vastzit.
