p99 = tail latency: 1% request paling lambat memakan 3s. Langkah pertama adalah mengukur dan memecahnya, bukan menebak. Bandingkan p50 vs p99 — jika p50 cepat tapi p99 3s, jalurnya tidak lambat merata; ada yang menggigit hanya saat beban atau di edge case (saturasi pool, jeda GC, N+1, cold cache, panggilan eksternal tanpa timeout).
p99 adalah , bukan rata-rata tunggu — mempercepat rata-rata tak berbuat apa pun bagi pelanggan yang tersangkut di belakang.
