p99 = tail latency: 最も遅い 1% のリクエストが 3s かかる。最初の一手は 推測せず、測定して分解する ことだ。p50 と p99 を比較する — p50 は速いのに p99 が 3s なら、経路は一様に遅いのではなく、何かが 負荷時やエッジケースでのみ 噛みついている(pool の飽和、GC の一時停止、N+1、cold cache、タイムアウト未設定の外部呼び出し)。
メンタルモデル: p99 は であり、平均待ち時間ではない — 平均を速くしても、最後尾で詰まった客には何の意味もない。
