p99 = tail latency : le 1 % de requêtes les plus lentes prennent 3 s. Le premier réflexe est de mesurer et décomposer, pas de deviner. Comparez p50 et p99 — si p50 est rapide mais p99 est à 3 s, le chemin n'est pas uniformément lent ; quelque chose ne mord que sous charge ou dans des cas limites (saturation du pool, pauses GC, N+1, cache froid, un appel externe sans timeout).
le p99 est la , pas l'attente moyenne — accélérer la moyenne ne fait rien pour le client coincé au fond.
