p99 = tail latency: el 1% más lento de las peticiones tarda 3s. El primer paso es medir y desglosar, no adivinar. Compara p50 vs p99 — si p50 es rápido pero p99 es 3s, la ruta no es uniformemente lenta; algo muerde solo bajo carga o en casos límite (saturación del pool, pausas de GC, N+1, cache fría, una llamada externa sin timing).
p99 es la , no la espera media — acelerar la media no hace nada por el cliente atascado al final.
