Goodput le gana a throughput cuando tu LLM es de verdad rápido — no solo está ocupado
Goodput es el throughput de los tokens útiles — los que terminan en la respuesta final. Throughput cuenta todo, incluyendo los tokens que el modelo generó y luego tiró a la basura porque el prompt era muy largo o la respuesta ya estaba completa. Cuando el modelo está chupando tokens pero la mayoría es ruido, el número de throughput se ve increíble y el servicio sigue sintiéndose lento.
El post hace las cuentas: con una ventana de 100k tokens, un solo prompt largo puede consumir 90% de la GPU solo para pasar datos de un lado a otro, mientras que la inferencia real usa una fracción de eso. Ese es el tipo de desperdicio que se nota como alta utilización y baja velocidad real. La solución suele ser compresión de prompts, reuso del KV-cache, o chunking — lo que sea que corte la grasa antes de que llegue a la GPU.
Esto es de esas cosas que suenan obvias cuando las ves, pero nadie escribe sobre ellas hasta que sus latencias se disparan a las 3 AM. Es la diferencia entre un servicio que se ve sano en Grafana y uno que de verdad responde rápido.
Por qué nos importa: cuando estamos pagando por tiempo de GPU o corriendo nuestras propias cajas, goodput es lo que de verdad estamos comprando — y los modelos baratos que se ven increíbles en papel pueden ser los más caros una vez que cuentas los tokens desperdiciados.
“Throughput dice que la GPU está ocupada. Goodput dice que la GPU es útil.”