Las peticiones batch le ganan a mil viajes — un solo tiro al modelo
El post de Ankit Rana es una nota corta sobre un patrón práctico con las APIs de LLM: mandás una sola petición batch que cubre un pedazo de trabajo en vez de disparar mil llamadas separadas. El modelo procesa el batch en un solo round trip, lo que ahorra latencia, corta el costo y reduce la superficie para los rate limits. La idea central es simple — si podés estructurar el input para que el modelo maneje varios items a la vez, hacelo.
Esto es del tipo de optimización que separa en silencio las apps de producción de los demos. Cada llamada extra a un LLM es plata real y tiempo real de espera. Cuando el tráfico es pesado, la diferencia entre una llamada y mil es la diferencia entre una app que se siente snappy y una que empieza a timeoutear. El post esboza cómo podrías batchear agrupando queries relacionadas, empacando instrucciones y respuestas en un payload — y después separando el output. Sin frameworks nuevos, sin tricks del modelo, solo mejor batching.
Por qué nos importa: si estás corriendo cualquier side hustle o negocio chiquito que usa AI por debajo, el batching es una de las formas más baratas de mantener los costos bajos y la velocidad alta sin contratar más ingenieros.
“Un solo tiro al modelo le gana a mil — y es gratis.”