Ya salió GPT-5 Turbo de OpenAI — 60% más barato y la mitad de latencia
OpenAI lanzó esta semana GPT-5 Turbo. Es el sucesor de GPT-4 Turbo y llega con un costo por token cerca del 60% menor y la mitad de latencia de respuesta. La tarifa es de unos $1.50 por millón de tokens de entrada y $6 por millón de tokens de salida — lo que lo pone entre las opciones más asequibles para cualquier shop que haya estado pagando GPT-4 desde los primeros días.
El modelo está construido sobre la arquitectura más reciente de OpenAI y es el nuevo default para la Chat Completions API. Eso significa que todo lo que apunta a gpt-4-turbo puede cambiar sin tocar código, que es lo que la mayoría de los equipos hará primero. También soporta ventanas de contexto de hasta 128K, así que maneja documentos largos y codebases sin las gimnasia de chunking.
El precio es lo que llama la atención, pero la historia real es la caída de latencia. OpenAI está usando un nuevo sistema de routing para enviar peticiones a los servidores correctos, lo que corta el wall-clock time a la mitad en muchos workloads. Para lo que sea que haga streaming de respuesta — un chat UI, un agente, una transcripción en vivo — la diferencia se nota. Para batch processing, los ahorros se compunden.
Por qué nos importa: los modelos en los que confiamos finalmente se están poniendo más baratos sin empeorar, lo que significa que las herramientas que construimos pueden correr más seguido y costar menos — sin vendor lock-in, sin sorpresas en la factura.
“Los modelos se están poniendo más baratos sin empeorar.”