vLLM 0.28 — 3.5x más rápido en ARM, más barato de correr
El equipo de vLLM soltó la versión 0.28.0 y la noticia es velocidad. En chips ARM — MacBooks M-series, instancias Graviton, Raspberry Pis — la inferencia ahora corre 3.5 veces más rápido que la versión anterior. Para el Codex CLI de OpenAI, eso se traduce en esperas notablemente más cortas para los completados, especialmente en máquinas que no tienen una GPU grande sentada en el escritorio.
La release también trae mejor soporte para los formatos de cuantización 4-bit más nuevos (AWQ y GPTQ). La cuantización es cómo metés un modelo grande en menos memoria redondeando los pesos a 4 bits. El trade-off es una pequeña caída en calidad, pero los ahorros son reales: modelos que antes necesitaban 80 GB de VRAM ahora corren en tarjetas de 16 o incluso 8 GB. Esa es la diferencia entre un modelo que no podés pagar y uno que anda en la laptop que ya tenés.
Esto es un proyecto mantenido por la comunidad — no es producto de OpenAI — y es el motor detrás de un montón de stacks LLM self-hosted corriendo en garajes y negocios chicos. La optimización ARM es la primera victoria grande para silicon no-x86 en este espacio, lo cual importa porque un montón de gente de la comunidad está construyendo sobre hardware ARM por precio, disponibilidad, o simplemente lo que hay en el cajón. El soporte de cuantización significa que GPUs más viejas pueden servir modelos que antes requerían tarjetas enterprise. Si estás corriendo un negocio chico, un side hustle, o solo un modelo privado en casa, 0.28 es la release que tenés que agarrar.
Por qué nos importa: los modelos por fin están lo suficientemente rápidos para correr en el hardware ARM barato que la mayoría de nosotros usa, así que no tenemos que rentar GPUs cloud caras para hacer el trabajo.
“La victoria ARM es la primera real — modelos que antes necesitaban $100/mes de VRAM en la nube ahora corren en un Mac Mini de $400.”