La próxima barrera no es el modelo — es el hardware
A16z escribe que la ventaja competitiva de los próximos años no va a venir de modelos más grandes, sino de chips diseñados para correrlos más barato. La tesis es simple: las GPUs actuales —H100, A100— son genéricas y caras. Si alguien diseña un chip específico para la carga de trabajo de inferencia, el costo por token se desploma.
No es nuevo en teoría. Los ASICs de Google para BERT y los TPU de Google para Transformer ya lo mostraron. Lo que cambia hoy es la escala. La inferencia de LLMs consume más potencia que los centros de datos tradicionales. Y los modelos crecen —70B, 170B, 500B— mientras el costo de la GPU se queda atrás. Si tu modelo es el mejor pero tu chip es lento, pierdes.
La pieza de A16z conecta con lo que ya se está moviendo en el mercado: chips como el Groq, los designs de Cerebras, los chips de Tenstorrent y AMD Strix Halo para inferencia local. La carrera no es solo por el modelo — es por la máquina que lo corre.
Why this matters for us: los chips diseñados para lo que hacemos —inferencia rápida, bajo costo— van a bajar el precio de las herramientas que la comunidad usa a diario, y los que no se adapten van a quedarse pagando de más por lo que otros ya tienen más barato.
“La carrera no es solo por el modelo — es por la máquina que lo corre.”