Nvidia mandó un modelo de 700B que cabe en una sola A100 — y esta vez es real
Nvidia soltó DeepSeek-V4-Pro-0813-NVFP4 en Hugging Face, y hace lo que los modelos grandes llevan prometiendo desde el año pasado: un modelo de 700 mil millones de parámetros que corre de verdad en una sola GPU A100. El truco es NVFP4, un formato comprimido de 4 bits que Nvidia armó para esto. Sin él, el modelo necesita ocho GPUs de 80 GB. Con él, necesitas una sola.
DeepSeek V4 ya era el modelo open-weights más barato de su clase — mejor que Llama 405B en la mayoría de benchmarks, y a una fracción de lo que GPT-4o o Claude 3.5 cobran por token. Ahora la cuantización de Nvidia lo convierte en algo que una tienda pequeña puede alojar de verdad. Un setup con una sola A100 no es juguete; esa tarjeta te sale entre $7k y $10k nueva. Pero es una fracción de un cluster de 8 GPUs y una fracción de las fees de la API en la nube a escala.
Por qué nos importa:
Para los primos que corren negocios chiquitos y las tías que publican en Facebook, esto significa que los modelos que antes vivían en los data centers de Silicon Valley por fin se están moviendo a hardware que cabe en un closet de servidores — y eso cambia quién puede construir con ellos.
“A 700B model that fits in one A100 — that's the shift, not the benchmark.”