Nvidia suelta DeepSeek V4 en FP4 — 37B params, la mitad de tamaño, calidad de 70B
Nvidia está liberando una versión cuantizada de DeepSeek V4 Pro bajo el nombre de Hugging Face DeepSeek-V4-Pro-0813-NVFP4. El modelo tiene 37 mil millones de parámetros y corre en punto flotante de 4 bits (FP4). La promesa es que entrega rendimiento similar a un modelo de 70B pero con mucha menos memoria y compute.
La cuantización es uno de esos moves que transforma los modelos open grandes de curiosidades de lab a algo que de verdad puedes correr. Un modelo de 800B necesita rack entero de servidor; 37B en FP4 cabe en una sola GPU. Eso abre un mundo de inferencia para shops y tinkerers que no tienen presupuestos de datacenter — los setups que corren en una 4090 o dos.
La participación de Nvidia es notable por sí misma. La compañía está empujando NVFP4 como su próximo formato de cuantización y lo está poniendo en Hugging Face para que cualquiera lo use. El modelo en sí lo desarrolló DeepSeek, no Nvidia, así que esto es un release estilo partnership más que un modelo first-party.
Por qué nos importa: los modelos open que de verdad caben en una GPU son los que shops chicos, orgs locales y devs de side-hustle pueden correr sin estar pidiendo créditos de cloud.
“800B necesita un rack. 37B en FP4 cabe en una 4090 — esa es la diferencia entre un lab toy y algo que de verdad puedes correr.”