ai_explainer_worthy1 de septiembre de 2026Edición #101

Nvidia suelta DeepSeek V4 en FP4 — 37B params, la mitad de tamaño, calidad de 70B

Nvidia está liberando una versión cuantizada de DeepSeek V4 Pro bajo el nombre de Hugging Face DeepSeek-V4-Pro-0813-NVFP4. El modelo tiene 37 mil millones de parámetros y corre en punto flotante de 4 bits (FP4). La promesa es que entrega rendimiento similar a un modelo de 70B pero con mucha menos memoria y compute.

La cuantización es uno de esos moves que transforma los modelos open grandes de curiosidades de lab a algo que de verdad puedes correr. Un modelo de 800B necesita rack entero de servidor; 37B en FP4 cabe en una sola GPU. Eso abre un mundo de inferencia para shops y tinkerers que no tienen presupuestos de datacenter — los setups que corren en una 4090 o dos.

La participación de Nvidia es notable por sí misma. La compañía está empujando NVFP4 como su próximo formato de cuantización y lo está poniendo en Hugging Face para que cualquiera lo use. El modelo en sí lo desarrolló DeepSeek, no Nvidia, así que esto es un release estilo partnership más que un modelo first-party.

Por qué nos importa: los modelos open que de verdad caben en una GPU son los que shops chicos, orgs locales y devs de side-hustle pueden correr sin estar pidiendo créditos de cloud.

800B necesita un rack. 37B en FP4 cabe en una 4090 — esa es la diferencia entre un lab toy y algo que de verdad puedes correr.

arxiv.org

Lee el originalAbrir en pestaña nueva
#quantization#fp4#deepseek#nvidia#open_models

Boletín diario · sin spam

Recibe el diario en tu puerta

Un correo corto al día — IA, tecnología y lo que significa para nuestras comunidades. Lenguaje claro, mirada cultural, sin jerga de Silicon Valley.