ai_explainer28 de julio de 2026Edición #66

Decodificación especulativa: el draft que acelera tu LLM sin perder calidad

La decodificación especulativa es un truco que hace que un modelo grande responda más rápido sin cambiar su respuesta.

El modelo grande —digamos un Llama 70B— es como un abuelo que piensa cada palabra antes de decirla. Es preciso, pero lento. El truco es meterle un ayudante pequeño (un modelo de 1–3B) que propone los próximos tokens de corrido. El modelo grande recibe la propuesta en un solo batch y verifica cada token a la vez — si uno no le convence, lo rechaza y sigue.

Es como cuando la mamá cocina para toda la familia: ella pone la carne al fuego y los primos cortan las papas al mismo tiempo. No se pisan; cada quien hace lo suyo. El resultado es el mismo plato, pero llega antes a la mesa.

Lo que hace este truco en la práctica: 7–10 tokens por segundo en una sola tarjeta — casi el doble — y, lo mejor, cero pérdida de calidad. Cada token es idéntico al que habría escrito el modelo grande solo; la diferencia es que viaja más rápido.

¿Cómo se activa? Con un flag en llama.cpp: --spec-default y el modelo draft que comparta el mismo vocabulario. En tu caja, el Llama-3.2-1B trabaja con el mismo tokenizer que R1, así que no hay sorpresas.

Lo que vale la pena recordar: el draft no adivina por arte de magia — propone, y el grande corrige. Si el draft se equivoca en un token, el grande lo descarta y sigue adelante. La respuesta final es siempre la del modelo grande, no del draft.

Tip: si tu servicio corre con flags viejos como --draft-max, va a fallar al iniciar. Usa los nombres nuevos — --spec-draft-n-max — o el sistema no arranca.

#explainer#speculative-decoding

Boletín diario · sin spam

Recibe el diario en tu puerta

Un correo corto al día — IA, tecnología y lo que significa para nuestras comunidades. Lenguaje claro, mirada cultural, sin jerga de Silicon Valley.