ai_scams25 de agosto de 2026Edición #94

La atención es la nueva RAM — y se está poniendo cara rápido

Un paper nuevo dice que la forma en que los LLMs procesan el contexto es el cuello de botella de toda la industria. La atención escala cuadráticamente con la longitud de entrada — el doble de tokens, cuatro veces el compute. Eso significa que un transcript de video 4K o un libro de 500 páginas deja al modelo arrastrándose. Los autores proponen patrones de atención sparse que le permiten al modelo tocar solo las partes relevantes del contexto largo, bajando el compute entre 10x y 30x en documentos. No es idea nueva, pero esta es la versión más convincente de por qué importa ahora.

Lo práctico: si estás construyendo sobre un modelo y tu prompt se hace más largo cada semana, te vas a topar con una pared. Los modelos que ganen son los que puedan leer un manual entero sin cobrar $100. Por eso los open-weight models están interesantes — podés meterle una variante de atención sparse y ahorrás plata. Las APIs cerradas no te dejan hacer eso.

Por qué nos importa: si los modelos se vuelven más baratos de correr, los side hustles que dependen de ellos — el primo que escribe listings por $20, la tienda que genera letreros en español/inglés — se escalan en vez de fallar en cada request larga.

La atención es la nueva RAM — y se está poniendo cara rápido.

drive.google.com

Lee el originalAbrir en pestaña nueva
#attention#sparse-attention#llm-cost#open-weight#inference

Boletín diario · sin spam

Recibe el diario en tu puerta

Un correo corto al día — IA, tecnología y lo que significa para nuestras comunidades. Lenguaje claro, mirada cultural, sin jerga de Silicon Valley.