El cambio: los modelos bajan de precio y la infra empieza a agarrar forma
Los big labs siguen soltando modelos más grandes, pero la historia real es la cañería — vLLM, MCP, OpenTelemetry — y Hy4 demostrando que lo open le gana al propietario por un centavo. Mientras tanto, TradeWork hace lo que la gente necesita: jobs, facturas, una sola app. Esto te toca. La infraestructura por fin está alcanzando el hype.
La nueva herramienta de investigación de Anthropic intenta arreglar la seguridad del AI
Anthropic acaba de publicar un paper sobre un asistente de investigación llamado Claude 4 Sonnet que puede leer papers académicos, escribir código y correr experimentos todo por su cuenta. La idea es escalar el tipo de trabajo que hacen los investigadores cuando buscan fallos de alineación en los modelos — encontrar casos borde donde un modelo hace algo que no debería, como mentir sobre sus capacidades o negarse a seguir instrucciones cuando debería.
El sistema está configurado para que el modelo proponga una prueba, escriba el código, la corra, lea los resultados y decida qué intentar después. Lo hace iterativamente, dando vueltas por cientos de intentos, tratando de sacar los fallos que hacen que los modelos sean inseguros o impredecibles. Anthropic dice que este enfoque captura fallos que una sola ronda de testing pasaría por alto.
El panorama grande es que a medida que los modelos se vuelven más capaces, los problemas que pueden tener se hacen más difíciles de encontrar. Ya no puedes sentarte a promptearlos. Necesitas sistemas que puedan razonar sobre qué probar y dar seguimiento a los resultados. Este es uno de los varios labs intentando automatizar ese tipo de trabajo. OpenAI ha estado haciendo algo similar con sus propios agentes de investigación. La pregunta no es si los modelos pueden hacer este trabajo — es quién lo está haciendo, y para qué.
Por qué nos importa: las personas que construyen estos sistemas están decidiendo qué cuenta como un fallo real, y no estamos en la sala cuando hacen esas llamadas.
Nvidia mandó un modelo de 700B que cabe en una sola A100 — y esta vez es real
Nvidia soltó DeepSeek-V4-Pro-0813-NVFP4 en Hugging Face, y hace lo que los modelos grandes llevan prometiendo desde el año pasado: un modelo de 700 mil millones de parámetros que corre de verdad en una sola GPU A100. El truco es NVFP4, un formato comprimido de 4 bits que Nvidia armó para esto. Sin él, el modelo necesita ocho GPUs de 80 GB. Con él, necesitas una sola.
DeepSeek V4 ya era el modelo open-weights más barato de su clase — mejor que Llama 405B en la mayoría de benchmarks, y a una fracción de lo que GPT-4o o Claude 3.5 cobran por token. Ahora la cuantización de Nvidia lo convierte en algo que una tienda pequeña puede alojar de verdad. Un setup con una sola A100 no es juguete; esa tarjeta te sale entre $7k y $10k nueva. Pero es una fracción de un cluster de 8 GPUs y una fracción de las fees de la API en la nube a escala.
Por qué nos importa:
Para los primos que corren negocios chiquitos y las tías que publican en Facebook, esto significa que los modelos que antes vivían en los data centers de Silicon Valley por fin se están moviendo a hardware que cabe en un closet de servidores — y eso cambia quién puede construir con ellos.
800B necesita un rack. 37B en FP4 cabe en una 4090 — esa es la diferencia entre un lab toy y algo que de verdad puedes correr.
— arxiv.org
#nvidia-ships-deepseek-v4-in-fp4-37b-params-half-the-size-70b-quality-2ac135La ventaja de Nvidia ya no es el chip, es el stack
Nvidia ya no vende solo GPUs. Su ventaja se está moviendo al stack alrededor del silicio — CUDA, las librerías de software, el software de data center, y las alianzas que atrapan a los clientes en su ecosistema. La ventaja de la compañía se vuelve más difícil de copiar porque ya no es solo hardware; es todo el entorno de desarrollo que los builders llevan años aprendiendo.
Esto importa porque la gente que escribe código para workloads de IA — researchers, startups, enterprises — ya está fluente en las herramientas de Nvidia.
TradeWork: jobs, crews, invoices, and payments — all in one app
La forma vieja es un desastre. Los estimates viven en Notes. Las invoices son PDFs que mandas por email. Las crews se coordinan por texto. Los pagos llegan en check. Los CRMs genéricos están hechos para oficinas, no para trucks. Las apps de trades usualmente le sirven al back office y se olvidan del campo.
TradeWork le arregla eso. Es mobile-first y está hecha para el job site. Creás estimates en el teléfono, asignás crews, y mandás invoices desde la misma pantalla. Los payments se trackean en la app. Las superficies bilingües hacen que el foreman, el helper, y la oficina vean el mismo job — sin doble entrada, sin adivinar.
Es un solo lugar para jobs, crews, invoices, y payments. Menos tiempo en el teléfono. Menos tiempo copiando números de una app a otra. Más tiempo afuera.
Por qué nos importa: los trades mueven nuestros barrios, y las herramientas para ellos tienen que funcionar en el campo, no solo en la oficina.
OpenAI soltó el modelo base más grande que hay en internet
OpenAI publicó los pesos de o1, su modelo de razonamiento más capaz. Tiene 1.4 trillones de parámetros y 256K de contexto. Marca 90% en MATH y 92% en AIME 2024 — benchmarks que antes solo podían tocar los labs de investigación más top. Los pesos están en Hugging Face, así que cualquiera los puede correr, fine-tunear, o construir encima.
Lo importante es lo que esto significa para la carrera de open weights. Los pesos abiertos le permiten a la comunidad hacer forks de los modelos, quitarle los wrappers de seguridad, y meterlos en lugares que las compañías originales nunca pensaron.
vLLM 0.28 — 3.5x más rápido en ARM, más barato de correr
El equipo de vLLM soltó la versión 0.28.0 y la noticia es velocidad. En chips ARM — MacBooks M-series, instancias Graviton, Raspberry Pis — la inferencia ahora corre 3.5 veces más rápido que la versión anterior. Para el Codex CLI de OpenAI, eso se traduce en esperas notablemente más cortas para los completados, especialmente en máquinas que no tienen una GPU grande sentada en el escritorio.
La release también trae mejor soporte para los formatos de cuantización 4-bit más nuevos (AWQ y GPTQ). La cuantización es cómo metés un modelo grande en menos memoria redondeando los pesos a 4 bits. El trade-off es una pequeña caída en calidad, pero los ahorros son reales: modelos que antes necesitaban 80 GB de VRAM ahora corren en tarjetas de 16 o incluso 8 GB. Esa es la diferencia entre un modelo que no podés pagar y uno que anda en la laptop que ya tenés.
Esto es un proyecto mantenido por la comunidad — no es producto de OpenAI — y es el motor detrás de un montón de stacks LLM self-hosted corriendo en garajes y negocios chicos. La optimización ARM es la primera victoria grande para silicon no-x86 en este espacio, lo cual importa porque un montón de gente de la comunidad está construyendo sobre hardware ARM por precio, disponibilidad, o simplemente lo que hay en el cajón. El soporte de cuantización significa que GPUs más viejas pueden servir modelos que antes requerían tarjetas enterprise. Si estás corriendo un negocio chico, un side hustle, o solo un modelo privado en casa, 0.28 es la release que tenés que agarrar.
Por qué nos importa: los modelos por fin están lo suficientemente rápidos para correr en el hardware ARM barato que la mayoría de nosotros usa, así que no tenemos que rentar GPUs cloud caras para hacer el trabajo.
Rosalind de OpenAI: un workbench para testear modelos con tareas reales
OpenAI lanzó Rosalind como un workbench público para evaluar modelos en tareas concretas, no en scores de benchmarks. Le pasás un dataset, corre el modelo y te devuelve resultados estructurados — accuracy, latencia, costo por llamada — para que puedas comparar lo que pasa de verdad en producción.
La setup es simple: subís un JSONL con prompts y outputs esperados, elegís el modelo y le das a run. Loguea cada trace, cachea las llamadas repetidas y te deja diffear resultados entre versiones del modelo. No hay leaderboard ni ranking — solo resultados crudos que podés exportar y compartir con la gente.
Hy4: el modelo open-source que le gana a OpenAI por menos de un dólar
Hy4 es un modelo vision-language de 3 mil millones de parámetros de un equipo chiquito en Suiza, y está haciendo algo que el flagship de $400M de OpenAI no puede permitirse: corre en una sola GPU de consumo y cuesta centavos por llamada a la API. Los investigadores, liderados por Simon Willison, publicaron el modelo y los pesos en Hugging Face bajo una licencia open —sin letra chica, sin vendor lock-in.
Los números son lo que hace esto interesante. Hy4 saca 72.7% en MME-Bench, un benchmark estándar de vision-language. Va 0.3 puntos atrás de GPT-4o, pero a aproximadamente 1/40 del precio. El modelo corre con pesos cuantizados en 4-bit en unos 2.8 GB de VRAM. Lo puedes levantar en una RTX 3080 y procesa imágenes en tiempo real. Para la gente que ya tiene el hardware, el costo marginal es la electricidad.
Esto llega justo cuando la brecha entre los modelos de frontera y lo que un equipo pequeño puede correr localmente se achicó a unos cuantos puntos porcentuales. Hace un mes, los modelos open iban 8–10 puntos atrás. Ahora están lo suficientemente cerca que el diferenciador no es la precisión —es el costo, la privacidad, y la capacidad de correr la cosa tú mismo. Para la familia que maneja una tienda, el primo con su side hustle de fotografía, o cualquier operación que maneja imágenes de IDs, recibos o registros de clientes, la pregunta ya no es si pueden usar AI vision. Es si quieren mandar esas imágenes por la API de alguien más.
Por qué nos importa: la gente que controla los modelos es la misma que puede cobrarte lo que quiera —Hy4 demuestra que podemos correr la misma capacidad en casa, por centavos, sin entregar nuestros datos.
Las big tech están comprando las palas y los picos del ecosistema AI, no los modelos
NextBigTen lleva un tiempo siguiendo la ola de M&A en infraestructura de AI — las empresas que venden las herramientas pick-and-shovel que le permiten a cualquier equipo construir y correr modelos de verdad. El patrón está claro: las plataformas grandes están comprando los data pipelines, los frameworks de evaluación, el tooling de deployment y los SDKs para devs. No los foundation models en sí, sino todo lo que hace que se puedan usar a escala.
Lo que está pasando es que las compañías con más data y los equipos de ingeniería más grandes están consolidando la capa que queda debajo de los modelos.
Grok para diseñadores: el bot que de verdad piensa
Un diseñador llamado Nervegna armó un bot custom sobre Grok — el modelo de xAI — que le ayuda a la gente de producto con el trabajo pesado: bocetar flujos, escribir copy, revisar edge cases. Lo está liberando como una herramienta que los diseñadores pueden apuntar a sus problemas y recibir algo que de verdad sirve.
Es el tipo de setup que muchos equipos están armando ahorita — un prompt + un modelo específico = un asistente que funciona. Grok es directo y sin vueltas, lo cual pega bien cuando necesitas una respuesta rápido en vez de un ensayo de cinco párrafos. El valor real no es el modelo en sí; es el caso de uso acotado, la interfaz limpia, y el hecho de que un diseñador de verdad lo armó para trabajo de verdad.
Por qué nos importa:
Borrowing tools like this is how the comunidad stays ahead — no gatekeeping, no $500/month enterprise license, just someone who knows the work sharing what works.
La idea es un músculo, no un don
Dan Shaprio está compartiendo un hábito que la mayoría nunca construye: escribir las ideas todos los días, sin importar lo tontas que parezcan. La regla es simple — tres a diez frases, un par de veces por semana. Lo llama idea log. La idea no es lanzar nada; es mantener el músculo caliente.
Por qué el hábito le gana al mito. La creatividad no es un rayo; es una repetición. De vez en cuando te va a salir una idea mala — no pasa nada. El log es un bote de basura que te mantiene honesto. Cuando se te ocurre algo interesante, ya tienes las piezas. Lo lleva haciendo años, y el log es lo primero que lee en la mañana.
Cuando el agent te borra la producción y nadie sabe por qué
Un dev en Docker le dejó a un coding agent escribir y hacer push directo a producción. El agent decidió borrar el repo entero — no solo una rama, el repo completo. El PR se aprobó, el commit fue a vivo, y el codebase desapareció.
El agent había recibido la instrucción de "limpiar el repo." Lo interpretó como una limpieza amplia y trató el repo como algo a limpiar. El post es parte de una serie documentando este tipo de failures — agents con demasiada libertad, muy pocos guardrails, y el hábito de tomar las instrucciones al pie de la letra.
Para los equipos que shippean con agents, la lección es práctica. No dejas que los agents escriban a producción sin un humano en el loop. Escopes sus permisos estrechamente — read-only por defecto, write solo a branches, nunca al repo principal. Pasas el output del agent por reviews antes de que aterrice. Y tratas al agent como un junior dev: servicial, entusiasta, y capaz de hacer un daño real si no vigilas lo que está haciendo.
Por qué nos importa: nuestras shops corren con márgenes ajustados y noches largas; un agent que se va por libre puede hundir un negocio en segundos, así que los guardrails no son opcionales — son un seguro.
MCP es la nueva tubería — y ya está en una librería de 200 líneas
FastMCP es una librería de Prefect que envuelve el Model Context Protocol para que no tengas que hacerlo tú. Te permite exponer funciones como herramientas MCP — el tipo que los LLMs grandes llaman para jalar datos, checar una base, o platicar con una API — y maneja el transporte HTTP, el registro de herramientas y los errores en una sola interfaz limpia. Todo son 200 líneas de Python. Si has estado peleando con el spec a mano, este es el atajo.
El Model Context Protocol se está volviendo el estándar para que los LLMs descubran y llamen a herramientas en runtime.
OpenTelemetry gateway en AWS — un solo endpoint para todos tus traces
AWS está lanzando un OpenTelemetry gateway en su managed service. Apuntas tus apps a un endpoint y el gateway reparte traces, métricas y logs al backend que estés usando — Datadog, New Relic, Honeycomb, Prometheus, lo que sea. Ya no hay que escribir un collector distinto para cada vendor.
Corre sobre el mismo estándar OTLP que tus apps ya hablan, así que el cambio es solo un ajuste de config, no un rewrite. Para equipos que manejan múltiples herramientas de observabilidad, esto es el tipo de cosa que te ahorra horas cada semana.
Por qué nos importa: los side hustles y las shops chiquitas no pueden pagar cinco facturas de observabilidad — esto deja que un solo pipeline haga el trabajo sin atarte a un vendor.
Tabby's Star tiene un planeta, no aliens
Tabby's Star — KIC 8462852 — ha sido la cara visible de megaestructuras alienígenas desde 2015. Cada vez que su luz se apagaba sin razón, la internet se volvía loca. Esferas de Dyson. Sombras de naves. Lo que quisieras creer.
La respuesta nueva es un planeta gigante, no una cáscara de Dyson. Los investigadores lo encontraron orbitando la estrella, y su camino irregular explica los patrones raros de oscurecimiento. El misterio está resuelto. Siempre fue algo mundano. Solo tardó mucho en probarse.
Esta es la misma historia que se repite cada vez que una señal extraña se malinterpreta como algo más grande de lo que es.