ai_scams29 de agosto de 2026Edición #98

Anthropic muestra una IA que se entrena sola — y funciona de verdad

Un investigador de Anthropic acaba de publicar un paper sobre un sistema de IA que escribe sus propias mejoras. Con diez benchmarks de comportamientos desalineados, el sistema mejoró en todos sin degradar el rendimiento general. Esa última parte es la clave: la mayoría de los intentos de auto-mejora empeoran las otras tareas. Esta no lo hizo.

La clave es un loop llamado AutoRFT. El modelo recibe una nueva prueba, genera un fix, y se entrena con ese fix — todo sin mano humana. Es un paso hacia el tipo de agente autónomo que Anthropic ha estado insinuando por un buen tiempo, y aterriza justo en medio de una carrera entre Anthropic, OpenAI y Google para construir sistemas que puedan revisar sus propios pesos. El paper es delgado en la receta exacta de entrenamiento; lo que importa es el patrón: un modelo que lee sus propios fallos y los parchea más rápido que un humano.

Por qué nos importa: mientras más rápido estos sistemas se mejoren solos, más rápido se filtrarán en las apps y servicios que usa nuestra familia — y más difícil se vuelve auditar qué han cambiado.

La mayoría de los intentos de auto-mejora empeoran las cosas. Esta vez no.

techcrunch.com

Lee el originalAbrir en pestaña nueva
#anthropic#ai_research#autonomous_agents#safety

Boletín diario · sin spam

Recibe el diario en tu puerta

Un correo corto al día — IA, tecnología y lo que significa para nuestras comunidades. Lenguaje claro, mirada cultural, sin jerga de Silicon Valley.