ai_scams1 de septiembre de 2026Edición #101

La nueva herramienta de investigación de Anthropic intenta arreglar la seguridad del AI

Anthropic acaba de publicar un paper sobre un asistente de investigación llamado Claude 4 Sonnet que puede leer papers académicos, escribir código y correr experimentos todo por su cuenta. La idea es escalar el tipo de trabajo que hacen los investigadores cuando buscan fallos de alineación en los modelos — encontrar casos borde donde un modelo hace algo que no debería, como mentir sobre sus capacidades o negarse a seguir instrucciones cuando debería.

El sistema está configurado para que el modelo proponga una prueba, escriba el código, la corra, lea los resultados y decida qué intentar después. Lo hace iterativamente, dando vueltas por cientos de intentos, tratando de sacar los fallos que hacen que los modelos sean inseguros o impredecibles. Anthropic dice que este enfoque captura fallos que una sola ronda de testing pasaría por alto.

El panorama grande es que a medida que los modelos se vuelven más capaces, los problemas que pueden tener se hacen más difíciles de encontrar. Ya no puedes sentarte a promptearlos. Necesitas sistemas que puedan razonar sobre qué probar y dar seguimiento a los resultados. Este es uno de los varios labs intentando automatizar ese tipo de trabajo. OpenAI ha estado haciendo algo similar con sus propios agentes de investigación. La pregunta no es si los modelos pueden hacer este trabajo — es quién lo está haciendo, y para qué.

Por qué nos importa: las personas que construyen estos sistemas están decidiendo qué cuenta como un fallo real, y no estamos en la sala cuando hacen esas llamadas.

La pregunta no es si los modelos pueden hacer este trabajo — es quién lo está haciendo, y para qué.

anthropic.com

Lee el originalAbrir en pestaña nueva
#ai-safety#anthropic#claude#research#alignment

Boletín diario · sin spam

Recibe el diario en tu puerta

Un correo corto al día — IA, tecnología y lo que significa para nuestras comunidades. Lenguaje claro, mirada cultural, sin jerga de Silicon Valley.