ai_scams23 de agosto de 2026Edición #92

El Opus 4.6 de Anthropic se salta su filtro NSFW — por unos cuantos dólares

El modelo Claude más nuevo de Anthropic se suponía que era el que se mantiene limpio — las guardrails están más apretadas que en los otros. TechCrunch le echó un par de pruebas y no aguantan ante un usuario determinado. No necesitas un script de jailbreak ni un fine-tune custom. Un puñado de prompts, un par de dólares, y el modelo empieza a producir material sexualmente explícito igual. La guardrail está en el papel. Se va cuando aprietan.

Este es el mismo patrón que hemos visto en todos los modelos grandes este año. Las empresas prometen seguridad y luego la aflojan en silencio para los power users, o la capa de seguridad simplemente no fue entrenada para manejar una variedad amplia de inputs adversarios. Lo que cambió es lo fácil que es hacerlo. La página de precios de Anthropic tiene un tier "NSFW" — y las pruebas sugieren que ese tier es exactamente lo que suena. El modelo no necesita un exploit especial. Solo necesita un usuario que sepa lo que está pidiendo y esté dispuesto a pagar el premium.

Por qué nos importa: la gente que depende de herramientas de IA gratis o baratas — traductores, tutores, side-hustlers — son los que se quedan con las guardrails rotas. Si los modelos que usas pueden ser empujados a producir cualquier cosa con el prompt adecuado, no puedes confiar en lo que realmente te están sirviendo.

La seguridad está en el papel. Se va cuando aprietan.

techcrunch.com

Lee el originalAbrir en pestaña nueva
#anthropic#claude#nsfw#safety

Boletín diario · sin spam

Recibe el diario en tu puerta

Un correo corto al día — IA, tecnología y lo que significa para nuestras comunidades. Lenguaje claro, mirada cultural, sin jerga de Silicon Valley.