Un paper nuevo muestra cómo evitar que los LLMs se dejen engañar para soltar secretos
Investigadores de Microsoft y OpenAI publicaron esta semana un paper sobre una clase de ataques llamada model extraction. La idea es simple: mandas un montón de queries a un modelo fine-tuneado, lees las respuestas y con eso entrenas tu propia copia. El paper demuestra que los ataques son reales y funcionan contra varios modelos populares.
Los autores corrieron los ataques sobre GPT-4o, GPT-4o-mini, Claude, Llama y varios más. También probaron unos cuantos trucos de defensa. Uno es agregar ruido a las salidas para que el modelo extraído no aprenda los detalles finos. Otro es limitar cuántas queries puede hacer un usuario. Ambos ayudan, pero ninguno bloquea el ataque por sí solo. Los mejores resultados vienen de combinarlos.
La conclusión práctica es clara: si fine-tuneaste un modelo con datos propietarios y lo sirves por API, alguien probablemente puede reconstruirlo. El paper no dice cuánto costaría ni qué tan rápido, pero los ataques son lo suficientemente rápidos como para valer la pena intentarlos. Si estás vendiendo acceso a modelos, esto es lo que deberías proteger antes que alguien más lo haga.
Por qué nos importa: muchas shops pequeñas están corriendo sus propios modelos fine-tuneados para atención al cliente o herramientas internas — si esos modelos se pueden copiar, el valor que compraron se está filtrando.
“Si fine-tuneaste un modelo con datos propietarios y lo sirves por API, alguien probablemente puede reconstruirlo.”