Model inversion: cómo tu LLM filtra secretos
Model inversion es una nueva clase de ataque contra los grandes modelos de lenguaje. En vez de adivinar prompts, los atacantes le meten al modelo inputs cuidadosamente diseñados y observan sus outputs — luego hacen reverse-engineering de los datos en los que fue entrenado. El resultado: información personal, documentos privados, hasta datos de entrenamiento de la competencia, sacados directo de los pesos del modelo.
El paper de Greptile recorre tres vectores de ataque: membership inference (¿esta persona existía en el training set?), reconstruction (reconstruir el registro original), y extraction (sacar campos específicos como email o SSN). Los ataques funcionan mejor en modelos más pequeños y en datos que fueron muy prominentes en el training — o sea, la mayoría de la web pública que se scrapeó en los LLMs.
El fix no es una sola cosa. Red teaming, input filtering y output sanitization ayudan pero no lo resuelven. El move real es tratar cualquier LLM que toque datos sensibles como un leaky bucket: asumir que va a regurgitar lo que vio, y diseñar alrededor de eso. Eso significa no meter PII, rotar training data, y — para lo que importa — usar modelos on-prem donde tú controlas lo que entra y lo que sale.
Por qué nos importa: Si estás corriendo un modelo con datos de clientes, tus competidores y los scammers pueden sacar esos datos de vuelta — así que la pregunta es si tu negocio está guardando más secretos de los que se da cuenta.
“Any LLM that touches sensitive data is a leaky bucket. Design around that.”