Model inversion: robando secretos de tu modelo de IA
Los investigadores pueden sacar datos privados de un modelo ya entrenado haciendo probing a sus outputs — no hackeando un servidor, sino mandándole inputs y leyendo las probabilidades que devuelve. El ataque funciona en modelos de clasificación, en image classifiers, y hasta en large language models. Puedes recuperar ejemplos del training set, a veces frases completas, a veces rostros. El paper lo llama model inversion, y los ataques se están volviendo más prácticos.
Lo que hace que esto no sea solo un ejercicio de paper es que los modelos que la gente está corriendo son los mismos que están en producción. Si tu modelo fue entrenado con data de usuarios — reviews de clientes, notas médicas, fotos — un attacker con acceso a la API puede empezar a hacerle preguntas y ver cómo se mueven los confidence scores. Eso es suficiente para reconstruir partes del training set. OpenAI, Google y Anthropic todos shippean modelos que exponen logits o token probabilities; el ataque necesita solo unas cuantas cientos de queries.
La fix no es dejar de entrenar modelos. La fix es limitar lo que el modelo revela. Eso significa borrar los confidence scores, clamping los logits, adding calibrated noise, y tratar los outputs del modelo como data sensible igual que tratas una database. Si estás shippeando una API, estás shippeando un side channel — y el side channel está filtrando.
Por qué nos importa: Las apps y bots que mucha gente de la comunidad ya usa corren sobre estos modelos, y si el modelo fue entrenado con data de personas, la data podría ser recuperable a través de los mismos botones que tocan todos los días.
“Si tu modelo fue entrenado con data de gente, podría estar tratando de devolvérsela.”