Cómo testear LLMs antes de lanzar — la checklist práctica
Un paper nuevo de OpenAI y researchers de la UC Berkeley mapea cómo evaluar language models antes de que lleguen a producción. Los autores pasan por el pipeline completo: elegir el test set correcto, los evaluation metrics, correr benchmarks, y checar failure modes como hallucination, bias, y prompt injection. Marcan que accuracy isn't the only metric — latency, cost per token, and safety all matter for real systems.
Lo que destaca es la parte que la mayoría de los equipos se salta: el adversarial test set. No solo le pasas prompts normales al modelo; le pasas los prompts que probablemente va a fallar — edge cases, multi-step reasoning, edge-case inputs. Muestran que los modelos que se ven bien en benchmarks estándar siguen fallando hard en producción. El paper también cubre cómo detectar cuando un modelo está confidently wrong, y cómo armar human-in-the-loop review para los casos que lo necesiten.
Esto no es teoría. Los autores han testeado docenas de modelos con este framework y las diferencias son reales — algunos modelos puntúan bien en benchmarks estándar pero se caen en adversarial tests, otros son más lentos y caros por ganancias marginales. El takeaway es práctico: si estás construyendo con LLMs, necesitas un test set que se parezca a lo que tus usuarios realmente van a enviar, no solo los leaderboards estándar.
Por qué nos importa: las small shops y los solo builders que usan las APIs de OpenAI o Anthropic son los que más se saltean estos tests — y los que se queman cuando el modelo empieza a hallucinar frente a clientes reales.
“Accuracy isn't the only metric — latency, cost per token, and safety all matter for real systems.”