Rosalind de OpenAI: un workbench para testear modelos con tareas reales
OpenAI lanzó Rosalind como un workbench público para evaluar modelos en tareas concretas, no en scores de benchmarks. Le pasás un dataset, corre el modelo y te devuelve resultados estructurados — accuracy, latencia, costo por llamada — para que puedas comparar lo que pasa de verdad en producción.
La setup es simple: subís un JSONL con prompts y outputs esperados, elegís el modelo y le das a run. Loguea cada trace, cachea las llamadas repetidas y te deja diffear resultados entre versiones del modelo. No hay leaderboard ni ranking — solo resultados crudos que podés exportar y compartir con la gente.
Así es como se está moviendo la industria de verdad. Benchmarks como MMLU y GSM8K son académicos; no te dicen si tu modelo se va a romper cuando lo metés en un flujo para el cliente. Rosalind es la respuesta a ese hueco — una herramienta práctica para la gente que escribe prompts y arma los pipelines, no para los papers.
Por qué nos importa: la gente que está mandando work de AI para bodegas y barberías necesita saber qué es real antes de ponerlo frente al cliente.
“Los benchmarks son académicos. Esto es para la gente que está armando los pipelines.”