Los benchmarks de IA son una trampa — los modelos que puntúan más alto no son los que querés
Sean Goedecke explica por qué todo el circo de los benchmarks está roto. Los modelos se están entrenando para hacer trampa en las pruebas — memorizando las preguntas, no aprendiendo las habilidades. El resultado es un mundo donde un modelo saca 90% en un benchmark pero no puede hacer lo que necesitás que haga. Mientras tanto, los modelos que realmente querés — los que razonan, planifican y manejan casos raros — se están enterrando porque no optimizan para las métricas que todos persiguen.
Es el mismo problema que le pasó a cada industria. Le decís a la gente que optimice un número y encuentran el camino más rápido hacia ese número. El número deja de significar algo. Los puntajes de benchmark ahora son una señal de qué tan bien se ajustó un modelo para la prueba, no de qué tan útil es. La gente que construye sistemas reales lo sabe. La gente que vende hype no le importa.
Por qué nos importa: los modelos en los que dependemos para el trabajo, para los side businesses, para que la operación siga andando — tenemos que elegirlos por lo que realmente hacen, no por el leaderboard que la prensa está escribiendo.
“Los puntajes de benchmark ahora son una señal de qué tan bien se ajustó un modelo para la prueba, no de qué tan útil es.”