Hex está midiendo agentes de IA que escriben SQL
Hex lanzó DataBench, un benchmark para evaluar analytics con agentes — esas IAs que leen un dataset, entienden lo que le pedís y escriben el SQL para responder. El benchmark prueba cómo se las arreglan con queries reales sobre tablas reales, no con ejemplos de juguete.
La idea es medir si un agente realmente hace el trabajo en vez de solo sonar seguro. Cubre el tipo de queries que la gente escribe de verdad: joins entre tablas, agregaciones, ventanas de tiempo. Los que fallan usualmente fallan porque el agente eligió la tabla equivocada, se saltó una columna, o escribió algo que parece bien pero devuelve números mal.
Esto importa porque los equipos están empezando a dejar que agentes de IA toquen datos de producción. Si un sistema no puede escribir SQL confiable sobre un schema real, no está listo para sentarse frente a algo que la gente usa todos los días.
Por qué nos importa: Cuando empecemos a dejar que agentes de IA consulten nuestras bases de datos, necesitamos saber que no van a devolver números mal en silencio — especialmente cuando esos números mal terminan en la mesa de un jefe o de un cliente.
“Los que fallan usualmente fallan porque el agente eligió la tabla equivocada, se saltó una columna, o escribió algo que parece bien pero devuelve números mal.”