Modelos tabulares que aprenden de sus propios errores
Un investigador de Leaflet publicó un paper que muestra que los foundation models entrenados con tablas pueden repararse a sí mismos. El truco: después de que el modelo hace sus predicciones, comparás su output con la tabla original, marcás las filas que se equivocó y las alimentás de vuelta al entrenamiento. El modelo se pone mejor en sus propios errores — sin necesidad de labelers humanos.
Es un paso chiquito pero significativo. Los datos tabulares — hojas de cálculo, bases de datos, CSVs — son el pan de cada día de cómo funcionan los negocios. No es lo flashy. Pero es lo que mantiene las luces prendidas. Y por años, los big models han sido mediocres con esto. Alucinan filas, leen mal los headers, no pueden hacer joins básicos. Este paper sugiere un camino práctico para arreglar eso.
El panorama más amplio: si los modelos pueden auto-mejorarse en datos tabulares a escala, el bottleneck se mueve del data labeling a la data quality. Bad tables make bad models. Clean tables make better ones. Y los modelos empiezan a ayudarte a limpiarlos.
Por qué nos importa: un montón de los negocios chicos, bodegas y operaciones de familia que conocemos corren sobre Excel y Google Sheets — si los modelos se ponen buenos con eso, las herramientas que se construyen encima dejan de ser caras y empiezan a servir de verdad.
“Bad tables make bad models. Clean tables make better ones.”