La pirámide de datos para robots — por qué el 3B le gana al 7B en robots reales
Tanay Shah soltó un paper que le da la vuelta a la intuición clásica del ML. Recopiló 24 horas de datos de un brazo robótico — 6M de imágenes y 6M de ángulos de articulaciones — y entrenó tres modelos: un transformer 3B, un transformer 7B y un modelo 7B de difusión. El 3B ganó. Y por mucho.
La razón es simple y no obvia al principio: los datos reales de robots son desordenados. Las articulaciones tiemblan. Las cámaras se agitan. Un modelo 7B tiene suficientes parámetros para memorizar el ruido. Se sobreajusta a los bichos del dataset y generaliza peor a un brazo robótico nuevo. El 3B es lo suficientemente liviano para aprender la señal — cómo moverse — sin memorizar el ruido. El 7B de difusión hace aún peor, porque la difusión es buenísima para generar imágenes pero no para aprender una política a partir de ellas.
Tanay lo llama pirámide de datos: el modelo correcto para un dataset depende de cuántos datos tenés, no de cuántos parámetros podés apilar. Bigger isn't always smarter — it's just more expensive.
Por qué nos importa: la gente que arma robots para bodegas, campos y cocinas no necesita el modelo más grande. Necesita el que le queda bien a los datos que puede recolectar de verdad. El camino del 3B es el que hay que vigilar.
“Bigger isn't always smarter — it's just more expensive.”