Un transformer diminuto entrenado en 1,5 horas supera a muchos LLMs en ARC
Un desarrollador ha entrenado un transformer pequeño desde cero en solo 1,5 horas con una RTX 5090 y logra un 44% en ARC-1, superando a muchos modelos grandes y con un coste de 67 céntimos.
Un desarrollador independiente ha conseguido un resultado llamativo en el benchmark ARC-AGI: ha entrenado un transformer pequeño desde cero en solo 1,5 horas con una RTX 5090 y ha obtenido un 44% de aciertos en ARC-1. La cifra supera a muchos modelos de lenguaje grandes y es la misma que logran otros sistemas de test-time training como TRM o HRM, pero con una fracción del coste: unos 67 céntimos de dólar en alquiler de GPU en vast.ai.
El resultado es una mejora de su trabajo anterior, que ya había llamado la atención de investigadores como Lucas Beyer, Jeremy Howard o Rohan Anil. Entonces muchos dudaron de que fuera posible; ahora el autor sube la apuesta con un modelo más rápido, mejor y barato, y además lo publica en abierto.
Cómo lo ha hecho
La idea no es nueva: en lugar de preentrenar un modelo masivo, entrena un transformer pequeño desde cero en cada conjunto de puzzles de ARC, usando solo los ejemplos disponibles. Cada puzzle tiene una embedding aprendida y las posiciones se codifican con RoPE 3D. Durante la inferencia, aplica aumentos de color y simetrías, y se queda con las dos respuestas más frecuentes.
La clave está en la eficiencia de muestra: el modelo necesita muy pocos datos para aprender la regla de cada puzzle. El autor cree que la eficiencia de muestra es el problema más importante de la IA actual y quiere llevar los transformers al límite en ese aspecto.
Entre los cambios respecto a su versión anterior: arquitectura más moderna (SwiGLU, RMSNorm), más capas (8 en vez de 4), menos aumentos de datos (más eficiente) y un optimizador llamado NorMuon que eliminó problemas de convergencia. También ha dejado de entrenar sobre los tokens de entrada, lo que hace el proceso supervisado y mejora ligeramente el resultado (del 40% al 44%), aunque el autor admite que no entiende del todo por qué.
La polémica del test-time training
El enfoque de entrenar sobre los puzzles de evaluación ha generado críticas. Algunos dicen que es hacer trampa, pero el autor defiende que ARC es un benchmark de metalearning y que se supone que el sistema debe aprender de los ejemplos de cada puzzle. Además, los labels de los tests están ocultos, así que no hay fuga de información.
También ha cambiado la forma de medir el coste: ahora muestra el coste de cómputo total de la vida del modelo (entrenamiento + inferencia), no solo por tarea. Y solo compara con otros métodos que hacen test-time training, no con LLMs que usan datos sintéticos o sesgos humanos.
Qué queda por ver
El autor cree que se puede llegar al 65% dentro del marco de los transformers con modificaciones sencillas, y anima a otros a intentarlo. Queda por ver si su enfoque escala a ARC-2 y si la comunidad acepta sus prácticas de evaluación. Por ahora, demuestra que la eficiencia de muestra puede lograr resultados sorprendentes con muy pocos recursos.
##Relacionado

Alexa avisa cuando algo nuevo te tiente a comprar
Amazon lanza 'Update Me With' en Alexa para avisar de novedades que inviten a comprar, como nuevos productos o eventos.
Dyson lanza un cepillo de dientes con cámara que usa IA para limpiar entre los dientes
El CameraJet de Dyson, a 499 dólares, detecta huecos entre los dientes con una cámara y dispara chorros de enjuague bucal automáticamente.

EEUU pide no frenar la IA en el G20, pero no todos estan de acuerdo
En el Foro Ministerial de Innovación del G20, Estados Unidos aboga por un enfoque favorable a la innovación en IA, mientras que críticos como Anthropic piden mayor regulación.