El artículo de Von Neumann de 1956 planteó cómo construir computación fiable a partir de componentes poco fiables: las neuronas son ruidosas, las conexiones cambian y, aun así, los cerebros funcionan. La lógica digital resolvió esto con alto voltaje y redundancia, pero eso hace que el coste energético crezca cuadráticamente.
El MIT acaba de reabrir la cuestión para los LLM. Entrenaron transformadores Llama-2 (de hasta 930M de parámetros) con 350B de tokens, poniendo aleatoriamente a cero bloques de matrices de 4×4 en las capas de atención y FFN con una probabilidad p, tanto durante el entrenamiento COMO durante la inferencia. Tras 40.000 horas de GPU: los modelos entrenados con fallos se volvieron MÁS resistentes a medida que aumentaban de escala. Los modelos entrenados sin fallos colapsaron cuando estos aparecieron durante la inferencia.
Ajustaron una ley de escalado modificada con un término de curvatura adicional que solo aparece cuando p > 0, lo que sugiere que las redes aprenden códigos correctores de errores cuya sobrecarga se mantiene finita a medida que crece N. Si esto se cumple asintóticamente, se podría ejecutar la inferencia en chips analógicos o de bajo voltaje, que consumen mucha menos energía por operación.
El pero: los experimentos llegan solo hasta 1B de parámetros. Confirmar esto a una escala de 405B costaría unos 100M de horas de GPU. Los puntos de control son públicos, pero casi nadie lo ha comentado desde que se publicó el preprint hace tres días.
La estrategia: entrenar una vez con fallos de hardware y desplegar el modelo en aceleradores deliberadamente imperfectos. La incógnita: nadie ha probado si la corrección aprendida se mantiene más allá de 1B de parámetros.
El MIT acaba de reabrir la cuestión para los LLM. Entrenaron transformadores Llama-2 (de hasta 930M de parámetros) con 350B de tokens, poniendo aleatoriamente a cero bloques de matrices de 4×4 en las capas de atención y FFN con una probabilidad p, tanto durante el entrenamiento COMO durante la inferencia. Tras 40.000 horas de GPU: los modelos entrenados con fallos se volvieron MÁS resistentes a medida que aumentaban de escala. Los modelos entrenados sin fallos colapsaron cuando estos aparecieron durante la inferencia.
Ajustaron una ley de escalado modificada con un término de curvatura adicional que solo aparece cuando p > 0, lo que sugiere que las redes aprenden códigos correctores de errores cuya sobrecarga se mantiene finita a medida que crece N. Si esto se cumple asintóticamente, se podría ejecutar la inferencia en chips analógicos o de bajo voltaje, que consumen mucha menos energía por operación.
El pero: los experimentos llegan solo hasta 1B de parámetros. Confirmar esto a una escala de 405B costaría unos 100M de horas de GPU. Los puntos de control son públicos, pero casi nadie lo ha comentado desde que se publicó el preprint hace tres días.
La estrategia: entrenar una vez con fallos de hardware y desplegar el modelo en aceleradores deliberadamente imperfectos. La incógnita: nadie ha probado si la corrección aprendida se mantiene más allá de 1B de parámetros.