Magic logra un pretraining 10 veces más eficiente que los modelos abiertos líderes
>10x More Efficient Pretraining
Magic, un equipo que entrena modelos de un billón de parámetros, ha desarrollado una receta de pretraining que iguala a DeepSeek V4 Pro Base usando aproximadamente 50 veces menos FLOPs, con un coste de unos 0,5 millones de dólares en GB200. Al escalar 10 veces más, supera a todos los modelos base abiertos en evaluaciones de perplejidad. El avance proviene de decenas de mejoras en arquitectura, optimizador, objetivo de entrenamiento y curación de datos, con un enfoque en generalización y conocimiento por dominios.
Creemos que el pretraining, el RL agéntico y el contexto largo son suficientes para construir agentes de programación sobrehumanos y automatizar la I+D en IA.
- woadwarrior01
Tienen un historial de hacer afirmaciones grandilocuentes como esta[1] de 2024, sin productos ni investigaciones visibles.
[1]: https://magic.dev/blog/100m-token-context-windows (también enlazado en su entrada de blog)
- simonw
> Igualamos DeepSeek V4 Pro Base usando ~50x menos FLOPs – eso es alrededor de la mitad del cómputo de pretraining de GPT3, o ~$0.5M en GB200.
Si esto se sostiene, es un asunto realmente importante.
- pvillano
Mucha gente está apostando su dinero a un crecimiento infinito para siempre del rendimiento de la IA, el uso de cómputo, la base de usuarios, el precio de suscripción.
Yo creo que el costo disminuirá para siempre.
- ansk
No sé lo suficiente sobre los modelos específicos con los que se comparan para decirlo de manera definitiva, pero me parece que están comparando sus modelos preentrenados con los modelos postentrenados de otros.
La métrica en la que se basa su afirmación de 10x (bits por byte) es exactamente la métrica que se optimiza durante el preentrenamiento. Los modelos postentrenados se ajustan finamente para optimizar otras métricas, lo cual se sabe que perjudica el rendimiento en evaluaciones de bits por byte. Así que las evaluaciones de bits por byte siempre harán que un modelo preentrenado se vea favorable en comparación con un modelo comparable que también ha pasado por postentrenamiento.
¿Alguien puede confirmar si los modelos con los que se comparan (DeepSeek V4, Kimi K2 y Nemotron 3 Ultra) han sido postentrenados?
- ismael_rr
Súper increíble. Ojalá publicaran el artículo sobre lo que hicieron para lograr esto. Recuerdo que nous publicó el artículo de superposición de tokens que mejoró los FLOPs de preentrenamiento algo, pero no 50x: https://nousresearch.com/token-superposition. Me pregunto si también encontraron algunas estrategias de tokenización interesantes