Magic обучает модель уровня DeepSeek V4 Pro в 50 раз дешевле
>10x More Efficient Pretraining
Magic достигла более чем 10-кратной вычислительной эффективности предобучения по сравнению с ведущими открытыми базовыми моделями. Их рецепт позволяет обучить модель, сопоставимую с DeepSeek V4 Pro Base, используя примерно в 50 раз меньше FLOPs — около 0,5 млн долларов на GB200. При масштабировании в 10 раз (4 млн долларов) они превзошли все публичные открытые базовые модели по perplexity. Прогресс достигнут за счет десятков улучшений в архитектуре, оптимизаторе, цели обучения и подготовке данных.
Мы, вероятно, самая маленькая команда в мире, обучающая триллионнопараметрические модели.
- woadwarrior01
У них есть история грандиозных заявлений вроде этого[1] от 2024 года, без видимых продуктов или исследований.
[1]: https://magic.dev/blog/100m-token-context-windows (также ссылка в их блогпосте)
- simonw
> Мы соответствуем DeepSeek V4 Pro Base, используя ~50x меньше FLOPs – это примерно половина вычислительных затрат на предобучение GPT3, или ~$0.5M на GB200.
Если это подтвердится, это действительно большое дело.
- pvillano
Многие люди ставят свои деньги на бесконечный рост производительности ИИ, использования вычислений, базы пользователей, цены подписки.
Я думаю, что стоимость будет снижаться вечно.
- ansk
Я недостаточно знаю о конкретных моделях, с которыми они сравниваются, чтобы утверждать это категорично, но мне кажется, что они сравнивают свои предобученные модели с постобученными моделями других.
Метрика, на которой основано их заявление о 10-кратном превосходстве (bits-per-byte), — это именно та метрика, которая оптимизируется во время предобучения. Постобученные модели дообучаются для оптимизации других метрик, что, как известно, негативно сказывается на производительности в оценках bits-per-byte. Таким образом, оценки bits-per-byte всегда будут выставлять предобученную модель в выгодном свете по сравнению с аналогичной моделью, которая также прошла постобучение.
Может ли кто-нибудь подтвердить, были ли модели, с которыми они сравниваются (DeepSeek V4, Kimi K2 и Nemotron 3 Ultra), постобучены?
- ismael_rr
Супер круто. Хотелось бы, чтобы они выпустили статью о том, что они сделали для достижения этого. Я помню, nous выпустили статью о token superposition, которая немного улучшила FLOPs предобучения, но не в 50 раз: https://nousresearch.com/token-superposition. Интересно, нашли ли они также какие-то крутые стратегии токенизации.