预训练效率提升10倍:Magic 的突破

>10x More Efficient Pretraining

前沿预训练通常被视为大实验室的专属游戏,但 Magic 团队通过算法效率的极致优化,实现了计算效率超过 10 倍的提升。我们仅需约 50 倍于 DeepSeek V4 Pro Base 的 FLOPs 就能达到同等性能,相当于 GPT3 预训练算力的一半,成本仅需约 50 万美元。在进一步扩展 10 倍算力后,我们的模型在困惑度评估上超越了所有公开可用的开源基座模型。这一突破证明,无需海量芯片堆叠,通过精妙的算法改进和数据策略,小团队也能在万亿参数模型训练上取得领先。未来,我们将继续探索长上下文、代理强化学习(agentic RL)以及对齐训练,致力于构建超越人类能力的编码智能体。

我们相信预训练、代理强化学习和长上下文足以构建超越人类的编码智能体并实现 AI 研发自动化。
  1. woadwarrior01

    他们此前就有过这类夸夸其谈的记录,比如 2024 年发布的声明 [1],却至今未见任何实际产品或研究成果。

    [1]: https://magic.dev/blog/100m-token-context-windows(他们的博客文章中也链接了此内容)

  2. simonw

    > 我们使用约少 50 倍的 FLOPs 就达到了 DeepSeek V4 Pro Base 的水平——这大约是 GPT3 预训练算力的二分之一,在 GB200 上成本约为 50 万美元。

    如果这一说法属实,那将是非常重大的突破。

  3. pvillano

    很多人押注 AI 性能、算力消耗、用户基数和订阅价格将永远无限增长。

    但我认为成本将永远持续下降。

  4. ansk

    我对他们具体对比的是哪些模型了解不够深入,无法下定论,但在我看来,他们似乎是在拿自己的预训练模型去对比别人的后训练模型。

    他们提出 10 倍提升所依据的指标(bits-per-byte)恰恰是预训练阶段专门优化的指标。后训练模型经过微调以优化其他指标,这已知会对 bits-per-byte 评估表现产生负面影响。因此,在 bits-per-byte 评估中,预训练模型相比同样经过后训练的同类模型,总会显得更有优势。

    能否有人确认一下,他们对比的模型(DeepSeek V4、Kimi K2 和 Nemotron 3 Ultra)是否都经过了后训练?

  5. ismael_rr

    太棒了。真希望他们能发布论文,详细说明是如何实现这一突破的。我记得 nous 曾发布过关于 token superposition 的论文,该研究确实提升了预训练 FLOPs 效率,但远未达到 50 倍:https://nousresearch.com/token-superposition。不知道他们是否也发现了一些巧妙的 tokenization 策略?

同日更多故事

2026-09-10