18 款前沿模型 NanoGPT 速度跑分大比拼

NanoGPT Speedrun Frontier

18 款前沿模型 NanoGPT 速度跑分大比拼

Prime Intellect 团队在 NanoGPT 优化器速度跑分中,对 18 款前沿模型进行了 153 次自主运行测试。从 Fable 5 到 Grok 4.6,各模型在记录时间、Token 消耗及实验次数上表现各异。测试结果显示,DeepSeek V4 Pro 和 Qwen3.8 Max 等模型在特定配置下表现突出,而部分模型如 GLM 5.3 仍在运行中。通过对比不同预算下的最佳验证记录,我们得以窥见各模型在自主研究任务中的真实效率与潜力。

我们在 NanoGPT 优化器速度跑分中,对 18 款前沿模型进行了 153 次自主运行测试。
  1. lhl

    在训练方面看到这些结果挺有意思的。我大多都用过这些模型来半自动地(连续跑好几天)搞内核优化(除了 Fable——它几乎立刻就会触发安全护栏,当时直接把我降级到 Opus 4.8)。我觉得对很多人来说这可能是个大问题,不过看起来 Opus 5 表现依然不错。

    我发现如果让它们无指导地自由发挥,模型(尤其是 GPT 系列)很容易钻牛角尖,但有了合适的脚手架,效果似乎相当好。我的一般流程是:从构思和性能分析阶段开始,限制运行次数,强制推进到列表中的下一项,然后迭代,有时会混合使用带有“新鲜视角”的模型。这理论上完全可以全自动,但我喜欢每天查看一次,看看进展并适时调整方向。

  2. vibe42

    “几乎所有模型都找到了相同的获胜思路。区分最佳轨迹的是实验留下的痕迹。它们保留了足够长的微弱信号以进行验证,同时它们对结果也有更好的理解。”

    好奇如果有一个能辅助在历史日志中保留信号的框架(harness),会不会改变结果。

    另外也好奇不同的目标提示词(goal prompts)会不会改变结果。不是那种大堆的提示词工程,而是细微的差别,比如“考虑新颖方案,追踪微弱信号”。

    在我看来,他们把相当多的 GPU 时间都分配给了同一个目标提示词。

  3. nsingh2

    这里的 sol 是怎么回事?备注里说它花了很多时间在等待,难道它只是没有有效地利用时间(比如没有并行运行),导致它的图表在时间轴上被拉长了?

    我还看到像 Opus 5 这样的备注,说它使用的是旧版本的 serial program.md,所以这些图表并不是完全公平的比较?

    编辑:博客似乎已经回应了这些问题 https://www.primeintellect.ai/blog/measuring-autonomous-rese...

  4. totetsu

    “我们在 nanoGPT 优化器速通挑战上,针对 18 款前沿模型进行了 153 次自主运行。”

    呃……好吧……但什么是“运行”(run)?去读博客吧。

    “我们想衡量前沿模型进行科研的能力……”“我们在 nanoGPT 优化器速通挑战上进行了 153 次自主运行。”

    好吧,但什么是优化器运行?这和擅长科研有什么关联?

    “作为对比,Anthropic 内部的自动化 AI 研发评估是在 CPU 节点上优化模型,”

    所以我得去搞清楚 Anthropic 在做什么才能理解?

    为什么不在博客里直接解释清楚是什么意思呢……

  5. espadrine

    我对加一个以美元为单位的第三 X 轴很感兴趣。

    时间有时更多关乎推理基础设施(尤其是脉动芯片),而非模型质量(提供商会调整参数以支持更大的批处理量,但这会牺牲延迟)。

    不同模型之间的 Token 并不总是完全等价的。

同日更多故事

2026-08-23