18 款前沿模型 NanoGPT 速度跑分大比拼
NanoGPT Speedrun Frontier

Prime Intellect 团队在 NanoGPT 优化器速度跑分中,对 18 款前沿模型进行了 153 次自主运行测试。从 Fable 5 到 Grok 4.6,各模型在记录时间、Token 消耗及实验次数上表现各异。测试结果显示,DeepSeek V4 Pro 和 Qwen3.8 Max 等模型在特定配置下表现突出,而部分模型如 GLM 5.3 仍在运行中。通过对比不同预算下的最佳验证记录,我们得以窥见各模型在自主研究任务中的真实效率与潜力。
我们在 NanoGPT 优化器速度跑分中,对 18 款前沿模型进行了 153 次自主运行测试。