重制 Minecraft 为何不是 AI 评测基准

Recreating Minecraft Is Not a Benchmark

重制 Minecraft 为何不是 AI 评测基准

GPT Astra 发布后,重制 Minecraft、画鹈鹕骑自行车等视觉演示瞬间刷屏。我称其为“demo-benchmarks”,它们直观易懂,却因目标固定而极易被模型过拟合。当测试集泄露进训练数据,小模型也能在 Artificial Analysis 等榜单上超越旗舰版,这测的是准备而非能力。虽然 LiveBench 和 ARC-AGI 尝试通过轮换题目来应对,但社交媒体依然偏爱直观的演示。演示是绝佳的营销内容,但绝不能作为衡量模型真实能力的标尺。如果模型在榜单上高分却在实际工作中频频受挫,那才是真正值得深挖的差距。

一个能按时间表被完美掌握的测试,衡量的是准备程度而非真实能力,这完全违背了基准测试的定义。

同日更多故事

2026-09-06