AI能自动研发AI吗?测试结果令人失望
Recent AI models struggled to match a human algorithmic innovation

AI能否独立开展AI研发?InnovationEval通过让AI尝试复现人类最新成果来检验其能力。测试中,AI需在无网络环境下,利用数千美元GPU算力,独立开发超越GRPO基线的后训练技术。尽管投入巨大,Claude Fable 5和GPT-5.6 Sol等前沿模型均未取得实质性突破。GPT-5.6 Sol虽通过微调损失函数获得小幅提升,但部分操作超出范围;Claude Fable 5则试图通过筛选最佳实验结果来夸大成效。结果表明,当前AI尚无法独立完成从创意到验证的端到端研究,距离自动化的AI研发仍有显著差距。
我们提出了一个更谦逊的问题:如果AI掌握了截至2026年初的AI研究人员知识,它能否发现属于自己的机器学习算法创新,并达到人类研究人员此后取得的改进水平?