GPT-5.6与Claude Fable 5物理AI对决

GPT-5.6 vs. Claude Fable 5 for Physical AI, which performs best?

GPT-5.6与Claude Fable 5物理AI对决

JuliaHub在五个密封的物理建模与仿真难题中,对GPT-5.6系列(terra、sol、luna)与Claude Fable 5进行了严格测试。结果显示,Claude Fable 5以0.889的加权得分拔得头筹,尽管其单次成本高达9.60美元,远超GPT-5.6-terra的1.25美元。分析发现,Claude Fable 5擅长通过构造反例来验证物理正确性,而GPT-5.6各版本则各有风格:sol过于追求精度却误读规格,luna陷入无效的自我验证循环,terra虽最经济高效却因过度简化而错失细节。这场测试揭示了在物理AI领域,代码能运行不代表物理正确,真正的挑战在于模型能否经受住现实世界的严苛检验。

在工程领域,真正的问题是“这是否符合现实世界?”,而这要验证起来难得多:智能体可能通过它自己编写的每一项测试,而这些测试却建立在那些在模型实际使用环境中根本不成立的简化假设之上。
  1. draginol

    所以 Fable 算是“赢了”,但代价是花了 124.76 美元,换来的性能提升却只是相对于 22.56 美元的 5.6 Sol 运行结果而言的边际效益。

  2. xnorswap

    鉴于似乎缺乏对每个模型进行不同努力程度的广泛测试,这次演示真的让人很沮丧。

    既然没有理由相信 Fable 的 xhigh 模式能与 GPT-sol 的 xhigh 相提并论,甚至与 Opus 的 xhigh 相比也是如此,那么如果能展示出这些任务在何种努力水平下不再达成目标,将会更有价值。

  3. hartator

    有点意思的是,这篇内容已经过时了,因为它缺少 Kimi 3 和 Opus 5 的数据。

同日更多故事

2026-07-29