GPT-5.6与Claude Fable 5物理AI对决
GPT-5.6 vs. Claude Fable 5 for Physical AI, which performs best?

JuliaHub在五个密封的物理建模与仿真难题中,对GPT-5.6系列(terra、sol、luna)与Claude Fable 5进行了严格测试。结果显示,Claude Fable 5以0.889的加权得分拔得头筹,尽管其单次成本高达9.60美元,远超GPT-5.6-terra的1.25美元。分析发现,Claude Fable 5擅长通过构造反例来验证物理正确性,而GPT-5.6各版本则各有风格:sol过于追求精度却误读规格,luna陷入无效的自我验证循环,terra虽最经济高效却因过度简化而错失细节。这场测试揭示了在物理AI领域,代码能运行不代表物理正确,真正的挑战在于模型能否经受住现实世界的严苛检验。
在工程领域,真正的问题是“这是否符合现实世界?”,而这要验证起来难得多:智能体可能通过它自己编写的每一项测试,而这些测试却建立在那些在模型实际使用环境中根本不成立的简化假设之上。