用Prince of Persia测试AI模型进化
Analyzing Frontier Model Progress with My Favourite Game: Prince of Persia
我通过让AI将Prince of Persia的6502汇编代码移植到C#,测试了从Claude Opus 4.6到Opus 5.5的模型进展。早期模型虽能生成代码,却因架构错误导致游戏无法游玩。直到Claude Opus 5获得运行DOSBox和截图对比的能力,才真正诊断出问题并重建引擎。而Opus 5.5更是仅凭一个提示词,就找到了SDLPoP社区的逆向工程文档,成功移植了房间绘制逻辑,将画面像素差异从8429个降至2个。这次实验证明,赋予AI自我验证和参考现有开源成果的能力,比单纯提升模型智力更能带来质的飞跃。
最大的飞跃不仅仅在于模型变得更聪明,更在于赋予了它们观察原版游戏并自我验证的能力。