Ploy 迁移到 GPT-5.6:快2.2倍,省27%
Migrating a production AI agent to GPT-5.6: 2.2x faster, 27% cheaper

我们终于把 Ploy 的生产级 AI 代理从 Claude Opus 切换到了 GPT-5.6 Sol。这次迁移带来了立竿见影的效果:构建速度提升了 2.2 倍,成本降低了 27%,且代码更精简。但过程绝非一帆风顺,我们发现评估框架本身往往偏向旧模型,导致新模型在初期被误判。更棘手的是,GPT-5.6 在工具调用和 Prompt caching 机制上与 Claude 存在巨大差异,比如它倾向于填满所有可选参数,甚至让文件读取失效。通过重构 Schema 和缓存策略,我们成功驯服了这些特性,让 GPT-5.6 真正发挥了其高效能。
你的评估框架是为当前模型量身定制的,而你对此一无所知。
- 有评论者指出,随着模型基座能力增强,早期为提升性能设计的复杂 Agent 架构(如 Planner)和提示词工程已不再必要,甚至因增加 Token 消耗和延迟而成为性能瓶颈。
- 一位管理大型 Monorepo 的开发者反馈,在解决内存泄漏等复杂深层问题时,ChatGPT 倾向于给出看似合理但错误的浅层方案,而 Opus 4.8 虽然速度较慢,但规划更严谨且能确保最终结果正确。
- 多位用户质疑当前 AI 产品市场中“质量信号”的失效,认为优秀的 UI 设计、文案和营销视频极易被 AI 伪造,导致难以区分精心打造的产品与低质内容。
- 有从业者建议通过 Feature Flag 或自动化评估套件(Eval Suite)来快速对比新旧模型表现,因为模型迭代极快,手动测试已无法跟上变化。
- 针对 AI 生成内容风格单一的问题,有开发者提出应像配置代码规范一样维护 WRITING.md 文件,明确指导模型如何组织语言和标点,而非仅关注功能实现。