GPT-5.6 Sol:OpenAI 最强视觉模型
GPT 5.6 Sol is the best "vision" model OpenAI ever released

OpenAI 最新发布的 GPT-5.6 系列中,Sol 模型在视觉能力上实现了质的飞跃。在 Roboflow 的基准测试中,Sol 将物体检测的 mAP@50 从 GPT-5.5 的 13.8 大幅提升至 46.2,彻底扭转了此前视觉检测薄弱的局面。无论是密集场景下的物体计数,还是复杂文档的布局分析,Sol 都展现出了超越前代的实力。尽管在成本和延迟上,Terra 和 Luna 提供了更平衡的选择,且 Gemini 3.5 Flash 在性价比上仍有优势,但 GPT-5.6 的发布标志着 OpenAI 在视觉智能领域已全面发力,为 UI 代理和屏幕理解任务带来了新的可能性。
Sol 显然是 OpenAI 迄今为止发布的最佳视觉模型。
HN 评论区
40- HarHarVeryFunny
总结里那句“仍存在明显局限。在我们的基准测试中,对于大规模检测和计数任务,Gemini 3.5 Flash 依然是比 GPT 5.6 Sol 更实用的选择,尤其是在价格方面”,听起来简直太保守了!
GPT 5.6 Sol 在所有基准测试中都被 Gemini 3.5 Flash 超越,唯一的例外是 OCR 任务,那里 Fable 才是赢家。
Gemini 3.5 Flash 不仅性能碾压 GPT 5.6 Sol,而且成本仅为后者的三分之一。
- weli
纯属个人经验之谈,仅供参考:
GPT 在视觉方面确实很强,或者说至少它们的 MoE 架构看起来非常连贯。根据我的经验,Claude 模型在处理语言任务时可能非常出色,但一旦需要看图并判断设计哪里不好、哪些部分需要改进,表现就会大打折扣。我最简单的测试方法就是给它一张我应用里某个功能的截图,然后说“识别非规范 UI 模块,提升可读性和一致性”。Sol 能出色地将页面重构为相互构建的可组合单元,整体视觉效果和手感都很棒。而 Claude 往往过度聚焦于某一部分,完全忽略了其他部分或整体的连贯性。
- evrimoztamur
展示的硬币样本看起来像是模型或测试框架未能正确注册 EXIF 方向导致的。硬币标记本身是正确的,只是旋转了 90 度。
- bearjaws
看到 Sol 被用来做“传统”AI 模型本来就能做的事(数药片),我觉得挺滑稽的。
我们的药房有专门的视觉模型,我根本无法想象在机器人系统中使用 Sol 所带来的延迟代价,那可能会慢上 25 到 50 倍。
- dllu
视觉能力依然糟糕得令人尴尬。
ChatGPT Pro 搭配 GPT 5.6-sol 的效果:https://chatgpt.com/share/6a834217-ca8c-83e8-a8e8-45d5b8797b...
谜题链接:https://activityvillage-files.s3.eu-west-2.amazonaws.com/s3f...
- fpgaminer
这次对比真的应该把 Gemini 3 Flash 加进来。至少也要加上 3.7。在我大多数测试中,3.5 和 3.6 在视觉能力上相对于 3 版本都是倒退,而且成本要高得多。3.7 终于比 3 版本稍微好了一点。
- mv4
讽刺的是,用来展示“最佳视觉模型”的药片计数示例,其实用 25 年前就诞生的 OpenCV 模板匹配技术就能轻松解决。
- kzrdude
在第三个视觉基准测试结果中,Sol 是 100% 正确的,但预期结果却有一个错误。这看起来像是个疏忽。
在下一个基准测试中,Sol 看起来又是正确的,但不知为何边界框(bboxes)旋转了 90 度。