GPT-5.6 Sol:OpenAI 最强视觉模型

GPT 5.6 Sol is the best "vision" model OpenAI ever released

GPT-5.6 Sol:OpenAI 最强视觉模型

OpenAI 最新发布的 GPT-5.6 系列中,Sol 模型在视觉能力上实现了质的飞跃。在 Roboflow 的基准测试中,Sol 将物体检测的 mAP@50 从 GPT-5.5 的 13.8 大幅提升至 46.2,彻底扭转了此前视觉检测薄弱的局面。无论是密集场景下的物体计数,还是复杂文档的布局分析,Sol 都展现出了超越前代的实力。尽管在成本和延迟上,Terra 和 Luna 提供了更平衡的选择,且 Gemini 3.5 Flash 在性价比上仍有优势,但 GPT-5.6 的发布标志着 OpenAI 在视觉智能领域已全面发力,为 UI 代理和屏幕理解任务带来了新的可能性。

Sol 显然是 OpenAI 迄今为止发布的最佳视觉模型。
  1. HarHarVeryFunny

    总结里那句“仍存在明显局限。在我们的基准测试中,对于大规模检测和计数任务,Gemini 3.5 Flash 依然是比 GPT 5.6 Sol 更实用的选择,尤其是在价格方面”,听起来简直太保守了!

    GPT 5.6 Sol 在所有基准测试中都被 Gemini 3.5 Flash 超越,唯一的例外是 OCR 任务,那里 Fable 才是赢家。

    Gemini 3.5 Flash 不仅性能碾压 GPT 5.6 Sol,而且成本仅为后者的三分之一。

  2. weli

    纯属个人经验之谈,仅供参考:

    GPT 在视觉方面确实很强,或者说至少它们的 MoE 架构看起来非常连贯。根据我的经验,Claude 模型在处理语言任务时可能非常出色,但一旦需要看图并判断设计哪里不好、哪些部分需要改进,表现就会大打折扣。我最简单的测试方法就是给它一张我应用里某个功能的截图,然后说“识别非规范 UI 模块,提升可读性和一致性”。Sol 能出色地将页面重构为相互构建的可组合单元,整体视觉效果和手感都很棒。而 Claude 往往过度聚焦于某一部分,完全忽略了其他部分或整体的连贯性。

  3. evrimoztamur

    展示的硬币样本看起来像是模型或测试框架未能正确注册 EXIF 方向导致的。硬币标记本身是正确的,只是旋转了 90 度。

  4. bearjaws

    看到 Sol 被用来做“传统”AI 模型本来就能做的事(数药片),我觉得挺滑稽的。

    我们的药房有专门的视觉模型,我根本无法想象在机器人系统中使用 Sol 所带来的延迟代价,那可能会慢上 25 到 50 倍。

  5. dllu

    视觉能力依然糟糕得令人尴尬。

    ChatGPT Pro 搭配 GPT 5.6-sol 的效果:https://chatgpt.com/share/6a834217-ca8c-83e8-a8e8-45d5b8797b...

    谜题链接:https://activityvillage-files.s3.eu-west-2.amazonaws.com/s3f...

  6. fpgaminer

    这次对比真的应该把 Gemini 3 Flash 加进来。至少也要加上 3.7。在我大多数测试中,3.5 和 3.6 在视觉能力上相对于 3 版本都是倒退,而且成本要高得多。3.7 终于比 3 版本稍微好了一点。

  7. mv4

    讽刺的是,用来展示“最佳视觉模型”的药片计数示例,其实用 25 年前就诞生的 OpenCV 模板匹配技术就能轻松解决。

  8. kzrdude

    在第三个视觉基准测试结果中,Sol 是 100% 正确的,但预期结果却有一个错误。这看起来像是个疏忽。

    在下一个基准测试中,Sol 看起来又是正确的,但不知为何边界框(bboxes)旋转了 90 度。

同日更多故事

2026-08-17