GPT-5.6 Sol、OpenAI史上最高のビジョンモデルに
GPT 5.6 Sol is the best "vision" model OpenAI ever released

OpenAIが発表したGPT-5.6シリーズ(Sol、Terra、Luna)を、Roboflowが独自のVLMベンチマークで検証。物体検出ではSolがmAP@50で46.2を記録し、GPT-5.5の13.8から大幅に向上。カウンティングも73.0%と改善した。一方、OCRはほぼ横ばいで、コストとレイテンシーは増加。Gemini 3.5 Flashが依然としてコストパフォーマンスに優れるが、OpenAIのビジョンへの本気度が示された。
SolはOpenAIがこれまでにリリースした中で明らかに最高のビジョンモデルです。
HNでの議論
11- HarHarVeryFunny
要約にある「まだ明確な限界がある。我々のベンチマークでは、特に価格を考慮すると、高頻度の検出と計数においてGemini 3.5 Flashの方が実用的な選択肢であり続ける」というのは、かなり控えめな表現だ。GPT 5.6 Solは、OCR(Fableが勝った唯一の例外)を除いて、すべてのベンチマークでGemini 3.5 Flashに負けている。Gemini 3.5 FlashはGPT 5.6 Solを上回っただけでなく、コストも3分の1だった。
- weli
個人的な意見ですが、GPTは視覚系のタスクで本当に優れています。少なくとも彼らのMoEは非常にまとまりがあるようです。私の経験では、Claudeモデルは言語では非常に優れていることがありますが、画像を見てデザインのどこが悪いのか、どの部分を改善すべきかを判断する必要がある瞬間に、性能が大幅に低下します。私の最も簡単なベンチマークは、アプリの機能のスクリーンショットを与えて「非規範的なUIブロックを特定し、読みやすさと一貫性を改善してください」と指示することです。Solは、ページを相互に構築する構成可能なユニットに再構築し、アプリの全体的な見た目と感触を向上させるのに非常に優れています。Claudeは一つの部分に過度に焦点を当て、残りの部分や全体の一貫性を完全に無視する傾向があります。
- evrimoztamur
示されているペニーのサンプルは、モデルまたはハーネスによって記録されたEXIFの向きの失敗のように見えます。コインは正しくマークされていますが、90度回転しています。
- bearjaws
Solが「従来の」AIモデルでもすでにできること(薬の数え上げ)に使われているのを見るのは、私にとって面白いです。私たちは薬局向けの視覚モデルを持っていますが、ロボティクスでSolを使うためにレイテンシーの低下を受け入れることは想像もできません。おそらく25〜50倍遅くなるでしょう。
- mv4
皮肉なことに、「最高の視覚モデル」を紹介するために選ばれた薬の数え上げの例は、25年前に作られた技術であるOpenCVのテンプレートマッチングで簡単に解決できます。
- kzrdude
3番目の視覚ベンチマークの結果では、Solは100%正しいですが、期待される結果には1つのエラーがあります。見落としのようです。次のベンチマークでは、Solは再び正しいように見えますが、バウンディングボックスが何らかの理由で90度回転しています。
- fpgaminer
この比較にはGemini 3 Flashも含めるべきです。少なくとも3.7は。私のテストのほとんどで、3.5と3.6はどちらも視覚能力の点で3と比較してダウングレードであり、コストははるかに高かったです。3.7はようやく3よりわずかに優れています。
- logicallee
同意します。非常に難しいタスクで非常によくできました。私は、ガラスの後ろにある非常に明るいポスターの小さな黒い部分にだけ見える、自分が着ていた服の非常に薄い反射を認識して描くように依頼しました。さらに、ポスター自体にも似た服がたまたま含まれていました。参照画像とその出力は、私の記事(https://medium.com/@rviragh/gpt-5-6-sol-very-good-image-reco...)で確認できます。人間は反射に簡単に焦点を合わせることができますが、これは視覚モデルにとっては大きな挑戦です。非常に印象的です。