DeepSeek、画像入力対応の「v4-flash-vision-exp」公開 最大600枚まで
DeepSeek-v4-flash-vision-exp

DeepSeekは2026年8月21日、画像入力に対応した実験モデル「deepseek-v4-flash-vision-exp」を公開した。OpenAI互換のChat Completions APIに加え、Anthropic互換の/messagesエンドポイントやResponses APIでも利用できる。画像はbase64エンコード、外部URL、Files APIの3通りの方法で渡せ、JPEG・PNG・GIF・WebP形式に対応。1リクエストで最大600枚の画像を処理でき、画像は自動リサイズされ1枚あたり最大384トークンとして課金される。
「画像は自動的にリサイズされ、1枚あたり最大384トークンとして課金される」
HNでの議論
153- ciberado
DeepSeekがPlaywrightのスクリーンショットを正確に表示できないことが、Sonnetから本当に恋しい唯一の点です。これは有望ですね。
> 画像はその寸法に基づいてトークンに変換され、これらのトークンはテキストトークンと一緒に課金されます。
> 推論の前に、すべての画像は自動的にリサイズされます:
> - 総ピクセル数がおよそ384×384未満の画像は、アスペクト比を維持したまま拡大されます。
> - より大きな画像は、リサイズ後の総ピクセル数がおよそ800×800の画像と同等になるように、アスペクト比を維持したまま縮小されます。
> その結果、画像あたりのトークン数には上限(384トークン)があります:例えば、2000×2000の画像と5000×5000の画像は、リサイズ後は同じトークン数を消費します。リクエストに複数の画像が含まれる場合、各画像は同じルールで独立してカウントされます—複数画像リクエストに対する特別な計算はありません。
私の理解が正しければ、画像あたり400トークンで、1ドルあたり2,500枚の画像になります。
編集:フォーマット。
- leumon
私にとっては、Qwen3.8 27Bが(ほぼ)正解した単純な時計テストで失敗します。
時計の画像 https://files.catbox.moe/kgwa5e.png を与えて、「時計は何時を示していますか?」と尋ねました(推論:高の両方で)。
DSの回答:時計は*5:10*(そして45秒)を示しています。
内訳は次のとおりです:
* *時針(赤、最も短い):* *5*を指しています。
* *分針(緑、最も長い):* *2*を指しており、これは10分を表します。
* *秒針(青、中程度):* *9*を指しており、これは45秒を表します。
Qwenの回答:時計は*8:10*を示しています(赤い秒針が5の位置、つまり*8:10:25*)。
- *時針*(短い、青)→ 8
- *分針*(長い、緑)→ 2(10分)
- *秒針*(細い、赤)→ 5(25秒)
正解は08:09:25です。
- LorenDB
DeepSeek v4 Flash 0731は、視覚機能を持っていると頻繁に思い込み、実際には見えないことに気づくと、テキストベースの画像分析ツールをでっち上げることがあると聞きました。その場合、これはモデルにとって素晴らしいアップグレードです。
逸話ですが、0731にスクリーンショットを見るのをやめるように言わなければなりませんでした。画像を読もうとしてセッションを壊し続けたからです。
- cjg007
ここ数ヶ月、視覚なしのv4-flashを使ってきましたが、コードタスクにはこれが頼りです。今、視覚が追加されたので、疑問に思うのです:このモデルがテキストのみのバージョンと同じことをすべてできるなら(さらに画像も見られる)、なぜテキストのみのバージョンを残しておくのでしょうか?
単にコストやレイテンシの問題ですか?それともテキストのみの方が優れている点があるのでしょうか?
- meetpateltech
ベンチマーク付きのニュース発表:https://api-docs.deepseek.com/news/news260821/
- zmmmmm
> より大きな画像は、アスペクト比を維持したまま縮小され、リサイズ後の総ピクセル数がおよそ800×800の画像と同等になるようにします。
これは便利ですが、OCRや他の多くのアプリケーションでは、もう少し高い解像度が必要です(例:A4またはレターサイズのページ全体を入れる場合)。
- BrucecarlL
おめでとうございます!DeepSeekはついに目を手に入れました — 暗黒時代はもうすぐ終わります。
- jerkstate
ちょうど私の画像認識ベンチマーク(「これはXXXのランドマークですか?」)を実行しましたが、ByteDance Seed 2.1 Turboが正解する多くの画像で間違えます。例えば:
「これはソールズベリー大聖堂ですか」と尋ね、ウェルズ大聖堂の写真を提供すると、「はい、ソールズベリー大聖堂の西側ファサードです」と答えます。ByteDance Seed 2.1 Turboは正しく「いいえ」と答えます。マンハッタン橋の写真をブルックリン橋として送った場合や、シャルトル大聖堂の写真をノートルダムとして送った場合も同様の結果です。
このような画像12枚のベンチマークがあり、Seedは11/12、DeepSeekは6/12しか正解しません。