DeepSeek-v4-flash-vision-exp: новая модель DeepSeek принимает изображения

DeepSeek выпустила экспериментальную модель deepseek-v4-flash-vision-exp, которая принимает изображения вместе с текстом. Модель поддерживает форматы JPEG, PNG, GIF и WebP, а также позволяет передавать картинки тремя способами: встроенным base64, по внешней ссылке или через Files API. Лимиты: до 600 изображений на запрос, максимальный размер одного файла — 64 МиБ, а каждое изображение преобразуется в не более 384 токенов. Модель доступна через OpenAI-совместимые API и Anthropic-совместимый эндпоинт.
Изображения поддерживаются только в сообщениях пользователя: изображения в сообщениях system или assistant возвращают ошибку 400.
- ciberado
Неспособность DS точно видеть скриншоты Playwright — единственное, чего мне действительно не хватает в Sonnet. Это многообещающе.
> Изображения преобразуются в токены на основе их размеров, и эти токены тарифицируются вместе с вашими текстовыми токенами.
> Перед инференсом каждое изображение автоматически масштабируется:
> - Изображения с общим количеством пикселей ниже примерно 384×384 увеличиваются с сохранением пропорций.
> - Более крупные изображения уменьшаются с сохранением пропорций, чтобы общее количество пикселей после масштабирования было примерно как у изображения 800×800.
> В результате на изображение приходится не более 384 токенов: например, изображение 2000×2000 и изображение 5000×5000 потребляют одинаковое количество токенов после масштабирования. Когда запрос содержит несколько изображений, каждое изображение учитывается независимо по тому же правилу — отдельного расчета для мульти-изображений нет.
400 токенов на изображение — это 2500 изображений за доллар, если я не ошибаюсь.
правка: формат.
- leumon
У меня она проваливает простой тест с часами, который Qwen3.8 27B (почти) прошёл.
Дано изображение часов https://files.catbox.moe/kgwa5e.png
Я спросил: «Который час показывают часы?» (в обоих случаях reasoning: high)
DS ответил: Часы показывают *5:10* (и 45 секунд).
Вот разбивка:
* *Часовая стрелка (красная, самая короткая):* указывает на *5*.
* *Минутная стрелка (зелёная, самая длинная):* указывает на *2*, что означает 10 минут.
* *Секундная стрелка (синяя, средняя):* указывает на *9*, что означает 45 секунд.
Qwen ответил: Часы показывают *8:10* (с красной секундной стрелкой на 5, т.е. *8:10:25*).
- *Часовая стрелка* (короткая, синяя) → 8
- *Минутная стрелка* (длинная, зелёная) → 2 (10 минут)
- *Секундная стрелка* (тонкая, красная) → 5 (25 секунд)
Правильный ответ: 08:09:25.
- ggangsir
Наконец-то. Они это поддерживают.
- LorenDB
Я слышал, что DeepSeek v4 Flash 0731 часто предполагает, что у неё есть зрение, а затем, обнаружив, что на самом деле видеть не может, начинает выдумывать текстовые инструменты анализа изображений. В таком случае это отличное обновление для модели.
Лично мне пришлось сказать 0731, чтобы она воздерживалась от просмотра скриншотов, потому что она постоянно ломала свои сессии, пытаясь читать изображения.
- zmmmmm
> Более крупные изображения уменьшаются с сохранением пропорций, чтобы общее количество пикселей после масштабирования было примерно как у изображения 800×800.
Это полезно, но для OCR и многих других применений нужно побольше (например, для полной страницы формата A4 / Letter).
- cjg007
Я уже несколько месяцев использую v4-flash без зрения — это мой выбор для задач с кодом. Теперь со зрением мне интересно: если эта модель может делать всё то же, что и текстовая версия (плюс видеть изображения), зачем тогда нужна текстовая?
Это просто цена/задержка? Или текстовая версия в чём-то лучше?
- meetpateltech
Новостное объявление с бенчмарками: https://api-docs.deepseek.com/news/news260821/
- BrucecarlL
Поздравляю! DeepSeek наконец-то обрёл глаза — тёмные времена остаются позади.