DeepSeek-v4-flash-vision-exp: новая модель DeepSeek принимает изображения

DeepSeek-v4-flash-vision-exp: новая модель DeepSeek принимает изображения

DeepSeek выпустила экспериментальную модель deepseek-v4-flash-vision-exp, которая принимает изображения вместе с текстом. Модель поддерживает форматы JPEG, PNG, GIF и WebP, а также позволяет передавать картинки тремя способами: встроенным base64, по внешней ссылке или через Files API. Лимиты: до 600 изображений на запрос, максимальный размер одного файла — 64 МиБ, а каждое изображение преобразуется в не более 384 токенов. Модель доступна через OpenAI-совместимые API и Anthropic-совместимый эндпоинт.

Изображения поддерживаются только в сообщениях пользователя: изображения в сообщениях system или assistant возвращают ошибку 400.
  1. ciberado

    Неспособность DS точно видеть скриншоты Playwright — единственное, чего мне действительно не хватает в Sonnet. Это многообещающе.

    > Изображения преобразуются в токены на основе их размеров, и эти токены тарифицируются вместе с вашими текстовыми токенами.

    > Перед инференсом каждое изображение автоматически масштабируется:

    > - Изображения с общим количеством пикселей ниже примерно 384×384 увеличиваются с сохранением пропорций.

    > - Более крупные изображения уменьшаются с сохранением пропорций, чтобы общее количество пикселей после масштабирования было примерно как у изображения 800×800.

    > В результате на изображение приходится не более 384 токенов: например, изображение 2000×2000 и изображение 5000×5000 потребляют одинаковое количество токенов после масштабирования. Когда запрос содержит несколько изображений, каждое изображение учитывается независимо по тому же правилу — отдельного расчета для мульти-изображений нет.

    400 токенов на изображение — это 2500 изображений за доллар, если я не ошибаюсь.

    правка: формат.

  2. leumon

    У меня она проваливает простой тест с часами, который Qwen3.8 27B (почти) прошёл.

    Дано изображение часов https://files.catbox.moe/kgwa5e.png

    Я спросил: «Который час показывают часы?» (в обоих случаях reasoning: high)

    DS ответил: Часы показывают *5:10* (и 45 секунд).

    Вот разбивка:

    * *Часовая стрелка (красная, самая короткая):* указывает на *5*.

    * *Минутная стрелка (зелёная, самая длинная):* указывает на *2*, что означает 10 минут.

    * *Секундная стрелка (синяя, средняя):* указывает на *9*, что означает 45 секунд.

    Qwen ответил: Часы показывают *8:10* (с красной секундной стрелкой на 5, т.е. *8:10:25*).

    - *Часовая стрелка* (короткая, синяя) → 8

    - *Минутная стрелка* (длинная, зелёная) → 2 (10 минут)

    - *Секундная стрелка* (тонкая, красная) → 5 (25 секунд)

    Правильный ответ: 08:09:25.

  3. ggangsir

    Наконец-то. Они это поддерживают.

  4. LorenDB

    Я слышал, что DeepSeek v4 Flash 0731 часто предполагает, что у неё есть зрение, а затем, обнаружив, что на самом деле видеть не может, начинает выдумывать текстовые инструменты анализа изображений. В таком случае это отличное обновление для модели.

    Лично мне пришлось сказать 0731, чтобы она воздерживалась от просмотра скриншотов, потому что она постоянно ломала свои сессии, пытаясь читать изображения.

  5. zmmmmm

    > Более крупные изображения уменьшаются с сохранением пропорций, чтобы общее количество пикселей после масштабирования было примерно как у изображения 800×800.

    Это полезно, но для OCR и многих других применений нужно побольше (например, для полной страницы формата A4 / Letter).

  6. cjg007

    Я уже несколько месяцев использую v4-flash без зрения — это мой выбор для задач с кодом. Теперь со зрением мне интересно: если эта модель может делать всё то же, что и текстовая версия (плюс видеть изображения), зачем тогда нужна текстовая?

    Это просто цена/задержка? Или текстовая версия в чём-то лучше?

  7. meetpateltech

    Новостное объявление с бенчмарками: https://api-docs.deepseek.com/news/news260821/

  8. BrucecarlL

    Поздравляю! DeepSeek наконец-то обрёл глаза — тёмные времена остаются позади.

Ещё за этот день

2026-08-21