DeepSeek-v4 视觉模型 API 指南

DeepSeek-v4-flash-vision-exp

DeepSeek-v4 视觉模型 API 指南

DeepSeek 推出了 deepseek-v4-flash-vision-exp 模型,支持通过 OpenAI 兼容接口、Anthropic 接口以及 Responses API 处理图像。开发者可以灵活选择三种方式上传图片:Base64 内嵌、外部 URL 或 Files API 文件引用。系统自动根据图像尺寸调整 Token 消耗,单图上限为 384 个 Token,并支持 JPEG、PNG、GIF 和 WebP 格式。文档详细说明了不同场景下的最佳实践,包括大文件处理、多图请求限制以及 detail 参数的使用策略,帮助开发者高效集成视觉分析能力。

图像会根据其尺寸转换为 Token,这些 Token 将与你的文本 Token 一起计费。
  1. ciberado

    DS 无法精准查看 Playwright 截图是我唯一怀念 Sonnet 的地方。这很有希望。

    > 图像会根据其尺寸转换为 token,这些 token 将与你的文本 token 一起计费。

    > 在推理之前,每张图片都会自动调整大小:

    > - 总像素数低于约 384×384 的图像会在保持宽高比的同时被放大。

    > - 较大的图像会在保持宽高比的同时被缩小,使得调整后的总像素数大约相当于 800×800 的图像。

    > 因此,每张图像的 token 上限为 384 个:例如,2000×2000 的图像和 5000×5000 的图像在调整大小后消耗的 token 数量相同。当请求包含多张图像时,每张图像都按相同规则独立计算——多图像请求没有单独的计费计算方式。

    如果我没记错的话,每张图像 400 个 token 意味着每美元可以处理 2,500 张图像。

    编辑:调整格式。

  2. leumon

    它没能通过简单的时钟测试,而 Qwen3.8 27B 几乎答对了。

    给定一张时钟的图片 https://files.catbox.moe/kgwa5e.png

    我问道:“时钟显示的时间是多少?”(两次都设置了 reasoning: high)

    DS 回答:时钟显示 *5:10*(以及 45 秒)。

    以下是详细分析:

    * *时针(红色,最短):* 指向 *5*。

    * *分针(绿色,最长):* 指向 *2*,代表 10 分钟。

    * *秒针(蓝色,中等长度):* 指向 *9*,代表 45 秒。

    Qwen 回答:时钟显示 *8:10*(红色秒针指向 5,即 *8:10:25*)。

    - *时针*(短,蓝色)→ 8

    - *分针*(长,绿色)→ 2(10 分钟)

    - *秒针*(细,红色)→ 5(25 秒)

    正确答案是 08:09:25。

  3. LorenDB

    我听说 DeepSeek v4 Flash 0731 经常假设自己具备视觉能力,一旦发现实际上看不见,就会转而发明基于文本的图像分析工具。如果是这种情况,这对模型来说是一个巨大的升级。

    据我所知,我曾不得不告诉 0731 不要查看截图,因为它一直试图读取图像,导致会话不断中断。

  4. cjg007

    这几个月以来,我一直在使用没有视觉功能的 v4-flash 版本——它是我的代码任务首选。现在有了视觉功能,我在想:如果这个模型能做纯文本版本能做的一切(还能看图像),为什么还要保留纯文本版本呢?

    仅仅是因为成本或延迟吗?还是说纯文本版本在某些方面做得更好?

  5. meetpateltech

    带有基准测试的新闻公告:https://api-docs.deepseek.com/news/news260821/

  6. zmmmmm

    > 较大的图像会在保持宽高比的同时被缩小,使得调整后的总像素数大约相当于 800×800 的图像。

    这很有用,但对于 OCR 和许多其他应用来说,分辨率需要再高一点(例如:放入完整的 A4 或 Letter 尺寸页面)。

  7. BrucecarlL

    恭喜!DeepSeek 终于长出了眼睛——黑暗的日子即将成为过去。

  8. shangyu1994

    看来多模态训练确实很有用,应用开发者可能需要考虑适配多模态智能体。

同日更多故事

2026-08-21