DeepSeek, 이미지 입력 지원 'v4-flash-vision' 공개

DeepSeek-v4-flash-vision-exp

DeepSeek, 이미지 입력 지원 'v4-flash-vision' 공개

DeepSeek가 이미지 입력을 지원하는 'deepseek-v4-flash-vision-exp' 모델을 공개했다. JPEG·PNG·GIF·WebP 형식을 지원하며, 이미지는 base64 인코딩, 외부 URL, Files API의 세 가지 방식으로 전달할 수 있다. 이미지는 리사이즈 후 최대 384토큰으로 환산되어 과금되며, 요청 본문 한도는 48MiB, 이미지당 최대 32MiB(파일 API 사용 시 64MiB)다. OpenAI 호환 API 외에도 Anthropic 호환 엔드포인트와 Responses API를 지원한다. 이미지는 사용자 메시지에서만 사용할 수 있으며, 시스템·어시스턴트 메시지에서 사용하면 400 오류가 발생한다.

  1. ciberado

    DS가 Playwright 스크린샷을 정확히 볼 수 없다는 것이 Sonnet에서 정말 그리운 유일한 점입니다. 이건 유망하네요.

    > 이미지는 크기에 따라 토큰으로 변환되며, 이 토큰은 텍스트 토큰과 함께 청구됩니다.

    > 추론 전에 모든 이미지는 자동으로 크기가 조정됩니다:

    > - 총 픽셀 수가 약 384×384 미만인 이미지는 종횡비를 유지하면서 확대됩니다.

    > - 더 큰 이미지는 종횡비를 유지하면서 축소되어 크기 조정 후 총 픽셀 수가 약 800×800 이미지와 비슷해집니다.

    > 결과적으로 이미지당 토큰 상한은 384개입니다. 예를 들어 2000×2000 이미지와 5000×5000 이미지는 크기 조정 후 동일한 토큰 수를 소비합니다. 요청에 여러 이미지가 포함된 경우 각 이미지는 동일한 규칙에 따라 독립적으로 계산되며, 다중 이미지 요청에 대한 별도의 계산은 없습니다.

    제가 틀리지 않았다면 이미지당 400토큰이면 달러당 2,500개의 이미지를 처리할 수 있습니다.

    편집: 형식 수정.

  2. leumon

    저에게는 간단한 시계 테스트에서 실패하는데, Qwen3.8 27B는 (거의) 맞췄습니다.

    시계 이미지가 주어졌을 때 https://files.catbox.moe/kgwa5e.png

    "시계가 몇 시를 가리키나요?"라고 물었습니다 (추론: 높음 모두).

    DS 답변: 시계는 *5:10* (그리고 45초)를 가리킵니다.

    자세한 설명은 다음과 같습니다:

    * *시침 (빨간색, 가장 짧음):* *5*를 가리킵니다.

    * *분침 (초록색, 가장 김):* *2*를 가리키며, 이는 10분을 나타냅니다.

    * *초침 (파란색, 중간 길이):* *9*를 가리키며, 이는 45초를 나타냅니다.

    Qwen 답변: 시계는 *8:10*을 가리킵니다 (빨간 초침이 5에 있음, 즉 *8:10:25*).

    - *시침* (짧음, 파란색) → 8

    - *분침* (김, 초록색) → 2 (10분)

    - *초침* (얇음, 빨간색) → 5 (25초)

    정답은 08:09:25입니다.

  3. LorenDB

    DeepSeek v4 Flash 0731이 시각 기능이 있다고 자주 가정하고, 실제로는 볼 수 없다는 것을 알게 되면 텍스트 기반 이미지 분석 도구를 지어내는 경향이 있다고 들었습니다. 그런 경우, 이번 업그레이드는 모델에 큰 개선입니다.

    일화적으로, 0731에게 스크린샷을 보지 말라고 말해야 했습니다. 이미지를 읽으려고 하면서 세션을 계속 깨뜨렸기 때문입니다.

  4. cjg007

    저는 이번 달 내내 비전 없는 v4-flash를 사용해 왔습니다. 코드 작업에 제首选입니다. 이제 비전이 추가되었으니, 이 모델이 텍스트 전용 버전이 하는 모든 일을 (그리고 이미지도 볼 수 있다면) 할 수 있다면, 왜 텍스트 전용 버전을 유지하는 걸까요?

    단지 비용/지연 시간 때문인가요? 아니면 텍스트 전용이 더 잘하는 것이 있나요?

  5. zmmmmm

    > 더 큰 이미지는 종횡비를 유지하면서 축소되어 크기 조정 후 총 픽셀 수가 약 800×800 이미지와 비슷해집니다.

    유용하지만 OCR 및 많은 다른 응용 프로그램에서는 조금 더 높아야 합니다 (예: 전체 A4/Letter 크기 페이지를 넣는 경우).

  6. meetpateltech

    벤치마크가 포함된 뉴스 발표: https://api-docs.deepseek.com/news/news260821/

  7. BrucecarlL

    축하합니다! DeepSeek가 마침내 눈을 얻었습니다 — 암흑기는 곧 끝날 것입니다.

  8. v9v

    흥미롭네요. Deepseek의 창립자가 멀티모달 모델에 전혀 집중하지 않기로 명시적으로 결정했고, AGI를 달성하기에 충분하다고 믿기 때문에 텍스트 전용으로 갈 것이라고 말하지 않았나요?

이 날의 다른 글

2026-08-21