DeepSeek v4 Flash Vision: Bilderkennung im API-Experiment
DeepSeek-v4-flash-vision-exp

DeepSeek hat mit deepseek-v4-flash-vision-exp ein experimentelles Vision-Modell veröffentlicht, das Bilder neben Text verarbeitet. Es unterstützt JPEG, PNG, GIF und WebP und ist über die OpenAI-kompatiblen Chat-Completions- und Responses-APIs sowie den Anthropic-Endpunkt nutzbar. Bilder lassen sich als Base64, externe URLs oder über die Files API übergeben. Die maximale Bildgröße beträgt 64 MiB, pro Anfrage sind bis zu 600 Bilder erlaubt. Das Modell skaliert Bilder vor der Inferenz auf etwa 800×800 Pixel, was die Token-Kosten auf höchstens 384 pro Bild begrenzt.
Bilder werden basierend auf ihren Abmessungen in Tokens umgewandelt und zusammen mit Ihren Text-Tokens abgerechnet.
- ciberado
Die Tatsache, dass DS Playwright-Screenshots nicht präzise ansehen kann, ist das Einzige, was ich bei Sonnet wirklich vermisse. Das hier ist vielversprechend.
> Bilder werden basierend auf ihren Abmessungen in Tokens umgewandelt, und diese Tokens werden zusammen mit deinen Text-Tokens abgerechnet.
> Vor der Inferenz wird jedes Bild automatisch in der Größe angepasst:
> - Bilder mit einer Gesamtpixelzahl unter ungefähr 384×384 werden unter Beibehaltung des Seitenverhältnisses hochskaliert.
> - Größere Bilder werden unter Beibehaltung des Seitenverhältnisses herunterskaliert, sodass die Gesamtpixelzahl nach der Größenänderung ungefähr der eines 800×800-Bildes entspricht.
> Dadurch gibt es eine Obergrenze von 384 Tokens pro Bild: Zum Beispiel verbrauchen ein 2000×2000-Bild und ein 5000×5000-Bild nach der Größenänderung die gleiche Anzahl von Tokens. Wenn eine Anfrage mehrere Bilder enthält, wird jedes Bild unabhängig nach derselben Regel gezählt—es gibt keine separate Berechnung für Anfragen mit mehreren Bildern.
400 Tokens pro Bild ergibt 2.500 Bilder pro Dollar, wenn ich mich nicht irre.
Bearbeitung: Format.
- leumon
Es besteht den einfachen Uhr-Test für mich nicht, den Qwen3.8 27B (fast) richtig hatte.
Angenommen, ein Bild einer Uhr https://files.catbox.moe/kgwa5e.png
Ich fragte es: "Wie spät ist es auf der Uhr?" (beide mit Reasoning: hoch)
DS antwortete: Die Uhr zeigt *5:10* (und 45 Sekunden).
Hier ist die Aufschlüsselung:
* *Stundenzeiger (rot, am kürzesten):* Zeigt auf die *5*.
* *Minutenzeiger (grün, am längsten):* Zeigt auf die *2*, was 10 Minuten bedeutet.
* *Sekundenzeiger (blau, mittellang):* Zeigt auf die *9*, was 45 Sekunden bedeutet.
Qwen antwortete: Die Uhr zeigt *8:10* (mit dem roten Sekundenzeiger auf der 5, d.h. *8:10:25*).
- *Stundenzeiger* (kurz, blau) → 8
- *Minutenzeiger* (lang, grün) → 2 (10 Minuten)
- *Sekundenzeiger* (dünn, rot) → 5 (25 Sekunden)
Die richtige Antwort ist 08:09:25.
- LorenDB
Ich habe gehört, dass DeepSeek v4 Flash 0731 häufig angenommen hat, dass es über Bilderkennungsfähigkeiten verfügt, und dann dazu übergegangen ist, textbasierte Bildanalyse-Tools zu erfinden, wenn es feststellt, dass es eigentlich nicht sehen kann. In diesem Fall ist das hier eine großartige Verbesserung für das Modell.
Anekdotisch musste ich 0731 sagen, es solle davon absehen, Screenshots anzusehen, da es seine Sitzungen ständig unterbrach, indem es versuchte, Bilder zu lesen.
- cjg007
Ich habe v4-flash ohne Bilderkennung in diesem Monat verwendet—es ist meine erste Wahl für Code-Aufgaben. Jetzt mit Bilderkennung frage ich mich: Wenn dieses Modell alles kann, was die reine Textversion kann (plus Bilder sehen), warum sollte man dann die reine Textversion behalten?
Ist es nur Kosten/Latenz? Oder gibt es etwas, das die reine Textversion besser kann?
- zmmmmm
> Größere Bilder werden unter Beibehaltung des Seitenverhältnisses herunterskaliert, sodass die Gesamtpixelzahl nach der Größenänderung ungefähr der eines 800×800-Bildes entspricht.
Es ist nützlich, aber für OCR und viele andere Anwendungen muss es etwas höher sein (z.B. bei einer ganzen A4-/Letter-Seite).
- meetpateltech
Nachrichtenankündigung mit Benchmarks: https://api-docs.deepseek.com/news/news260821/
- BrucecarlL
Herzlichen Glückwunsch! DeepSeek hat endlich Augen bekommen—die dunklen Tage liegen hinter uns.
- v9v
Interessant. Hatte der Gründer von Deepseek nicht gesagt, dass sie sich bewusst dazu entschieden hatten, sich überhaupt nicht auf multimodale Modelle zu konzentrieren und nur Text zu verwenden, weil sie glaubten, dass das ausreicht, um AGI zu erreichen?