DeepSeek v4 Flash Vision: Bilderkennung im API-Experiment

DeepSeek-v4-flash-vision-exp

DeepSeek v4 Flash Vision: Bilderkennung im API-Experiment

DeepSeek hat mit deepseek-v4-flash-vision-exp ein experimentelles Vision-Modell veröffentlicht, das Bilder neben Text verarbeitet. Es unterstützt JPEG, PNG, GIF und WebP und ist über die OpenAI-kompatiblen Chat-Completions- und Responses-APIs sowie den Anthropic-Endpunkt nutzbar. Bilder lassen sich als Base64, externe URLs oder über die Files API übergeben. Die maximale Bildgröße beträgt 64 MiB, pro Anfrage sind bis zu 600 Bilder erlaubt. Das Modell skaliert Bilder vor der Inferenz auf etwa 800×800 Pixel, was die Token-Kosten auf höchstens 384 pro Bild begrenzt.

Bilder werden basierend auf ihren Abmessungen in Tokens umgewandelt und zusammen mit Ihren Text-Tokens abgerechnet.

Mehr von diesem Tag

2026-08-21