DeepSeek-v4-flash-vision-exp: el modelo de DeepSeek que analiza imágenes

DeepSeek ha publicado la documentación de su nuevo modelo de visión, deepseek-v4-flash-vision-exp, que acepta imágenes junto a texto para describir fotos, leer texto de capturas y analizar gráficos. El modelo soporta formatos JPEG, PNG, GIF y WebP, y admite hasta 600 imágenes por petición, con un límite de 48 MiB para el cuerpo de la solicitud. Las imágenes se pueden enviar en base64, mediante URL externa o a través de la Files API. El modelo también es compatible con la API de Anthropic y la Responses API.
El formato se detecta a partir del contenido real del archivo, no del nombre del archivo ni del tipo MIME declarado.
- ciberado
Que DeepSeek no pueda ver con precisión las capturas de pantalla de Playwright es lo único que echo de menos de Sonnet. Esto es prometedor.
> Las imágenes se convierten en tokens según sus dimensiones, y estos tokens se facturan junto con tus tokens de texto.
> Antes de la inferencia, cada imagen se redimensiona automáticamente:
> - Las imágenes con un número total de píxeles inferior a aproximadamente 384×384 se amplían manteniendo su relación de aspecto.
> - Las imágenes más grandes se reducen manteniendo su relación de aspecto para que el número total de píxeles tras el redimensionado sea aproximadamente el de una imagen de 800×800.
> Como resultado, hay un límite superior de 384 tokens por imagen: por ejemplo, una imagen de 2000×2000 y una de 5000×5000 consumen el mismo número de tokens tras el redimensionado. Cuando una solicitud contiene varias imágenes, cada una se cuenta de forma independiente bajo la misma regla: no hay un cálculo separado para solicitudes con varias imágenes.
400 tokens por imagen resultan en 2.500 imágenes por dólar, si no me equivoco.
edit: formato.
- leumon
Falla en la prueba simple del reloj para mí, que Qwen3.8 27B acertó (casi).
Dada una imagen de un reloj https://files.catbox.moe/kgwa5e.png
Le pregunté "¿qué hora marca el reloj?" (ambos con razonamiento: alto)
DS respondió: El reloj marca *5:10* (y 45 segundos).
Aquí está el desglose:
* *Manecilla de la hora (roja, la más corta):* Apuntando al *5*.
* *Manecilla de los minutos (verde, la más larga):* Apuntando al *2*, que representa 10 minutos.
* *Manecilla de los segundos (azul, mediana):* Apuntando al *9*, que representa 45 segundos.
Qwen respondió: El reloj marca *8:10* (con la manecilla roja de los segundos en el 5, es decir, *8:10:25*).
- *Manecilla de la hora* (corta, azul) → 8
- *Manecilla de los minutos* (larga, verde) → 2 (10 minutos)
- *Manecilla de los segundos* (fina, roja) → 5 (25 segundos)
La respuesta correcta es 08:09:25.
- LorenDB
He oído que DeepSeek v4 Flash 0731 ha asumido con frecuencia que tiene capacidades de visión y luego recurre a inventar herramientas de análisis de imágenes basadas en texto cuando descubre que en realidad no puede ver. En ese caso, esta es una gran mejora para el modelo.
Anécdota: tuve que decirle a 0731 que se abstuviera de ver capturas de pantalla porque seguía rompiendo sus sesiones al intentar leer imágenes.
- cjg007
He estado usando v4-flash sin visión durante estos meses: es mi opción preferida para tareas de código. Ahora con visión, me pregunto: si este modelo puede hacer todo lo que hace la versión solo texto (además de ver imágenes), ¿por qué mantener la versión solo texto?
¿Es solo cuestión de coste/latencia? ¿O hay algo que la versión solo texto hace mejor?
- zmmmmm
> Las imágenes más grandes se reducen manteniendo su relación de aspecto, de modo que el número total de píxeles tras el redimensionado sea aproximadamente el de una imagen de 800×800.
Es útil, pero para OCR y muchas otras aplicaciones necesita ser un poco más alto (por ejemplo, para poner una página completa A4 / Carta).
- meetpateltech
Anuncio de noticias con benchmarks: https://api-docs.deepseek.com/news/news260821/
- BrucecarlL
¡Felicidades! DeepSeek por fin ha ganado ojos: los días oscuros están a punto de quedar atrás.
- v9v
Interesante. ¿No estaba diciendo el fundador de DeepSeek que habían decidido explícitamente no centrarse en modelos multimodales en absoluto y que iban a ser solo texto porque creían que era suficiente para lograr la AGI?