DeepSeek-v4-flash-vision-exp: el modelo de DeepSeek que analiza imágenes

DeepSeek-v4-flash-vision-exp: el modelo de DeepSeek que analiza imágenes

DeepSeek ha publicado la documentación de su nuevo modelo de visión, deepseek-v4-flash-vision-exp, que acepta imágenes junto a texto para describir fotos, leer texto de capturas y analizar gráficos. El modelo soporta formatos JPEG, PNG, GIF y WebP, y admite hasta 600 imágenes por petición, con un límite de 48 MiB para el cuerpo de la solicitud. Las imágenes se pueden enviar en base64, mediante URL externa o a través de la Files API. El modelo también es compatible con la API de Anthropic y la Responses API.

El formato se detecta a partir del contenido real del archivo, no del nombre del archivo ni del tipo MIME declarado.
  1. ciberado

    Que DeepSeek no pueda ver con precisión las capturas de pantalla de Playwright es lo único que echo de menos de Sonnet. Esto es prometedor.

    > Las imágenes se convierten en tokens según sus dimensiones, y estos tokens se facturan junto con tus tokens de texto.

    > Antes de la inferencia, cada imagen se redimensiona automáticamente:

    > - Las imágenes con un número total de píxeles inferior a aproximadamente 384×384 se amplían manteniendo su relación de aspecto.

    > - Las imágenes más grandes se reducen manteniendo su relación de aspecto para que el número total de píxeles tras el redimensionado sea aproximadamente el de una imagen de 800×800.

    > Como resultado, hay un límite superior de 384 tokens por imagen: por ejemplo, una imagen de 2000×2000 y una de 5000×5000 consumen el mismo número de tokens tras el redimensionado. Cuando una solicitud contiene varias imágenes, cada una se cuenta de forma independiente bajo la misma regla: no hay un cálculo separado para solicitudes con varias imágenes.

    400 tokens por imagen resultan en 2.500 imágenes por dólar, si no me equivoco.

    edit: formato.

  2. leumon

    Falla en la prueba simple del reloj para mí, que Qwen3.8 27B acertó (casi).

    Dada una imagen de un reloj https://files.catbox.moe/kgwa5e.png

    Le pregunté "¿qué hora marca el reloj?" (ambos con razonamiento: alto)

    DS respondió: El reloj marca *5:10* (y 45 segundos).

    Aquí está el desglose:

    * *Manecilla de la hora (roja, la más corta):* Apuntando al *5*.

    * *Manecilla de los minutos (verde, la más larga):* Apuntando al *2*, que representa 10 minutos.

    * *Manecilla de los segundos (azul, mediana):* Apuntando al *9*, que representa 45 segundos.

    Qwen respondió: El reloj marca *8:10* (con la manecilla roja de los segundos en el 5, es decir, *8:10:25*).

    - *Manecilla de la hora* (corta, azul) → 8

    - *Manecilla de los minutos* (larga, verde) → 2 (10 minutos)

    - *Manecilla de los segundos* (fina, roja) → 5 (25 segundos)

    La respuesta correcta es 08:09:25.

  3. LorenDB

    He oído que DeepSeek v4 Flash 0731 ha asumido con frecuencia que tiene capacidades de visión y luego recurre a inventar herramientas de análisis de imágenes basadas en texto cuando descubre que en realidad no puede ver. En ese caso, esta es una gran mejora para el modelo.

    Anécdota: tuve que decirle a 0731 que se abstuviera de ver capturas de pantalla porque seguía rompiendo sus sesiones al intentar leer imágenes.

  4. cjg007

    He estado usando v4-flash sin visión durante estos meses: es mi opción preferida para tareas de código. Ahora con visión, me pregunto: si este modelo puede hacer todo lo que hace la versión solo texto (además de ver imágenes), ¿por qué mantener la versión solo texto?

    ¿Es solo cuestión de coste/latencia? ¿O hay algo que la versión solo texto hace mejor?

  5. zmmmmm

    > Las imágenes más grandes se reducen manteniendo su relación de aspecto, de modo que el número total de píxeles tras el redimensionado sea aproximadamente el de una imagen de 800×800.

    Es útil, pero para OCR y muchas otras aplicaciones necesita ser un poco más alto (por ejemplo, para poner una página completa A4 / Carta).

  6. meetpateltech

    Anuncio de noticias con benchmarks: https://api-docs.deepseek.com/news/news260821/

  7. BrucecarlL

    ¡Felicidades! DeepSeek por fin ha ganado ojos: los días oscuros están a punto de quedar atrás.

  8. v9v

    Interesante. ¿No estaba diciendo el fundador de DeepSeek que habían decidido explícitamente no centrarse en modelos multimodales en absoluto y que iban a ser solo texto porque creían que era suficiente para lograr la AGI?

Más de este día

2026-08-21