Gemini 3.8 Flash: avances en ingeniería de software y agentes

Google DeepMind presenta la ficha técnica de Gemini 3.8 Flash, la nueva iteración de su familia de modelos que mejora el rendimiento en ingeniería de software y flujos de trabajo de conocimiento agéntico. Basado en Gemini 3.7 Flash, mantiene niveles de esfuerzo configurables para equilibrar calidad, costo y latencia. La ficha detalla arquitectura, datos de entrenamiento, evaluaciones de seguridad y limitaciones conocidas, incluyendo una ligera regresión en seguridad multilingüe.

Gemini 3.8 Flash está diseñado para escalar de manera rentable agentes de producción de propósito general, incluidos casos de uso como ingeniería de software, tareas de agente y flujos de trabajo complejos de conocimiento.
  1. simonw

    La velocidad combinada con el hecho de que esta cosa es realmente buena en HTML y JavaScript es bastante emocionante.

    Esto es lo que obtuve por 1,8 centavos y 13 segundos a partir de la indicación "hazme algo genial en html":

    https://gisthost.github.io/?6a77bc41a81718c6aaa10d4ab243c59f

    Transcripción aquí (era parte de un chat): https://gist.github.com/simonw/b6149a49d327164d67d62c3d12992...

  2. jampa

    He estado usando Gemini 3.7 para mi aplicación personal de planificación de viajes. En múltiples benchmarks, ocupa un lugar más alto en todo lo que probé:

    - Conocimiento del mundo real (cuándo abre y cierra un lugar, la región geográfica, datos históricos). También es el mejor para tomar un grupo de lugares y calcular un orden de visita.

    - Clasificación de fotos (qué foto debería ser la principal). Gemini puede decir si una foto es del lugar o de la vista desde él.

    - Análisis de documentos (extraer la información relevante del viaje de los PDF).

    Si usas LLMs para algo que no sea programación, definitivamente recomiendo no descartar a Gemini como hice yo solo porque otros modelos son más populares.

  3. mattlondon

    Actualmente en la cima en https://deepswe.datacurve.ai - ¡superando a Opus 5!

    https://artificialanalysis.ai/models/gemini-3-8-flash muestra una puntuación de inteligencia de 59, ¡la misma que Opus 5 medium!

    Vaya - para un modelo flash esto parece tener un rendimiento potente en los benchmarks. Queda por ver cómo es usarlo.

  4. simonw

    Pelicans (esfuerzo de pensamiento alto, medio, bajo): https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - costo alto 8.9742 centavos

    Aquí están los pelicans 3.7 para comparar: https://tools.simonwillison.net/markdown-svg-renderer.html?u... - costo alto 8.4387 centavos

    (Creo que el nivel de pensamiento bajo es una regresión en 3.8 en comparación con 3.7.)

  5. simonw

    Lo más interesante de los modelos Gemini sigue siendo su soporte multimodal: aceptan entrada de audio y video, mientras que los modelos insignia de OpenAI y Anthropic todavía son solo de imagen.

    Gemini Flash también es bastante barato, por lo que es una gran familia para realizar análisis de medios, como extraer datos estructurados de imágenes y videos.

  6. brap

    La gente ha estado subestimando a Gemini últimamente, pero estas últimas versiones de Flash (que fueron muy rápidas) son muy buenas.

    Este tipo de modelos rápidos y baratos son excelentes para tareas que son verificables y se pueden reintentar infinitamente (como programar); básicamente puedes obtener resultados de frontera con un buen marco de trabajo (a una fracción del tiempo y el dinero).

  7. abixb

    Me gusta la estrategia de Google aquí. Estos nuevos modelos Flash (Flash 3.6, 3.7 y ahora 3.8) obviamente han sido destilados de un modelo mucho más grande no publicado (Gemini 3.5 Pro, creo recordar de los rumores).

    Un aspecto de los lanzamientos de modelos que no se discute tanto es la invalidación de caché (cambios en la arquitectura subyacente, pesos o tokenizadores); creo que Google parece estar exprimiendo al máximo la última versión 'Pro' que lanzaron con 3.1 en febrero.

    Los modelos pequeños alcanzando a sus hermanos mayores son noticias fantásticas.

  8. Galorious

    ¿Alguien está usando estos modelos mediante la suscripción de Google (no la API)? Intenté en el pasado usar la CLI de Gemini y luego agy - headless invocado por codex y claude code, pero eran tan increíblemente buggy que se atascaban 1/2 veces y cancelé. Me interesa saber si eso ha cambiado.

  9. mattlondon

    Vaya, esto viene después de - ¿3 o 4 semanas desde 3.7 Flash, que también fue 3 o 4 semanas después de 3.6 Flash si no recuerdo mal?

    Espero con ansias más información, pero parece que Deepmind sin Demis tomando las decisiones ha sido liberado y está operando a toda velocidad? ¡Impactante!

    En este punto es un meme, por supuesto, pero ¿dónde está 3.5 Pro :)

  10. a11r

    Parece que la estrategia de actualizaciones regulares con mejoras incrementales está funcionando bien. Curiosamente, el mayor salto en la puntuación del Índice de Inteligencia de Artificial Analysis es para el nivel de razonamiento Medio (3.7 fue 51, 53, 57 para Bajo, Medio y Alto; 3.8 es 52, 57, 59 respectivamente). Creo que las puntuaciones en niveles de razonamiento más bajos son más indicativas de la capacidad del modelo, ya que los niveles más altos se centran en maximizar los benchmarks. Usamos el nivel de razonamiento más bajo en producción con buenos resultados.

Más de este día

2026-09-02