Google DeepMind выпускает Gemini 3.8 Flash: быстрее, безопаснее и с контекстом до 1M токенов

Google DeepMind представила Gemini 3.8 Flash — новую модель в семействе Gemini 3, которая развивает достижения Gemini 3.7 Flash в области разработки ПО и агентных рабочих процессов. Модель поддерживает настраиваемые уровни усилий для баланса качества, стоимости и задержки, а также принимает на вход текст, изображения, аудио и видео с контекстным окном до 1M токенов. В отчёте о безопасности отмечается, что по сравнению с 3.7 Flash модель показывает схожие показатели безопасности, но с небольшим регрессом в многоязычной безопасности. Оценки Frontier Safety Framework не выявили новых критических возможностей.

Наши оценки показали, что Gemini 3.8 Flash не имеет значимых новых возможностей или существенного роста производительности в областях, указанных в нашей Frontier Safety Framework, по сравнению с Gemini 3.7 Flash.
  1. simonw

    Скорость в сочетании с тем, что эта штука реально хороша в HTML и JavaScript, довольно захватывает. Вот что я получил за 1,8 цента и 13 секунд по запросу "сделай мне классную штуку на html": https://gisthost.github.io/?6a77bc41a81718c6aaa10d4ab243c59f Транскрипт здесь (это было частью чата): https://gist.github.com/simonw/b6149a49d327164d67d62c3d12992...

  2. jampa

    Я использую Gemini 3.7 для своего личного приложения по планированию поездок. По нескольким бенчмаркам он превосходит всё, что я пробовал:

    - Знание реального мира (когда что-то открывается и закрывается, географический регион, исторические факты). Также он лучше всех справляется с тем, чтобы взять группу мест и выстроить порядок посещения.

    - Ранжирование фотографий (какое фото должно быть главным). Gemini может определить, является ли фото самого объекта или видом с него.

    - Разбор документов (извлечение нужной информации о поездке из PDF).

    Если вы используете LLM для чего-то, кроме кодинга, я определенно рекомендую не сбрасывать со счетов Gemini, как это делал я, только потому, что другие модели более популярны.

  3. mattlondon

    Сейчас на вершине на https://deepswe.datacurve.ai — обходит Opus 5! https://artificialanalysis.ai/models/gemini-3-8-flash показывает показатель интеллекта 59, такой же, как у Opus 5 medium! Вау — для flash-модели это выглядит мощно по бенчмаркам. Посмотрим, каково это в использовании.

  4. simonw

    Пеликаны (уровень мышления высокий, средний, низкий): https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - высокая стоимость 8,9742 цента. Вот пеликаны 3.7 для сравнения: https://tools.simonwillison.net/markdown-svg-renderer.html?u... - высокая стоимость 8,4387 цента. (Я думаю, что низкий уровень мышления — это регресс в 3.8 по сравнению с 3.7.)

  5. simonw

    Самое интересное в моделях Gemini — это по-прежнему их мультимодальная поддержка: они принимают аудио- и видео-ввод, а флагманы OpenAI и Anthropic до сих пор только с изображениями. Gemini Flash также довольно дешев, так что это отличное семейство для анализа медиа, например, извлечения структурированных данных из изображений и видео.

  6. brap

    Люди в последнее время недооценивали Gemini, но эти последние Flash-релизы (которые были очень быстрыми) чертовски хороши. Такие быстрые и дешевые модели отлично подходят для задач, которые проверяемы и могут повторяться бесконечно (например, кодинг), по сути, можно получить результаты уровня frontier с хорошей обвязкой (за долю времени и денег).

  7. abixb

    Мне нравится стратегия Google здесь. Эти новые Flash-модели последнего времени (Flash 3.6, 3.7 и теперь 3.8), очевидно, дистиллированы из гораздо более крупной невыпущенной модели (Gemini 3.5 Pro, если я правильно помню слухи). Один аспект релизов моделей, который обсуждается не так часто, — это инвалидация кэша (изменения в базовой архитектуре, весах или токенизаторах); я считаю, что Google, похоже, выжимает максимум из последней версии 'Pro', которую они выпустили с 3.1 в феврале. Маленькие модели, догоняющие своих старших братьев и сестер, — фантастическая новость.

  8. mattlondon

    Вау, это после чего — 3 или 4 недели с момента 3.7 Flash, который тоже был через 3 или 4 недели после 3.6 Flash, если я правильно помню? Я с нетерпением жду дополнительной информации, но похоже, что Deepmind без Демиса, который принимает решения, был выпущен на свободу и работает на полной скорости? Шок! На данный момент это, конечно, мем, но где 3.5 Pro :)

  9. Galorious

    Кто-нибудь здесь использует эти модели через подписку Google (не API)? Я пробовал в прошлом использовать gemini cli, а затем agy — headless, вызываемый codex и claude code, но они были настолько невероятно багованные, что зависали в 1/2 случаев, и я отменил. Интересно, изменилось ли это!

  10. a11r

    Похоже, стратегия регулярных обновлений с инкрементальными улучшениями работает хорошо. Интересно, что самый большой скачок в индексе интеллекта Artificial Analysis — для уровня рассуждений Medium (у 3.7 было 51, 53, 57 для Low, Medium и High, у 3.8 — 52, 57, 59 соответственно). Я думаю, что оценки на более низких уровнях рассуждений более показательны для возможностей модели, поскольку более высокие уровни рассуждений сосредоточены на накрутке бенчмарков. Мы используем самый низкий уровень рассуждений в продакшене с хорошими результатами.

Ещё за этот день

2026-09-02