Gemini 3.8 Flash登場:ソフトウェアエンジニアリングとエージェント知識ワークフローを強化

Google DeepMindがGemini 3.8 Flashのモデルカードを公開。Gemini 3.7 Flashをベースに、ソフトウェアエンジニアリングとエージェント知識ワークフローでの性能が向上。カスタマイズ可能な努力レベルで品質・コスト・レイテンシを調整でき、1Mトークンのコンテキストウィンドウと64Kトークンの出力をサポート。安全性評価では、多言語安全性が+5.4pp改善する一方、テキスト安全性は-0.4ppとわずかに低下。フロンティア安全性の評価では、重要な能力レベルに達しないとされている。

Gemini 3.8 Flashは、ソフトウェアエンジニアリングとエージェント知識ワークフローにわたって性能向上を実現し、Gemini 3モデルファミリーの次のイテレーションです。
  1. simonw

    この速度と、このモデルがHTMLやJavaScriptに本当に優れているという事実が組み合わさって、とてもエキサイティングです。

    「かっこいいものをHTMLで作って」というプロンプトに対して、1.8セントと13秒で得られた結果がこちらです:

    https://gisthost.github.io/?6a77bc41a81718c6aaa10d4ab243c59f

    トランスクリプトはこちら(チャットの一部でした):https://gist.github.com/simonw/b6149a49d327164d67d62c3d12992...

  2. jampa

    私は個人的な旅行計画アプリにGemini 3.7を使っています。複数のベンチマークで、試したすべての項目で上位にランクされています:

    - 実世界の知識(何がいつ開閉するか、地理的地域、歴史的事実)。また、場所の集まりから訪問順序を組み立てるのも最も得意です。

    - 写真のランキング(どの写真をヒーローにするか)。Geminiは、写真がそのものの写真なのか、それともそこからの眺めなのかを判断できます。

    - 文書解析(PDFから関連する旅行情報を抽出する)。

    コーディング以外にLLMを使うなら、他のモデルの方が人気があるからといって、私がそうだったようにGeminiを軽視しないことを強くお勧めします。

  3. mattlondon

    現在、https://deepswe.datacurve.ai でトップです - Opus 5を破っています!

    https://artificialanalysis.ai/models/gemini-3-8-flash は、インテリジェンススコア59で、Opus 5 mediumと同じです!

    うわー、フラッシュモデルとしては、これはベンチマークで強力な結果を出しているようです。実際に使ってみた感じはまだわかりませんが。

  4. simonw

    ペリカン(思考努力:高、中、低):https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - 高コスト 8.9742セント

    比較用の3.7のペリカンはこちら:https://tools.simonwillison.net/markdown-svg-renderer.html?u... - 高コスト 8.4387セント

    (3.8では、3.7と比較して思考レベル低は後退していると思います。)

  5. simonw

    Geminiモデルで最も興味深い点は、依然としてマルチモーダルサポートです。音声と動画の入力を受け付けますが、OpenAIとAnthropicのフラッグシップはまだ画像のみです。

    また、Gemini Flashはかなり安価なので、画像や動画から構造化データを抽出するようなメディア分析に最適なファミリーです。

  6. brap

    人々は最近Geminiを軽視してきましたが、ここ最近のFlashリリース(非常に急速でした)は本当に素晴らしいです。

    この種の高速で安価なモデルは、検証可能で無限に再試行できるタスク(コーディングなど)に最適で、優れたハーネスを使えば、基本的にフロンティアレベルの結果を(時間とコストをほんの一部で)得ることができます。

  7. Galorious

    このモデルをAPIではなくGoogleサブスクリプション経由で使っている人はいますか? 以前、gemini cliとagy(codexやclaude codeによって呼び出されるヘッドレス)を使って試しましたが、信じられないほどバグが多く、1/2の確率で停止してしまい、解約しました。それが変わったかどうか知りたいです!

  8. abixb

    ここでのGoogleの戦略は気に入っています。最近のこれらの新しいFlashモデル(Flash 3.6、3.7、そして今回の3.8)は、明らかに、はるかに大きな未公開モデル(噂によるとGemini 3.5 Pro)から蒸留されています。

    モデルリリースのあまり議論されない側面の一つに、キャッシュの無効化(基盤となるアーキテクチャ、重み、またはトークナイザーの変更)があります。Googleは、2月にリリースした最後の「Pro」バージョン(3.1)から最大限を引き出そうとしているように思えます。

    小さなモデルが大きな兄弟に追いついてきているのは、素晴らしいニュースです。

  9. mattlondon

    うわー、これは3.7 Flashから3、4週間後で、それも3.6 Flashから3、4週間後だったと思います。

    詳細な情報を待ち望んでいますが、Demisが指揮を執らずにDeepmindが解き放たれ、フルスピードで動いているように聞こえますね?驚きです!

    この時点でネタですが、3.5 Proはどこにあるのでしょうか :)

  10. a11r

    定期的なアップデートと段階的な改善という戦略がうまく機能しているようです。興味深いことに、Artificial Analysis Intelligence Indexスコアで最大のジャンプは、推論レベル中(3.7は低、中、高で51、53、57、3.8はそれぞれ52、57、59)です。低い推論レベルでのスコアは、モデルの能力をより示していると思います。なぜなら、高い推論レベルはベンチマーク最大化に焦点を当てているからです。私たちは本番環境で最も低い推論レベルを使用しており、良い結果が得られています。

この日のほかの記事

2026-09-02