Gemini 3.8 Flash登場:ソフトウェアエンジニアリングとエージェント知識ワークフローを強化
Google DeepMindがGemini 3.8 Flashのモデルカードを公開。Gemini 3.7 Flashをベースに、ソフトウェアエンジニアリングとエージェント知識ワークフローでの性能が向上。カスタマイズ可能な努力レベルで品質・コスト・レイテンシを調整でき、1Mトークンのコンテキストウィンドウと64Kトークンの出力をサポート。安全性評価では、多言語安全性が+5.4pp改善する一方、テキスト安全性は-0.4ppとわずかに低下。フロンティア安全性の評価では、重要な能力レベルに達しないとされている。
Gemini 3.8 Flashは、ソフトウェアエンジニアリングとエージェント知識ワークフローにわたって性能向上を実現し、Gemini 3モデルファミリーの次のイテレーションです。
HNでの議論
410- simonw
この速度と、このモデルがHTMLやJavaScriptに本当に優れているという事実が組み合わさって、とてもエキサイティングです。
「かっこいいものをHTMLで作って」というプロンプトに対して、1.8セントと13秒で得られた結果がこちらです:
https://gisthost.github.io/?6a77bc41a81718c6aaa10d4ab243c59f
トランスクリプトはこちら(チャットの一部でした):https://gist.github.com/simonw/b6149a49d327164d67d62c3d12992...
- jampa
私は個人的な旅行計画アプリにGemini 3.7を使っています。複数のベンチマークで、試したすべての項目で上位にランクされています:
- 実世界の知識(何がいつ開閉するか、地理的地域、歴史的事実)。また、場所の集まりから訪問順序を組み立てるのも最も得意です。
- 写真のランキング(どの写真をヒーローにするか)。Geminiは、写真がそのものの写真なのか、それともそこからの眺めなのかを判断できます。
- 文書解析(PDFから関連する旅行情報を抽出する)。
コーディング以外にLLMを使うなら、他のモデルの方が人気があるからといって、私がそうだったようにGeminiを軽視しないことを強くお勧めします。
- mattlondon
現在、https://deepswe.datacurve.ai でトップです - Opus 5を破っています!
https://artificialanalysis.ai/models/gemini-3-8-flash は、インテリジェンススコア59で、Opus 5 mediumと同じです!
うわー、フラッシュモデルとしては、これはベンチマークで強力な結果を出しているようです。実際に使ってみた感じはまだわかりませんが。
- simonw
ペリカン(思考努力:高、中、低):https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - 高コスト 8.9742セント
比較用の3.7のペリカンはこちら:https://tools.simonwillison.net/markdown-svg-renderer.html?u... - 高コスト 8.4387セント
(3.8では、3.7と比較して思考レベル低は後退していると思います。)
- simonw
Geminiモデルで最も興味深い点は、依然としてマルチモーダルサポートです。音声と動画の入力を受け付けますが、OpenAIとAnthropicのフラッグシップはまだ画像のみです。
また、Gemini Flashはかなり安価なので、画像や動画から構造化データを抽出するようなメディア分析に最適なファミリーです。
- brap
人々は最近Geminiを軽視してきましたが、ここ最近のFlashリリース(非常に急速でした)は本当に素晴らしいです。
この種の高速で安価なモデルは、検証可能で無限に再試行できるタスク(コーディングなど)に最適で、優れたハーネスを使えば、基本的にフロンティアレベルの結果を(時間とコストをほんの一部で)得ることができます。
- Galorious
このモデルをAPIではなくGoogleサブスクリプション経由で使っている人はいますか? 以前、gemini cliとagy(codexやclaude codeによって呼び出されるヘッドレス)を使って試しましたが、信じられないほどバグが多く、1/2の確率で停止してしまい、解約しました。それが変わったかどうか知りたいです!
- abixb
ここでのGoogleの戦略は気に入っています。最近のこれらの新しいFlashモデル(Flash 3.6、3.7、そして今回の3.8)は、明らかに、はるかに大きな未公開モデル(噂によるとGemini 3.5 Pro)から蒸留されています。
モデルリリースのあまり議論されない側面の一つに、キャッシュの無効化(基盤となるアーキテクチャ、重み、またはトークナイザーの変更)があります。Googleは、2月にリリースした最後の「Pro」バージョン(3.1)から最大限を引き出そうとしているように思えます。
小さなモデルが大きな兄弟に追いついてきているのは、素晴らしいニュースです。
- mattlondon
うわー、これは3.7 Flashから3、4週間後で、それも3.6 Flashから3、4週間後だったと思います。
詳細な情報を待ち望んでいますが、Demisが指揮を執らずにDeepmindが解き放たれ、フルスピードで動いているように聞こえますね?驚きです!
この時点でネタですが、3.5 Proはどこにあるのでしょうか :)
- a11r
定期的なアップデートと段階的な改善という戦略がうまく機能しているようです。興味深いことに、Artificial Analysis Intelligence Indexスコアで最大のジャンプは、推論レベル中(3.7は低、中、高で51、53、57、3.8はそれぞれ52、57、59)です。低い推論レベルでのスコアは、モデルの能力をより示していると思います。なぜなら、高い推論レベルはベンチマーク最大化に焦点を当てているからです。私たちは本番環境で最も低い推論レベルを使用しており、良い結果が得られています。