Gemini 3.7 Flash登場、コーディング性能が大幅向上

GoogleがGemini 3.7 Flashを発表。コーディングとエージェント向けの最もインテリジェントな実用モデルで、デバッグや問題解決、初回コード精度が向上。FrontierCode 1.1 Mainで43.6%、DeepSWE v1.1で65.3%を達成し、Web開発や知識集約型タスクでも優れた性能を発揮。価格は3.6 Flashの半額で、開発者体験も改善。Google AI Pro/Ultra向けのGemini Sparkにも搭載される。
3.7 Flashは、3.6 Flashと比較して、デバッグや問題解決などのコーディングタスクで大幅な向上を示しています。
HNでの議論
495- jjcm
画像→HTMLテストです。Geminiはこれまでずっとビジョン分野で実力以上の働きをしてきたので、いつもこれを試すのが楽しみです。
元画像: https://image.non.io/neonRamenDesigns.webp
Gemini 3.7ビルド: https://html.non.io/neonRamenGemini3.7
比較用のOpus 5ビルド: https://html.non.io/neonRamen
この分野ではOpusが依然として最高峰ですが、価格的に同等のLLMであるGrok 4.6と比べてGemini 3.7がどれだけ優れているか注目に値します: https://html.non.io/neonRamenGrok4.6 。GeminiがGrokを圧倒すると思っていましたが(これまでは概ねそうでした)、Grokはかなり追いついてきています。
- simonw
この3.7 Flashモデルの「プロモーション価格」は本当に変です。
2026年12月31日に価格が2倍になる予定ですが、5ヶ月後もまだこのモデルを使っている人がいるとは考えにくいです。特に3.6 Flashがほんの3週間前に出たばかりなのに!
デフォルトの思考レベルでの最初の試みでは、野心的なペリカンができましたが、自転車に欠陥がありました: https://tools.simonwillison.net/markdown-svg-renderer#url=ht...
その後、高・中・低の思考レベルで試したところ(奇妙なことに「最小」はオプションから外れていました。3.5と3.6ではあったのに)、最初の2つではかなり素晴らしいペリカンができました:
https://tools.simonwillison.net/markdown-svg-renderer.html#u...
追記: これはSafariでの話ですが、ここでの返信で指摘されているように、ペリカンはFirefoxやChromeでは正しく表示されません!おそらくSVG内のこの無効なフィルターが原因だと思われます:
<filter id="shadow" x="-10%" y="-10%" width="130%" height="130%"></filter>
フィルターは追加の要素を含むことを意図しており、空であってはなりません: https://drafts.csswg.org/filter-effects/#FilterElement - そのため、ChromeとFirefoxは壊れたフィルターを参照する要素を削除するが、Safariは削除しないのかもしれません。
- Alifatisk
GPT-5.6 Lunaの非常識な割引以来、あまり興奮することがなくなりました。つまり、ベンチマークを見てください。Gemini 3.7 FlashはDeepSWE 1.1で良い成績を収めていますが、Luna(Max)の方がはるかに優れています。私は個人的にLuna(Xhigh)を使い続けています。それで十分であり、推論トークンでコンテキストウィンドウをあまり肥大化させないからです。
> 2027年1月1日以降、入力トークン$1.50/1M、出力トークン$7.50/1Mが適用されます。
これをLunaの入力$0.2/1M(キャッシュ時$0.02)と出力$1.2/1Mと比較してください。
- wxw
Luna/Terraとのベンチマークを公開する必要があります。Lunaははるかに安価で、Flashの必要性を弱めているように感じます。
私はFlashシリーズのモデルは、低コスト・大量処理・主にテキストベースのユースケース(例:要約、解析、フォーマット)向けであり、低コストが強調されるものだと考えてきました。
[編集: ああ、ベンチマークはこちら: https://blog.google/innovation-and-ai/models-and-research/ge...
TerraというよりLunaの競合相手で、興味深いポジショニングです。ミッドティアのモデルでの差別化はかなり難しいと感じます。]
- parasti
実際の発表: https://blog.google/innovation-and-ai/models-and-research/ge...
つまり、3.6 Flashより優れていて、価格は半額です。最近のGeminiモデルにはかなり興奮しています。仕事で一日中Opus 5を待っていた後だと、本当に速く感じます。
- twelvechairs
https://artificialanalysis.ai/models/gemini-3-7-flash
Geminiの売りは、スピード、特にエンドツーエンドの応答時間であり続けています。
- sid_talks
Gemini Flashモデルは、Googleのような企業から出ていることを考えると、とても理にかなっています。Google AI Mode for searchは、私が本当に便利だと思う製品です。Googleが、推論コストを抑えられる、より小型で高速かつ十分に賢いモデルに注力したのは理にかなっています。それは彼らの製品エコシステムとうまく調和します。
Google AI Modeは、一貫して良い結果と速さを提供してくれます。それは私にとって「ググる」という行為を本当に変えました。
- fmind-dev
Gemini Flashは、最も優れた「十分に良い」モデルの1つです。私はこの種のモデルを、自動化や迅速な開発イテレーションループのために日常的に使用しています。
残念ながら、大規模なリファクタリングや長時間実行される開発ループには、しばしば力不足です。
- euazOn
マルチモーダル機能は素晴らしいですが、テキストのみを扱う場合、DS V4 Flash/Proを使うよりもこれを使う利点は何でしょうか?同等の知能で13〜26倍安く、多くの推論プロバイダーで利用可能です。
DS V4 Proでは不十分だが、Flash 3.7なら十分というユースケースは、マルチモーダル以外には思い当たりません。
Lunaも同様で、8倍安いです。出典: artificialanalysis
唯一の利点は、おそらくTPUのおかげで、卓越したスピードだと思います。
- Topfi
> Gemini 3.7 Flashの新機能 [0]
> コーディングとエージェントタスク: 実世界のソフトウェアエンジニアリングとエージェントベンチマークで品質が大幅に向上し、問題解決率が向上し、エージェントループの失敗が減少。
> ウェブ開発とデザイン適合性の強化: デザインモックから直接、忠実度の高いデスクトップおよびウェブアプリケーションコードを生成し、デザイン遵守とモックに対する既存コードベースの監査における1:1のデザイン適合性の検証で大きな向上。
> プロモーション価格: Gemini 3.7 Flashは、入力トークン$0.75/1M、出力トークン$3.75/1Mの特別価格で提供されます。この新しい料金は3.6 Flashにも適用されます。特別価格は2026年12月31日までで、その後は入力トークン$1.50/1M、出力トークン$7.50/1Mが適用されます。
まだ3.5 Proの兆候はありません。テストする必要がありますが、Gemini 3系の他のすべてのモデルからすると期待は低いです。それでも希望はあります。ただ、プロモーション価格が4ヶ月間限定であることが理解できません。この業界では、年末までに3.7 Flashがまだ使われているとは考えにくいので、なぜ正式価格にしないのでしょうか?