Gemini 3.8 Flash: Googles neues KI-Modell für Softwareentwicklung und Agenten
Google DeepMind hat die Modellkarte für Gemini 3.8 Flash veröffentlicht, die nächste Iteration der Gemini-3-Familie. Das Modell baut auf Gemini 3.7 Flash auf und bietet Verbesserungen bei Softwareentwicklung und agentischen Wissensabläufen. Es unterstützt weiterhin anpassbare Anstrengungsstufen, um Qualität, Kosten und Latenz zu steuern. Die Sicherheitsbewertungen zeigen eine ähnliche Leistung wie beim Vorgänger, mit leichten Regressionen bei mehrsprachiger Sicherheit. Gemini 3.8 Flash ist für kosteneffiziente, produktionsreife Agenten konzipiert.
Gemini 3.8 Flash ist gut geeignet für Nutzer, Entwickler und Unternehmen, die kosteneffiziente Skalierung von allgemeinen, produktionsreifen Agenten benötigen.
- simonw
Die Geschwindigkeit in Kombination mit der Tatsache, dass dieses Ding wirklich gut in HTML/JavaScript ist, ist ziemlich aufregend. Hier ist, was ich für 1,8 Cent und 13 Sekunden mit der Aufforderung "bau mir was Cooles in HTML" bekommen habe: https://gisthost.github.io/?6a77bc41a81718c6aaa10d4ab243c59f
Transkript hier (es war Teil eines Chats): https://gist.github.com/simonw/b6149a49d327164d67d62c3d12992...
- jampa
Ich benutze Gemini 3.7 für meine persönliche Reiseplanungs-App. Bei mehreren Benchmarks schneidet es bei allem, was ich ausprobiert habe, besser ab:
- Wissen über die reale Welt (wann etwas öffnet und schließt, die geografische Region, historische Fakten). Es ist auch am besten darin, eine Gruppe von Orten zu nehmen und eine Besuchsreihenfolge zu ermitteln.
- Fotobewertung (welches Foto das Hauptbild sein sollte). Gemini kann erkennen, ob ein Foto das Objekt selbst oder die Aussicht davon zeigt.
- Dokumentanalyse (Extrahieren der relevanten Reiseinformationen aus PDFs).
Wenn du LLMs für etwas anderes als Programmieren nutzt, empfehle ich dir definitiv, Gemini nicht so zu unterschätzen, wie ich es getan habe, nur weil andere Modelle beliebter sind.
- mattlondon
Derzeit an der Spitze bei https://deepswe.datacurve.ai - schlägt Opus 5!
https://artificialanalysis.ai/models/gemini-3-8-flash zeigt einen Intelligenzwert von 59, genauso wie Opus 5 Medium!
Wow - für ein Flash-Modell scheint das in Benchmarks stark zu sein. Es bleibt abzuwarten, wie es sich in der Nutzung anfühlt.
- simonw
Pelikane (Denkaufwand hoch, mittel, niedrig): https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - hohe Kosten 8,9742 Cent
Hier sind die 3.7-Pelikane zum Vergleich: https://tools.simonwillison.net/markdown-svg-renderer.html?u... - hohe Kosten 8,4387 Cent
(Ich denke, die niedrige Denkstufe ist eine Regression bei 3.8 im Vergleich zu 3.7.)
- simonw
Das Interessanteste an den Gemini-Modellen ist immer noch ihre Multimodal-Unterstützung: Sie akzeptieren Audio- und Videoeingaben, die Flaggschiffe von OpenAI und Anthropic sind immer noch nur auf Bilder beschränkt.
Gemini Flash ist auch ziemlich billig, also ist es eine großartige Familie für Medienanalyse, wie das Extrahieren strukturierter Daten aus Bildern und Videos.
- brap
Die Leute haben Gemini in letzter Zeit verschlafen, aber diese letzten Flash-Releases (die sehr schnell kamen) sind verdammt gut.
Diese schnellen und billigen Modelle sind großartig für Aufgaben, die überprüfbar sind und unendlich oft wiederholt werden können (wie Programmieren). Du kannst im Grunde Spitzenergebnisse mit einem guten Framework bekommen (zu einem Bruchteil der Zeit und des Geldes).
- abixb
Ich mag Googles Strategie hier. Diese neuen Flash-Modelle der letzten Zeit (Flash 3.6, 3.7 und jetzt 3.8) wurden offensichtlich aus einem viel größeren, unveröffentlichten Modell (Gemini 3.5 Pro, wenn ich mich richtig an die Gerüchte erinnere) destilliert.
Ein Aspekt von Modellveröffentlichungen, der nicht so oft diskutiert wird, ist die Cache-Invalidierung (Änderungen an zugrunde liegender Architektur, Gewichten oder Tokenizern); ich schätze, Google scheint das Maximum aus der letzten 'Pro'-Version herauszuholen, die sie mit 3.1 im Februar veröffentlicht haben.
Kleine Modelle, die mit ihren größeren Geschwistern aufholen, sind fantastische Neuigkeiten.
- Galorious
Nutzt hier jemand diese Modelle über ein Google-Abonnement (nicht API)? Ich habe es in der Vergangenheit mit gemini cli und dann agy - headless, aufgerufen von codex und claude code, versucht, aber sie waren so unglaublich fehlerhaft, dass es in der Hälfte der Fälle stehen blieb und ich gekündigt habe. Mich würde interessieren, ob sich das geändert hat!
- mattlondon
Wow, das kommt nach - was, 3 oder 4 Wochen seit 3.7 Flash, das auch 3 oder 4 Wochen nach 3.6 Flash war, wenn ich mich richtig erinnere?
Ich warte gespannt auf weitere Informationen, aber es klingt so, als ob Deepmind ohne Demis, der das Sagen hat, entfesselt wurde und mit voller Geschwindigkeit arbeitet? Schock!
An diesem Punkt ist es natürlich ein Meme, aber wo ist 3.5 Pro :)
- a11r
Es sieht so aus, als ob die Strategie regelmäßiger Updates mit inkrementellen Verbesserungen gut funktioniert. Interessanterweise ist der größte Sprung im Artificial Analysis Intelligence Index Score bei der Denkstufe Mittel (3.7 war 51, 53, 57 für Niedrig, Mittel und Hoch, 3.8 ist 52, 57, 59 jeweils). Ich denke, dass Werte bei niedrigeren Denkstufen eher die Modellfähigkeit anzeigen, da höhere Denkstufen auf Benchmaxxing ausgerichtet sind. Wir verwenden die niedrigste Denkstufe in der Produktion mit guten Ergebnissen.