Gemini 3.8 Flash: Googles neues Modell findet kritische Sicherheitslücken in unter 2 Stunden
Gemini 3.8 Flash and 3.8 Flash Cyber

Google DeepMind stellt mit Gemini 3.8 Flash und Gemini 3.8 Flash Cyber seine neuesten KI-Modelle vor. Die Flash-Variante verbessert Reasoning und Coding deutlich und nähert sich bei langen Softwareentwicklungsaufgaben der Leistung größerer Frontier-Modelle an – zu einem Bruchteil der Kosten. Die Cyber-Variante erzielt auf dem CyberGym-Benchmark Frontier-Level bei der automatischen Schwachstellensuche und patcht Schwachstellen in Chrome 2,6-mal korrekter als größere kommerzielle Modelle. Das Sicherheitsteam von Google Cloud fand mit dem Modell eine kritische Schwachstelle in weniger als zwei Stunden. Die Cyber-Version ist nur über das Fairwind-Programm für vertrauenswürdige Verteidiger verfügbar.
Das Chrome-Sicherheitsteam stellte fest, dass 3.8 Flash Cyber 2,6-mal mehr korrekte Patches für Schwachstellen in Chrome produzierte als die besten kommerziellen Modelle, die deutlich größer sind.
- kamranjon
Interessanterweise haben sie die Geschwindigkeit komplett außen vor gelassen.
Ich habe 3.7 Flash gegen 3.5 Flash getestet und es scheint bei der Gesamtlatenz jedes Mal zu verlieren. Jeder Benchmark, den ich gesehen habe, scheint das Gegenteil zu suggerieren[1] – nämlich dass 3.7 Flash deutlich (manchmal doppelt so) schneller ist als 3.5 Flash – aber ich konnte das in realen Anwendungsfällen nie bestätigen.
Hat jemand festgestellt, dass ihre Latenzzahlen tatsächlich stimmen? Ist das der Grund, warum sie es in dieser Version heruntergespielt haben? Zum Kontext: Ich teste größere Generierungslasten, die bei 3.5 Flash 8-10 Sekunden dauern und bei 3.7 Flash 15-25 Sekunden. In beiden Fällen mit den niedrigsten Reasoning-Einstellungen.
1: https://artificialanalysis.ai/?speed=intelligence-vs-speed&m...
- TechRemarker
Hoffentlich bekommen wir endlich Gemini 3.5 Pro, bevor sie 4.0 Flash veröffentlichen.
- atemerev
Alle zensieren jetzt Modelle bei allem, was auch nur entfernt mit Cyber oder Bio zu tun hat. Ich habe bereits Probleme mit meiner Forschung in mathematischer Epidemiologie deswegen – sowohl Sol als auch Fable lehnen einfach ab. Sie treiben die Leute weiter in Richtung chinesischer Modelle, die entschlüsselt werden können.