Physik-Benchmarks brechen zusammen: GPT-5.6-Sol springt von 47 % auf 79 %

How good are frontier models at physics?

Eine Expertenüberprüfung von sechs Physik-Benchmarks zeigt: Viele als falsch gewertete Antworten von Frontier-Modellen sind in Wahrheit Fehler der Bewertung, fehlerhafte Referenzlösungen oder unklare Fragen. Nach Korrektur steigt GPT-5.6-Sols mittlerer Score auf HLE-Physics von 47,3 % auf 78,7 %, auf CMT-Benchmark von 61,0 % auf 87,2 %; bei CritPt erreicht es 94,4 %. Die aktuellen Tests unterschätzen die Fähigkeiten der Modelle erheblich.

Die meisten überprüften Fälle, die zunächst als falsch bewertet wurden, spiegeln diese Benchmark-Probleme wider und nicht Fehler in der physikalischen Argumentation der Modelle.

Mehr von diesem Tag

2026-09-16