Claude Opus 5 löst nur 30 % der Aufgaben: Neuer Stanford-Benchmark misst KI-Agenten in der Wissenschaft
Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Terminal-Bench-Science ist ein neuer Benchmark, der von Forschern der Stanford University und dem Team hinter Terminal-Bench entwickelt wurde. Er bewertet KI-Agenten anhand von 70 anspruchsvollen, von Wissenschaftlern kuratierten Arbeitsabläufen aus Lebens-, Physik-, Erd-, Mathematik- und Ingenieurwissenschaften. Der Benchmark soll reale Forschungspraxis widerspiegeln und wird kontinuierlich weiterentwickelt. Im ersten Release erreicht das stärkste Modell, Claude Opus 5, nur eine Lösungsrate von 30 %, was die großen verbleibenden Herausforderungen für KI in der Wissenschaft verdeutlicht.
Wissenschaftler, nicht Modellentwickler oder Datenanbieter, setzen die Messlatte für wissenschaftliche Fähigkeiten in der KI.
- j_maffe
Die Aufgaben sind das, worauf man hier wirklich achten sollte:
https://github.com/harbor-framework/terminal-bench-science/t...
- johnnyApplePRNG
Es überrascht mich nicht, dass Claude bei wissenschaftlicher Intelligenz deutlich besser abschneidet als Sol.
Man merkt, dass Claude wirklich ein breites Spektrum hochspezifischer wissenschaftlicher und mathematischer Nuancen erfasst ... während Codex im Grunde nur fürs Programmieren da ist und sonst nichts.
Das ist zumindest das Gefühl, das ich bei beiden habe, und ich habe beide in der letzten Woche ausgiebig im 20x-Tarif genutzt.
Versteht mich nicht falsch, Codex ist großartig darin, Bugs zu finden und Spiele zu bauen. Es ist großartig.
- CJefferson
Ich mache mir Sorgen, dass hier nicht die Korrektheit geprüft wird. Ich habe festgestellt, dass Claude in letzter Zeit schrecklich darin ist, Anweisungen zu befolgen. Ich bitte es, den Algorithmus aus einem Paper zu implementieren, und es macht etwas Einfacheres und Langsameres und wenn man es darauf anspricht, kommt diese dumme Entschuldigungsnummer. Man kann ihm nichts anvertrauen, was in ein Paper käme, es lügt zu viel. 4.6 konnte keine so komplexen Aufgaben, aber es hat gemacht, was verlangt wurde.
- boorang
Ich habe ziemlich viel aus Context Engineering herausgeholt, indem ich meine persönlichen Programmier-Heuristiken zu meiner AGENTS.md hinzugefügt habe und Unterdokumente nach einem Muster "wenn du X tust, konsultiere Y" referenziert habe. Ich nehme an, andere machen Ähnliches, aber ich war ziemlich überrascht, als ich es dazu bringen konnte, Code zu generieren, der dem ziemlich nahe kommt, was ich tun würde, wenn ich es manuell machen würde. Ich bin neugierig, ob Wissenschaftler und Mathematiker so etwas machen. "Wenn ich X sehe, prüfe ich typischerweise sofort Y" oder wie auch immer ihre domänenspezifischen Heuristiken aussehen.
- jerpint
Die Tatsache, dass Opus 5 Fable übertrifft, finde ich seltsam.
Aus persönlicher Erfahrung fühlt sich Opus 5 in fast jeder Hinsicht (bei Programmieraufgaben) schlechter an als Fable.