GLM-5.3 schlägt Anthropic- und OpenAI-Modelle – für ein Fünftel der Kosten
GLM-5.3 (open-weight) beat Anthropic/OpenAI models – for 1/5 the cost

Der Ed-o-meter von Reinvently hat 17 führende LLMs auf 28 realen Aufgaben getestet. Das Open-Weight-Modell GLM-5.3 erreicht als erstes 100 % Bestehensquote in allen fünf Kategorien (Coding, Data, Realworld, Security, Tool-use) und kostet mit 0,28 $ pro Testrunde nur etwa ein Fünftel von GPT-5.5. GPT-5.5 ist mit 13,2 s schneller beim ersten Token, während GPT-5.6-Luna der günstigste Workhorse ist. Die Ergebnisse zeigen auch Sicherheitslücken bei der GPT-5.6-Serie und Verweigerungen bei Anthropic-Modellen.
GLM-5.3 ist das erste Modell auf dem Board, das alle fünf Ecken – Coding, Data, Realworld, Security und Tool-use – zu 100 % meistert.
- hellohello2
Das Ganze liest sich sofort, als wäre es von Claude generiert, was es schwer macht, es ernst zu nehmen.
Warum widersprechen diese Ergebnisse den bestehenden ernsthaften Versuchen, LLMs zu benchmarken? Nämlich:
- jchw
Fast 10 Modelle bestehen den Benchmark mit >95% – ist das nicht... ziemlich übersättigt?
Ich bin auch sehr skeptisch gegenüber Benchmarks, die irgendein Haiku-Modell sehr hoch einstufen. Ich war von Haiku durchweg wenig beeindruckt und meine Meinung ist, dass man es im Grunde nicht verwenden sollte. Und doch erreicht es hier Kimi K3. HMMMM.
„Rubric Quality" scheint etwas realistischer als „Pass Rate", aber es wird offenbar von Fable 5 bewertet...
Dieser gesamte Text ist außerdem offensichtlich stark KI-gestützt, was der Sache nicht gerade hilft.
- gertlabs
Ein Problem ist, dass 30 $ pro Durchlauf für viele verifizierbare Aufgaben wirklich verrauscht sind. Unsere laufen normalerweise mindestens eine Größenordnung mehr für ein Modell in der Preisklasse von GLM 5.3.
Wir haben gerade GLM 5.3-Ergebnisse auf unseren Multi-Agent-Coding-Evaluierungen veröffentlicht, und es ist definitiv ein beeindruckendes Modell, das bei etwa #6 landet. Für den Preis ist es tatsächlich nicht Pareto-optimal und liegt leicht hinter Grok 4.6 (das schneller und zum gleichen Preis ist) und Sol 5.6 (das weitaus weniger Denk-Tokens für vergleichbare Ergebnisse verwendet). Wie bei den meisten chinesischen Modellen zeichnet es sich durch Iterieren in einem Rahmen aus, während seine erste Antwort/Basis-Fluidintelligenz unter der amerikanischen Spitze liegt.
Daten unter https://gertlabs.com/rankings
- iamcoder18
Es gibt keine Möglichkeit, dass GPT 5.5 besser ist als GPT 5.6 Sol, und gemini-3.6-flash ist besser als beide. Ich würde diesem Benchmark überhaupt nicht vertrauen.
- solenoid0937
Keine Ahnung, ich nutze offene Modelle jeden Tag für persönliche Projekte und geschlossene Modelle für die Arbeit.
Offene Modelle sind alle entschieden weit hinter Fable und auch ein gutes Stück hinter Opus. Alle diese Beiträge lesen sich für mich wie Wunschdenken.
Ich verstehe, dass die Leute sich sehnlichst wünschen, dass die offene Grenze dort ist, wo die geschlossene Grenze ist, aber das ist einfach offensichtlich nicht der Fall, wenn man die Modelle tatsächlich in einem echten Projekt verwendet.
- ac29
Ich bin mir nicht sicher, ob ich einem Benchmark vertrauen soll, bei dem Haiku eine fast perfekte Punktzahl erreicht und Fable auf dem letzten Platz liegt.
- Klaster_1
In der letzten Woche war ich intensiv damit beschäftigt, ein Gerät mit Hilfe von GLM-5.3 zu reverse-engineeren, und es hat alle meine Erwartungen übertroffen – ich habe tatsächlich viel mehr erreicht, als ich gedacht hätte. Ich habe noch nie auf so niedriger Ebene gearbeitet; es hätte Monate gedauert, ARM-Assembly zu lernen und herauszufinden, wie man Exploits findet und schreibt. Anfangs habe ich das mit Claude versucht, aber es blockierte mich bei der allerersten Nachricht, also bekam ich eine Rückerstattung und beschloss, z.ai auszuprobieren. Die einzigen Nachteile sind, dass es vielleicht etwas langsamer ist als mein Opus bei der Tagesarbeit und ich ~200 EUR für einen Monatsplan zahlen musste, um nicht in ein paar Tagen an die Wochenlimits zu stoßen. Wenn dieses Leistungsniveau vielleicht 50 EUR kosten würde, würde ich ernsthaft über ein langfristiges Abonnement nachdenken.
- CMay
> Wenn du ein Modell ausführst, dann führe glm-5.3 aus
Das ist eine schreckliche Schlussfolgerung daraus, denn mit nur 28 Aufgaben und einer hohen Bestehensquote für die meisten Modelle sagt es fast nichts aus.
Teste ein Modell für deinen Anwendungsfall und verwende das schnellste, kleinste, günstigste Modell, das deinen Anwendungsfall zu 100% erfüllt.
Oder, wenn du wirklich ein Modell mit starker allgemeiner Leistung brauchst, nimm einen Benchmark wie diesen mit so begrenztem Aufgabensatz definitiv nicht ernst.