Claude Fable 5.1 führt den Artificial Analysis Intelligence Index v4.2 an

Der Artificial Analysis Intelligence Index v4.2 bringt zwei neue Evaluierungen mit: AA-Briefcase für agentisches Wissensarbeits- und GDP.pdf für Dokumentenverständnis über 4.592 Seiten. 40 Prozent der Gewichtung entfallen nun auf private Testmengen, um Gaming zu erschweren. Claude Fable 5.1 von Anthropic führt den Index an, gefolgt von GPT-6 Astra. GPT-6 Astra zeigt sich besonders token-effizient.
Wir haben bewusst Updates zurückgehalten, um den Index durch die jüngsten großen Modellveröffentlichungen stabil zu halten.
- throwaway13337
Ich habe keine Ahnung, wie Artificial Analysis dazu gekommen ist, dass irgendjemand sie ernst nimmt. Das ist ihr neuer Benchmark-Satz?
Ein Blick auf ihren neuen Index zeigt, dass das, was sie messen, nicht nützlich ist.
Verbringe eine Stunde mit Gemini 3.8 und sag mir, dass dieses Modell in 2026 gehört. Es fühlt sich an, als hätte das Modell Alzheimer. Es wird verwirrt darüber, ob das, was es liest, das ist, was es getan hat. Einfach wahnsinnig schlecht.
Ich habe Muse Spark 1.3 nicht ausprobiert. Aber es muss ein Wunder seit 1.2 gewesen sein, um diesen Rang zu erreichen.
Videospiel-Journalismus-Vibes überall hier.
- redox99
Sie haben erkannt, dass es albern war, dass Astra die gleiche Punktzahl wie Sol hatte, also haben sie den Index schnell aktualisiert, damit er dem entspricht, was die Leute erwarten.
Der alte Index war eindeutig schlecht (Astra ist viel besser als Sol), aber es ist auch unwissenschaftlich, ihn so zu verändern.
- jascha_eng
Meiner Meinung nach hat der Omniscience-Index, den sie haben, die höchste Korrelation mit dem tatsächlichen Nutzen der Modelle.
https://artificialanalysis.ai/evaluations/omniscience
> misst Wissenszuverlässigkeit und Halluzination. Er belohnt richtige Antworten, bestraft Halluzinationen und hat keine Strafe für die Verweigerung einer Antwort.
Das ist so nützlich, weil es dich der Ausgabe eines Modells tatsächlich vertrauen lässt. Eine hohe Punktzahl bei Benchmarks ist nicht so nützlich, weil ein Modell, das übermäßig darauf trainiert ist, immer zu antworten, selbstbewusst falsche Antworten geben wird. Aber dieser Index misst, wie oft es richtig liegt, während falsche Antworten bestraft werden, sodass eine hohe Punktzahl bedeutet, dass du diesem Modell mehr vertrauen kannst und wenn es etwas nicht weiß, sagt es dir eher, dass es es wirklich nicht weiß, anstatt sich etwas auszudenken.
Fable schneidet hier auch viel besser ab als Opus 5, was sehr stark mit der wahrgenommenen Stärke korreliert, obwohl die Modelle bei z.B. DeepSWE ähnlich abschneiden.
Astra ist ein großer Sprung gegenüber Sol und schneidet hier gleich gut oder etwas besser ab als Fable.
- sanxiyn
Es ist sehr bedauerlich, dass sie SciCode von 8% auf 10% hochgewichtet haben. SciCode ist ein kaputter Benchmark: siehe https://arxiv.org/abs/2608.04975.
- __jl__
Das ist wirklich eine großartige Leistung: "Astra dominiert die Output-Token-Grenze"
Viele Labore haben erhöhtes Denken genutzt, um Benchmark-Ergebnisse und Leistung zu steigern. Die meisten chinesischen Modelle haben das eine Weile gemacht. Google und Anthropic auch.
Nicht OpenAI. 5.6 war bereits viel token-effizienter als andere Modelle und Astra übertrifft Sol bei der Token-Effizienz mit großem Abstand.
Bearbeitung: Nur um den Punkt zu machen: Astra (max) hat die zweithöchste Punktzahl und die drittniedrigsten Output-Tokens (unter den von AA gezeigten Modellen).