Grok 4.7: Künstliche Analyse zeigt Stärken und Kosten

Grok 4.7 Intelligence, Performance and Price Analysis

Grok 4.7: Künstliche Analyse zeigt Stärken und Kosten

Artificial Analysis hat Grok 4.7 (xhigh) einem umfassenden Benchmark unterzogen. Der Intelligence Index v4.3.2 kombiniert zehn Evaluierungen, darunter AA-Briefcase, Terminal-Bench 4.0 und Humanity's Last Exam. Die Analyse vergleicht Intelligenz mit Kosten pro Aufgabe, Token-Verbrauch und Kontextfenster. Besonders der AA-Omniscience Index misst Wissenszuverlässigkeit und Halluzinationen. Die Ergebnisse zeigen, wie sich Grok 4.7 im Wettbewerb um Open-Weights- und proprietäre Modelle schlägt.

Der AA-Omniscience Index misst Wissenszuverlässigkeit und Halluzination. Er belohnt richtige Antworten, bestraft Halluzinationen und hat keine Strafe für die Verweigerung einer Antwort.

Mehr von diesem Tag

2026-09-21