Grok 4.7: Künstliche Analyse zeigt Stärken und Kosten
Grok 4.7 Intelligence, Performance and Price Analysis
Artificial Analysis hat Grok 4.7 (xhigh) einem umfassenden Benchmark unterzogen. Der Intelligence Index v4.3.2 kombiniert zehn Evaluierungen, darunter AA-Briefcase, Terminal-Bench 4.0 und Humanity's Last Exam. Die Analyse vergleicht Intelligenz mit Kosten pro Aufgabe, Token-Verbrauch und Kontextfenster. Besonders der AA-Omniscience Index misst Wissenszuverlässigkeit und Halluzinationen. Die Ergebnisse zeigen, wie sich Grok 4.7 im Wettbewerb um Open-Weights- und proprietäre Modelle schlägt.
Der AA-Omniscience Index misst Wissenszuverlässigkeit und Halluzination. Er belohnt richtige Antworten, bestraft Halluzinationen und hat keine Strafe für die Verweigerung einer Antwort.