Grok 4.7、知能・性能・価格を徹底分析——Artificial Analysisが最新インデックスで評価
Grok 4.7 Intelligence, Performance and Price Analysis
Artificial AnalysisがGrok 4.7(xhigh)の知能・性能・価格を分析。10種類の評価を組み合わせたIntelligence Index v4.3.2で、エージェント知識作業、コーディング、医療推論などを測定。AA-Omniscience Indexでは知識の信頼性と幻覚を評価し、コスト効率やトークン使用量も比較。コンテキストウィンドウやキャッシュ価格も公開。
AA-Omniscience Index(高いほど良い)は知識の信頼性と幻覚を測定する。正解には報酬を与え、幻覚にはペナルティを課し、回答を拒否してもペナルティはない。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が正解より多いことを示す。