Grok 4.7 обошёл конкурентов по интеллекту, но стоит ли он своих денег?
Grok 4.7 Intelligence, Performance and Price Analysis
Artificial Analysis представила детальный анализ Grok 4.7 (xhigh), оценив его по индексу интеллекта v4.3.2, включающему 10 бенчмарков, таких как AA-Briefcase, GDPval-AA, Terminal-Bench 4.0 и Humanity's Last Exam. В отчёте сравниваются интеллект, потребление токенов и стоимость выполнения задач с другими моделями. Особое внимание уделено цене за задачу, использованию кэша и размеру контекстного окна, что позволяет оценить экономическую эффективность модели.
AA-Omniscience Index (higher is better) measures knowledge reliability and hallucination. It rewards correct answers, penalizes hallucinations, and has no penalty for refusing to answer.