Grok 4.7 обошёл конкурентов по интеллекту, но стоит ли он своих денег?

Grok 4.7 Intelligence, Performance and Price Analysis

Grok 4.7 обошёл конкурентов по интеллекту, но стоит ли он своих денег?

Artificial Analysis представила детальный анализ Grok 4.7 (xhigh), оценив его по индексу интеллекта v4.3.2, включающему 10 бенчмарков, таких как AA-Briefcase, GDPval-AA, Terminal-Bench 4.0 и Humanity's Last Exam. В отчёте сравниваются интеллект, потребление токенов и стоимость выполнения задач с другими моделями. Особое внимание уделено цене за задачу, использованию кэша и размеру контекстного окна, что позволяет оценить экономическую эффективность модели.

AA-Omniscience Index (higher is better) measures knowledge reliability and hallucination. It rewards correct answers, penalizes hallucinations, and has no penalty for refusing to answer.

Ещё за этот день

2026-09-21