Claude Opus 5.5 обходит конкурентов по интеллекту, но проигрывает по цене

Claude Opus 5.5 Intelligence, Performance and Price Analysis

Claude Opus 5.5 обходит конкурентов по интеллекту, но проигрывает по цене

Artificial Analysis опубликовала детальный разбор Claude Opus 5.5: оценка по Intelligence Index v4.3.2, включающему десять бенчмарков, анализ стоимости выполнения задач, расхода токенов и размера контекстного окна. Модель демонстрирует высокие результаты в агентных задачах и работе с документами, однако цена за миллион токенов и общая стоимость прогона тестов остаются значительными. Отдельно измеряется склонность к галлюцинациям через AA-Omniscience.

AA-Omniscience Index (higher is better) measures knowledge reliability and hallucination. It rewards correct answers, penalizes hallucinations, and has no penalty for refusing to answer.

Ещё за этот день

2026-09-22