Claude Opus 5.5 обходит конкурентов по интеллекту, но проигрывает по цене
Claude Opus 5.5 Intelligence, Performance and Price Analysis
Artificial Analysis опубликовала детальный разбор Claude Opus 5.5: оценка по Intelligence Index v4.3.2, включающему десять бенчмарков, анализ стоимости выполнения задач, расхода токенов и размера контекстного окна. Модель демонстрирует высокие результаты в агентных задачах и работе с документами, однако цена за миллион токенов и общая стоимость прогона тестов остаются значительными. Отдельно измеряется склонность к галлюцинациям через AA-Omniscience.
AA-Omniscience Index (higher is better) measures knowledge reliability and hallucination. It rewards correct answers, penalizes hallucinations, and has no penalty for refusing to answer.