Интеллект против цены: почему график ArtificialAnalysis вводит в заблуждение, и как выглядит реальная картина

LLMs: Intelligence vs. Cost

Интеллект против цены: почему график ArtificialAnalysis вводит в заблуждение, и как выглядит реальная картина

Инженер OpenTeams и мейнтейнер Dask анализирует график Intelligence vs. cost от ArtificialAnalysis и объясняет, почему он вводит в заблуждение: логарифмическая шкала скрывает разницу в цене, официальные цены API завышены для open-weights моделей, а локальные модели показаны по датацентровым ценам. Он строит собственные графики с линейной шкалой, ценами OpenRouter и стоимостью электроэнергии для локального запуска, показывая, что разрыв в цене между топовыми моделями (Anthropic, OpenAI) и дешёвыми китайскими (GLM, Qwen) огромен, а прирост интеллекта подчиняется закону убывающей отдачи.

Люди не логарифмичны, и их деньги тоже.
  1. oliwary

    Выглядит отлично! Я также считаю, что скорость должна быть частью метрики (т.е. сколько времени модели требуется, чтобы реально решить задачу). Для себя я предпочитаю запускать дорогие модели, такие как Sol, на лёгких рассуждениях, что обычно даёт мне хорошие ответы с быстрым откликом.

    Для моего стиля программирования (быстрые переписки и исправления) большая разница, если модель отвечает за 1-2 минуты по сравнению с 5-10, и я готов платить немного больше за это.

  2. themgt

    Существует огромная разница в стоимости между самыми современными моделями от Anthropic и OpenAI и гораздо более дешёвыми китайскими моделями... Насколько дополнительный интеллект, который покупается за опустошение кошелька, подчиняется закону убывающей отдачи: в то время как инженер или учёный высшего уровня, вероятно, сможет оценить, насколько Fable 5.1 лучше... большинству людей будет трудно это понять.

    Nebari официально указан как продукт JATIC в рамках инструментария нового поколения, поддерживающего разработку ИИ для Министерства обороны.

    Мы официально на расстоянии одного рукопожатия от Кевина Бэкона до того, как Министерство обороны одобрит запуск китайских OSS-моделей, потому что они размещены локально, а мы все слишком глупы, чтобы заметить разницу?

    https://openteams.com/open-source-isnt-the-real-risk-in-nati...

  3. datadrivenangel

    Жалоба на невозможность переключения между линейной и логарифмической шкалой справедлива, именно это я сделал для создания 3D-приложения по границе скорость/стоимость/качество для недавнего выступления на митапе: https://www.williamangel.net/apps/model_performance.html

    Поскольку скорость важна, так как рассуждения и оборудование определяют как стоимость, так и скорость, это трёхмерный компромисс.

Ещё за этот день

2026-09-02