GLM-5.3 обходит модели Anthropic и OpenAI в тестах — и стоит в 5 раз дешевле

GLM-5.3 (open-weight) beat Anthropic/OpenAI models – for 1/5 the cost

GLM-5.3 обходит модели Anthropic и OpenAI в тестах — и стоит в 5 раз дешевле

Независимый бенчмарк Ed-o-meter прогнал 17 ведущих LLM через 28 реальных задач в едином окружении. Открытая модель GLM-5.3 показала 100% прохождение, оценку 9.3 и стоимость всего $0.28 за весь набор — примерно пятую часть стоимости gpt-5.5. При этом gpt-5.5 быстрее (13.2 с против 16.3 с до первого токена), а gpt-5.6-luna — самый дешевый вариант для фоновых задач. Авторы отмечают, что fable-5 и opus-5 отказались выполнять часть заданий, а линейка gpt-5.6 провалила тесты на безопасность.

glm-5.3 — первая модель на доске, которая прошла все пять категорий — кодинг, работу с данными, реальные задачи, безопасность и инструменты — со 100% результатом.
  1. hellohello2

    Всё это сразу читается как сгенерированное Клодом, из-за чего трудно воспринимать это всерьёз. Почему эти результаты противоречат существующим серьёзным попыткам бенчмаркинга LLM? А именно: https://artificialanalysis.ai/ https://arena.ai/leaderboard/agent

  2. jchw

    Почти 10 моделей проходят бенчмарк с результатом >95% — разве это не... существенно перенасыщено? Я также очень скептически отношусь к бенчмаркам, которые ставят любую модель Haiku очень высоко. Я был совершенно не впечатлён Haiku, и моё мнение состоит в том, что её в принципе не стоит использовать. И всё же здесь она сравнивается с Kimi K3. ХМММ. «Rubric Quality» кажется немного более реалистичным, чем «Pass Rate», но, судя по всему, его оценивает Fable 5... Весь этот отчёт также явно очень сильно написан с помощью ИИ, что не помогает делу.

  3. gertlabs

    Одна проблема в том, что 30 долларов за прогон — это очень шумно для многих проверяемых задач. Наши прогоны обычно стоят как минимум на порядок дороже для модели ценового класса GLM 5.3. Мы только что опубликовали результаты GLM 5.3 на наших мультиагентных оценках кодирования, и это определённо впечатляющая модель, занимающая около 6-го места. Для своей цены она на самом деле не Парето-оптимальна, немного уступая Grok 4.6 (которая быстрее и стоит столько же) и Sol 5.6 (которая использует гораздо меньше токенов на размышление для сопоставимых результатов). Как и большинство китайских моделей, она превосходно итерирует в рамках обвязки, в то время как её первый ответ/базовый интеллект ниже американского фронтира. Данные на https://gertlabs.com/rankings

  4. iamcoder18

    Не может быть, чтобы GPT 5.5 была лучше, чем GPT 5.6 Sol, и чтобы gemini-3.6-flash была лучше обеих. Я бы не доверял этому бенчмарку вообще.

  5. solenoid0937

    Не знаю, я каждый день использую открытые модели для личных проектов и закрытые — для работы. Открытые модели определённо сильно отстают от Fable и заметно отстают от Opus. Все эти посты читаются как мотивированное/желательное мышление. Я понимаю, что люди очень хотят, чтобы открытый фронтир был там же, где закрытый, но это совершенно очевидно не так, если реально использовать модели на настоящем проекте.

  6. ac29

    Не уверен, что стоит доверять бенчмарку, где Haiku получает почти идеальный результат, а Fable занимает последнее место вместе с кем-то

  7. Klaster_1

    Последнюю неделю я активно занимался реверс-инжинирингом устройства с помощью GLM-5.3, и она превзошла все мои ожидания — мне на самом деле удалось добиться гораздо большего, чем я думал. Я никогда не работал с такими низкоуровневыми вещами, мне потребовались бы месяцы, чтобы выучить ассемблер ARM и научиться находить и писать эксплойты. Изначально я пытался сделать это с Клодом, но она заблокировала меня на первом же сообщении, поэтому я получил возврат денег и решил попробовать z.ai. Единственные недостатки — это то, что она, возможно, немного медленнее, чем мой Opus на основной работе, и мне пришлось заплатить ~200 евро за месячный план, чтобы не упереться в недельные лимиты через пару дней. Если бы такой уровень возможностей стоил, скажем, 50 евро, я бы серьёзно подумывал о долгосрочной подписке.

  8. CMay

    > если запускать одну модель, запускайте glm-5.3

    Это ужасный вывод из этого, учитывая всего 28 задач и высокий процент прохождения для большинства моделей, это почти ничего не говорит.

    Протестируйте модель для вашего случая использования и используйте самую быструю, самую маленькую и самую дешёвую модель, которая на 100% удовлетворяет вашему случаю.

    Или, если вам действительно нужна модель с сильной обобщённой производительностью, определённо не стоит относиться к такому бенчмарку серьёзно с таким ограниченным набором задач.

Ещё за этот день

2026-08-23