Девять кодинг-харнессов против вашего ноутбука: кто выживет на локальной модели

Nine coding harnesses vs. your laptop

Девять кодинг-харнессов против вашего ноутбука: кто выживет на локальной модели

Автор прогнал девять кодинг-харнессов через восемь задач Exercism на M4 MacBook Pro с локальной Qwen 3.8 27B. Главная проблема — огромные системные промпты и схемы инструментов: у opencode это 18 046 токенов и 226 секунд ожидания первого токена, у pi — всего 2 008 токенов и 22 секунды. Харнессы делятся на три группы: лёгкие и стабильные, тяжёлые но дисциплинированные, и тяжёлые на старте. Собственный харнесс автора chad с MLX-движком разгоняется до 17,4 токенов/с.

На скоростях ноутбука это разница между 22 и 226 секундами, измеренными. Невыносимо!
  1. OleksandrC

    Если вы ищете кодинг-агента, который хорошо впишется в среду с ограниченными ресурсами (например, ноутбуки, крошечные VPS-серверы или маленькие одноплатные компьютеры и т.п.), и при этом отлично работает с локальными моделями — вам может понравиться hax (https://usehax.dev/). Нативный C-бинарник размером 0.7 МБ с динамической линковкой, потребляет несколько МБ оперативной памяти при работе, автоматически находит конфигурацию у запущенного локального llama-server и использует минималистичный системный промпт и инструменты для экономии контекста.

  2. julesrms

    Кажется, на HN непрерывным потоком проносятся бенчмарки агентных харнессов. И каждый раз я задаюсь вопросом: куда смотрят люди, создающие эти тесты, когда решают, какие харнессы тестировать? Потому что прямо сейчас никто, похоже, не утруждает себя тестированием моего! (https://juggler.studio)

    Я знаю, что Juggler совсем новый, но в этой области происходит столько суеты, что трудно понять, куда мне двигаться. Сложно угадать, сыграли бы сильные стороны juggler'а хорошо в конкретном тесте вроде этого или выставили бы его в плохом свете. Любая обратная связь о том, какие параметры людям интересны, полезна, когда я решаю, что оптимизировать.

  3. alex_john_m

    Что это вообще должно означать?

    «он разбрасывается до 50% между ночами, так что ничего между тощими руками — не находка».

  4. toasty228

    Немного не по теме, потому что я не использую локальные модели, но недавно я прогнал бенчмарк codex против pi и omp на своей рабочей нагрузке и обнаружил, что codex и быстрее, и эффективнее по токенам, чем pi/omp. Не было ни единого случая, где pi оказался бы быстрее или дешевле.

  5. larodi

    Я вижу эту закономерность: многие используют Qwen 3.8 27B для локального инференса как на Apple Silicon, так и на x86. Это подразумевает, что модель, должно быть, очень хороша, раз мнения всех этих людей сходятся на ней.

Ещё за этот день

2026-09-11