Девять кодинг-харнессов против вашего ноутбука: кто выживет на локальной модели
Nine coding harnesses vs. your laptop

Автор прогнал девять кодинг-харнессов через восемь задач Exercism на M4 MacBook Pro с локальной Qwen 3.8 27B. Главная проблема — огромные системные промпты и схемы инструментов: у opencode это 18 046 токенов и 226 секунд ожидания первого токена, у pi — всего 2 008 токенов и 22 секунды. Харнессы делятся на три группы: лёгкие и стабильные, тяжёлые но дисциплинированные, и тяжёлые на старте. Собственный харнесс автора chad с MLX-движком разгоняется до 17,4 токенов/с.
На скоростях ноутбука это разница между 22 и 226 секундами, измеренными. Невыносимо!
- OleksandrC
Если вы ищете кодинг-агента, который хорошо впишется в среду с ограниченными ресурсами (например, ноутбуки, крошечные VPS-серверы или маленькие одноплатные компьютеры и т.п.), и при этом отлично работает с локальными моделями — вам может понравиться hax (https://usehax.dev/). Нативный C-бинарник размером 0.7 МБ с динамической линковкой, потребляет несколько МБ оперативной памяти при работе, автоматически находит конфигурацию у запущенного локального llama-server и использует минималистичный системный промпт и инструменты для экономии контекста.
- julesrms
Кажется, на HN непрерывным потоком проносятся бенчмарки агентных харнессов. И каждый раз я задаюсь вопросом: куда смотрят люди, создающие эти тесты, когда решают, какие харнессы тестировать? Потому что прямо сейчас никто, похоже, не утруждает себя тестированием моего! (https://juggler.studio)
Я знаю, что Juggler совсем новый, но в этой области происходит столько суеты, что трудно понять, куда мне двигаться. Сложно угадать, сыграли бы сильные стороны juggler'а хорошо в конкретном тесте вроде этого или выставили бы его в плохом свете. Любая обратная связь о том, какие параметры людям интересны, полезна, когда я решаю, что оптимизировать.
- alex_john_m
Что это вообще должно означать?
«он разбрасывается до 50% между ночами, так что ничего между тощими руками — не находка».
- toasty228
Немного не по теме, потому что я не использую локальные модели, но недавно я прогнал бенчмарк codex против pi и omp на своей рабочей нагрузке и обнаружил, что codex и быстрее, и эффективнее по токенам, чем pi/omp. Не было ни единого случая, где pi оказался бы быстрее или дешевле.
- larodi
Я вижу эту закономерность: многие используют Qwen 3.8 27B для локального инференса как на Apple Silicon, так и на x86. Это подразумевает, что модель, должно быть, очень хороша, раз мнения всех этих людей сходятся на ней.