Почему кодинг-агенты остаются настолько глупыми?
Why Are Coding Agents So Dumb?

Автор делится опытом использования кодинг-агентов с февраля 2025 года и отмечает, что, несмотря на прогресс LLM, сами агенты остаются узким местом. Он разбирает их ключевые недостатки: неумение распараллеливать задачи, делегировать, планировать, а также отсутствие песочницы и знаний о самих себе. В конце он предлагает список функций, которые хотел бы видеть в идеальном агенте.
Если бы сотрудник сказал мне, что просидел всю смену без дела, потому что хотел услышать мое мнение по какому-то поверхностному вопросу, я бы быстро его уволил.
- johnfn
Все эти проблемы решены.
> Агенты не умеют управлять задачами
Скажи «используй субагентов».
> Агенты не умеют делегировать
Скажи «используй субагентов на Haiku/Sonnet».
> Агенты никогда не слышали об агентах
Это даже не проблема: автор просто недоумевает, почему Anthropic не встроил всю документацию Claude Code в харнесс, но, конечно, засорять контекст таким образом не имеет смысла.
> Агенты отвратительно доносят планы
Правда, коммуникацию можно улучшить.
> Агенты ищут любой повод прекратить работу
Просто используй /loop.
> Агенты полезны только тогда, когда идут на ненужный риск
Просто используй песочницу. Ладно, технически эту проблему буквально не решают Anthropic/OpenAI, но её решает миллион стартапов по песочницам для агентов.
- Neywiny
Я постоянно с этим сталкиваюсь. Приятно видеть, что здесь есть и другие, кто мучается. Наверное, когда всё, что ты делаешь — это одноразовые простые тривиальные задачи, то плевать. Я заметил, что для этого они отлично подходят. Но как только нужно делать настоящую работу, все пилят собственные эзотерические заброшенные поделки, которые вроде бы работают, а вроде бы и нет. Звёзды — не идеальный показатель, но я не видел ничего с больше чем парой сотен звёзд среди того, что нахожу на GitHub. То же самое со скачиваниями плагинов. Было очень одиноко чувствовать себя единственным, кого не очаровывает текущее положение дел.
- polyterative
Я понимаю вашу точку зрения, но даже сам факт того, что я могу поговорить с компьютером и происходит что-то полезное, до сих пор кажется мне чудом. Не думаю, что когда-нибудь привыкну к тому, насколько хороши новые модели. Я просто не успеваю за ними. И я занимаюсь этим профессионально. Десять часов в день.
Многое можно улучшить, но это уже такая большая скорость.
- mstank
Раньше я довольно сильно узнавал себя в этой статье. За последние 3–4 месяца — уже не так. Я обнаружил, что последние модели — Opus 5.5, Astra и т.д. — жонглируют несколькими задачами, исключительно хорошо делегируют и очень хорошо работают самостоятельно.
С моделями с открытыми весами у меня всё ещё иногда бывают проблемы, но передовые лаборатории решили вышеописанное для большинства случаев.
- ilamont
агент никогда не останавливается и не говорит: «Погоди, это могла бы сделать другая модель — дешевле и быстрее». Он просто продолжает пахать медленной, дорогой моделью. И наоборот, агент никогда не говорит: «Эта модель слишком тупа для такой задачи. Позову-ка поумнее».
Это довольно крупный недостаток, который усугубляется тем, что большинство людей не знают, какую модель выбрать, или строят предположения на основе иерархии Anthropic или «усилий», которые требует задача.
Вроде Fable: твои самые сложные задачи. Ты имеешь в виду сложные задачи уровня Филдсовской медали? Или сложные задачи уровня анализа и обновления трёх чудовищных таблиц? Или сложные задачи уровня написания нового романа в стиле Уильяма Гибсона?