Почему кодинг-агенты остаются настолько глупыми?

Why Are Coding Agents So Dumb?

Почему кодинг-агенты остаются настолько глупыми?

Автор делится опытом использования кодинг-агентов с февраля 2025 года и отмечает, что, несмотря на прогресс LLM, сами агенты остаются узким местом. Он разбирает их ключевые недостатки: неумение распараллеливать задачи, делегировать, планировать, а также отсутствие песочницы и знаний о самих себе. В конце он предлагает список функций, которые хотел бы видеть в идеальном агенте.

Если бы сотрудник сказал мне, что просидел всю смену без дела, потому что хотел услышать мое мнение по какому-то поверхностному вопросу, я бы быстро его уволил.
  1. johnfn

    Все эти проблемы решены.

    > Агенты не умеют управлять задачами

    Скажи «используй субагентов».

    > Агенты не умеют делегировать

    Скажи «используй субагентов на Haiku/Sonnet».

    > Агенты никогда не слышали об агентах

    Это даже не проблема: автор просто недоумевает, почему Anthropic не встроил всю документацию Claude Code в харнесс, но, конечно, засорять контекст таким образом не имеет смысла.

    > Агенты отвратительно доносят планы

    Правда, коммуникацию можно улучшить.

    > Агенты ищут любой повод прекратить работу

    Просто используй /loop.

    > Агенты полезны только тогда, когда идут на ненужный риск

    Просто используй песочницу. Ладно, технически эту проблему буквально не решают Anthropic/OpenAI, но её решает миллион стартапов по песочницам для агентов.

  2. Neywiny

    Я постоянно с этим сталкиваюсь. Приятно видеть, что здесь есть и другие, кто мучается. Наверное, когда всё, что ты делаешь — это одноразовые простые тривиальные задачи, то плевать. Я заметил, что для этого они отлично подходят. Но как только нужно делать настоящую работу, все пилят собственные эзотерические заброшенные поделки, которые вроде бы работают, а вроде бы и нет. Звёзды — не идеальный показатель, но я не видел ничего с больше чем парой сотен звёзд среди того, что нахожу на GitHub. То же самое со скачиваниями плагинов. Было очень одиноко чувствовать себя единственным, кого не очаровывает текущее положение дел.

  3. polyterative

    Я понимаю вашу точку зрения, но даже сам факт того, что я могу поговорить с компьютером и происходит что-то полезное, до сих пор кажется мне чудом. Не думаю, что когда-нибудь привыкну к тому, насколько хороши новые модели. Я просто не успеваю за ними. И я занимаюсь этим профессионально. Десять часов в день.

    Многое можно улучшить, но это уже такая большая скорость.

  4. mstank

    Раньше я довольно сильно узнавал себя в этой статье. За последние 3–4 месяца — уже не так. Я обнаружил, что последние модели — Opus 5.5, Astra и т.д. — жонглируют несколькими задачами, исключительно хорошо делегируют и очень хорошо работают самостоятельно.

    С моделями с открытыми весами у меня всё ещё иногда бывают проблемы, но передовые лаборатории решили вышеописанное для большинства случаев.

  5. ilamont

    агент никогда не останавливается и не говорит: «Погоди, это могла бы сделать другая модель — дешевле и быстрее». Он просто продолжает пахать медленной, дорогой моделью. И наоборот, агент никогда не говорит: «Эта модель слишком тупа для такой задачи. Позову-ка поумнее».

    Это довольно крупный недостаток, который усугубляется тем, что большинство людей не знают, какую модель выбрать, или строят предположения на основе иерархии Anthropic или «усилий», которые требует задача.

    Вроде Fable: твои самые сложные задачи. Ты имеешь в виду сложные задачи уровня Филдсовской медали? Или сложные задачи уровня анализа и обновления трёх чудовищных таблиц? Или сложные задачи уровня написания нового романа в стиле Уильяма Гибсона?

Ещё за этот день

2026-10-09