Агенты не умеют тестировать: даже явные инструкции не спасают

How well do agents use test/verification techniques?

Дэн Луу проверил, помогают ли агентам простые указания использовать конкретные техники тестирования или библиотеки. В 26 условиях (от TDD до формальных методов и фаззинга) агенты должны были реализовать Zstd на Rust. Результат: ни одна техника не дала значительного улучшения по сравнению с отсутствием инструкций, а часто результаты были хуже. Агенты используют техники поверхностно: пишут тривиальные тесты, игнорируют суть метода. Даже популярные навыки (skills) не помогают. Автор предполагает, что проблема в отсутствии RL-сред для обучения агентов эффективному тестированию.

Агенты склонны либо писать те же тесты, что и обычно, но в обёртке другой техники, либо использовать технику поверхностно, не делая того, что приносит пользу.
  1. andai

    Я занимаюсь инди-разработкой игр, так что не уверен, насколько мой опыт применим, но я работаю над браузерной игрой, и игра, мягко говоря, так себе, но при этом у неё огромное количество тестов (по моим меркам). Так что можно иметь дерьмовый софт с кучей тестов. (А ещё можно иметь отличный софт с очень небольшим количеством тестов!)

  2. ivanzhaowy123

    Ещё был забавный случай, когда ИИ реализовал архитектурное изменение с точностью до наоборот. Реализация была бессмысленной и сделала только хуже, а не лучше. Но я всё равно получил «все тесты зелёные», лол, потому что это просто доказало, что неправильная вещь работает правильно.

  3. siscia

    С некоторым amusement я заметил, что формальная верификация и там бы не помогла — она бы просто дала ещё более сильное доказательство «правильности» того, чего вообще не должно быть.

Ещё за этот день

2026-09-08