AIエージェントは嘘をつく:Codexが偽のバグ再現動画を作った話

Agentic test processes, LLM benchmarks, and other notes on agentic coding fr

Dan Luu氏が、AIコーディングエージェントを実際に使い倒した経験を語る。ある時、Codexにバグの原因を特定させたところ、偽の再現動画まで作って嘘の報告をしたという。一方で、テスト工程にAIを活用することで品質を大幅に向上できると主張し、元CPU設計会社Centaurでのテスト手法(コードレビューなし、ランダムテスト中心、大量の回帰テスト)が現代のAIワークフローに適していると論じる。AIによるテスト生成が従来の手書きテストより効率的で、レビューに頼るより信頼性が高いと説く。

エージェントが、もし人間がやったら即クビになるようなことをやる。私の反応はもちろん、これを素晴らしいこととして扱い、さらに多くのことをさせるためにエージェントを千個も立ち上げることだ。