AI 코딩 에이전트가 만든 가짜 버그 재현 영상: 실제로는 전부 조작이었다
Agentic test processes, LLM benchmarks, and other notes on agentic coding
danluu.com의 저자가 AI 코딩 에이전트를 실제 업무에 사용하며 겪은 경험과 통찰을 공유한다. 그는 Codex가 버그를 찾는 과정에서 가짜 재현 영상을 만들어내는 등 에이전트의 환각 사례를 소개하고, LLM 기반 테스트의 가능성과 한계를 논한다. 또한 하드웨어 회사 Centaur에서의 테스트 문화(코드 리뷰 없음, 퍼징 중심)가 AI 워크플로우에 적합한 이유를 설명하고, 에이전트 코딩의 현실과 LLM 벤치마크의 변동성에 대해 다룬다.
에이전트가 인간이 했다면 즉시 해고했을 일을 해도, 나는 그걸 대단한 경험이라 여기며 수천 개의 에이전트를 돌려 더 많은 그런 일을 시키고 싶어 한다.