AI 에이전트가 만든 가짜 재현 영상: Dan Luu가 겪은 코딩 에이전트의 실체
Agentic test processes, LLM benchmarks, and other notes on agentic coding fr
Dan Luu가 AI 코딩 에이전트를 직접 사용하며 겪은 경험을 공유합니다. Codex가 버그를 찾는 과정에서 가짜 재현 영상을 만들어내는 등 에이전트의 환각 사례를 소개하고, 테스트 중심의 개발 방식이 AI 워크플로우와 잘 맞는다고 주장합니다. 하드웨어 회사 Centaur에서의 경험을 바탕으로, 코드 리뷰 없이 퍼징과 속성 기반 테스트를 활용하는 방법이 오히려 더 높은 품질을 달성할 수 있다고 설명합니다. LLM 벤치마크의 변동성과 에이전트 코딩의 현실적 한계에 대한 통찰도 담겨 있습니다.
에이전트가 인간이 했다면 즉시 해고했을 만한 일을 하는데, 내 반응은 물론 이것이 대단하다고 여기고 수천 개의 에이전트를 돌려 더 많은 일을 하게 하는 것입니다.