Ask HN: 코딩 에이전트로 좋은 코드를 생산하는 사람이 있나요?
Ask HN: Is anybody producing good code with coding agents?
저는 시니어 엔지니어들로부터 AI 생성 코드의 품질에 대한 불만을 듣고 있습니다. Claude, Copilot 등이 만든 코드는 읽기 힘들고 함정이 많아 리뷰에 5배 더 오래 걸리며, 제가 승인한 코드를 제대로 이해하지 못할 때가 많습니다. 예전처럼 숙련된 동료에게 배우고 장인정신을 발휘하던 시절이 그립습니다. 이 문제를 해결한 사람이 있나요?
저는 보통 AI를 사용해 제가 직접 작성할 코드와 거의 같은 코드를 약 5배 빠르게 생산합니다. Claude Code가 오랫동안 마음대로 실행되어 검토할 엉망진창을 만들게 하지 않습니다. 검토하기 쉬운 작은 청크 단위로 작업을 시키고, 피드백을 주고, 반복하면서 원하는 결과가 나올 때까지 진행한 후 다음 단계로 넘어갑니다. 시간이 걸리긴 하지만 거대한 엉망 코드 리뷰보다 빠르다는 것을 알게 되었습니다.
제안된 해결책의 문제가 무엇인가요? 더 이상 코드를 읽거나 쓰지 마세요. 강력한 하네스를 갖추세요. 제 30명 정도 팀이 대부분 그렇게 운영되고 있습니다. 우리가 해결하려는 문제는 결코 코드를 작성하는 것이 아니라 비즈니스 문제를 해결하는 것이었습니다.
"더 이상 코드를 이해하지 못한다. 그래도 작동한다." 오늘은 괜찮습니다. "다시는 코드를 이해할 필요가 없을 것이다"는 훨씬 다른 이야기입니다. 코드를 이해하지 못하고, 그 코드가 어떤 인간에 의해서도 작성되지 않았다면, 결국 궁지에 몰렸을 때 빠져나오기가 얼마나 어려울까요? 그 지점에 도달하기까지 이해를 유지하는 것보다 더 쉬울까요, 더 어려울까요? 회사의 운명을 그 답에 걸고 있을 수도 있습니다. 얼마나 확신하시나요?
제가 해온 방식은 LLM을 사용해 제가 쓰고 싶지 않은 코드, 즉 프로토타입, 테스트, 벤치마크, 격리된 거의 복사-붙여넣기 수준의 단순한 코드를 생성하는 것입니다. 저는 여전히 예전처럼 직접 코드를 작성합니다. 그렇게 하는 것을 즐기기도 하고, LLM이 생성하고 재생성하는 코드를 이해하고 수정하는 것이 처음부터 제 방식대로 코드를 작성하는 것보다 더 어렵고 지루하며 시간이 많이 걸리기 때문입니다.
그것은 스펙트럼입니다. AI가 유지 관리하는 코드(예: 성능 데이터를 시각화하는 GUI)의 경우 코드가 어떻게 생겼든 신경 쓰지 않습니다. 그냥 Claude나 Codex가 마음대로 하도록 놔두고 100% 바이브 코딩합니다. 신경 쓰는 코드의 경우, 생성되는 모든 헝크를 감사합니다. 광범위한 스타일 가이드라인을 제공하고, 주석에 20줄짜리 에세이를 쓰는 것 같은 것들을 단속합니다. 미션 크리티컬 코드의 경우, 제가 직접 코드를 작성하고 에이전트에게 리뷰를 맡깁니다.
중요한 프로젝트에서 여러 번 바이브 코딩으로 궁지에 몰린 후, 이제 두 가지 모드만 있습니다: 별로 신경 쓰지 않는 코드(주로 프론트엔드 React)에는 clankermaxx, 그 외 모든 것은 직접 작성합니다. 백엔드에 Django를 사용하면 이미 대부분의 불필요한 부분이 제거되고, 직접 작성하면 실제로 무슨 일이 일어나는지 이해하게 됩니다. 지금은 잘 작동합니다. 테스트에 대해서는 아직 망설이고 있습니다: 작성하는 것을 별로 좋아하지 않지만, LLM이 생성한 테스트는 최전선 모델의 xhigh 사고에서도 꽤 형편없습니다. 보통 생성하지만, 1==1을 테스트하는 것 외에는 아무것도 테스트한다는 확신이 없습니다. 안타깝게도 수동으로 작성하는 데 드는 시간을 정당화하기 어렵습니다.
저는 제 opencode + open weight 설정에 매우 만족하고 있으며, 코드는 일반적으로 꽤 좋습니다. 하지만 일반적인 AI 쓰레기 패턴을 찾기 위해 에이전트에게 토큰을 소비하게 합니다. 플러그인을 통해 대부분의 내부 시스템을 교체하고, 내장 에이전트 대신 사용자 정의 에이전트 세트를 사용하며, 하위 작업마다 다른 모델 패밀리를 사용합니다. (Claude가 자신의 코드를 리뷰하게 하지 않습니다.) 곧 오픈 소스로 공개할 예정입니다. "better-opencode" 플러그인 스위트를 주목해 주세요. HN에 공유하겠습니다 :] 단기적으로는 코드 탐색/리뷰에 GLM 5.3 prose를 정말 좋아합니다. 한번 시도해 보세요. 더 저렴하고(flash 모델) Big AI 모델들의 온갖 실수를 잡아냅니다. 지난주에 glm-5.3-flash로 사용자 정의 PR 리뷰를 전면 롤아웃했습니다. 대부분의 개발자는 아직 Claude를 사용 중이며, fireworks와 opencode로 이동시키고 있습니다. OpenCode Go는 월 $10로 오픈 웨이트 모델을 시험해 볼 수 있는 좋은 방법입니다.