로컬 모델로 코딩할 때, 9개 하네스 중 대부분이 노트북을 괴롭히는 이유
Nine coding harnesses vs. your laptop

데이터센터 GPU 대신 노트북에서 로컬 모델로 코딩 하네스를 돌리면 어떤 일이 벌어질까? 9개 하네스를 8개 Exercism 과제로 테스트한 결과, 큰 시스템 프롬프트와 툴 스키마 때문에 첫 토큰까지 최대 226초를 기다려야 했다. Opencode는 18,046 토큰의 프롬프트로 컨텍스트의 44%만 남기고, crush는 125%의 월클록 동안 모델을 바쁘게 만들었다. 반면 chad는 5개 툴과 99% 캐시 재사용으로 24/24 통과, MLX 인프로세스 엔진에서는 17.4 토큰/초까지 끌어올렸다.
당신의 노트북은 클라이언트이자 서버다. 최선의 경우 그 사이드 요청들은 로컬 모델을 큐에 대기시키고, 최악의 경우 반복적인 긴 프리필을 유발한다.
HN 토론
38- OleksandrC
리소스가 제한된 환경(노트북, 작은 VPS 서버, 소형 싱글보드 컴퓨터 등)에 잘 맞으면서 로컬 모델과도 잘 작동하는 코딩 에이전트를 찾고 있다면, hax(https://usehax.dev/)도 좋아할지 모릅니다. 0.7 MB 동적 링크 네이티브 C 바이너리이고, 실행 시 RAM 사용량은 몇 MB 수준이며, 실행 중인 로컬 llama-server에서 설정을 자동으로 검색하고, 간결한 컨텍스트 사용을 위해 미니멀한 시스템 프롬프트와 도구를 사용합니다.
- julesrms
HN에는 에이전트 하네스 벤치마크가 계속 흘러 지나가는 것 같습니다. 그리고 매번 궁금해요. 이 테스트를 만드는 사람들은 어떤 하네스를 테스트할지 결정할 때 어디를 보고 있는 걸까요? 지금은 아무도 제 것을 테스트할 생각을 안 하는 것 같으니까요! (https://juggler.studio)
Juggler가 아주 새롭다는 건 알지만, 이 분야에 변화가 너무 많아서 어디에 집중해야 할지 알기 어렵습니다. Juggler의 강점이 이런 특정 테스트와 잘 맞을지, 아니면 나쁘게 보일지 추측하기 어렵고, 사람들이 어떤 파라미터에 관심 있는지에 대한 모든 피드백은 제가 무엇을 최적화할지 결정할 때 알아두면 유용합니다.
- alex_john_m
이게 무슨 뜻이죠?
"밤 사이에 최대 50%까지 퍼지므로, 린 암(lean arms) 사이에 있는 것은 아무것도 발견된 게 아니다."
- toasty228
로컬 모델을 쓰는 게 아니라서 좀 주제에서 벗어나지만, 최근에 제 작업 부하로 codex vs pi vs omp를 벤치마크했는데 codex가 pi/omp보다 더 빠르고 토큰 효율도 더 좋다는 걸 발견했습니다. pi가 더 빠르거나 더 저렴했던 경우는 단 하나도 없었습니다.
- larodi
많은 사람이 Apple Silicon과 x86 모두에서 로컬 추론용으로 Qwen 3.8 27B를 사용하는 패턴을 볼 수 있습니다. 이는 이 모든 사람들의 의견이 그 모델로 수렴한다는 점을 고려하면 그 모델이 매우 뛰어나야 한다는 것을 의미합니다.