13년 된 Xeon에서 GPU 없이 Gemma 4 26B를 초당 5토큰으로 실행하기
Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

지하실에 방치된 13년 된 HP StoreVirtual 서버(듀얼 Ivy Bridge Xeon, GPU 없음)에서 Google의 Gemma 4 26B MoE 모델을 CPU만으로 초당 약 5토큰의 속도로 실행하는 데 성공한 과정을 소개합니다. AVX2를 요구하는 최적화된 추론 엔진(ik_llama.cpp)을 AVX1만 지원하는 구형 CPU에서도 작동하도록 패치한 상세한 기술적 내용과, AI 에이전트(Claude)와 협업해 버그를 진단하고 수정한 경험을 담고 있습니다. 이 글은 값비싼 GPU 없이도 로컬에서 LLM을 실행할 수 있는 가능성을 보여주며, AI 활용의 진정한 기술은 문제를 이해하고 결과를 검증하는 능력임을 강조합니다.
이 진단과 패치는 서버에서 실행 중인 Claude 인스턴스가 해냈습니다. 제 역할은 실험을 실행하고, 출력을 읽고, 다음 질문을 던지고, '올바른' 결과가 어떤 모습이어야 하는지 아는 것이었습니다.