로컬 AI, 클라우드 없이 실제 질의 88.7% 처리한다

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

LLM 질의 대부분은 중앙 집중형 클라우드에서 처리되지만, 20B 이하 소형 로컬 모델과 Apple M4 Max 같은 로컬 가속기가 이제 실용적 대안이 되고 있다. 연구진은 전력당 지능(IPW)이라는 지표로 20개 이상 로컬 LM, 8개 가속기, 100만 건의 실제 질의를 평가했다. 로컬 LM은 88.7%의 질의에 답했고, 2023~2025년 IPW는 5.3배 향상됐으며 로컬 처리 가능 범위는 23.2%에서 71.3%로 늘었다.

로컬 가속기는 동일한 모델을 실행하는 클라우드 가속기보다 최소 1.4배 낮은 IPW를 달성해, 로컬 가속기 최적화에 상당한 여지가 있음을 보여준다.

이 날의 다른 글

2026-09-16