GLM, 10만 개 중국산 AI 칩으로 자체 추론 인프라 구축
GLM Built Its Own Inference Infrastructure

GLM-5.3-Flash의 프로덕션 추론 서비스를 10만 개 이상의 중국산 AI 가속기 클러스터에서 처음부터 구축했다. 1M 토큰 컨텍스트와 멀티모달 요청을 지원해야 했고, 커널 지원 부족과 문서화 미비 속에서도 Infra Agent가 최적화 루프를 돌며 2주 만에 프로덕션 준비를 완료했다. 그 결과 엔드투엔드 처리량이 초기 대비 3배로 늘었고, 토큰당 비용은 NVIDIA GPU 수준에 도달했다.
충분한 컴퓨팅과 시간이 주어진다면, 그 종착점은 스스로 후속 모델을 완전히 자율적으로 설계하고 학습할 수 있는 시스템이다. 이것이 바로 재귀적 자기 개선(RSI)이다.