AI가 스스로 추론 하드웨어를 설계하다: 오픈소스 AI 가속기 openTPU
AI is now capable of developing its own inference hardware

openTPU는 AI가 RTL, ISA, 시뮬레이터, 컴파일러, 프로파일러를 모두 설계한 오픈소스 AI 가속기다. Kintex-7 FPGA 카드에서 Qwen3, LFM2.5, Qwen3.5 등 10개 모델을 실제 가중치로 구동하며, 시뮬레이터와 비트 단위로 동일한 토큰을 생성한다. LFM2.5-230M은 초당 85.8토큰, Qwen3.5-4B는 5.88토큰을 디코딩한다. DRAM 대역폭의 94%를 활용하고, 35B MoE 모델도 전문가를 스트리밍해 실행한다.
AI 에이전트가 하드웨어 설계에서 얼마나 멀리 갈 수 있는지, 그리고 자신의 추론을 실행하는 칩을 만들 수 있는지 묻는다.