13年前のXeonでGemma 4 26Bを5トークン/秒で実行
Running Gemma 4 26B at 5 tokens/sec on a 13-year-old Xeon with no GPU

13年前のHP StoreVirtualサーバー(Ivy Bridge Xeon、GPUなし)で、GoogleのGemma 4 26B MoEモデルを約5トークン/秒で実行する方法を紹介。著者は、AVX2非対応のCPUで動作させるため、ik_llama.cppのフォークにパッチを適用し、Claude AIの支援を得てバグを修正。この記事では、古いハードウェアで最新のAIモデルを動かすための具体的な手順と、その過程で得た洞察を共有している。
「良いAI使い」とは、いつの間にか「サブスクリプションにお金を払うこと」を意味するようになった。本当のスキルは別にあると思う:モデルをよく理解して、誰もパッケージ化してくれなかった問題にそれを向け、返ってきた答えが実際に正しいかどうかを見極めることだ。