13 年老 Xeon 无 GPU 跑飞 Gemma 4
Running Gemma 4 26B at 5 tokens/SEC on a 13-year-old Xeon with no GPU

我地下室里那台 13 年前的 HP StoreVirtual 存储服务器,原本只配存盘,如今却奇迹般跑起了 Google 的 Gemma 4 26B 模型。这台双路 Ivy Bridge Xeon 机器没有 GPU,甚至不支持 AVX2 指令集,导致原本优化的 ik_llama.cpp 直接崩溃。在 AI 助手 Claude 的帮助下,我定位了代码中因指令集缺失导致的隐藏状态错误,并手动修复了 C++ 内核的 fallback 逻辑。最终,这台成本不足 300 美元的老旧设备实现了每秒 5 个 token 的推理速度。这不仅是一次硬件极限挑战,更证明了真正的 AI 能力不在于租用昂贵的 GPU,而在于能否让模型在任意硬件上正确运行。
“擅长 AI”的含义已悄然变成了“付费订阅”,但我认为真正的技能在于:足够了解模型,能将其指向无人封装的问题,并判断返回的答案是否真正正确。
HN 评论区
212- 有评论者指出,9 tok/s 的生成速度虽慢于人类思考,但已远超人类编码速度,且本地部署能解决数据隐私和订阅限制问题,适合处理敏感或批处理任务。
- 多位用户质疑厂商基准测试(benchmarks)的真实性,认为 Bonsai 等模型在真实任务中表现远不如数据亮眼,常出现逻辑死循环,建议对官方数据保持怀疑。
- 有观点反驳'AI 将取代人类'的论调,强调 AI 本质是增强工具,人类作为利益相关者(stakeholders)无法被替代,且通过 rm-safe 等工具可规避 LLM 造成的灾难性错误。
- 针对硬件效率,有用户分享通过降低 GPU 功耗限制(如从 300W 降至 200W)可在几乎不损失生成速度的情况下显著降低能耗和噪音。
- 关于模型选型,有评论者认为慢速但智能的模型(如 GLM5.2)会导致开发者失去对代码的心智模型,反而偏好快速但稍逊的模型以维持决策主导感。