Hetzner 正在实验 LLM 推理服务

Hetzner is working on LLM Inference

Hetzner 正在实验 LLM 推理服务

Hetzner 正在其基础设施上实验 LLM 推理服务,这并非正式产品发布,而是一个没有计费、SLA 或生产保证的实验。目前仅提供 OpenAI 兼容的 API,支持 Qwen/Qwen3.6-35B-A3B-FP8 模型。我在测试中发现其首字延迟低至 153 毫秒,输出速度达 224 tokens/秒,表现相当快。虽然当前模型较小且存在小瑕疵,但真正值得关注的是 Hetzner 的战略意图:利用其高效的硬件采购和数据中心运营能力,将闲置 GPU 资源转化为推理服务收入。如果未来能引入 B200/B300 级硬件并扩展模型库,Hetzner 有望成为欧洲乃至全球的重要推理服务商。

这个产品比模型本身更有趣,关键在于 Hetzner 为什么要测试推理服务。

同日更多故事

2026-07-24