Hetzner wagt sich an LLM-Inferenz: Ein Experiment mit Potenzial
Hetzner is working on LLM Inference

Hetzner testet mit einem experimentellen OpenAI-kompatiblen API LLM-Inferenz auf der eigenen Infrastruktur. Aktuell gibt es nur ein Modell (Qwen3.6-35B-A3B-FP8), keine Abrechnung und keine SLA. Erste Tests zeigen eine beeindruckende Geschwindigkeit: 153 ms Time-to-First-Token und 224 Tokens pro Sekunde. Der Autor spekuliert, dass Hetzner mit dem Experiment spare GPU-Kapazitäten auslasten und in den Markt für Open-Weight-Inferenz einsteigen will. Die entscheidende Frage bleibt, ob Hetzner künftig auch Hardware für große Modelle wie GLM-5 anbieten wird.
Wenn jemand Inferenz in ein weiteres margenschwaches Infrastrukturprodukt verwandeln kann, ist Hetzner zumindest ein glaubwürdiger Kandidat.