Hetzner se lanza a la inferencia de LLM: primeras impresiones
Hetzner is working on LLM Inference

Hetzner está experimentando con la inferencia de LLM, ofreciendo una API compatible con OpenAI en su propia infraestructura. Actualmente solo incluye el modelo Qwen/Qwen3.6-35B-A3B-FP8, sin facturación ni SLA. El autor probó la API y reporta una latencia media de 153 ms al primer token y 224 tokens por segundo. Aunque el modelo es pequeño y comete errores simples, el producto es interesante por su potencial: Hetzner podría aprovechar su eficiencia en hardware para ofrecer inferencia de bajo margen. La gran incógnita es si ampliarán su catálogo de GPUs para modelos más grandes.
Si Hetzner sigue sirviendo uno o dos modelos pequeños, no lo veo convirtiéndose en un proveedor de inferencia importante; eso sería un experimento genial, pero poco más.