Etched Sohu vs. NVIDIA: Transformer-ASIC gegen GPU
Etched Sohu vs. Nvidia: Transformer ASIC vs. GPU (2026)

Etched AI hat mit Sohu einen ASIC vorgestellt, der ausschließlich Transformer-Architekturen beschleunigt und laut eigenen Angaben 500.000 Tokens pro Sekunde auf einem 8-Chip-Server erreicht. Der Vergleich mit NVIDIA GPUs wie H100 und B200 zeigt jedoch, dass dieser Vorteil nur bei Batch-Größe 1 gilt; bei typischen Serving-Lasten schrumpft er erheblich. Zudem kann Sohu keine MoE-Modelle wie DeepSeek V4 oder Qwen3-235B-A22B ausführen, was einen großen Teil aktueller Produktionsworkloads ausschließt. Der Artikel analysiert Architektur, Speicherdesign und Kosten pro Token und bewertet, wann sich der ASIC-Einsatz lohnt.
Sohu ist eine Wette darauf, dass Transformer-Attention die dominierende KI-Architektur für die nächsten Jahre bleibt – und dass die Workload stabil genug ist, um auf jegliche Programmierbarkeit zu verzichten.
- tonis2
Selbst wenn der Sohu-ASIC-Chip den Attention-Teil super schnell macht, werden die Engpässe nicht dann auftreten, wenn diese Daten zur nächsten Stufe gehen? Ich frage mich nur, wie hoch die Wahrscheinlichkeit ist, dass wir tatsächlich anfangen, ASIC-Chips für bestimmte Teile der KI-Inferenz zu verwenden.
- pyrolistical
Ich kann es kaum erwarten, bis es einen Single-Chip-ASIC für Qwen3.8 27B gibt. Er ist klein, also sollte er pro Chip günstig sein. Und er ist so viel schlauer, als er für seine Größe sein sollte. Das Problem ist, dass ASICs ewig brauchen, um gefertigt zu werden, und immer Monate hinter dem neuesten Open-Weight-SOTA zurückliegen.
- rvz
2 Stunden und keine Kommentare – das lässt mich fragen, ob der Etched-Chip überhaupt existiert. > Sohu-Zahlen sind pro Chip, abgeleitet aus Etcheds veröffentlichtem 8-Chip-Server-Claim von 500.000 tok/s bei Llama 70B; nicht unabhängig verifiziert. (behauptet von Etched) Das sind also keine verifizierten Benchmarks und alles nur Behauptungen. Nochmal: Ist dieser Chip echt?