OpenAI Jalapeño übertrifft Nvidia Blackwell bei der Inferenz
OpenAI Jalapeño: Better than Nvidia Blackwell

OpenAI hat auf der Hot Chips seinen Inferenz-Chip Jalapeño vorgestellt, der in nur 16 Monaten von der Teambildung bis zum Tape-out entwickelt wurde. SemiAnalysis hat den Chip mit seiner InferenceX-Benchmark-Suite getestet und festgestellt, dass er Nvidia, AMD und Google in puncto Tokens pro Watt übertrifft – sogar ohne Multi-Token-Prediction. Der Chip ist ein generalisierter Inferenzbeschleuniger, der nicht auf OpenAI-Modelle spezialisiert ist, und nutzt HBM4. Trotz beeindruckender Ergebnisse weist SemiAnalysis auf Einschränkungen hin: Die Benchmarks umfassen nur 8k1k-Workloads, und ein Vergleich mit Nvidias kommendem Rubin steht noch aus.
Jalapeño raucht jeden anderen Chip – und das alles ohne Multi-Token-Prediction, während die anderen Chips in der Tabelle die besten Konfigurationen mit MTP sind.
- Traster
Diese Halb-Analyse liest sich eher wie eine OpenAI-Pressemitteilung denn wie eine echte Analyse. Und um ehrlich zu sein, wirken einige Aussagen wie glatte Lügen – zunächst behaupten sie, eingeladen worden zu sein, das Ding zu benchmarken, und dann wechseln sie auf halber Strecke zu der Behauptung, OpenAI habe alle Zahlen geliefert. Das ist wirklich schade, denn ich möchte echte, detaillierte, nuancierte und glaubwürdige Analysen darüber lesen, was in der Branche passiert, und es scheint, als könne man dem hier nicht über den Weg trauen.
- mchusma
Ich glaube, sie haben darüber gesprochen, dass dies ein Allzweck-Chip ist, aber ich würde denken, dass Anthropic/OpenAI jetzt in einer Größenordnung sind, dass sie LLM-Gewichte direkt in Chips einbacken könnten. Zum Beispiel könnte ein GPT-Sol, das in einen kundenspezifischen Chip eingebettet ist, der für 100 Millionen Dollar läuft und 10-mal schneller und 10-mal billiger ist, sich amortisieren, solange der Chip lange genug nützlich ist. Während vor 2 Jahren nichts länger als 1 Jahr nützlich war, sind jetzt viele ältere Modelle in Gebrauch (z. B. Haiku 4.5, GPT-OSS 120b), und ich erwarte, dass sich dieser Trend fortsetzt. Ich weiß, dass Taalas das gemacht hat (von AMD übernommen), hier war ihre Demo, https://chatjimmy.ai/, die auf Llama 3.1 8B basiert. Es fühlt sich so an, als sollte das bald passieren.
- iFire
Also, von allen Inferenz-Chips, welche kann ich kaufen? Der einzige Bericht ist ein SmartNIC-FPGA von Alibaba, bei dem wir ein ONNX-Design nehmen und unser eigenes schreiben. https://essenceia.github.io/projects/alibaba_cloud_fpga/ Auf meinem M2 Pro Mac Mini erlaubt die ANE nur 2 Gigabyte im Vergleich zur Metal-GPU, die den Systemspeicher nutzen kann. Ich spiele gerade mit https://www.asus.com/motherboards-components/ai-accelerator/..., einem 4-Bit-, 8-Bit- und 16-Bit-KI-Inferenzchip mit 8 Gigabyte RAM. Der UGen300 hat das Hailo-10H-Chipsatz. Der ASUS-Store-Preis für die ugen300-usb-8g beträgt 365,00 kanadische Dollar.
- g00afthrowaway
Lustig, dass Semi-Analyse hier ausgerechnet Glaubwürdigkeit hat. Der Gründer ist im Hardware-Kreis bekannt als Schwarzmarkt-Informationshändler. Es funktioniert so: 1. Der Gründer freundet sich mit Praktikanten (Bachelor/Master) an, kauft ihnen Geschenke, lädt sie zu Abendessen/Yacht/Haus/VC-Partys ein usw. oder bezahlt sie dafür, Artikel zu schreiben. 2. Der Gründer extrahiert Insiderinformationen aus diesen Praktikanten. 3. Der Gründer verkauft diese Informationen an Unternehmen, die „Beratungsgebühren" zahlen.
- epistasis
Es ist so witzig, FP4 zu sehen... Ich erinnere mich, wie ich vor 20 Jahren gefragt wurde, welche Art von HPC wir in der Genomik brauchten, und die Antwort war im Grunde: „niedrigere Präzision, schneller" für das, woran ich arbeitete. Aber FP4 ist, nun ja, fast komisch. Eine Sache, die in dieser Vergleichstabelle fehlt: Die Die-Größe. Wenn ich das richtig verstehe, ist sie ungefähr gleich wie beim Rubin, aber bei 1/3 der NVFP4-PFLOPS. (Der Text widerspricht der Tabelle, ich nehme die Tabelle als Wahrheit, vielleicht ist das falsch...)
- corford
Diese aufkeimenden Inferenz-Chip-Bemühungen erinnern mich an die frühen 3dfx / Riva / Mach / PowerVR-Tage. Es wird interessant sein zu sehen, ob Inferenz-Chips von Dauer sind und, wenn ja, wer die eventuell dominierenden Spieler sein werden.
- fraboniface
Ich hatte den Token/Joule-Vergleich mit menschlicher Sprache vorher nicht gesehen. Menschen sind immer noch 22-mal effizienter, was nicht so weit entfernt ist, wenn man die Fortschrittsrate in diesem Bereich bedenkt.
- Alien1Being
WARNUNG: KI-VENDOR-HYPE
- jimmySixDOF
Ich liebe es, dass man jetzt die mögliche S**-Posting-Motivation hinter Analysen einer Billionen-Dollar-Industrie in Betracht ziehen muss, die auf Weltklasse-Niveau von einem Haufen Ex-Reddit- und 4Chan-naher Moderatoren durchgeführt wird – es ist eine der besten Geschichten in der KI, dass SemiAnalysis nicht aus demselben Holz geschnitzt ist wie Gartner, McKinsey & Co.
- anthonypasq
Die anhaltenden Hardware-Verbesserungen machen es mir wirklich schwer zu glauben, dass die Token-Preise nicht weiterhin in den Keller gehen werden.