OpenAI의 자체 칩 'Jalapeño', Nvidia Blackwell 제치고 추론 성능 1위

OpenAI Jalapeño: Better than Nvidia Blackwell

OpenAI의 자체 칩 'Jalapeño', Nvidia Blackwell 제치고 추론 성능 1위

OpenAI가 Broadcom과 함께 개발한 LLM 추론 전용 칩 'Jalapeño'가 Hot Chips에서 공개됐다. SemiAnalysis는 OpenAI 연구소에서 직접 벤치마크를 수행, Jalapeño가 전력 대비 토큰 처리량(perf/W)에서 Nvidia Blackwell은 물론 AMD, Google의 칩을 모두 압도한다고 밝혔다. 특히 단일 토큰 예측만으로 Blackwell의 다중 토큰 예측을 능가하며, DeepSeek R1에서 동시성 1 기준 초당 700토큰 이상을 달성했다. OpenAI는 특정 모델에 특화하지 않고 일반적인 추론 칩으로 설계했으며, HBM4를 채택해 대역폭당 전력 효율도 최고 수준이다. 다만 아직 엔지니어링 샘플 단계로, NVIDIA의 차세대 칩 Rubin과의 비교가 더 공정하다는 평가도 있다.

Jalapeño는 모든 칩을 압도한다.
  1. Traster

    이 반분석적인 기사는 실제 분석이라기보다는 OpenAI의 보도자료에 훨씬 더 가깝게 읽힌다. 그리고 솔직히 말해서, 일부 진술은 완전히 거짓말처럼 보인다 - 처음에는 벤치마킹하도록 초대받았다고 주장하다가, 중간쯤 가서는 OpenAI가 모든 수치를 제공했다고 주장하는 식으로 바뀐다. 이건 정말 짜증 나는 일이다. 왜냐하면 나는 업계에서 무슨 일이 일어나고 있는지에 대한 실제로 상세하고 미묘하며 신뢰할 수 있는 분석을 읽고 싶은데, 이 글은 믿을 수 없기 때문이다.

  2. mchusma

    나는 그들이 이 칩이 범용 칩이라고 말하는 것을 들었지만, Anthropic/OpenAI는 이제 LLM 가중치를 칩에 직접 구울 수 있는 규모에 도달했다고 생각한다. 예를 들어, GPT Sol을 맞춤형 칩에 구워서 1억 달러에 실행하고 10배 빠르고 10배 저렴하게 실행한다면, 칩이 충분히 오래 유용하다면 비용을 스스로 충당할 수 있을 것이다. 2년 전만 해도 1년 이상 유용한 것은 없었지만, 지금은 많은 오래된 모델이 사용 중이며(예: Haiku 4.5, GPT-OSS 120b), 이 추세는 계속될 것으로 예상한다. 이것이 AMD가 인수한 Taalas가 하던 일이라는 것을 알고 있다. 여기 그들의 데모가 있다: https://chatjimmy.ai/ (Llama 3.1 8B 기반). 이것이 곧 시작되어야 할 것 같은 느낌이 든다.

  3. iFire

    그렇다면 추론 전용 칩 중에서 내가 살 수 있는 것은 무엇인가? 유일한 보고서는 알리바바의 스마트닉 FPGA로, ONNX 디자인을 가져와서 우리가 직접 작성하는 것이다. https://essenceia.github.io/projects/alibaba_cloud_fpga/ 내 M2 Pro Mac Mini에서는 ANE가 2GB만 허용하는 반면, Metal GPU는 시스템 RAM을 사용할 수 있다. 현재 https://www.asus.com/motherboards-components/ai-accelerator/... (4비트, 8비트, 16비트 AI 추론 칩, 8GB RAM)을 가지고 놀고 있다. UGen300은 Hailo-10H 칩셋을 사용한다. ASUS 스토어에서 ugen300-usb-8g의 가격은 365캐나다 달러이다.

  4. g00afthrowaway

    재밌네, 반분석이 여기서 신뢰를 얻다니. 창립자는 하드웨어 업계에서 암시장 정보 거래자로 잘 알려져 있다. 그 방식은 이렇다: 1. 창립자는 학부 인턴/대학원생 인턴과 친해져서 선물을 사주고, 저녁/요트/집/VC 파티 등에 초대하거나, 그들에게 돈을 주고 기사를 쓰게 한다. 2. 창립자는 이 인턴들로부터 내부 정보를 빼낸다. 3. 창립자는 이 정보를 '컨설팅' 수수료를 지불하는 회사에 판다.

  5. epistasis

    FP4를 보니 정말 웃기다. 20년 전에 유전체학에서 어떤 HPC가 필요한지 물어봤을 때, 내가 하던 일에 대한 답은 기본적으로 '더 낮은 정밀도, 더 빠르게'였다. 하지만 FP4는 거의 코믹하다. 비교 표에 없는 한 가지: 다이 크기. 내가 올바르게 이해한다면, Rubin과 거의 같지만 NVFP4 PFLOPs의 1/3이다. (본문은 표와 일치하지 않는다. 나는 표를 진실로 받아들인다. 아마도 틀렸을 수도 있다...)

  6. corford

    이 초기 추론 칩 노력들은 초기 3dfx / riva / mach / powervr 시절을 떠올리게 한다. 추론 칩이 계속해서 존재할지, 그리고 그렇다면 결국 누가 지배적인 플레이어가 될지 지켜보는 것이 흥미로울 것이다.

  7. fraboniface

    나는 인간의 말과 토큰/줄 비교를 본 적이 없었다. 인간은 여전히 22배 더 효율적이며, 이 분야의 발전 속도를 고려하면 그렇게 멀지 않은 수치이다.

  8. jimmySixDOF

    이제는 수조 달러 규모의 산업에 대한 분석이 전직 Reddit 및 4Chan 인접 중재자들에 의해 세계적 수준으로 수행되는데, 그 뒤에 숨은 장난칠 동기를 고려해야 한다는 점이 마음에 든다. SemiAnalysis가 Gartner McKinsey 등과 같은 재질이 아니라는 것은 AI에서 가장 좋은 이야기 중 하나이다.

  9. anthonypasq

    지속적인 하드웨어 개선으로 인해 토큰 가격이 계속 폭락하지 않을 것이라고 믿기가 정말 어렵다.

  10. blt

    AI 워크로드가 전용 하드웨어를 갖게 되어 범용 장치가 다시 범용 용도로 사용될 수 있게 되는 것이 얼른 왔으면 좋겠다.

이 날의 다른 글

2026-08-25