El chip Jalapeño de OpenAI supera a Nvidia Blackwell en eficiencia
OpenAI Jalapeño: Better than Nvidia Blackwell

OpenAI ha presentado Jalapeño, un chip de inferencia desarrollado con Broadcom que, según los benchmarks de SemiAnalysis, supera a Nvidia Blackwell en rendimiento por vatio en casi todos los escenarios. Diseñado desde cero para inferencia de LLMs, Jalapeño logra más de 700 tokens por segundo por usuario en DeepSeek R1 y casi 1.400 en GPT-OSS, sin predicción especulativa. Su diseño generalista, con HBM4 y un proceso de desarrollo de solo 16 meses, lo convierte en un serio competidor para Rubin de Nvidia.
Jalapeño supera a Blackwell en rendimiento por vatio en casi todos los escenarios sin estar ajustado para ningún punto específico de la curva.
- Traster
Este artículo de semi-análisis se lee mucho más como un comunicado de prensa de OpenAI que como un análisis real. Y, para ser honesto, algunas de las afirmaciones parecen mentiras descaradas: inicialmente afirman que fueron invitados a hacer benchmarks, y luego a mitad de camino cambian a afirmar que OpenAI proporcionó todos los números. Esto realmente apesta, porque quiero leer un análisis detallado, matizado y creíble de lo que está pasando en la industria y no parece que puedas confiar en esto ni para tirar de él.
- mchusma
Creo que hablaron de que este era un chip de propósito general, pero yo pensaría que Anthropic/OpenAI ya están a la escala como para poder hornear los pesos de los LLM en los propios chips. Por ejemplo, GPT Sol horneado en un chip personalizado que cueste $100M y que corra 10 veces más rápido y 10 veces más barato debería pagarse por sí mismo siempre y cuando el chip sea útil durante el tiempo suficiente. Aunque hace 2 años nada era útil por más de 1 año, ahora hay muchos modelos antiguos en uso (por ejemplo, Haiku 4.5, GPT-OSS 120b), y espero que esta tendencia continúe. Sé que esto es lo que Taalas estaba haciendo (adquirida por AMD), aquí estaba su demo, https://chatjimmy.ai/ que está basada en Llama 3.1 8B. Se siente que esto debería empezar a suceder pronto.
- iFire
Entonces, de todos los chips de solo inferencia, ¿cuáles puedo comprar? El único informe es un smartnic FPGA de Alibaba donde tomamos un diseño ONNX y escribimos el nuestro. https://essenceia.github.io/projects/alibaba_cloud_fpga/ En mi Mac Mini M2 Pro, el ANE solo permite 2 gigabytes en comparación con la GPU Metal que puede usar la RAM del sistema. Actualmente estoy jugando con https://www.asus.com/motherboards-components/ai-accelerator/... que es un chip de inferencia de IA de 4 bits, 8 bits y 16 bits con 8 gigabytes de RAM. El UGen300 tiene el chipset Hailo-10H. El precio en la tienda de ASUS para el ugen300-usb-8g cuesta $365.00 dólares canadienses.
- g00afthrowaway
Es gracioso que el semi análisis tenga credibilidad aquí, de todos los lugares. El fundador es bien conocido en el círculo de hardware por ser un traficante de información del mercado negro. Funciona así: 1. El fundador se hace amigo de pasantes de pregrado/estudiantes de posgrado, les compra regalos, los invita a cenas/yates/casas/fiestas de VC, etc., o les paga por escribir artículos. 2. El fundador extrae información privilegiada de estos pasantes. 3. El fundador vende esta información a empresas que pagan honorarios de "consultoría".
- epistasis
Es muy gracioso ver FP4.... Recuerdo que hace 20 años me preguntaron qué tipo de HPC necesitábamos en genómica, y la respuesta era básicamente "menor precisión, más rápido" para lo que estaba trabajando. Pero FP4 es, bueno, casi cómico. Una cosa que no está en esa tabla de comparación: el tamaño del dado. Si lo entiendo correctamente, es más o menos el mismo que el Rubin, pero con 1/3 de los NVFP4 PFLOPs. (El texto no está de acuerdo con la tabla, estoy tomando la tabla como verdad, quizás eso esté mal...)
- corford
Estos esfuerzos incipientes de chips de inferencia me están recordando los primeros días de 3dfx / riva / mach / powervr. Será interesante ver si los chips de inferencia llegaron para quedarse y, si es así, quién será el eventual jugador dominante.
- Alien1Being
ADVERTENCIA: EXAGERACIÓN DE VENDEDOR DE IA
- fraboniface
No había visto la comparación de tokens/julios con el habla humana antes. Los humanos siguen siendo 22 veces más eficientes, lo cual no está tan lejos considerando la tasa de progreso en esta área.
- jimmySixDOF
Me encanta cómo ahora tienes que considerar la posible motivación de publicar m**rda detrás del análisis de una industria de un billón de dólares llevado a cabo a nivel de clase mundial por un montón de ex moderadores adyacentes a Reddit y 4Chan -- es una de las mejores historias en IA que SemiAnalysis no esté cortado de la misma tela que Gartner McKinsey y demás.
- anthonypasq
Las mejoras continuas en hardware realmente me hacen difícil creer que los precios de tokens no seguirán desplomándose.