OpenAI presenta el chip Jalapeño en Hot Chips con benchmarks que marcan un antes y un después

Jalapeño ya tiene resultados: así rindió en el benchmark InferenceX

Durante la conferencia Hot Chips de este martes, OpenAI dio a conocer una mirada más detallada de Jalapeño, su nuevo sistema de inferencia, junto con el primer lote de resultados de rendimiento. La prueba se realizó con el benchmark InferenceX de SemiAnalysis y los números colocan al chip por delante de los procesadores de inferencia de última generación disponibles actualmente.

Gráfico del chip Jalapeño de OpenAI que compara un ASIC personalizado con una nube de GPU
El diseño del chip Jalapeño de OpenAI frente al enfoque tradicional de GPU en la nube.

Métricas destacadas

Según los datos compartidos por OpenAI, Jalapeño registró más tokens por usuario y más rendimiento por kilovatio en comparación con los procesadores de inferencia considerados estado del arte.

Métrica Resultado de Jalapeño
Tokens por usuario Más que los procesadores de última generación
Throughput por kilovatio Mayor rendimiento por unidad de potencia

“La conclusión es que los resultados muestran un avance muy, muy significativo frente al estado del arte”, afirmó Richard Ho, director de hardware de OpenAI, en una llamada con la prensa.

Ho añadió que Jalapeño “puede servir más trabajo de IA por unidad de potencia, mientras devuelve respuestas más rápido”, y que es “muy eficiente para atender a muchos clientes”, con la capacidad de operar con muy baja latencia.

Frente a Nvidia Blackwell

Un dato relevante es que la comparación se realizó contra un sistema con Nvidia Blackwell. Sin embargo, para el momento en que Jalapeño alcance su despliegue total, la competencia podría haber avanzado de forma importante, lo que mantiene abierta la carrera por la supremacía en inferencia.

Despliegue: volúmenes pequeños en 2026 y mayor escala en 2027

El director de hardware de OpenAI estimó que Jalapeño comenzará a desplegarse a finales de 2026 “en volúmenes muy pequeños”, y que el despliegue más significativo llegará en 2027.

Un desarrollo conjunto con Broadcom y un enfoque multigeneracional

Jalapeño, anunciado por primera vez en octubre del año pasado, fue desarrollado por OpenAI en estrecha colaboración con Broadcom. En el proceso, los propios modelos de OpenAI asistieron en el desarrollo. La compañía planea convertirlo en una plataforma multigeneracional, en la que productos de IA, modelos, chips y memoria se desarrollen de forma coordinada.

Dos personas sostienen el procesador Jalapeño de OpenAI como reconocimiento del nuevo chip
La presentación de Jalapeño refuerza la alianza entre OpenAI y Broadcom.

Por qué el enfoque integral marca la diferencia

Gracias a esta visión de pila completa, OpenAI pudo trabajar en fases específicas del proceso de inferencia que suelen generar fricción. En particular, Jalapeño fue diseñado para minimizar los retardos en las fases de prefill y comunicación, dos de los puntos que con mayor frecuencia se convierten en cuellos de botella.

“Diseñamos Jalapeño para minimizar el movimiento de datos y los retrasos de comunicación”, señaló la compañía en un comunicado. “Esto significa que el estado del modelo, incluida la caché KV utilizada para generar una respuesta, puede colocarse y mantenerse local mientras el sistema activa la combinación correcta de cómputo, memoria y red para cada fase de inferencia”.

Con estos primeros resultados, OpenAI demuestra que el camino del hardware propio puede ofrecer ventajas de rendimiento y eficiencia en el competitivo mercado de la inferencia de IA.

Comparte este artículo

Otras notas de tu interés:

Economia

Stability AI recauda 76 millones de dólares en una Serie B con gigantes del entretenimiento

Negocios

Anthropic actualiza Claude con memoria compartida entre Chat y Cowork

Negocios

Gamma adquiere a Lica, startup de diseño respaldada por Accel, y crea laboratorio de investigación en IA

Negocios

Gamma adquiere Lica: la startup que quiere redefinir las presentaciones

Politica

Republicanos en estados clave lanzan un ultimátum: ‘Darline treatment’ y el ‘put up or shut up’ sacuden la política en EE.UU.

Economia

Keenable recauda 26 millones para indexar la web para los agentes de IA

Economia

Entrevista: Thibault Sottiaux, líder de producto de OpenAI, explica ChatGPT Work

Familia y Crianza

Linkdaze: El Calendario Inteligente que Organiza Todo el Hogar

Tecnologia

Ox Alpha: ¿quién está detrás del misterioso modelo de IA “stealth”?

Tecnologia

Ox Alpha: el misterioso modelo de IA que nadie sabe quién creó