Jalapeño ya tiene resultados: así rindió en el benchmark InferenceX
Durante la conferencia Hot Chips de este martes, OpenAI dio a conocer una mirada más detallada de Jalapeño, su nuevo sistema de inferencia, junto con el primer lote de resultados de rendimiento. La prueba se realizó con el benchmark InferenceX de SemiAnalysis y los números colocan al chip por delante de los procesadores de inferencia de última generación disponibles actualmente.

Métricas destacadas
Según los datos compartidos por OpenAI, Jalapeño registró más tokens por usuario y más rendimiento por kilovatio en comparación con los procesadores de inferencia considerados estado del arte.
| Métrica | Resultado de Jalapeño |
|---|---|
| Tokens por usuario | Más que los procesadores de última generación |
| Throughput por kilovatio | Mayor rendimiento por unidad de potencia |
“La conclusión es que los resultados muestran un avance muy, muy significativo frente al estado del arte”, afirmó Richard Ho, director de hardware de OpenAI, en una llamada con la prensa.
Ho añadió que Jalapeño “puede servir más trabajo de IA por unidad de potencia, mientras devuelve respuestas más rápido”, y que es “muy eficiente para atender a muchos clientes”, con la capacidad de operar con muy baja latencia.
Frente a Nvidia Blackwell
Un dato relevante es que la comparación se realizó contra un sistema con Nvidia Blackwell. Sin embargo, para el momento en que Jalapeño alcance su despliegue total, la competencia podría haber avanzado de forma importante, lo que mantiene abierta la carrera por la supremacía en inferencia.
Despliegue: volúmenes pequeños en 2026 y mayor escala en 2027
El director de hardware de OpenAI estimó que Jalapeño comenzará a desplegarse a finales de 2026 “en volúmenes muy pequeños”, y que el despliegue más significativo llegará en 2027.
Un desarrollo conjunto con Broadcom y un enfoque multigeneracional
Jalapeño, anunciado por primera vez en octubre del año pasado, fue desarrollado por OpenAI en estrecha colaboración con Broadcom. En el proceso, los propios modelos de OpenAI asistieron en el desarrollo. La compañía planea convertirlo en una plataforma multigeneracional, en la que productos de IA, modelos, chips y memoria se desarrollen de forma coordinada.

Por qué el enfoque integral marca la diferencia
Gracias a esta visión de pila completa, OpenAI pudo trabajar en fases específicas del proceso de inferencia que suelen generar fricción. En particular, Jalapeño fue diseñado para minimizar los retardos en las fases de prefill y comunicación, dos de los puntos que con mayor frecuencia se convierten en cuellos de botella.
“Diseñamos Jalapeño para minimizar el movimiento de datos y los retrasos de comunicación”, señaló la compañía en un comunicado. “Esto significa que el estado del modelo, incluida la caché KV utilizada para generar una respuesta, puede colocarse y mantenerse local mientras el sistema activa la combinación correcta de cómputo, memoria y red para cada fase de inferencia”.
Con estos primeros resultados, OpenAI demuestra que el camino del hardware propio puede ofrecer ventajas de rendimiento y eficiencia en el competitivo mercado de la inferencia de IA.