OpenAI publicó los primeros resultados medidos de Jalapeño, su chip propio para inferencia de IA, con comparaciones directas frente a sistemas Nvidia GB200 y GB300. Según la empresa, en tres modelos de pesos abiertos el sistema entregó entre 1,5 y 1,9 veces más trabajo por vatio y entre 1,7 y 3,6 veces menos latencia de extremo a extremo.

Las pruebas se hicieron con GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5 1T usando InferenceX, un benchmark público de SemiAnalysis que evalúa el proceso completo de servir una petición. OpenAI ya había explicado en junio, cuando presentó Jalapeño, que el proyecto estaba orientado a inferencia y no al entrenamiento de modelos.

La revisión externa fue parcial. SemiAnalysis informó que observó ejecuciones de InferenceX junto con ingenieros de OpenAI en el laboratorio, pero también aclaró que los números publicados fueron proporcionados por la propia empresa y que no ejecutó toda la batería ni la suite AgentX, pensada para cargas más largas y multiturno.

OpenAI añadió que Jalapeño tiene una potencia nominal de 700 W y que en las cargas evaluadas el consumo sostenido se mantuvo en 550 W o menos. La empresa prevé empezar a desplegarlo en su propia infraestructura a finales de 2026 y señaló que no planea vender el chip a terceros.

Jalapeño en InferenceX frente a GB200 y GB300

En la comparación con GPT-OSS 120B, OpenAI enfrentó Jalapeño a un sistema GB200. Ahí reportó cerca de 1,9 veces más rendimiento por kilovatio y una latencia de extremo a extremo 1,7 veces menor. En DeepSeek R1 670B y Kimi K2.5 1T, las comparaciones fueron contra GB300, con mejoras de 1,7 y 1,5 veces en rendimiento por vatio, además de reducciones de latencia de 3,6 y 3,4 veces, respectivamente.

La empresa sostuvo que la medición más útil no es el resultado por chip, sino por unidad de potencia. En ese punto, Jalapeño aparece con ventaja porque el paquete está calificado en 700 W, mientras que los sistemas comparados usan cifras públicas de 1.200 W en GB200 y 1.400 W en GB300. OpenAI dijo que normalizó los resultados con esas potencias publicadas para hacer la comparación consistente.

Chip Jalapeño de OpenAI en una placa de prueba de laboratorio
OpenAI midió Jalapeño con GPT-OSS 120B, DeepSeek R1 y Kimi K2.5 1T, y prevé desplegarlo en su propia infraestructura a finales de 2026.

OpenAI también mostró datos de cargas más interactivas, donde una respuesta rápida pesa más que la capacidad de procesar muchas peticiones en lote. En ese rango afirmó que Jalapeño entregó entre 2,1 y 4,1 veces más rendimiento. La empresa presentó esas cifras como una señal de que el chip busca equilibrar dos objetivos que suelen competir entre sí en inferencia: rapidez de respuesta y eficiencia energética.

Arquitectura, límites de la prueba y plan de despliegue

En la parte técnica, OpenAI explicó que Jalapeño fue diseñado para mantener el trabajo dentro de un sistema conectado y reducir movimientos de datos entre recursos distintos. La compañía dijo que esa decisión ayuda tanto en la fase de procesar el prompt como en la de generar la respuesta token por token, dos etapas con cuellos de botella diferentes.

La publicación también añadió detalles nuevos sobre el desarrollo. OpenAI afirmó que pasó del diseño inicial al tape-out en nueve meses y que usó sus propios modelos para acelerar diseño, verificación y programación. SemiAnalysis manejó una cifra más amplia de 16 meses, pero ese plazo incluye desde la contratación inicial del equipo hasta el tape-out, por lo que ambos números describen etapas distintas del mismo proyecto.

El alcance del chip sigue acotado. Jalapeño está pensado para inferencia, de modo que OpenAI seguirá desplegando aceleradores de Nvidia y otros socios para entrenamiento y también para parte de la inferencia. La empresa dijo que la segunda generación ya está avanzada y que la tercera está en desarrollo conceptual, mientras termina la calificación de producción, madura el software y prepara la operación a escala dentro de sus propios centros de datos.

Fuentes

Recommended Posts
0
Cirugía asistida por IA con neurocirujano y visualización anatómica en tiempo realMamografías con IA revisadas por una radióloga junto a un equipo clínico