OpenAI présente les résultats de performance de Jalapeño lors de la conférence Hot Chips
Lors de la conférence Hot Chips, OpenAI a fourni une présentation détaillée de son nouveau matériel, Jalapeño, mettant en avant ses résultats de performance et ses métriques de benchmark. Testé sur le benchmark InferenceX de SemiAnalysis, Jalapeño a démontré un débit et une efficacité supérieurs, affichant plus de tokens par utilisateur par rapport aux processeurs d’inférence actuellement leaders sur le marché.
« En fin de compte, les résultats montrent un progrès de performance très, très significatif par rapport à l’état de l’art », a déclaré Richard Ho, responsable matériel chez OpenAI, lors d’un appel presse. Il a souligné que Jalapeño offre des temps de réponse plus rapides tout en gérant efficacement les charges de travail en intelligence artificielle par unité d’énergie, ce qui le rend adapté à servir un grand nombre de clients avec une faible latence.
La comparaison de performance a principalement impliqué le système Nvidia Blackwell. Cependant, Ho a averti qu’une fois Jalapeño complètement déployé, les avancées anticipées de la concurrence pourraient modifier le paysage. Il a projeté que Jalapeño serait initialement déployé à la fin de 2026, bien que dans des quantités limitées, un déploiement plus large étant attendu en 2027.
Initialement annoncé en octobre 2025, le développement de Jalapeño a été un effort collaboratif entre OpenAI et Broadcom, utilisant les propres modèles d’OpenAI pour orienter le processus. L’objectif est que Jalapeño serve de plateforme multigénérationnelle intégrant efficacement des produits d’IA, des modèles, des puces et de la mémoire.
Cette approche globale permet à OpenAI de s’attaquer à des défis spécifiques dans le processus d’inférence. Jalapeño est conçu pour réduire les délais dans les phases de préremplissage et de communication, qui représentent des goulets d’étranglement courants dans le traitement. « Nous avons conçu Jalapeño pour minimiser les mouvements de données et les délais de communication », a noté l’entreprise dans un article de blog. Ce design permet à l’état du modèle, y compris le cache KV utilisé pendant la génération de réponse, d’être localisé, optimisant ainsi la combinaison des ressources de calcul, de mémoire et de mise en réseau pour chaque phase d’inférence.