Aujourd’hui: Août 25, 2026
OpenAI dévoile les résultats des performances de sa puce Jalapeño lors de la conférence Hot Chips

OpenAI dévoile les résultats des performances de sa puce Jalapeño lors de la conférence Hot Chips

OpenAI dévoile les résultats de référence pour Jalapeño lors de la conférence Hot Chips

Lors de la conférence Hot Chips, OpenAI a présenté un aperçu détaillé de son nouveau matériel, Jalapeño, en mettant en avant ses résultats de référence et ses métriques de performance. Testé sur le benchmark InferenceX de SemiAnalysis, Jalapeño a démontré un débit et une efficacité supérieurs, montrant un nombre de tokens par utilisateur plus élevé par rapport aux processeurs d’inférence actuels les plus performants.

« En résumé, les résultats montrent un avance de performance très, très significative par rapport à l’état de l’art », a déclaré Richard Ho, responsable du matériel chez OpenAI, lors d’une conférence de presse. Il a souligné que Jalapeño offre des temps de réponse plus rapides tout en gérant efficacement les charges de travail en IA par unité d’énergie, le rendant adapté à la gestion d’un nombre important de clients avec une faible latence.

La comparaison de performance a principalement concerné le système Nvidia Blackwell. Cependant, Ho a prévenu qu’au moment où Jalapeño sera entièrement déployé, les avancées attendues des concurrents pourraient modifier le paysage. Il a projeté que Jalapeño connaîtrait un déploiement initial à la fin de 2026, bien que dans des quantités limitées, avec un déploiement plus large prévu pour 2027.

Initialement annoncé en octobre 2025, le développement de Jalapeño a été un effort collaboratif entre OpenAI et Broadcom, utilisant les modèles internes d’OpenAI pour guider le processus. L’intention est que Jalapeño serve de plateforme multigénérationnelle intégrant efficacement les produits, modèles, puces et mémoires d’IA.

Cette approche globale permet à OpenAI de s’attaquer à des défis spécifiques dans le processus d’inférence. Jalapeño est conçu pour réduire les délais dans les phases de pré-remplissage et de communication, qui sont des goulets d’étranglement courants dans le traitement. « Nous avons conçu Jalapeño pour minimiser les mouvements de données et les retards de communication », a noté la société dans un billet de blog. Ce design permet à l’état du modèle, y compris le cache KV utilisé lors de la génération des réponses, d’être localisé, optimisant ainsi la combinaison des ressources de calcul, de mémoire et de réseau pour chaque phase d’inférence.

Laisser un commentaire

Your email address will not be published.

Don't Miss