
OpenAI publie des données de benchmark Jalapeño montrant des gains d'efficacité par rapport au Nvidia GB300
Les chiffres de benchmark publiés lors de la conférence Hot Chips indiquent que le processeur d'inférence personnalisé d'OpenAI offre jusqu'à 1.9 fois plus de travail par watt que les systèmes Nvidia GB300.
Résultats des benchmarks et performances d'inférence
Lors de la conférence Hot Chips mardi, OpenAI a présenté les premiers benchmarks de performance pour Jalapeño, son processeur d'inférence d'intelligence artificielle personnalisé. Les tests menés sur le benchmark SemiAnalysis InferenceX ont évalué le processeur par rapport aux systèmes Nvidia GB200 et GB300 sur trois grands modèles de langage : GPT-OSS 120B, DeepSeek R1 et la version à 1 billion de paramètres de Kimi K2.5. Jalapeño a délivré entre 1.5 et 1.9 fois plus de travail IA par watt que le matériel de comparaison en pic de performance. La latence de réponse a diminué d'un facteur compris entre 1.7 et 3.6 sur les modèles évalués, avec la marge de performance la plus large observée sur Kimi K2.5. Richard Ho, vice-président du matériel chez OpenAI, a déclaré que la puce atteignait à la fois un débit plus élevé et une latence plus faible.
En résumé, les résultats montrent une avancée de performance très, très significative par rapport à l'état de l'art.
Architecture et spécifications de puissance
Jalapeño est un circuit intégré spécifique à une application développé en collaboration avec Broadcom et Celestica. OpenAI a utilisé ses propres modèles d'intelligence artificielle pendant le développement, achevant le processus de conception du concept initial au silicium final en neuf mois. Le processeur fonctionne avec une consommation nominale de 700 watts, tandis que la puissance soutenue est restée inférieure à 550 watts lors des tests de benchmark. En comparaison, les systèmes Nvidia GB200 consomment 1,200 watts et les systèmes GB300 consomment 1,400 watts. Jalapeño est conçu exclusivement pour des tâches d'inférence plutôt que pour l'entraînement de modèles, optimisant la gestion de la mémoire et la mise en cache locale clé-valeur pour réduire les délais de transmission de données lors des phases de préremplissage et de communication. La société d'analyse indépendante SemiAnalysis a noté que les tests par rapport au matériel de la génération Blackwell précèdent les comparaisons avec la nouvelle architecture Rubin de Nvidia.
- OpenAI Jalapeño
- 700 W
- Nvidia GB200
- 1200 W
- Nvidia GB300
- 1400 W
Calendrier de déploiement et feuille de route multi-générationnelle
OpenAI prévoit de déployer Jalapeño en volumes limités dans son infrastructure de centre de données interne avant la fin de 2026, suivi d'un volume accru en 2027 et d'une production à grande échelle au quatrième trimestre 2027. L'entreprise développe actuellement une puce de deuxième génération dont la sortie est prévue dans les mois à venir, tandis qu'une troisième itération est en phase de conception conceptuelle. OpenAI a confirmé qu'elle n'a pas l'intention de vendre les puces Jalapeño à des clients externes, réservant toute la production pour faire fonctionner des services tels que ChatGPT, Codex, l'API publique et les produits agents. La plateforme multi-générationnelle permet à OpenAI de co-développer des algorithmes, des systèmes de mémoire et des processeurs physiques pour répondre aux exigences futures des modèles.
- Développement initial annoncé
- OpenAI présente le processeur Jalapeño
- Benchmarks de performance dévoilés à la conférence Hot Chips
- Premier déploiement en petit volume dans l'infrastructure d'OpenAI
- Début prévu de la production à grande échelle
Relations avec les fournisseurs et contexte sectoriel
Parce que Jalapeño ne peut pas entraîner de nouveaux modèles, OpenAI reste dépendant de fournisseurs de semi-conducteurs externes pour son infrastructure informatique plus large. La direction de l'entreprise a affirmé que les accélérateurs commerciaux d'autres fournisseurs continueront à alimenter les charges de travail d'entraînement aux côtés du silicium d'inférence propriétaire.
Nous allons avoir besoin de beaucoup de puissance de calcul. Et Jalapeño en fait partie. Cerberus en fait partie. Nvidia en fait partie. AMD en fait partie.
L'effort matériel personnalisé suit des développements similaires dans l'industrie, avec Anthropic concevant du silicium en interne, Google négociant avec Marvell pour des puces d'inférence personnalisées, et Amazon et Microsoft exploitant des processeurs propriétaires. Parallèlement, l'Union européenne a engagé 20 milliards d'euros pour des gigafactories d'IA qui achètent du matériel commercial sur le marché libre, coïncidant avec des augmentations de prix des serveurs de plus de 15% annoncées par Nvidia.


