TL;DR : OpenAI a publié les premiers résultats de mesure pour Jalapeño — le premier ASIC d'inférence maison, fabriqué en collaboration avec Broadcom. Le résultat : 1,5 à 1,9 fois plus de travail IA par watt, et une latence de bout en bout 1,7 à 3,6 fois inférieure par rapport aux systèmes de comparaison commerciaux, testé sur trois modèles ouverts via un benchmark public. Le plus grand avantage réside dans les charges de travail interactives avec des performances jusqu'à 4,1 fois supérieures. La montée en cadence de la production s'étalera sur 2027.
Ce qu'est Jalapeño
- La première puce d'inférence maison d'OpenAI, développée conjointement avec Broadcom et optimisée pour l'exécution de modèles de langage.
- Les mesures ont été réalisées sur InferenceX, le benchmark public de SemiAnalysis — il ne s'agit donc pas d'une simple présentation interne.
- Modèles testés : GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. Cela prouve que l'architecture fonctionne également avec des modèles ouverts, et pas uniquement avec des modèles propriétaires.
Les mesures en un coup d'œil
| Métrique | Jalapeño vs. Système de comparaison |
|---|---|
| Travail par watt (Débit de pointe) | 1,5–1,9× plus |
| Latence de bout en bout | 1,7–3,6× inférieure |
| Charges de travail interactives | Performances 2,1–4,1× supérieures |
| Kimi K2.5 1T (le plus grand modèle testé) | ~1,5× Perf/Watt, latence 3,4× inférieure |
| Puissance nominale / Puissance continue mesurée | 700 W / ≤ 550 W |
modeles: [GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T]
benchmark: InferenceX (SemiAnalysis, public)
puissance: nominale 700 W, mesurée <= 550 W
production: montée en cadence sur 2027, majorité de la production au T4 2027
Pourquoi la puce est rapide : Co-Design plutôt qu'un empilement de composants
Jalapeño minimise le déplacement des données — la véritable source de goulots d'étranglement dans l'inférence des LLM. Pour cela, le système utilise plusieurs leviers :
- Le Prefill (traitement du prompt) nécessite une forte puissance de calcul, tandis que le Decode (réponse générée token par token) est limité par la bande passante de la mémoire. Selon la phase d'inférence, la puce active la combinaison adéquate de calcul, de mémoire et de réseau.
- Le cache KV est délibérément placé et conservé localement, plutôt que d'être constamment déplacé entre les ressources.
- Le réseau fait partie intégrante de l'architecture : de grands domaines maintiennent l'ensemble d'une charge de travail dans un système interconnecté, afin que les temps d'attente entre les puces ne dominent pas la latence globale.
Les mesures sont effectuées avec une expérience utilisateur équivalente (matched user experience) : la même quantité de travail utile par watt pour une latence identique. C'est exactement la référence nécessaire pour les charges de travail basées sur des agents (agents IA), dont les sous-étapes s'additionnent de manière séquentielle — si une étape prend du retard, le temps total de la tâche augmente.
Lors de tests internes, l'avance sur les modèles frontières (frontier models) d'OpenAI s'est encore creusée, ce qui indique que : plus la charge de travail est massive et exigeante, plus l'architecture démontre sa pertinence.
Ce que les développeurs doivent en retenir
- Les prix des API subiront une pression à la baisse. Plus de travail par watt à latence égale réduit le coût unitaire par million de tokens — la tendance des récentes sorties (sous la barre du dollar pour les modèles ouverts) devrait se poursuivre.
- Le bond le plus significatif concerne les charges de travail interactives. Ceux qui développent des agents avec de nombreuses petites étapes séquentielles en profiteront de manière disproportionnée (jusqu'à 4,1×) — rendant les chaînes d'actions longues concrètement exploitables.
- Les environnements locaux (stacks) restent pertinents. Jalapeño est un matériel conçu pour les centres de données avec une puissance nominale de 700 W. Pour garantir la souveraineté des données et des coûts prévisibles, les bancs de tests MLX/vLLM demeurent essentiels ; les modèles ouverts testés fonctionnent dans les deux environnements.
- Planifier ses fenêtres de déploiement. La majeure partie de la capacité sera disponible au quatrième trimestre 2027 — les étapes de consolidation technique pour 2027/28 peuvent être synchronisées sur ce calendrier.
FAQ
Comment savoir si Jalapeño est pertinent pour mon projet ? En observant deux indicateurs : le travail par watt et la latence de bout en bout pour la longueur de prompt typique de votre cas d'usage. Si votre charge de travail est interactive (réponses courtes, nombreuses étapes), la puce offre le plus grand levier selon les tests. Pour les prompts longs (documents entiers) nécessitant peu de réponses, la différence est moins marquée, car le Prefill et la bande passante mémoire y dominent la latence.
Plus de performances par watt signifie-t-il automatiquement des prix d'API plus bas ? Pas automatiquement, mais la dynamique va dans ce sens : le coût unitaire par token baisse avec l'efficacité. OpenAI a fait part de son intention de répercuter ces gains sur ses clients, et la concurrence acharnée autour des modèles à poids ouverts (open-weights) accentue encore cette pression sur les prix. Toutefois, seuls les chiffres du tableau tarifaire officiel de l'API font foi.
Mes modèles actuels fonctionneront-ils sans modification sur Jalapeño ? Oui, la puce exécute des modèles, elle ne requiert pas de nouveaux formats. Les exemples mesurés (GPT-OSS 120B, DeepSeek R1 et Kimi K2.5) sont précisément les modèles ouverts que les pipelines locaux et hébergés utilisent déjà aujourd'hui. La syntaxe de l'API reste identique ; seules les courbes de latence et de tarification évoluent en faveur des utilisateurs.
Dois-je abandonner mes modèles locaux à cause de Jalapeño ? Pas dans l'immédiat — la production ne débute qu'en 2027 et la disponibilité sera restreinte au lancement. Après le premier mois d'exploitation en production, comparez la latence mesurée via l'API avec vos propres mesures locales. En cas de besoin de souveraineté des données (On-Premise, aucune requête externe), les déploiements locaux restent assurément le choix le plus approprié.
Comment se positionne Jalapeño face à NVIDIA Blackwell ? Les systèmes de comparaison utilisés dans InferenceX sont les générations Blackwell disponibles sur le marché. Sur la plage de fonctionnement testée, Jalapeño se maintient sur le front de Pareto : une combinaison de débit, d'efficacité énergétique et de latence égale ou supérieure. Cela ne signifie pas "toujours plus rapide", mais plutôt : à budget de latence équivalent, la puce fournit plus de travail par watt — la mesure la plus pragmatique pour les agents IA.
Sources
- OpenAI — Premiers résultats de Jalapeño : https://openai.com/index/jalapeno-first-results/
- SemiAnalysis (Éditeur du benchmark InferenceX) : https://semianalysis.com/
- Discussion Hacker News (298 points) : https://news.ycombinator.com/