OpenAI

Journée produits OpenAI du 10.09 : Agents API, GPT-Live-1, ChatGPT for Financial Services — le backend d'agents devient un produit

Journée produits OpenAI du 10.09 : Agents API, GPT-Live-1, ChatGPT for Financial Services — le backend d'agents devient un produit

TL;DR : Le 10 septembre 2026, OpenAI a regroupé son backend d'agents en trois produits : l'API Agents fournit le Codex-Harness en tant que service managé, GPT-Live-1 remplace la chaîne STT–LLM–TTS par un modèle vocal full duplex unique, et ChatGPT for Financial Services intègre des données de marché sous licence avec des citations vérifiables directement dans le modèle. Pour les développeurs, cela signifie qu'il faut évaluer chaque couche individuellement : que dois-je utiliser en first-party et que dois-je câbler moi-même ?

La journée en un tableau

ProduitCoucheStatutPoint clé
Agents APIOrchestrationBêta publiqueLe Codex-Harness en tant qu'API : compaction du contexte, recherche d'outils, sous-agents
GPT-Live-1VoixDisponible via APIFull duplex dans un seul modèle, délégation aux modèles backend
ChatGPT for Financial ServicesDonnéesLancéDonnées premium (Daloopa, PitchBook, LSEG, etc.) indexées sur l'infrastructure d'OpenAI

Agents API : le Codex-Harness devient un produit

Les agents utiles nécessitent plus qu'un modèle puissant : ils ont besoin d'une gestion du contexte, d'une utilisation efficace des outils et d'une coordination de sous-agents. C'est précisément ce harness (harnais/infrastructure), qui propulse Codex et ChatGPT pour le travail, qui est désormais disponible sous le nom d'Agents API en bêta publique — avec un seul appel d'API, défini par la tâche, le modèle, les outils et l'environnement.

Les principales composantes :

  • Environnement au choix : Sandbox hébergée par OpenAI, infrastructure propre ou partenaires tels que Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop, Vercel et Blaxel.
  • Compaction automatique : Si les sessions s'approchent de la limite de contexte, l'API résume elle-même le contexte précédent. Les workflows s'étalant sur plusieurs fenêtres de contexte n'ont plus besoin de leur propre logique de compaction.
  • Tool Search : Ne charge que les définitions d'outils pertinentes — ce qui réduit les coûts en tokens et préserve le cache du modèle.
  • Programmatic Tool Calling : Les agents appellent les outils en parallèle, enchaînent les opérations et filtrent les résultats dans le code, au lieu de tout renvoyer dans le contexte.
  • Support multi-agents : Les tâches complexes sont décomposées en parties indépendantes et déléguées à des sous-agents parallèles ; chacun conserve son propre contexte.
  • Fondation ouverte : L'API fonctionne sur le Codex-Harness open source et prend en charge le MCP, les fonctions personnalisées et les outils intégrés comme la recherche web.

L'appel minimal suit un modèle simple :

json
{
  "task": "Analyse les résultats trimestriels et crée un tableau comparatif",
  "model": "gpt-5.6",
  "tools": ["web_search", "code_interpreter"],
  "environment": "openai_hosted_sandbox"
}

GPT-Live-1 : le full duplex plutôt qu'une course de relais

Image symbolique : écouter et parler en même temps – un seul modèle au lieu d'une chaîne STT–LLM–TTS.
Image symbolique : écouter et parler en même temps – un seul modèle au lieu d'une chaîne STT–LLM–TTS.
Les agents vocaux classiques enchaînent la reconnaissance vocale (STT), le modèle de raisonnement (LLM) et la synthèse vocale (TTS). Chaque transfert ajoute de la latence et perturbe le rythme. GPT-Live-1 écoute et parle simultanément au sein d'un seul modèle — et délègue les tâches de raisonnement plus profondes et l'utilisation d'outils à un modèle backend comme GPT-6 Astra ou un modèle tiers.

Les résultats mesurables issus des évaluations d'OpenAI :

  • Full Duplex Bench : +30 points de pourcentage par rapport à GPT-Realtime-2.1, en particulier sur la latence de prise de parole (turn-taking) et le comportement interactif.
  • Tau3 (intelligence des agents vocaux dans des tâches de bout en bout) : 1ère place, couplé avec GPT-6 Astra pour un effort de raisonnement moyen.
  • Valeur pratique chez Speak : Les apprenants ont bénéficié de plus de temps de réflexion, les interruptions ont chuté de près de 80 % par rapport aux systèmes fonctionnant au tour par tour.

Autres points forts : le ton, le rythme et le style peuvent être contrôlés via le prompt système ; les bruits de fond et les pauses sont gérés sans perturbation ; la téléphonie est prise en charge nativement, de la réservation au restaurant jusqu'au menu vocal du support. Nativement, le modèle génère des transcriptions ASR et le texte des réponses, et prend en charge le keyword-biasing — avec une détection explicite des tours de parole, sans être lui-même au tour par tour.

ChatGPT for Financial Services : la couche de données comme avantage stratégique

Image symbolique : remonter les chiffres jusqu'à la source – la couche de données comme véritable levier.
Image symbolique : remonter les chiffres jusqu'à la source – la couche de données comme véritable levier.
Le même jeudi a été lancé ChatGPT for Financial Services, développé avec Morgan Stanley et Evercore en tant que partenaires de conception. Le produit fonctionne sur GPT-6 Astra et couvre le quotidien des analystes : valorisations, modèles LBO, sélection d'acheteurs, analyses de résultats, pitchbooks avec les modèles de l'entreprise.

Le véritable levier est la couche de données : les données premium de Daloopa, PitchBook et LSEG News (y compris Reuters) sont directement intégrées, avec des connexions à S&P Capital IQ, MSCI, Moody's, Dow Jones Factiva, Preqin, Intapp, Datasite et Box — sans contrats séparés ni connecteurs à configurer soi-même. Les données sont indexées sur l'infrastructure d'OpenAI, ce qui est censé améliorer la récupération (retrieval), la latence et les nouvelles citations plus granulaires : les chiffres peuvent être retracés jusqu'à leur source.

Comme preuve, OpenAI cite le benchmark OfficeQA Pro (bulletins du Trésor américain avec tableaux, graphiques et notes de bas de page) : GPT-6 Astra atteint 69,9 %, contre 60,2 % pour son prédécesseur GPT-5.6 Sol. En toute franchise, cela signifie qu'il reste un taux d'erreur d'environ 30 % — il y a donc encore une marge de progression importante en matière de fiabilité des chiffres. Aucun prix n'a été communiqué lors du lancement.

En marge de cette même journée

  • Data Agent dans ChatGPT Work : accès structuré aux données directement dans le client de travail.
  • Accès gouvernemental : les agences gouvernementales obtiennent une connexion à cette gamme de modèles.

Check-list : Quelle couche dois-je utiliser en first-party ?

  1. Orchestration : Avez-vous besoin de gérer vous-même la compaction, la recherche d'outils et les sous-agents ? Si oui, l'API Agents est le chemin le plus court — le hosted harness vous épargne votre propre maintenance.
  2. Voix : Votre pile STT–LLM–TTS est-elle stable, mais lente ? GPT-Live-1 consolide la chaîne dans un seul modèle ; comparez la latence aux coûts par minute.
  3. Données : Votre entreprise utilise-t-elle déjà Daloopa, PitchBook ou LSEG ? Vérifiez si les citations en first-party réduisent vraiment votre taux d'erreur avant de maintenir des connecteurs en double.
  4. Escalade : N'utilisez vos propres modèles que si des impératifs de résidence des données ou une infrastructure asynchrone (late-night) l'exigent par rapport à la version API.

FAQ

Quelle est la différence entre l'API Agents et la précédente API Responses ?

L'API Agents est une structure managée basée sur le même Codex-Harness open source qui propulse également Codex et ChatGPT pour le travail. Vous définissez la tâche, le modèle, les outils et l'environnement en un seul appel, tandis que l'API se charge de la compaction du contexte, de la découverte d'outils et de la coordination des sous-agents. L'API Responses reste la primitive de base pour les appels directs au modèle ; l'API Agents ajoute la couche d'orchestration par-dessus.

Pourquoi le full duplex est-il un avantage pour les agents vocaux par rapport aux systèmes au tour par tour ?

Dans les chaînes au tour par tour, le système attend un segment vocal terminé avant de répondre — les pauses et les interruptions ajoutent de la latence à chaque fois. GPT-Live-1 écoute et parle simultanément, réagit aux interruptions et aux confirmations en temps réel, et évite les transferts (handoffs) rigides de la chaîne STT–LLM–TTS. En pratique, cela signifie : des temps d'attente plus courts, des dialogues plus naturels et près de 80 % de perturbations en moins lors du test d'apprentissage chez Speak.

Comment vérifier si ChatGPT for Financial Services remplace ma configuration de données ?

Comparez les sources intégrées avec vos licences actuelles : Daloopa pour les états financiers, PitchBook pour les données d'entreprises privées, LSEG y compris Reuters pour les actualités. Si votre équipe utilise déjà ces services, vous économisez sur les connecteurs et obtenez des citations plus granulaires issues d'une source indexée. Ensuite, vérifiez sur deux ou trois vrais modèles si la qualité de citation réduit votre taux d'erreur — à 69,9 % sur OfficeQA Pro, une part de vérification manuelle reste nécessaire.

L'API Agents vaut-elle la peine pour les équipes ayant leur propre infrastructure ?

Oui, car l'environnement est au choix : Sandbox hébergée par OpenAI pour un démarrage rapide, VPC ou Sandboxes partenaires comme Cloudflare, E2B ou Modal pour des configurations contrôlées. Le principal avantage réside dans la maintenance : la logique de compaction, la recherche d'outils et la coordination multi-agents sont fournies et mises à jour par OpenAI à chaque nouvelle version de modèle. Seuls ceux qui gèrent des cas spécifiques en dehors de ce harness seront plus flexibles avec une pile câblée par leurs soins.

Que signifie concrètement la délégation avec GPT-Live-1 ?

Le modèle vocal lui-même se charge d'écouter et de parler, mais il délègue le raisonnement et les appels d'outils à un modèle backend, comme GPT-6 Astra pour les cas complexes, ou un modèle plus économique pour de gros volumes comme la planification (scheduling). Vous séparez ainsi la latence vocale de la profondeur de réflexion et pouvez adapter les coûts par catégorie de tâche. L'architecture reste modulaire sans que vous ayez besoin d'orchestrer la chaîne vous-même.

Sources

Un sujet pour votre équipe ? Parlons-en 30 minutes.

Nous identifions ce qui fonctionne vraiment dans votre entreprise — concret, sans avalanche de slides.

Sans engagement · 30 minutes · Devis sous 48 h