TL;DR: Il 10 settembre 2026, OpenAI ha raggruppato il suo backend per agenti in tre prodotti: l'Agents API offre il Codex-Harness come servizio gestito, GPT-Live-1 sostituisce la catena STT–LLM–TTS con un unico modello vocale full-duplex, e ChatGPT for Financial Services porta dati di mercato su licenza con fonti citabili direttamente nel modello. Per i builder questo significa: valutare ogni layer singolarmente — cosa adotto come soluzione first-party e cosa sviluppo da solo?
La giornata in sintesi
| Prodotto | Layer | Stato | Punto chiave |
|---|---|---|---|
| Agents API | Orchestrazione | Public Beta | Codex-Harness come API: Compattazione del contesto, Tool Search, Sub-agenti |
| GPT-Live-1 | Voice | Disponibile in API | Full-duplex in un solo modello, delega a modelli backend |
| ChatGPT for Financial Services | Dati | Lanciato | Dati premium (Daloopa, PitchBook, LSEG, ecc.) indicizzati sull'infrastruttura OpenAI |
Agents API: il Codex-Harness diventa un prodotto
Gli agenti utili richiedono molto più di un modello potente: necessitano di gestione del contesto, uso efficiente degli strumenti e coordinamento dei sub-agenti. Esattamente questa infrastruttura (harness), che alimenta Codex e ChatGPT for Work, è ora disponibile come Agents API in beta pubblica — tramite una singola chiamata API, definita da task, modello, strumenti (tools) e ambiente.
I componenti principali:
- Ambiente selezionabile: Sandbox ospitata da OpenAI, infrastruttura propria o partner come Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop, Vercel e Blaxel.
- Compattazione automatica: Se le sessioni si avvicinano al limite di contesto, l'API riassume automaticamente il contesto precedente. I workflow su più finestre di contesto non richiedono più una logica di compattazione personalizzata.
- Tool Search: Carica solo le definizioni dei tool pertinenti, riducendo i costi dei token e preservando la cache del modello.
- Programmatic Tool Calling: Gli agenti chiamano gli strumenti in parallelo, concatenano le operazioni e filtrano i risultati nel codice, invece di riportare tutto nel contesto.
- Supporto Multi-Agente: I task complessi vengono suddivisi in parti indipendenti e delegati a sub-agenti paralleli; ognuno mantiene il proprio contesto.
- Fondamenta aperte: L'API gira sul Codex-Harness open-source e supporta MCP (Model Context Protocol), funzioni personalizzate e tool integrati come la ricerca web.
La chiamata minima segue un pattern semplice:
{
"task": "Analizza i risultati trimestrali e crea una tabella comparativa",
"model": "gpt-5.6",
"tools": ["web_search", "code_interpreter"],
"environment": "openai_hosted_sandbox"
}
GPT-Live-1: Full-duplex al posto della staffetta
I risultati misurabili dalle analisi di OpenAI:
- Benchmark Full Duplex: +30 punti percentuali rispetto a GPT-Realtime-2.1, in particolare nella latenza di turn-taking e nel comportamento di interazione.
- Tau3 (Intelligenza degli agenti vocali in task end-to-end): 1° posto, abbinato a GPT-6 Astra per carichi di ragionamento medi.
- Valore pratico con Speak: Gli studenti hanno avuto più tempo per pensare, le interruzioni sono diminuite di quasi l'80% rispetto ai sistemi basati sui turni.
Altri punti di forza: tono, ritmo e stile possono essere controllati tramite il system prompt; i rumori di fondo e le pause vengono elaborati senza interruzioni; la telefonia è supportata nativamente, dalla prenotazione di un ristorante al menu vocale dell'assistenza. Il modello restituisce nativamente le trascrizioni ASR e il testo della risposta, e supporta il keyword-biasing — con riconoscimento esplicito dei turni, pur non essendo esso stesso basato sui turni.
ChatGPT for Financial Services: il layer dei dati come fossato (moat)
La vera leva è il layer dei dati: dati premium di Daloopa, PitchBook e LSEG News (inclusa Reuters) sono integrati direttamente, con connessioni aggiuntive a S&P Capital IQ, MSCI, Moody's, Dow Jones Factiva, Preqin, Intapp, Datasite e Box — senza contratti separati o connettori da configurare. I dati sono indicizzati sull'infrastruttura OpenAI, il che dovrebbe migliorare il retrieval, la latenza e le nuove citazioni più granulari: i numeri possono ora essere tracciati fino alla fonte.
Come prova, OpenAI cita il benchmark OfficeQA Pro (Bollettini del Tesoro U.S. con tabelle, grafici e note a piè di pagina): GPT-6 Astra raggiunge il 69,9%, mentre il predecessore GPT-5.6 Sol si fermava al 60,2%. A conti fatti, questo significa che rimane un margine di errore di circa il 30% — c'è quindi ancora un ampio margine di miglioramento sui dati numerici. Al lancio non è stato reso noto il prezzo.
Note a margine della giornata
- Data Agent in ChatGPT Work: Accesso strutturato ai dati direttamente nel client di lavoro.
- Accesso Governativo: Le agenzie governative ottengono una connessione dedicata alla linea di modelli.
Checklist: Quale layer adotto come first-party?
- Orchestrazione: Hai bisogno di sviluppare autonomamente la compattazione, la ricerca dei tool e i sub-agenti? Allora l'Agents API è la strada più breve: l'harness ospitato ti risparmia la manutenzione.
- Voice: Il tuo stack STT–LLM–TTS è stabile ma lento? GPT-Live-1 consolida la catena in un solo modello; bilancia la latenza con i costi al minuto.
- Dati: La tua azienda usa già Daloopa, PitchBook o LSEG? Verifica se le citazioni first-party riducono effettivamente il tasso di errore prima di mantenere due volte gli stessi connettori.
- Escalation: Passa a modelli proprietari solo se le operazioni notturne dell'infrastruttura o la residenza dei dati non possono essere soddisfatte dalla versione API.
FAQ
Qual è la differenza tra l'Agents API e la precedente API Responses?
L'Agents API è una struttura gestita basata sullo stesso Codex-Harness open-source che alimenta Codex e ChatGPT for Work. Definisci task, modello, tool e ambiente in una singola chiamata, mentre l'API gestisce la compattazione del contesto, il tool-discovery e il coordinamento dei sub-agenti. L'API Responses rimane la primitiva di base per le chiamate dirette al modello; l'Agents API aggiunge il layer di orchestrazione al di sopra di essa.
Perché il full-duplex è un vantaggio per gli agenti vocali rispetto ai sistemi basati sui turni?
Nelle catene basate sui turni, il sistema attende il termine di un segmento vocale chiuso e poi risponde: le pause e le interruzioni aggiungono latenza ogni volta. GPT-Live-1 ascolta e parla simultaneamente, reagisce alle interruzioni e alle conferme in tempo reale ed evita i passaggi (handoff) macchinosi della catena STT–LLM–TTS. In pratica: tempi di attesa più brevi, dialoghi più naturali e quasi l'80% di interruzioni in meno nei test di apprendimento con Speak.
Come verifico se ChatGPT for Financial Services può sostituire il mio setup di dati?
Confronta le fonti integrate con le tue licenze attuali: Daloopa per i rendiconti finanziari, PitchBook per i dati sulle società private, LSEG (inclusa Reuters) per le news. Se il tuo team utilizza già questi servizi, risparmi sui connettori e ottieni citazioni più granulari da una fonte indicizzata. Successivamente, testa con due o tre modelli reali se la qualità delle citazioni abbassa il tuo tasso di errore — con un 69,9% su OfficeQA Pro, rimane una quota significativa di lavoro di verifica manuale.
L'Agents API conviene ai team con un'infrastruttura propria?
Sì, perché l'ambiente è selezionabile: sandbox ospitata da OpenAI per partenze rapide, VPC o sandbox di partner come Cloudflare, E2B o Modal per setup controllati. Il vantaggio principale risiede nella manutenzione: OpenAI fornisce la logica di compattazione, la ricerca dei tool e il coordinamento multi-agente con ogni nuova release del modello. Solo chi gestisce casi d'uso molto specifici al di fuori di questo harness troverà più flessibile uno stack sviluppato internamente.
Cosa significa concretamente la "delega" in GPT-Live-1?
Il modello vocale stesso gestisce l'ascolto e il parlato, ma cede il ragionamento e le chiamate agli strumenti a un modello di backend, come GPT-6 Astra per i casi complessi o un modello più economico per volumi elevati come lo scheduling. In questo modo si separa la latenza vocale dalla profondità di ragionamento, permettendo di allineare i costi alla classe di task. L'architettura rimane modulare senza doversi occupare dell'orchestrazione della catena.
Fonti
- https://openai.com/index/introducing-the-agents-api/ — Introducing the Agents API (OpenAI, 2026)
- https://openai.com/index/introducing-gpt-live-1-in-the-api/ — Build more natural voice experiences with GPT-Live-1 in the API (OpenAI, 2026)
- https://openai.com/index/introducing-chatgpt-financial-services — Introducing ChatGPT for Financial Services (OpenAI, 2026)
- https://developers.openai.com/api/docs/guides/agents-api/overview — Agents API Overview (Documentazione ufficiale)
- https://www.reuters.com/business/openai-launches-chatgpt-financial-services-industry-2026-09-10 — Reuters: OpenAI launches ChatGPT for financial services industry (10/09/2026)
- https://thenextweb.com/news/openai-chatgpt-financial-services-dora-data-residency — TNW: OpenAI launches ChatGPT for Financial Services (2026)