Vai al contenuto

AI News · industry

Voice AI full-duplex: i modelli che ascoltano mentre parlano

A settembre 2026 OpenAI, Google, Alibaba e StepFun hanno lanciato modelli vocali che si possono interrompere a metà frase. Cosa è cambiato, chi guida in quale test e cosa significa per le telefonate aziendali.

Entagl Team9 min di lettura
Voice AI full-duplex: i modelli che ascoltano mentre parlano

La voice AI full-duplex è un unico modello che ascolta e parla nello stesso momento, così chi chiama può interrompere, fare una pausa o dire "ah-ah" senza spezzare la conversazione. Al 7 ottobre 2026, GPT-Live-1 di OpenAI guida lo Speech to Speech Index di Artificial Analysis con 83.2, un soffio davanti a Gemini 3.8 Live Extended Thinking di Google con 82.6, mentre la cinese StepFun è in testa nel test che misura quanto una conversazione sembra naturale, con il 98.9%. Tutti e tre sono stati lanciati o aggiornati negli ultimi tre mesi.

Se la tua attività risponde al telefono, settembre 2026 è il mese in cui la tecnologia alla base delle chiamate con l'AI è cambiata.

Cosa significa "full-duplex" e perché conta in una telefonata?

La maggior parte degli agenti telefonici AI costruiti prima del 2026 funzionava come una staffetta. Lo speech-to-text trasformava le parole di chi chiamava in testo, un modello linguistico scriveva una risposta e il text-to-speech la leggeva ad alta voce. Ogni passaggio aggiunge ritardo, e il sistema deve indovinare quando chi chiama ha finito di parlare. Se anticipa, gli parla sopra. Se ritarda, cala un silenzio imbarazzante.

Un modello full-duplex ascolta e parla all'interno di un'unica rete, senza interruzioni. Può sentire "scusa, anzi facciamo giovedì" mentre è ancora a metà frase e cambiare direzione. Sa distinguere chi ha smesso di parlare da chi sta solo pensando.

La differenza si vede nella pratica. Secondo OpenAI, l'app per imparare le lingue Speak ha ridotto di quasi l'80% le interruzioni durante le pause di riflessione degli studenti rispetto ai precedenti sistemi a turni. Un altro cliente citato nello stesso annuncio, che costruisce conversazioni rivolte ai pazienti, ha dichiarato che abbandonare la vecchia configurazione a catena ha eliminato 23,000 righe di codice.

Forse ti è già capitato di riattaccare a un voice bot perché continuava a interromperti.

Cosa è uscito tra luglio e ottobre 2026?

Modello Laboratorio Regione Pesi Rilascio Cosa spicca
GPT-Live-1 OpenAI USA Chiuso (API) 10 set 2026 Affida il ragionamento complesso e le chiamate agli strumenti a un modello di backend separato; supporto per la telefonia
Gemini 3.8 Live / 3.8 Live Extended Thinking Google DeepMind USA Chiuso (API) 15 set 2026 Esegue le chiamate agli strumenti in background mentre continua a parlare; oltre 97 lingue
StepAudio 3 Realtime StepFun Cina Chiuso (API, anteprima) 15 set 2026 Punteggio più alto sulle dinamiche conversazionali su Artificial Analysis
Qwen-Audio-3.1-Realtime Alibaba Qwen Cina Chiuso (API) Set 2026 Taglio di prezzo di circa l'85% sul modello in tempo reale
Grok Voice Think Fast 2.0 xAI USA Chiuso (API) 29 lug 2026 Tasso di completamento dei compiti più alto su Artificial Analysis
NemotronLabs VoiceChat 11B NVIDIA USA Pesi aperti Ago 2026 Primo modello full-duplex aperto con chiamata agli strumenti
Raon-SpeechChat-9B Krafton Corea del Sud Pesi aperti Apr 2026 Tempo al primo audio più rapido della classifica (solo inglese)
Step-Audio R1.1 (Realtime) StepFun Cina Pesi aperti Inizio 2026 Modello vocale aperto in tempo reale con ottimi punteggi di ragionamento

Fonti: OpenAI, Google, documentazione StepFun, The Decoder su Qwen-Audio-3.1, xAI, NVIDIA su Hugging Face, Krafton su Hugging Face, StepFun su Hugging Face.

Nell'elenco si leggono due tendenze. La prima: ogni modello di frontiera ormai separa il "continuare a parlare" dal "fare il lavoro". GPT-Live-1 delega il ragionamento a un modello testuale di backend, Gemini 3.8 Live chiama gli strumenti in modo asincrono e StepFun descrive il suo modello come capace di pensare mentre parla. La seconda: la fascia a pesi aperti ora include un modello full-duplex in grado di chiamare strumenti a metà conversazione, cosa che fino a questa estate offrivano solo le API in hosting.

Qual è il miglior modello di voice AI in questo momento?

Non c'è un vincitore unico, e chi ne nomina uno senza dire "in quale test" sta cercando di venderti qualcosa. Artificial Analysis combina quattro test nel suo indice: ragionamento sul parlato, prestazioni agentiche sui compiti di assistenza clienti di τ-Voice, preferenza nell'arena e completamento dei compiti. Le dinamiche conversazionali vengono riportate a parte. Al 7 ottobre 2026:

Test (Artificial Analysis) In testa Punteggio Subito dietro
Speech to Speech Index complessivo GPT-Live-1 (backend Astra, medium) 83.2 Gemini 3.8 Live Extended Thinking (High) 82.6; Grok Voice Think Fast 2.0 High 81.3
Ragionamento sul parlato (Big Bench Audio) StepAudio 3 Realtime (StepFun) 99.7% Qwen Audio 3.0 Realtime Plus 99.2%; Qwen3.5 Omni Plus Realtime 98.7%
Prestazioni agentiche (compiti di assistenza clienti τ-Voice) GPT-Live-1 (backend Astra, medium), una sola prova 74.5% Gemini 3.8 Live Extended Thinking (High) 68.6%
Dinamiche conversazionali (pause, turni di parola, interruzioni) StepAudio 3 Realtime (StepFun) 98.9% Qwen Audio 3.0 Realtime Plus 98.4%; GPT-Live-1 (Sol, low) 97.3%
Completamento dei compiti nella Speech Agent Arena Grok Voice Think Fast 2.0 High 94.6% Gemini 3.8 Live 93.2%

Ecco come leggere la tabella. Nell'indice complessivo OpenAI, Google e xAI stanno entro due punti l'una dall'altra, il che all'atto pratico è un pareggio. Nel ragionamento sul parlato e in quanto la conversazione sembra naturale sono in testa i modelli cinesi: StepFun e Alibaba battono tutti i modelli statunitensi su entrambi i fronti. Il vantaggio di OpenAI nel test di assistenza clienti si basa su una sola prova, quindi consideralo provvisorio. E il divario di prezzo è reale: Artificial Analysis indica Qwen Audio 3.0 Realtime Plus di Alibaba come il modello più economico tra quelli che monitora per ora di audio in ingresso.

Tieni presente che il più recente Qwen-Audio-3.1-Realtime di Alibaba non aveva ancora un punteggio in classifica quando abbiamo controllato, per cui le righe di Alibaba qui sopra si riferiscono alla versione 3.0.

Dove sono ancora carenti i nuovi modelli?

I post di lancio sono ottimisti. Le tabelle dei benchmark sono più oneste.

  • Essere naturali e portare a termine il lavoro sono abilità diverse. PersonaPlex, il modello aperto di NVIDIA, ottiene il 91.0% sulle dinamiche conversazionali ma il 19% sul ragionamento sul parlato nella stessa tabella di Artificial Analysis. Un modello può sembrare fluido e sbagliare comunque la prenotazione.
  • Ascoltare meglio può voler dire fermarsi più lentamente. I risultati tecnici di Alibaba, riassunti da MarkTechPost, mostrano che il suo modello è diventato molto più bravo a ignorare il parlato non rivolto a lui, ma il tasso di ripresa indesiderata dopo un'interruzione è salito da 0.035 a 0.130, e impiega 1.116 secondi per fermarsi quando viene interrotto, contro gli 0.383 secondi di GPT-Realtime-2.
  • I compiti di assistenza clienti restano un problema aperto. Anche il miglior modello su τ-Voice completa circa tre compiti su quattro tra quelli che replicano casi di compagnie aeree, retail e telecomunicazioni. L'altro quarto fallisce.
  • I pesi aperti sono disomogenei. Step-Audio R1.1, il modello aperto di StepFun, ottiene il 97.6% sul ragionamento sul parlato, un decimo di punto dietro al migliore di Google (Gemini 3.8 Live Extended Thinking, 97.7%) e davanti a tutti i modelli di OpenAI e xAI. Però nessun modello aperto ha ancora un punteggio di assistenza clienti su τ-Voice, e la recensione di AI Weekly della model card di NVIDIA nota che il modello sceglie lo strumento giusto l'82.5% delle volte ma compila correttamente i dettagli solo nel 44.2% dei casi. Controlla la licenza di ogni modello prima di costruirci sopra.

Cosa significa per un'attività che riceve chiamate?

In pratica, il canale telefonico è appena diventato più adatto al lavoro vero, e meno tollerante con le configurazioni lente. Nei messaggi di testo la velocità decide già le vendite. Nel Response Velocity Study di Entagl, le conversazioni a cui si è risposto entro 60 secondi hanno convertito al 35.1%, contro il 12.2% con risposte tra 5 e 60 minuti, su 32,581 conversazioni. La telefonata è il canale più impaziente che esista.

Tre cose da fare con questa notizia:

  1. Metti alla prova le interruzioni, non le demo. Chiama il tuo agente AI e interrompilo a metà frase, cambia la data a metà strada, resta in silenzio per quattro secondi. La nostra guida per valutare un agente telefonico AI elenca gli scenari che vale la pena provare.
  2. Giudica l'azione, non la voce. Una voce piacevole che prenota l'orario sbagliato è peggio di una voce qualunque che prenota quello giusto. Verifica che l'appuntamento, l'ordine o la richiamata arrivino davvero nel tuo sistema.
  3. Non legarti a un solo modello vocale. Il 15 settembre Google ha dichiarato che Gemini 3.8 Live Extended Thinking era al numero 1 nell'indice di Artificial Analysis; tre settimane dopo GPT-Live-1 gli sta sopra di 0.6 punti. Abbiamo spiegato il discorso generale in perché non dovresti costruire la tua attività su un solo modello AI, e la voce è il campo in cui questo pesa di più.

Che ruolo ha il Coordinator di Entagl?

Il Coordinator di Entagl gestisce chiamate in entrata e in uscita su numeri di telefono e chiamate WhatsApp (sui numeri supportati e, dove WhatsApp lo richiede, con il permesso del cliente), usando modelli speech-to-speech nativi invece di una staffetta a catena. Il suo livello vocale è costruito per cambiare il modello sottostante senza ricostruire l'agente: di default funziona con Gemini Live, e i modelli realtime di OpenAI stanno arrivando come seconda opzione. Prima di comporre il numero, legge i riepiloghi delle conversazioni recenti del cliente, i suoi appuntamenti e le chiamate passate, così una chiamata di conferma o una richiamata richiesta parte con il contesto giusto invece che con un "come posso aiutarla?". Ogni chiamata lascia una trascrizione nella scheda del cliente.

Per capire dove si collocano le chiamate lungo il percorso del cliente, leggi La voce AI per assistenza clienti e vendite. Per l'uso più comune, la nostra raccolta di ricerche sui no-show spiega cosa cambiano davvero le chiamate di conferma.

Vuoi sentire come suona una chiamata AI con il contesto completo sul tuo caso d'uso? Prenota una demo di 30 minuti.

FAQ

Qual è la differenza tra voice AI full-duplex e half-duplex?

La voice AI half-duplex (a turni) parla a turno: aspetta che tu smetta, poi risponde. La voice AI full-duplex ascolta e parla contemporaneamente, quindi può reagire alle interruzioni, ai segnali di ascolto come "mm-mm" e alle pause mentre sta ancora parlando.

Qual è il miglior modello di voice AI a ottobre 2026?

Dipende dal test. Su Artificial Analysis, al 7 ottobre 2026, GPT-Live-1 guida lo Speech to Speech Index complessivo con 83.2, di poco davanti a Gemini 3.8 Live Extended Thinking (82.6) e Grok Voice Think Fast 2.0 (81.3). StepAudio 3 Realtime di StepFun è in testa sulle dinamiche conversazionali con il 98.9%.

Esistono modelli vocali full-duplex open source?

Sì. NVIDIA descrive il suo NemotronLabs VoiceChat 11B come il primo modello full-duplex aperto con chiamata agli strumenti, Raon-SpeechChat-9B di Krafton è aperto e solo in inglese, e StepFun pubblica i pesi di Step-Audio R1.1. Il loro ragionamento può essere solido, ma nessuno ha ancora un punteggio sul benchmark di assistenza clienti τ-Voice, e le licenze cambiano da modello a modello, quindi controlla le condizioni prima di costruirci sopra.

I modelli full-duplex rendono gli agenti telefonici AI pronti per qualsiasi chiamata?

No. Il miglior modello sul benchmark di assistenza clienti τ-Voice completa il 74.5% dei compiti, sulla base di una sola prova. Mantieni un percorso chiaro verso una persona e verifica le azioni che l'agente compie, non solo come suona.

Un'attività deve scegliere uno di questi modelli?

Di solito non direttamente. Il primo posto della classifica è passato di mano entro tre settimane dal lancio di Google del 15 settembre, quindi la scelta più sicura è una piattaforma il cui livello vocale possa passare a un altro modello senza ricostruire l'agente, e di cui verifichi le opzioni supportate prima di impegnarti.

Fonti: pagine prodotto e model card di OpenAI, Google DeepMind, StepFun, xAI, NVIDIA e Krafton; classifica Speech to Speech di Artificial Analysis (consultata il 7 ottobre 2026); The Decoder (23 settembre 2026); MarkTechPost (28 settembre 2026); AI Weekly (agosto 2026); Entagl Response Velocity Study (2026).

Pubblicato da Entagl Team on