Pular para o conteúdo

AI News · industry

IA de Voz Full-Duplex: Os Modelos Que Ouvem Enquanto Falam

Em setembro de 2026, a OpenAI, a Google, a Alibaba e a StepFun lançaram modelos de voz que pode interromper a meio de uma frase. O que mudou, quem lidera em cada teste e o que isto significa para as chamadas telefónicas das empresas.

Entagl Team9 min de leitura
IA de Voz Full-Duplex: Os Modelos Que Ouvem Enquanto Falam

A IA de voz full-duplex é um único modelo que ouve e fala ao mesmo tempo, por isso quem liga pode interromper, fazer uma pausa ou dizer "aham" sem quebrar a conversa. À data de 7 de outubro de 2026, o GPT-Live-1 da OpenAI lidera o Speech to Speech Index da Artificial Analysis com 83.2, uma unha à frente do Gemini 3.8 Live Extended Thinking da Google, com 82.6, enquanto a chinesa StepFun encabeça o teste que mede o quão natural parece uma conversa, com 98.9%. Os três foram lançados ou atualizados nos últimos três meses.

Se gere uma empresa que atende telefones, setembro de 2026 foi o mês em que a tecnologia por trás das chamadas com IA mudou.

O que significa "full-duplex" e porque é que importa numa chamada telefónica?

A maioria dos agentes telefónicos de IA criados antes de 2026 funcionava como uma estafeta. O speech-to-text transformava as palavras de quem ligava em texto, um modelo de linguagem escrevia uma resposta e o text-to-speech lia-a em voz alta. Cada passagem acrescenta atraso, e o sistema tem de adivinhar quando é que a pessoa acabou de falar. Se adivinha cedo demais, fala por cima dela. Se adivinha tarde demais, fica um silêncio constrangedor.

Um modelo full-duplex ouve e fala numa só rede, de forma contínua. Consegue ouvir "desculpe, afinal pode ser quinta-feira" ainda a meio da frase e mudar de rumo. Consegue distinguir quem parou de falar de quem está apenas a pensar.

Na prática, a diferença nota-se. A OpenAI indica que a aplicação de aprendizagem de línguas Speak reduziu em quase 80% as interrupções durante as pausas de reflexão dos alunos, em comparação com os sistemas anteriores por turnos. Outro cliente citado no mesmo anúncio, que cria conversas dirigidas a pacientes, afirmou que abandonar a sua configuração em cadeia eliminou 23,000 linhas de código.

É bem possível que já tenha desligado a chamada a um bot de voz porque ele não parava de o interromper.

O que foi lançado entre julho e outubro de 2026?

Modelo Laboratório Região Pesos Lançamento O que se destaca
GPT-Live-1 OpenAI EUA Fechados (API) 10 set. 2026 Passa o raciocínio difícil e as chamadas de ferramentas a um modelo de backend separado; suporte para telefonia
Gemini 3.8 Live / 3.8 Live Extended Thinking Google DeepMind EUA Fechados (API) 15 set. 2026 Executa chamadas de ferramentas em segundo plano enquanto continua a falar; mais de 97 línguas
StepAudio 3 Realtime StepFun China Fechados (API, pré-visualização) 15 set. 2026 Pontuação mais alta em dinâmica conversacional na Artificial Analysis
Qwen-Audio-3.1-Realtime Alibaba Qwen China Fechados (API) set. 2026 Corte de preço de cerca de 85% no modelo em tempo real
Grok Voice Think Fast 2.0 xAI EUA Fechados (API) 29 jul. 2026 Taxa de sucesso nas tarefas mais alta na Artificial Analysis
NemotronLabs VoiceChat 11B NVIDIA EUA Pesos abertos ago. 2026 Primeiro modelo full-duplex aberto com chamadas de ferramentas
Raon-SpeechChat-9B Krafton Coreia do Sul Pesos abertos abr. 2026 Tempo até ao primeiro áudio mais rápido da tabela (só inglês)
Step-Audio R1.1 (Realtime) StepFun China Pesos abertos Anteriormente, em 2026 Modelo de fala em tempo real aberto, com boas pontuações de raciocínio

Fontes: OpenAI, Google, documentação da StepFun, The Decoder sobre o Qwen-Audio-3.1, xAI, NVIDIA no Hugging Face, Krafton no Hugging Face, StepFun no Hugging Face.

Há dois padrões que atravessam a lista. Primeiro, todos os modelos de ponta separam agora "continuar a falar" de "ir fazer o trabalho". O GPT-Live-1 delega o raciocínio num modelo de texto de backend, o Gemini 3.8 Live chama ferramentas de forma assíncrona e a StepFun descreve o seu modelo como pensando enquanto fala. Segundo, o escalão de pesos abertos já inclui um modelo full-duplex capaz de chamar ferramentas a meio da conversa, algo que até este verão só as APIs alojadas ofereciam.

Qual é o melhor modelo de IA de voz neste momento?

Não há um vencedor único, e quem aponta um sem dizer "em que teste" está a vender alguma coisa. A Artificial Analysis combina quatro testes no seu índice: raciocínio de fala, desempenho agêntico em tarefas de apoio ao cliente do τ-Voice, preferência na arena e sucesso nas tarefas. A dinâmica conversacional é reportada à parte. À data de 7 de outubro de 2026:

Teste (Artificial Analysis) Líder Pontuação Logo atrás
Speech to Speech Index global GPT-Live-1 (backend Astra, medium) 83.2 Gemini 3.8 Live Extended Thinking (High) 82.6; Grok Voice Think Fast 2.0 High 81.3
Raciocínio de fala (Big Bench Audio) StepAudio 3 Realtime (StepFun) 99.7% Qwen Audio 3.0 Realtime Plus 99.2%; Qwen3.5 Omni Plus Realtime 98.7%
Desempenho agêntico (tarefas de apoio ao cliente do τ-Voice) GPT-Live-1 (backend Astra, medium), uma tentativa 74.5% Gemini 3.8 Live Extended Thinking (High) 68.6%
Dinâmica conversacional (pausas, troca de vez, interrupções) StepAudio 3 Realtime (StepFun) 98.9% Qwen Audio 3.0 Realtime Plus 98.4%; GPT-Live-1 (Sol, low) 97.3%
Sucesso nas tarefas na Speech Agent Arena Grok Voice Think Fast 2.0 High 94.6% Gemini 3.8 Live 93.2%

Leia a tabela assim. No índice global, a OpenAI, a Google e a xAI estão a menos de dois pontos umas das outras, o que na prática é um empate. No raciocínio de fala e na naturalidade da conversa, lideram os modelos chineses: a StepFun e a Alibaba batem todos os modelos norte-americanos em ambos. A vantagem da OpenAI no teste de apoio ao cliente assenta numa única tentativa, por isso trate-a como provisória. E a diferença de preço é real: a Artificial Analysis indica o Qwen Audio 3.0 Realtime Plus da Alibaba como o modelo mais barato que acompanha, por hora de áudio de entrada.

Note que o mais recente Qwen-Audio-3.1-Realtime da Alibaba ainda não tinha pontuação na tabela quando a consultámos, por isso as linhas da Alibaba acima referem-se à versão 3.0.

Onde é que os novos modelos ainda ficam aquém?

Os anúncios de lançamento são otimistas. As tabelas de benchmarks são mais honestas.

  • Soar natural e cumprir a tarefa são competências diferentes. O PersonaPlex, modelo aberto da NVIDIA, obtém 91.0% em dinâmica conversacional mas 19% em raciocínio de fala, na mesma tabela da Artificial Analysis. Um modelo pode soar fluido e mesmo assim errar a marcação.
  • Ouvir melhor pode significar parar mais devagar. Os resultados técnicos da própria Alibaba, resumidos pela MarkTechPost, mostram que o modelo melhorou muito a ignorar falas que não lhe eram dirigidas, mas a sua taxa de retomas indesejadas após interrupções subiu de 0.035 para 0.130, e demora 1.116 segundos a parar quando é interrompido, contra 0.383 segundos do GPT-Realtime-2.
  • As tarefas de apoio ao cliente continuam por resolver. Mesmo o melhor modelo no τ-Voice conclui cerca de três em cada quatro tarefas simuladas de companhias aéreas, retalho e telecomunicações. O quarto restante falha.
  • Os pesos abertos são irregulares. O Step-Audio R1.1, modelo aberto da StepFun, obtém 97.6% em raciocínio de fala, uma décima abaixo do melhor da Google (Gemini 3.8 Live Extended Thinking, 97.7%) e acima de todos os modelos da OpenAI e da xAI. Mas nenhum modelo aberto tem ainda pontuação de apoio ao cliente no τ-Voice, e a análise da AI Weekly ao model card da NVIDIA nota que o modelo escolhe a ferramenta certa 82.5% das vezes, mas só preenche os detalhes corretamente em 44.2% dos casos. Confirme a licença de cada modelo antes de construir sobre ele.

O que significa isto para uma empresa que recebe chamadas?

Em termos práticos, o canal telefónico ficou mais viável para trabalho a sério e menos tolerante com configurações lentas. A rapidez já decide vendas no texto. No Response Velocity Study da Entagl, as conversas respondidas em menos de 60 segundos converteram a 35.1%, contra 12.2% entre 5 e 60 minutos, num total de 32,581 conversas. Uma chamada telefónica é o canal mais impaciente que existe.

Três coisas a fazer com esta notícia:

  1. Teste interrupções, não demonstrações. Ligue para o seu agente de IA e corte-lhe a palavra a meio da frase, mude a data a meio do caminho, fique calado durante quatro segundos. O nosso guia para avaliar um agente telefónico de IA enumera os cenários que vale a pena testar.
  2. Avalie a ação, não a voz. Uma voz agradável que marca o horário errado é pior do que uma voz simples que marca o certo. Verifique se a marcação, a encomenda ou o pedido de retorno de chamada chega mesmo ao seu sistema.
  3. Não se case com um único modelo de voz. A 15 de setembro, a Google afirmou que o Gemini 3.8 Live Extended Thinking estava em 1.º lugar no índice da Artificial Analysis; três semanas depois, o GPT-Live-1 está 0.6 pontos acima dele. Defendemos a ideia geral em porque não deve construir o seu negócio sobre um único modelo de IA, e é na voz que isto mais se faz sentir.

Onde entra o Coordinator da Entagl?

O Coordinator da Entagl trata chamadas recebidas e efetuadas através de números de telefone e de chamadas do WhatsApp (em números compatíveis e com a autorização do cliente quando o WhatsApp o exige), usando modelos nativos de speech-to-speech em vez de uma estafeta em cadeia. A sua camada de voz foi pensada para trocar o modelo subjacente sem reconstruir o agente: o Gemini Live corre por omissão e os modelos em tempo real da OpenAI estão a ser disponibilizados como segunda opção. Antes de ligar, lê resumos das conversas recentes do cliente, das suas marcações e das chamadas anteriores, para que uma chamada de confirmação ou um retorno pedido comece com contexto, e não com "em que posso ajudar?". Cada chamada deixa uma transcrição na ficha do cliente.

Para perceber onde as chamadas entram ao longo do percurso do cliente, veja IA de voz para apoio ao cliente e vendas. Para o uso mais comum, a nossa compilação de estudos sobre faltas às marcações mostra o que as chamadas de confirmação realmente mudam.

Quer ouvir como soa uma chamada de IA com contexto completo no seu próprio caso de uso? Marque uma demonstração de 30 minutos.

FAQ

Qual é a diferença entre IA de voz full-duplex e half-duplex?

A IA de voz half-duplex (por turnos) fala à vez: espera que pare de falar e depois responde. A IA de voz full-duplex ouve e fala ao mesmo tempo, por isso consegue reagir a interrupções, a sinais de escuta como "hum-hum" e a pausas enquanto ainda está a falar.

Qual é o melhor modelo de IA de voz em outubro de 2026?

Depende do teste. Na Artificial Analysis, à data de 7 de outubro de 2026, o GPT-Live-1 lidera o Speech to Speech Index global com 83.2, ligeiramente à frente do Gemini 3.8 Live Extended Thinking (82.6) e do Grok Voice Think Fast 2.0 (81.3). O StepAudio 3 Realtime da StepFun lidera em dinâmica conversacional, com 98.9%.

Existem modelos de voz full-duplex de código aberto?

Sim. A NVIDIA descreve o seu NemotronLabs VoiceChat 11B como o primeiro modelo full-duplex aberto com chamadas de ferramentas, o Raon-SpeechChat-9B da Krafton é aberto e só em inglês, e a StepFun publica os pesos do Step-Audio R1.1. O raciocínio destes modelos pode ser forte, mas nenhum foi ainda avaliado no benchmark de apoio ao cliente τ-Voice, e as licenças variam, por isso confirme os termos antes de construir.

Os modelos full-duplex tornam os agentes telefónicos de IA prontos para qualquer chamada?

Não. O melhor modelo no benchmark de apoio ao cliente τ-Voice conclui 74.5% das tarefas, com base numa única tentativa. Mantenha um caminho claro para uma pessoa e teste as ações que o agente executa, não apenas a forma como soa.

Uma empresa precisa de escolher um destes modelos?

Normalmente, não diretamente. O topo da tabela mudou de mãos menos de três semanas depois do lançamento da Google a 15 de setembro, por isso a opção mais segura é uma plataforma cuja camada de voz possa passar para outro modelo sem reconstruir o agente, e cujas opções suportadas confirme antes de se comprometer.

Fontes: páginas de produto e model cards da OpenAI, Google DeepMind, StepFun, xAI, NVIDIA e Krafton; tabela Speech to Speech da Artificial Analysis (consultada a 7 de outubro de 2026); The Decoder (23 de setembro de 2026); MarkTechPost (28 de setembro de 2026); AI Weekly (agosto de 2026); Response Velocity Study da Entagl (2026).

Publicado por Entagl Team on