Перейти к содержимому

AI News · industry

Полнодуплексный голосовой ИИ: модели, которые слушают, пока говорят

OpenAI, Google, Alibaba и StepFun в сентябре 2026 года выпустили голосовые модели, которые можно перебить на полуслове. Что изменилось, кто лидирует в каком тесте и что это значит для деловых телефонных звонков.

Entagl Team9 мин. чтения
Полнодуплексный голосовой ИИ: модели, которые слушают, пока говорят

Полнодуплексный голосовой ИИ: это одна модель, которая слушает и говорит одновременно, поэтому собеседник может перебить её, сделать паузу или сказать «угу», и разговор не развалится. По состоянию на 7 октября 2026 года GPT-Live-1 от OpenAI возглавляет Speech to Speech Index от Artificial Analysis с результатом 83.2, на волосок опережая Gemini 3.8 Live Extended Thinking от Google (82.6). А китайская StepFun лидирует в тесте на то, насколько естественно ощущается разговор: 98.9%. Все три модели вышли или обновились за последние три месяца.

Если ваш бизнес отвечает на звонки, запомните: в сентябре 2026 года технология, на которой держатся ИИ-звонки, изменилась.

Что значит «полный дуплекс» и почему это важно в телефонном разговоре?

Большинство телефонных ИИ-агентов, созданных до 2026 года, работали как эстафета. Распознавание речи превращало слова звонящего в текст, языковая модель писала ответ, а синтез речи его зачитывал. Каждая передача добавляет задержку, и системе приходится угадывать, договорил ли человек. Угадала рано: перебивает. Угадала поздно: повисает неловкая тишина.

Полнодуплексная модель слушает и говорит внутри одной сети, непрерывно. Она может услышать «ой, давайте лучше на четверг», пока сама ещё не закончила фразу, и сменить курс. Она отличает звонящего, который замолчал, от того, кто просто задумался.

На практике разница заметна. По данным OpenAI, приложение для изучения языков Speak сократило число перебиваний во время пауз, когда ученик подбирает слова, почти на 80% по сравнению с прежними пошаговыми системами. Другой клиент из того же анонса, который строит разговоры с пациентами, рассказал, что переход с цепочки моделей избавил его от 23,000 строк кода.

Возможно, вы и сами бросали трубку, потому что голосовой бот без конца вас перебивал.

Что вышло с июля по октябрь 2026 года?

Модель Лаборатория Регион Веса Дата выхода Чем выделяется
GPT-Live-1 OpenAI США Закрытые (API) 10 сен. 2026 Передаёт сложные рассуждения и вызовы инструментов отдельной фоновой модели; поддержка телефонии
Gemini 3.8 Live / 3.8 Live Extended Thinking Google DeepMind США Закрытые (API) 15 сен. 2026 Вызывает инструменты в фоне, не прерывая речь; 97+ языков
StepAudio 3 Realtime StepFun Китай Закрытые (API, предварительная версия) 15 сен. 2026 Лучший результат по динамике разговора у Artificial Analysis
Qwen-Audio-3.1-Realtime Alibaba Qwen Китай Закрытые (API) Сен. 2026 Цена realtime-модели снижена примерно на 85%
Grok Voice Think Fast 2.0 xAI США Закрытые (API) 29 июля 2026 Самая высокая доля успешно выполненных задач у Artificial Analysis
NemotronLabs VoiceChat 11B NVIDIA США Открытые веса Авг. 2026 Первая открытая полнодуплексная модель с вызовом инструментов
Raon-SpeechChat-9B Krafton Южная Корея Открытые веса Апр. 2026 Самое быстрое время до первого звука в рейтинге (только английский)
Step-Audio R1.1 (Realtime) StepFun Китай Открытые веса Ранее в 2026 году Открытая речевая модель реального времени с сильными результатами в рассуждениях

Источники: OpenAI, Google, документация StepFun, The Decoder о Qwen-Audio-3.1, xAI, NVIDIA на Hugging Face, Krafton на Hugging Face, StepFun на Hugging Face.

В списке видны две закономерности. Во-первых, каждая передовая модель теперь разделяет «продолжать говорить» и «пойти сделать дело». GPT-Live-1 передаёт рассуждения фоновой текстовой модели, Gemini 3.8 Live вызывает инструменты асинхронно, а StepFun описывает свою модель как думающую во время речи. Во-вторых, среди моделей с открытыми весами появилась полнодуплексная модель, способная вызывать инструменты прямо посреди разговора. До этого лета такое умели только облачные API.

Какая голосовая ИИ-модель сейчас лучшая?

Единого победителя нет, и тот, кто называет его, не уточнив «в каком тесте», что-то вам продаёт. Artificial Analysis сводит в свой индекс четыре теста: рассуждения в речи, агентную работу на задачах клиентского сервиса τ-Voice, предпочтения пользователей на арене и успешность выполнения задач. Динамику разговора площадка оценивает отдельно. По состоянию на 7 октября 2026 года:

Тест (Artificial Analysis) Лидер Результат Следом идут
Общий Speech to Speech Index GPT-Live-1 (бэкенд Astra, medium) 83.2 Gemini 3.8 Live Extended Thinking (High) 82.6; Grok Voice Think Fast 2.0 High 81.3
Рассуждения в речи (Big Bench Audio) StepAudio 3 Realtime (StepFun) 99.7% Qwen Audio 3.0 Realtime Plus 99.2%; Qwen3.5 Omni Plus Realtime 98.7%
Агентная работа (задачи клиентского сервиса τ-Voice) GPT-Live-1 (бэкенд Astra, medium), одна попытка 74.5% Gemini 3.8 Live Extended Thinking (High) 68.6%
Динамика разговора (паузы, очерёдность реплик, перебивания) StepAudio 3 Realtime (StepFun) 98.9% Qwen Audio 3.0 Realtime Plus 98.4%; GPT-Live-1 (Sol, low) 97.3%
Успешность задач в Speech Agent Arena Grok Voice Think Fast 2.0 High 94.6% Gemini 3.8 Live 93.2%

Как читать эту таблицу. В общем индексе OpenAI, Google и xAI укладываются в два пункта друг от друга, а на практике это ничья. В рассуждениях в речи и в том, насколько естественно ощущается разговор, лидируют китайские модели: StepFun и Alibaba обходят все американские модели по обоим показателям. Лидерство OpenAI в тесте клиентского сервиса основано на одной попытке, так что считайте его предварительным. И разница в цене реальна: по данным Artificial Analysis, Qwen Audio 3.0 Realtime Plus от Alibaba самая дешёвая из отслеживаемых моделей в пересчёте на час входящего аудио.

Учтите, что более новую Qwen-Audio-3.1-Realtime от Alibaba на момент нашей проверки ещё не оценили в рейтинге, поэтому строки Alibaba выше относятся к версии 3.0.

В чём новые модели всё ещё не дотягивают?

Анонсы полны оптимизма. Таблицы бенчмарков честнее.

  • Звучать естественно и доводить дело до конца: это разные навыки. Открытая PersonaPlex от NVIDIA набирает 91.0% по динамике разговора, но только 19% по рассуждениям в речи в той же таблице Artificial Analysis. Модель может звучать гладко и всё равно перепутать бронь.
  • Лучше слушать иногда означает медленнее останавливаться. Собственные технические результаты Alibaba, которые пересказывает MarkTechPost, показывают: модель стала намного лучше игнорировать речь, обращённую не к ней, но доля нежелательных возобновлений речи после перебивания выросла с 0.035 до 0.130. А чтобы замолчать, когда её перебивают, ей нужно 1.116 секунды против 0.383 секунды у GPT-Realtime-2.
  • Задачи клиентского сервиса всё ещё не решены. Даже лучшая модель в τ-Voice выполняет примерно три из четырёх смоделированных задач авиакомпании, розничного магазина и оператора связи. Остальная четверть проваливается.
  • Модели с открытыми весами неоднородны. Открытая Step-Audio R1.1 от StepFun набирает 97.6% по рассуждениям в речи: на десятую долю пункта меньше лучшей модели Google (Gemini 3.8 Live Extended Thinking, 97.7%) и выше любой модели OpenAI и xAI. Но ни у одной открытой модели пока нет результата в тесте клиентского сервиса τ-Voice, а обзор AI Weekly карточки модели NVIDIA отмечает, что она выбирает нужный инструмент в 82.5% случаев, но правильно заполняет детали лишь в 44.2%. Прежде чем строить что-то на такой модели, проверьте её лицензию.

Что это значит для бизнеса, который принимает звонки?

Практический вывод простой: телефонный канал стал пригоднее для настоящей работы и менее снисходителен к медленным решениям. В текстовых каналах скорость и так решает судьбу продаж. В исследовании скорости ответа Entagl разговоры, на которые ответили в течение 60 секунд, конвертировались в 35.1% случаев, против 12.2% при ответе через 5–60 минут. Выборка: 32,581 разговор. А телефонный звонок самый нетерпеливый канал из всех.

Три вещи, которые стоит сделать с этой новостью:

  1. Проверяйте перебивания, а не демо. Позвоните своему ИИ-агенту и перебейте его на полуслове, поменяйте дату на середине разговора, помолчите четыре секунды. В нашем руководстве по оценке телефонного ИИ-агента перечислены сценарии, которые стоит прогнать.
  2. Оценивайте действие, а не голос. Приятный голос, который бронирует не то время, хуже простого голоса, который бронирует правильное. Убедитесь, что запись, заказ или обратный звонок действительно появляются в вашей системе.
  3. Не привязывайтесь к одной голосовой модели. 15 сентября Google заявила, что Gemini 3.8 Live Extended Thinking занимает #1 в индексе Artificial Analysis. Через три недели GPT-Live-1 стоит на 0.6 пункта выше. Общие доводы мы изложили в статье почему не стоит строить бизнес на одной ИИ-модели, и в голосовых сценариях это бьёт сильнее всего.

Какое место здесь занимает Coordinator от Entagl?

Coordinator от Entagl принимает и совершает звонки через телефонные номера и звонки WhatsApp (на поддерживаемых номерах и с разрешения клиента там, где этого требует WhatsApp). Он использует нативные модели «речь в речь», а не цепочку моделей. Его голосовой слой устроен так, чтобы базовую модель можно было заменить без пересборки агента: по умолчанию работает Gemini Live, а realtime-модели OpenAI постепенно добавляются как второй вариант. Перед звонком он читает сводки недавних разговоров клиента, его записи и прошлые звонки, поэтому звонок с подтверждением или запрошенный обратный звонок начинается с контекста, а не с вопроса «чем могу помочь?». После каждого звонка в карточке клиента остаётся расшифровка.

О том, где звонки уместны на пути клиента, читайте в статье ИИ-голос для клиентского сервиса и продаж. О самом частом сценарии рассказывает наш обзор исследований о неявках: что на самом деле меняют звонки с подтверждением.

Хотите услышать, как звучит ИИ-звонок с полным контекстом в вашем собственном сценарии? Запишитесь на 30-минутное демо.

FAQ

Чем полнодуплексный голосовой ИИ отличается от полудуплексного?

Полудуплексный (пошаговый) голосовой ИИ говорит по очереди: ждёт, пока вы замолчите, и только потом отвечает. Полнодуплексный голосовой ИИ слушает и говорит одновременно, поэтому может реагировать на перебивания, поддакивания вроде «угу» и паузы, пока сам ещё говорит.

Какая голосовая ИИ-модель лучшая в октябре 2026 года?

Зависит от теста. У Artificial Analysis по состоянию на 7 октября 2026 года GPT-Live-1 лидирует в общем Speech to Speech Index с результатом 83.2, чуть опережая Gemini 3.8 Live Extended Thinking (82.6) и Grok Voice Think Fast 2.0 (81.3). StepAudio 3 Realtime от StepFun лидирует по динамике разговора с результатом 98.9%.

Существуют ли полнодуплексные голосовые модели с открытым исходным кодом?

Да. NVIDIA называет свою NemotronLabs VoiceChat 11B первой открытой полнодуплексной моделью с вызовом инструментов, Raon-SpeechChat-9B от Krafton открыта и работает только на английском, а StepFun публикует веса Step-Audio R1.1. Рассуждения у них бывают сильными, но ни одну пока не оценили в бенчмарке клиентского сервиса τ-Voice, а лицензии различаются, так что проверьте условия, прежде чем строить на них продукт.

Готовы ли телефонные ИИ-агенты на полнодуплексных моделях к любому звонку?

Нет. Лучшая модель в бенчмарке клиентского сервиса τ-Voice выполняет 74.5% задач, и это по результатам одной попытки. Оставьте понятный путь к живому сотруднику и проверяйте действия, которые выполняет агент, а не только то, как он звучит.

Нужно ли бизнесу выбирать одну из этих моделей?

Как правило, не напрямую. Вершина рейтинга сменила владельца в течение трёх недель после запуска Google 15 сентября. Поэтому надёжнее выбрать платформу, чей голосовой слой может перейти на другую модель без пересборки агента, и заранее проверить, какие варианты она поддерживает.

Источники: страницы продуктов и карточки моделей OpenAI, Google DeepMind, StepFun, xAI, NVIDIA и Krafton; рейтинг Speech to Speech от Artificial Analysis (проверено 7 октября 2026 года); The Decoder (23 сентября 2026 года); MarkTechPost (28 сентября 2026 года); AI Weekly (август 2026 года); исследование скорости ответа Entagl (Response Velocity Study, 2026).

Опубликовано Entagl Team on