Кто ведёт гонку голосовых ИИ-агентов в реальном времени — и что из неё доступно из России
Голосовые модели перестали быть чат-ботом с синтезом речи поверх текста: OpenAI и Google выпустили модели, которые слушают и говорят одним потоком без пересборки через текст, ElevenLabs строит на этом агентскую инфраструктуру для бизнеса, а из России напрямую эта гонка почти не видна — доступны только локальные альтернативы Яндекса и Сбера.
Ещё два года назад «голосовой ИИ» означало три модели подряд: распознавание речи переводит звук в текст, языковая модель думает над текстом, синтез речи озвучивает ответ. Каждый шов в этой цепочке добавлял задержку и терял интонацию — пауза в полторы-две секунды была нормой, а модель не слышала, смеётесь вы или злитесь. В 2026 году у лидеров рынка это уже не так: OpenAI, Google и вслед за ними Яндекс переводят голосовых агентов на модели «речь-в-речь», которые слушают и говорят одним потоком.
Почему это не то же самое, что голосовой ввод
OpenAI прямо объясняет разницу в анонсе своей текущей флагманской голосовой модели gpt-realtime: в отличие от классического конвейера из нескольких моделей, Realtime API «обрабатывает и генерирует звук напрямую через одну модель и один API», что снижает задержку и сохраняет нюансы речи. Практическое следствие — «barge-in»: пользователь может перебить модель на середине фразы, и она остановится и перестроится, как человек в разговоре, а не будет договаривать заготовленный ответ.
OpenAI: gpt-realtime как рабочая лошадка продакшена
Realtime API стал общедоступным для продакшн-нагрузок с выходом модели gpt-realtime: два новых голоса (Cedar и Marin), поддержка удалённых MCP-серверов, ввод изображений и телефония через SIP — то есть агента можно напрямую посадить на входящую линию колл-центра. По собственным замерам OpenAI на бенчмарке Big Bench Audio (аудио-версия задач на рассуждение) модель набирает 82,8% против 65,6% у предыдущей версии; на ComplexFuncBench, который проверяет точность вызова функций, — 66,5% против 49,7%. Тарификация — по аудио-токенам: 32 доллара за 1 млн токенов на входе и 64 доллара за 1 млн на выходе для основной модели, у облегчённой mini-версии — 10 и 20 долларов соответственно. В пересчёте на минуты разговора это около 2 центов за минуту, которую говорит пользователь, и около 8 центов за минуту, которую говорит модель.
Google отвечает Gemini 3.8 Live — и целится в сложные задачи
15 сентября 2026 года Google представила сразу две модели: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе — тоже «речь-в-речь» без промежуточного текста, обе на лету распознают и переключаются между 97 языками прямо посреди разговора, обрабатывают видео и изображения почти в реальном времени и умеют выполнять вызовы инструментов в фоне, продолжая разговор («сейчас проверю» вместо тишины). Разница между версиями — в глубине: обычная Live рассчитана на масштаб и низкую стоимость, Extended Thinking — на связные многошаговые задачи, где агенту нужно рассуждать и говорить одновременно. По данным Google, Extended Thinking заняла первое место в независимом рейтинге Artificial Analysis Speech-to-Speech Quality Index (82,6 балла) и набрала 97,7% на Big Bench Audio.
Цифры двух вендоров считаны разными методиками и напрямую не складываются в один рейтинг, но динамика видна без оговорок: за год с небольшим планка на аудио-рассуждении выросла с 65% до почти 98%, и это уже не эффект новизны, а рабочий инструмент для задач, где ошибка голосового агента стоит денег — колл-центр банка или запись на приём в клинике.
ElevenLabs: не гонка моделей, а слой поверх них
ElevenLabs в этой гонке не участвует напрямую — компания не публикует свою frontier-модель речь-в-речь, а строит платформу Conversational AI, которая собирает голосового агента из чужих LLM, своего синтеза голоса и логики диалога, и продаёт это как конструктор для бизнеса: агент для колл-центра, поддержки или продаж без своей команды ML-инженеров. С 2026 года компания снизила тарифы на минуты разговора — базовый тариф начинается от 10 центов за минуту сверх пакетных минут, включённых в подписку. Важная деталь мелким шрифтом: в стоимость минуты пока не входит счёт за саму LLM внутри агента — ElevenLabs временно берёт эти расходы на себя, но предупреждает, что в будущем начнёт выставлять их отдельно.
Что реально доступно из России
Здесь у гонки OpenAI и Google для российского бизнеса есть практический потолок: прямой доступ к Realtime API и Gemini Live API требует иностранного юрлица, зарубежной карты и работы в обход официальных ограничений — то есть это инструмент для тех, кто уже работает вовне, а не типовое решение для колл-центра в России.
На внутреннем рынке роль голосового реального времени для бизнеса взял на себя Yandex AI Studio: платформа даёт готовый конструктор голосового агента с задержкой ответа меньше секунды, возможностью перебить агента на полуслове и прямым подключением по SIP к существующей телефонии заказчика — не нужно поднимать отдельную инфраструктуру для передачи звонка. По собственным примерам Яндекса, агентов уже пилотируют крупная сеть ресторанов для приёма заказа голосом на киосках самообслуживания и сеть АЗС — для заказа топлива и оплаты без похода к кассиру. Для голоса можно выбрать образ из готового каталога или собрать свой через отдельный сервис Brand Voice Lite.
У Сбера ставка другая — не B2B-конструктор для колл-центров, а собственный голосовой ассистент для потребителя. С обновлением GigaChat 2.0 на умных колонках SberBoom ассистент Салют перешёл на живой диалог: он удерживает нить разговора и не требует каждый раз объяснять контекст заново, как раньше приходилось делать с голосовыми командами роботизированного вида. Это решает другую задачу, чем Realtime API Яндекса или OpenAI, — оно про потребительский опыт «умной колонки», а не про агента, которого бизнес встраивает в свою телефонию.
Что это значит на практике
Для тех, кто строит продукт с голосовым интерфейсом и может работать через иностранную инфраструктуру, технологическая планка сейчас — у gpt-realtime и Gemini 3.8 Live Extended Thinking: обе модели одним куском обрабатывают звук, держат сложные многошаговые сценарии и меряются в независимых рейтингах, а не только в собственных пресс-релизах. Для бизнеса, которому нужен голосовой агент внутри России здесь и сейчас — на входящей линии колл-центра, без обхода ограничений и без своей команды ML — практический выбор один: Yandex AI Studio с его SIP-интеграцией и задержкой меньше секунды. GigaChat и Салют в эту нишу не целятся вовсе: это конкурент не бизнес-платформам, а потребительским голосовым ассистентам вроде Алисы.
Источник: OpenAI, Google, ElevenLabs, Яндекс, Сбер
Упомянутые инструменты
Не пропускать важное
Заведите кабинет: добавьте нейросети, которыми пользуетесь, — и получайте только то, что касается именно их. Цены, тарифы, доступность из России, письмо перед списанием. Бесплатно.



