Разборы

Кто ведёт гонку голосовых ИИ-агентов в реальном времени — и что из неё доступно из России

Голосовые модели перестали быть чат-ботом с синтезом речи поверх текста: OpenAI и Google выпустили модели, которые слушают и говорят одним потоком без пересборки через текст, ElevenLabs строит на этом агентскую инфраструктуру для бизнеса, а из России напрямую эта гонка почти не видна — доступны только локальные альтернативы Яндекса и Сбера.

Дэми Авалонов основатель NeiroAI 5 мин чтения
Кто ведёт гонку голосовых ИИ-агентов в реальном времени — и что из неё доступно из России

Ещё два года назад «голосовой ИИ» означало три модели подряд: распознавание речи переводит звук в текст, языковая модель думает над текстом, синтез речи озвучивает ответ. Каждый шов в этой цепочке добавлял задержку и терял интонацию — пауза в полторы-две секунды была нормой, а модель не слышала, смеётесь вы или злитесь. В 2026 году у лидеров рынка это уже не так: OpenAI, Google и вслед за ними Яндекс переводят голосовых агентов на модели «речь-в-речь», которые слушают и говорят одним потоком.

Почему это не то же самое, что голосовой ввод

OpenAI прямо объясняет разницу в анонсе своей текущей флагманской голосовой модели gpt-realtime: в отличие от классического конвейера из нескольких моделей, Realtime API «обрабатывает и генерирует звук напрямую через одну модель и один API», что снижает задержку и сохраняет нюансы речи. Практическое следствие — «barge-in»: пользователь может перебить модель на середине фразы, и она остановится и перестроится, как человек в разговоре, а не будет договаривать заготовленный ответ.

OpenAI: gpt-realtime как рабочая лошадка продакшена

Realtime API стал общедоступным для продакшн-нагрузок с выходом модели gpt-realtime: два новых голоса (Cedar и Marin), поддержка удалённых MCP-серверов, ввод изображений и телефония через SIP — то есть агента можно напрямую посадить на входящую линию колл-центра. По собственным замерам OpenAI на бенчмарке Big Bench Audio (аудио-версия задач на рассуждение) модель набирает 82,8% против 65,6% у предыдущей версии; на ComplexFuncBench, который проверяет точность вызова функций, — 66,5% против 49,7%. Тарификация — по аудио-токенам: 32 доллара за 1 млн токенов на входе и 64 доллара за 1 млн на выходе для основной модели, у облегчённой mini-версии — 10 и 20 долларов соответственно. В пересчёте на минуты разговора это около 2 центов за минуту, которую говорит пользователь, и около 8 центов за минуту, которую говорит модель.

Google отвечает Gemini 3.8 Live — и целится в сложные задачи

15 сентября 2026 года Google представила сразу две модели: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе — тоже «речь-в-речь» без промежуточного текста, обе на лету распознают и переключаются между 97 языками прямо посреди разговора, обрабатывают видео и изображения почти в реальном времени и умеют выполнять вызовы инструментов в фоне, продолжая разговор («сейчас проверю» вместо тишины). Разница между версиями — в глубине: обычная Live рассчитана на масштаб и низкую стоимость, Extended Thinking — на связные многошаговые задачи, где агенту нужно рассуждать и говорить одновременно. По данным Google, Extended Thinking заняла первое место в независимом рейтинге Artificial Analysis Speech-to-Speech Quality Index (82,6 балла) и набрала 97,7% на Big Bench Audio.

82,8%gpt-realtime (OpenAI), Big Bench Audio
97,7%Gemini 3.8 Live Extended Thinking, Big Bench Audio
97языков на лету у Gemini 3.8 Live

Цифры двух вендоров считаны разными методиками и напрямую не складываются в один рейтинг, но динамика видна без оговорок: за год с небольшим планка на аудио-рассуждении выросла с 65% до почти 98%, и это уже не эффект новизны, а рабочий инструмент для задач, где ошибка голосового агента стоит денег — колл-центр банка или запись на приём в клинике.

ElevenLabs: не гонка моделей, а слой поверх них

ElevenLabs в этой гонке не участвует напрямую — компания не публикует свою frontier-модель речь-в-речь, а строит платформу Conversational AI, которая собирает голосового агента из чужих LLM, своего синтеза голоса и логики диалога, и продаёт это как конструктор для бизнеса: агент для колл-центра, поддержки или продаж без своей команды ML-инженеров. С 2026 года компания снизила тарифы на минуты разговора — базовый тариф начинается от 10 центов за минуту сверх пакетных минут, включённых в подписку. Важная деталь мелким шрифтом: в стоимость минуты пока не входит счёт за саму LLM внутри агента — ElevenLabs временно берёт эти расходы на себя, но предупреждает, что в будущем начнёт выставлять их отдельно.

Что реально доступно из России

Здесь у гонки OpenAI и Google для российского бизнеса есть практический потолок: прямой доступ к Realtime API и Gemini Live API требует иностранного юрлица, зарубежной карты и работы в обход официальных ограничений — то есть это инструмент для тех, кто уже работает вовне, а не типовое решение для колл-центра в России.

На внутреннем рынке роль голосового реального времени для бизнеса взял на себя Yandex AI Studio: платформа даёт готовый конструктор голосового агента с задержкой ответа меньше секунды, возможностью перебить агента на полуслове и прямым подключением по SIP к существующей телефонии заказчика — не нужно поднимать отдельную инфраструктуру для передачи звонка. По собственным примерам Яндекса, агентов уже пилотируют крупная сеть ресторанов для приёма заказа голосом на киосках самообслуживания и сеть АЗС — для заказа топлива и оплаты без похода к кассиру. Для голоса можно выбрать образ из готового каталога или собрать свой через отдельный сервис Brand Voice Lite.

У Сбера ставка другая — не B2B-конструктор для колл-центров, а собственный голосовой ассистент для потребителя. С обновлением GigaChat 2.0 на умных колонках SberBoom ассистент Салют перешёл на живой диалог: он удерживает нить разговора и не требует каждый раз объяснять контекст заново, как раньше приходилось делать с голосовыми командами роботизированного вида. Это решает другую задачу, чем Realtime API Яндекса или OpenAI, — оно про потребительский опыт «умной колонки», а не про агента, которого бизнес встраивает в свою телефонию.

Что это значит на практике

Для тех, кто строит продукт с голосовым интерфейсом и может работать через иностранную инфраструктуру, технологическая планка сейчас — у gpt-realtime и Gemini 3.8 Live Extended Thinking: обе модели одним куском обрабатывают звук, держат сложные многошаговые сценарии и меряются в независимых рейтингах, а не только в собственных пресс-релизах. Для бизнеса, которому нужен голосовой агент внутри России здесь и сейчас — на входящей линии колл-центра, без обхода ограничений и без своей команды ML — практический выбор один: Yandex AI Studio с его SIP-интеграцией и задержкой меньше секунды. GigaChat и Салют в эту нишу не целятся вовсе: это конкурент не бизнес-платформам, а потребительским голосовым ассистентам вроде Алисы.

Источник: OpenAI, Google, ElevenLabs, Яндекс, Сбер

Упомянутые инструменты

Не пропускать важное

Заведите кабинет: добавьте нейросети, которыми пользуетесь, — и получайте только то, что касается именно их. Цены, тарифы, доступность из России, письмо перед списанием. Бесплатно.

Создать кабинет Войти

Читать дальше

Разборы 17 сентября 2026 Агенты ИИ делают втрое больше работы, чем люди, — и, по данным Anthropic, столько же атакуют OpenAI впервые раскрыла внутреннюю статистику: агенты уже делают в 3,1 раза больше работы, чем люди-исследователи компании. В том же отчёте — признание,… Разборы 8 сентября 2026 Цены флагманов сравнялись до цента — но счёт всё равно выходит разный За первую неделю сентября OpenAI и Anthropic с разницей в два дня открыли новый верхний ярус рынка — $10 за миллион входных… Разборы 20 августа 2026 Кто ведёт рынок ИИ-генерации видео в 2026 году — и почему Sora выбыла из гонки OpenAI полностью закрывает Sora — и веб-версию, и API, — оставляя нишу генерации видео другим вендорам. Разбираем, кто сейчас реально ведёт рынок… Разборы 14 августа 2026 Кто ведёт рынок ИИ-ассистентов для кода в 2026 году — и что из него доступно из России Рынок ИИ-помощников для разработчиков за полтора года прошёл путь от автодополнения строки до агентов, которые сами открывают задачу, пишут код и собирают…