OpenAI показала GPT-Live: голосовой ИИ, который слушает и говорит одновременно
Из голосового режима ChatGPT убрали детектор конца реплики — модель работает в полном дуплексе, поэтому паузы перестали быть заметными.
OpenAI опубликовала разбор GPT-Live — третьего поколения своей голосовой системы, которое уже работает в ChatGPT Voice. Главное изменение архитектурное: из звукового тракта убрали детектор конца реплики.
Почему это заметно на слух
Раньше голосовые ассистенты работали по очереди: маленькая модель-детектор угадывала, договорил ли человек, и только потом за дело бралась большая языковая модель. Ошибка в любую сторону портила разговор — либо ассистент перебивал на середине фразы, либо отвечал с задержкой.
Голосовая модель GPT-Live работает в полном дуплексе: слушает и говорит одновременно, поэтому отдельный детектор ей не нужен. Когда для ответа требуется серьёзное рассуждение или вызов инструментов, система обращается к старшим моделям вроде GPT-5.5 — по отдельному асинхронному пути, не прерывая разговор.
Что это значит на практике
Для пользователя разница не в качестве текста, а в ритме: разговор перестаёт быть обменом репликами через паузу. На этой же архитектуре построены новые возможности десктопного приложения ChatGPT — управление компьютером голосом и координация агентов.
Для тех, кто делает собственные голосовые сценарии, важна ещё одна деталь: OpenAI отделила голосовой тракт от логики приложения, так что поведение сервиса можно менять, не задевая отзывчивость. Систему разрабатывали шесть месяцев, публикация — инженерный разбор, а не анонс новой подписки.
Ограничения доступа из России не изменились: официально ChatGPT в РФ по-прежнему недоступен. Что умеет сервис и сколько стоит — в карточке Chat GPT.
Источник: OpenAI




Комментарий опубликован.