8 июля 2026 года OpenAI представила GPT-Live-1 и GPT-Live-1 mini — пару полнодуплексных голосовых моделей, которые могут одновременно слушать и говорить, — заменив режим Advanced Voice Mode в ChatGPT и обозначив самый значительный архитектурный сдвиг в технологии ИИ-голоса на сегодняшний день. Релиз состоялся всего через два дня после обновления ориентированного на разработчиков Realtime API с моделью GPT-Realtime-2.1, что сократило p95-задержку как минимум на 25% и улучшило обработку прерываний. В совокупности эти шаги свидетельствуют о самом явном на сегодняшний день ставке OpenAI на то, что голос — а не текст — станет основным интерфейсом для приложений на базе ИИ.
Более 150 миллионов человек уже используют ChatGPT Voice и функцию диктовки каждую неделю. С GPT-Live OpenAI рассчитывает, что это число значительно вырастет, а разработчики, создающие голосовые приложения, последуют за трендом.
Конец очередности реплик: что на самом деле означает полный дуплекс
Ключевым техническим достижением GPT-Live стала так называемая OpenAI «полнодуплексная архитектура». В телекоммуникациях полный дуплекс означает, что обе стороны телефонного разговора могут говорить и слушать одновременно. В применении к ИИ это означает, что модель непрерывно обрабатывает входящий аудиопоток даже во время генерации собственного голосового ответа — больше не нужно ждать полной паузы, чтобы определить, когда пользователь закончил мысль.
«Вместо обработки последовательности отдельных сообщений GPT-Live непрерывно обрабатывает входные данные во время генерации вывода», — говорится в заявлении OpenAI. «Поэтому модель может принимать решения о взаимодействии много раз в секунду: говорить ли, продолжать слушать, сделать паузу, прервать или вызвать инструмент».
На практике это означает голосового помощника, который может вставлять подтверждающие реплики — «угу», «да», «понял» — пока пользователь ещё говорит, улавливать естественную паузу, не перебивая преждевременно, и корректно обрабатывать быстрые прерывания без срыва диалога. Предыдущий режим Advanced Voice Mode, запущенный для платных пользователей в 2024 году, обрабатывал аудио в рамках одной модели, но по-прежнему работал в жёстком пошаговом режиме реплик. Как признала компания, «поскольку определение окончания реплики основано на тишине, даже короткая пауза или фоновый шум могли быть приняты за конец высказывания — что приводило к неестественным прерываниям».
Во время пресс-брифинга руководитель направления ChatGPT Voice Атти Элити сообщил, что у него были 30–40-минутные разговоры с голосовой функцией во время прогулок — сценарий использования, который был бы невозможен при предыдущем поколении с его хрупким определением очередности реплик.
Двухуровневая архитектура: голос встречается с рассуждением
GPT-Live внедряет второе структурное изменение, которое может оказаться не менее значимым: разделение слоя голосового взаимодействия и слоя рассуждений. Когда пользователь задаёт простой вопрос, GPT-Live обрабатывает его напрямую. Но если запрос требует веб-поиска, более глубокого анализа или сложной агентной работы, GPT-Live делегирует задачу передовой модели, работающей в фоновом режиме — на момент запуска это GPT-5.5, — и продолжает общение с пользователем, пока вычисления выполняются асинхронно.
Такая модель делегирования — важная архитектурная ставка. Вместо создания единой монолитной голосовой модели, которая пытается быть одновременно плавной в разговоре и глубоко интеллектуальной, OpenAI разделила задачу на две части: голосовая модель, оптимизированная для взаимодействия в реальном времени, и отдельный механизм рассуждений, который можно заменять по мере развития технологий. Как отмечает OpenAI, «по мере выпуска новых передовых моделей мы будем постоянно обновлять модель, используемую GPT-Live».
В оценках с участием людей GPT-Live-1 и GPT-Live-1 mini получили явное предпочтение по сравнению с Advanced Voice Mode по таким показателям, как общее впечатление, управление очередностью реплик, обработка прерываний, плавность и естественность. В автоматизированных тестах GPT-Live-1 продемонстрировала улучшения в задачах научного рассуждения экспертного уровня (GPQA) и агентного веб-поиска (BrowseComp).
Три поколения голосового ИИ: как мы к этому пришли
Чтобы понять, насколько далеко продвинулся голосовой ИИ, полезно проследить три поколения, приведшие к GPT-Live:
| Поколение | Архитектура | Обработка очередности | Прослушивание во время речи | Ощущение задержки |
|---|---|---|---|---|
| Каскадная (2023) | STT → LLM → TTS (3 модели) | Дискретные реплики | Нет | Медленно, неестественно |
| Пошаговая (2024) | Одна модель, нативное аудио | Дискретная, по тишине | Нет | Быстрее, но жёстко |
| Полнодуплексная (2026) | Одна модель + делегирование | Непрерывная, решения/сек | Да | Быстро, естественно, выразительно |
Сторона для разработчиков: GPT-Realtime-2.1 и что появится в API
Пока GPT-Live-1 постепенно становится доступной пользователям ChatGPT по всему миру, OpenAI также 6 июля обновила ориентированный на разработчиков Realtime API, представив GPT-Realtime-2.1 и GPT-Realtime-2.1-mini. Обновление улучшает распознавание буквенно-цифровых комбинаций — что критично для чтения номеров заказов, телефонных номеров и кодов подтверждения — а также улучшает обработку тишины и шума и повышает надёжность реакции на прерывания. Снижение p95-задержки как минимум на 25% достигнуто за счёт улучшенного кэширования, а не изменения размера модели.
Обе модели уже доступны через Realtime API, а ценообразование отражает разницу в стоимости между полнофункциональными сценариями и сценариями с большим объёмом использования:
| Цена (за 1 млн токенов) | GPT-Realtime-2.1 | GPT-Realtime-2.1-mini |
|---|---|---|
| Текстовый ввод | $4.00 | $0.60 |
| Текстовый вывод | $24.00 | $2.40 |
| Аудиоввод | $32.00 | $10.00 |
| Аудиовывод | $64.00 | $20.00 |
Аудиотарифы мини-модели — $10 за миллион входных токенов против $32 у полной модели — делают её очевидным выбором для голосового трафика большого объёма, где скорость и стоимость важнее максимальной глубины рассуждений. OpenAI также подтвердила, что GPT-Live появится в API, и разработчики могут подписаться на уведомления об открытии доступа.
Что это означает для разработчиков приложений
По мере того как голосовой ИИ переходит от новинки к инфраструктуре, разработчики приложений сталкиваются с новой задачей обнаружения: как пользователи найдут ваше голосовое приложение на всё более насыщенном рынке? Категория ИИ-приложений быстро растёт, и чтобы выделиться, требуется нечто большее, чем просто интересная функция — необходима продуманная стратегия ASO и привлечения пользователей, адаптированная к поисковому поведению в эпоху ИИ.
Решения ASOWorld по маркетингу ИИ-приложений помогают разработчикам анализировать портфели ключевых слов конкурентов в нише ИИ и реализовывать поэтапные стратегии продвижения — от низкочастотных до высокочастотных запросов — чтобы обеспечить устойчивую видимость по мере расширения экосистемы голосовых приложений.
Конкурентная среда: все хотят говорить
OpenAI не единственная компания, стремящаяся к естественному голосовому взаимодействию. Apple обновила Siri, улучшив обработку контекста и разговорные возможности. Amazon также модернизировала Alexa. Стартапы, такие как Sesame, основанный соучредителем Oculus Бренданом Айрибом, запустили ИИ-помощников, ориентированных на более естественное общение при одновременном выполнении задач в фоновом режиме. Monogram, привлёкший $40 млн на посевном раунде от DST и Lux Capital, делает ставку на визуальные ответы, чтобы сделать голосовых ассистентов более интерактивными.
Рыночные возможности значительны. По данным The Business Research Company, мировой рынок приложений голосовых ассистентов вырастет с $7,21 млрд в 2025 году до $9,62 млрд в 2026 году, а более широкие прогнозы по ИИ-голосовым ассистентам достигают $44,26 млрд. При 8,4 млрд активных голосовых ассистентов по всему миру и объёме голосовой коммерции, приближающемся к $100 млрд, инфраструктура, которую строит OpenAI — как для потребителей, так и для разработчиков, — выводит компанию в центр быстро расширяющейся экосистемы.
Что дальше
Видение OpenAI выходит далеко за рамки ChatGPT. Элити предположил, что голос может стать «основным интерфейсом для вычислений» при выполнении сложной, длительной агентной работы — задач, которые сейчас пользователи решают с помощью Codex и ChatGPT. Также появлялись сообщения о возможном запуске OpenAI наушников с поддержкой ИИ в этом году, однако компания отказалась раскрывать детали о аппаратных продуктах во время брифинга.
Новый голосовой режим не лишён ограничений. Во время живой демонстрации функция перевода на хинди воспроизводила речь с сильным американским акцентом и неестественным, книжным тоном. OpenAI заявила, что модель оптимизирована для «большинства разговорных языков», но не уточнила, каких именно. Поддержка видео, совместного использования экрана и полной многоязычной паритетности на момент запуска отсутствует.
Тем не менее архитектурный сдвиг реален. Разделив голосовое взаимодействие и рассуждение и сделав полнодуплексный разговор стандартом, а не премиальной функцией, OpenAI кардинально изменила то, что разработчики приложений могут создавать, — и то, чего пользователи будут ожидать от любого последующего голосового опыта.




