Главная
Отрасли новости
последние новости

Новые модели GPT-Live от OpenAI делают голосовые разговоры с ИИ естественными

GPT-Live от OpenAI приносит полнофункциональный голосовой ИИ с двусторонней связью более чем 150 миллионам пользователей. Вот что новые модели и обновления Realtime API означают для разработчиков приложений.
Дата выхода: Jul 9, 2026
Дата обновления: Jul 9, 2026
Новые модели GPT-Live от OpenAI делают голосовые разговоры с ИИ естественными

8 июля 2026 года OpenAI представила GPT-Live-1 и GPT-Live-1 mini — пару полнодуплексных голосовых моделей, которые могут одновременно слушать и говорить, — заменив режим Advanced Voice Mode в ChatGPT и обозначив самый значительный архитектурный сдвиг в технологии ИИ-голоса на сегодняшний день. Релиз состоялся всего через два дня после обновления ориентированного на разработчиков Realtime API с моделью GPT-Realtime-2.1, что сократило p95-задержку как минимум на 25% и улучшило обработку прерываний. В совокупности эти шаги свидетельствуют о самом явном на сегодняшний день ставке OpenAI на то, что голос — а не текст — станет основным интерфейсом для приложений на базе ИИ.

 

Более 150 миллионов человек уже используют ChatGPT Voice и функцию диктовки каждую неделю. С GPT-Live OpenAI рассчитывает, что это число значительно вырастет, а разработчики, создающие голосовые приложения, последуют за трендом.

 

Конец очередности реплик: что на самом деле означает полный дуплекс

 

Ключевым техническим достижением GPT-Live стала так называемая OpenAI «полнодуплексная архитектура». В телекоммуникациях полный дуплекс означает, что обе стороны телефонного разговора могут говорить и слушать одновременно. В применении к ИИ это означает, что модель непрерывно обрабатывает входящий аудиопоток даже во время генерации собственного голосового ответа — больше не нужно ждать полной паузы, чтобы определить, когда пользователь закончил мысль.

 

«Вместо обработки последовательности отдельных сообщений GPT-Live непрерывно обрабатывает входные данные во время генерации вывода», — говорится в заявлении OpenAI. «Поэтому модель может принимать решения о взаимодействии много раз в секунду: говорить ли, продолжать слушать, сделать паузу, прервать или вызвать инструмент».

 

На практике это означает голосового помощника, который может вставлять подтверждающие реплики — «угу», «да», «понял» — пока пользователь ещё говорит, улавливать естественную паузу, не перебивая преждевременно, и корректно обрабатывать быстрые прерывания без срыва диалога. Предыдущий режим Advanced Voice Mode, запущенный для платных пользователей в 2024 году, обрабатывал аудио в рамках одной модели, но по-прежнему работал в жёстком пошаговом режиме реплик. Как признала компания, «поскольку определение окончания реплики основано на тишине, даже короткая пауза или фоновый шум могли быть приняты за конец высказывания — что приводило к неестественным прерываниям».

 

Во время пресс-брифинга руководитель направления ChatGPT Voice Атти Элити сообщил, что у него были 30–40-минутные разговоры с голосовой функцией во время прогулок — сценарий использования, который был бы невозможен при предыдущем поколении с его хрупким определением очередности реплик.

 

Двухуровневая архитектура: голос встречается с рассуждением

 

GPT-Live внедряет второе структурное изменение, которое может оказаться не менее значимым: разделение слоя голосового взаимодействия и слоя рассуждений. Когда пользователь задаёт простой вопрос, GPT-Live обрабатывает его напрямую. Но если запрос требует веб-поиска, более глубокого анализа или сложной агентной работы, GPT-Live делегирует задачу передовой модели, работающей в фоновом режиме — на момент запуска это GPT-5.5, — и продолжает общение с пользователем, пока вычисления выполняются асинхронно.

 

Такая модель делегирования — важная архитектурная ставка. Вместо создания единой монолитной голосовой модели, которая пытается быть одновременно плавной в разговоре и глубоко интеллектуальной, OpenAI разделила задачу на две части: голосовая модель, оптимизированная для взаимодействия в реальном времени, и отдельный механизм рассуждений, который можно заменять по мере развития технологий. Как отмечает OpenAI, «по мере выпуска новых передовых моделей мы будем постоянно обновлять модель, используемую GPT-Live».

 

В оценках с участием людей GPT-Live-1 и GPT-Live-1 mini получили явное предпочтение по сравнению с Advanced Voice Mode по таким показателям, как общее впечатление, управление очередностью реплик, обработка прерываний, плавность и естественность. В автоматизированных тестах GPT-Live-1 продемонстрировала улучшения в задачах научного рассуждения экспертного уровня (GPQA) и агентного веб-поиска (BrowseComp).

 

Три поколения голосового ИИ: как мы к этому пришли

 

Чтобы понять, насколько далеко продвинулся голосовой ИИ, полезно проследить три поколения, приведшие к GPT-Live:

Поколение Архитектура Обработка очередности Прослушивание во время речи Ощущение задержки
Каскадная (2023) STT → LLM → TTS (3 модели) Дискретные реплики Нет Медленно, неестественно
Пошаговая (2024) Одна модель, нативное аудио Дискретная, по тишине Нет Быстрее, но жёстко
Полнодуплексная (2026) Одна модель + делегирование Непрерывная, решения/сек Да Быстро, естественно, выразительно

 

Сторона для разработчиков: GPT-Realtime-2.1 и что появится в API

 

Пока GPT-Live-1 постепенно становится доступной пользователям ChatGPT по всему миру, OpenAI также 6 июля обновила ориентированный на разработчиков Realtime API, представив GPT-Realtime-2.1 и GPT-Realtime-2.1-mini. Обновление улучшает распознавание буквенно-цифровых комбинаций — что критично для чтения номеров заказов, телефонных номеров и кодов подтверждения — а также улучшает обработку тишины и шума и повышает надёжность реакции на прерывания. Снижение p95-задержки как минимум на 25% достигнуто за счёт улучшенного кэширования, а не изменения размера модели.

 

Обе модели уже доступны через Realtime API, а ценообразование отражает разницу в стоимости между полнофункциональными сценариями и сценариями с большим объёмом использования:

Цена (за 1 млн токенов) GPT-Realtime-2.1 GPT-Realtime-2.1-mini
Текстовый ввод $4.00 $0.60
Текстовый вывод $24.00 $2.40
Аудиоввод $32.00 $10.00
Аудиовывод $64.00 $20.00

 

Аудиотарифы мини-модели — $10 за миллион входных токенов против $32 у полной модели — делают её очевидным выбором для голосового трафика большого объёма, где скорость и стоимость важнее максимальной глубины рассуждений. OpenAI также подтвердила, что GPT-Live появится в API, и разработчики могут подписаться на уведомления об открытии доступа.

 

Что это означает для разработчиков приложений

 

По мере того как голосовой ИИ переходит от новинки к инфраструктуре, разработчики приложений сталкиваются с новой задачей обнаружения: как пользователи найдут ваше голосовое приложение на всё более насыщенном рынке? Категория ИИ-приложений быстро растёт, и чтобы выделиться, требуется нечто большее, чем просто интересная функция — необходима продуманная стратегия ASO и привлечения пользователей, адаптированная к поисковому поведению в эпоху ИИ.

 

Решения ASOWorld по маркетингу ИИ-приложений помогают разработчикам анализировать портфели ключевых слов конкурентов в нише ИИ и реализовывать поэтапные стратегии продвижения — от низкочастотных до высокочастотных запросов — чтобы обеспечить устойчивую видимость по мере расширения экосистемы голосовых приложений.

 

Конкурентная среда: все хотят говорить

 

OpenAI не единственная компания, стремящаяся к естественному голосовому взаимодействию. Apple обновила Siri, улучшив обработку контекста и разговорные возможности. Amazon также модернизировала Alexa. Стартапы, такие как Sesame, основанный соучредителем Oculus Бренданом Айрибом, запустили ИИ-помощников, ориентированных на более естественное общение при одновременном выполнении задач в фоновом режиме. Monogram, привлёкший $40 млн на посевном раунде от DST и Lux Capital, делает ставку на визуальные ответы, чтобы сделать голосовых ассистентов более интерактивными.

 

Рыночные возможности значительны. По данным The Business Research Company, мировой рынок приложений голосовых ассистентов вырастет с $7,21 млрд в 2025 году до $9,62 млрд в 2026 году, а более широкие прогнозы по ИИ-голосовым ассистентам достигают $44,26 млрд. При 8,4 млрд активных голосовых ассистентов по всему миру и объёме голосовой коммерции, приближающемся к $100 млрд, инфраструктура, которую строит OpenAI — как для потребителей, так и для разработчиков, — выводит компанию в центр быстро расширяющейся экосистемы.

 

Что дальше

 

Видение OpenAI выходит далеко за рамки ChatGPT. Элити предположил, что голос может стать «основным интерфейсом для вычислений» при выполнении сложной, длительной агентной работы — задач, которые сейчас пользователи решают с помощью Codex и ChatGPT. Также появлялись сообщения о возможном запуске OpenAI наушников с поддержкой ИИ в этом году, однако компания отказалась раскрывать детали о аппаратных продуктах во время брифинга.

 

Новый голосовой режим не лишён ограничений. Во время живой демонстрации функция перевода на хинди воспроизводила речь с сильным американским акцентом и неестественным, книжным тоном. OpenAI заявила, что модель оптимизирована для «большинства разговорных языков», но не уточнила, каких именно. Поддержка видео, совместного использования экрана и полной многоязычной паритетности на момент запуска отсутствует.

 

Тем не менее архитектурный сдвиг реален. Разделив голосовое взаимодействие и рассуждение и сделав полнодуплексный разговор стандартом, а не премиальной функцией, OpenAI кардинально изменила то, что разработчики приложений могут создавать, — и то, чего пользователи будут ожидать от любого последующего голосового опыта.

ASO World
ASO World
Поставщик услуг по оптимизации App Store (ASO)
Увеличьте популярность вашего приложения с помощью установок, ключевых установок, отзывов и рейтингов, а также гарантированного повышения позиций в рейтинге!
ASO World
ASO World
ASO World
ASO World