2026年7月8日、OpenAIはGPT-Live-1およびGPT-Live-1 miniを発表しました。これは同時に聞き取りと発話が可能なフルデュプレックス音声モデルのペアであり、ChatGPTの高度音声モードに代わるものとして、これまでで最も重要なAI音声技術のアーキテクチャ転換を示すものです。このリリースは、同社が開発者向けRealtime APIをGPT-Realtime-2.1へ更新し、p95レイテンシを少なくとも25%削減し、割り込み処理を改善したわずか2日後に行われました。これらの動きは、AI搭載アプリケーションの主要インターフェースがテキストではなく音声になるという、OpenAIのこれまでで最も明確な賭けを示しています。
すでに1億5,000万人以上が毎週ChatGPTの音声機能とディクテーション機能を利用しています。GPT-Liveによってその数は大幅に増加し、音声対応アプリを構築する開発者もそれに続くとOpenAIは期待しています。
ターン制の終焉:フルデュプレックスの本当の意味
GPT-Liveにおける決定的な技術的進歩は、OpenAIが「フルデュプレックスアーキテクチャ」と呼ぶものです。通信分野においてフルデュプレックスとは、電話中に双方が同時に話し、聞くことができることを意味します。これをAIに応用すると、モデルは自身の音声応答を生成している間も入力音声を継続的に処理することを意味します。ユーザーが話し終えるまでの明確な無音の隙間を待つ必要はもうありません。
「個別のメッセージの連続を処理するのではなく、GPT-Liveは出力を生成しながら継続的に入力を処理します」とOpenAIは発表で述べています。「そのため、モデルは1秒間に何度も対話の判断を行うことができます。話すか、聞き続けるか、一時停止するか、割り込むか、あるいはツールを呼び出すかを判断できます。」
実際には、ユーザーがまだ話している最中に「うんうん」「そうですね」「わかりました」といった相づちを挟むことができ、早まって割り込むことなく自然な間を拾い、急な割り込みにも対話を崩さず対応できる音声アシスタントを意味します。2024年に有料ユーザー向けに提供開始された従来の高度音声モードは、単一モデル内で音声を処理していたものの、依然として厳格なターン制のやり取りに依存していました。同社も認めている通り、「ターン検出は無音に基づいているため、短い間や背景ノイズでさえターン終了と誤認され、不自然なタイミングでモデルが割り込む可能性がありました。」
記者説明会で、ChatGPT音声のプロダクトリードであるAtty Eleti氏は、散歩中に音声機能と30〜40分に及ぶ会話を行ったと述べました。これは従来世代の脆弱なターン検出では実現困難だったユースケースです。
二層アーキテクチャ:音声と推論の融合
GPT-Liveは、同様に重要となり得る第二の構造的変化を導入しています。それは、音声対話レイヤーと推論レイヤーを分離したことです。ユーザーが単純な質問をした場合、GPT-Liveが直接対応します。しかし、ウェブ検索や高度な推論、複雑なエージェント的作業を必要とする場合、GPT-Liveはバックグラウンドで動作する最先端モデルにタスクを委任します。リリース時点ではGPT-5.5が使用され、計算が非同期で行われている間もユーザーとの会話を継続します。
この委任モデルは重要なアーキテクチャ上の賭けです。会話の流暢さと高度な知性の両方を兼ね備えた単一の巨大な音声モデルを構築するのではなく、OpenAIは問題を二分しました。リアルタイム対話に最適化された音声ネイティブモデルと、最先端技術の進歩に応じて入れ替え可能な独立した推論エンジンです。OpenAIは「新しい最先端モデルをリリースするたびに、GPT-Liveで使用するモデルも継続的に更新します」と述べています。
人間による評価では、GPT-Live-1およびGPT-Live-1 miniは、総合的な好み、ターン処理、割り込み、会話の流れ、自然さの各指標において高度音声モードより強く支持されました。自動ベンチマークでは、GPT-Live-1は専門家レベルの科学的推論(GPQA)およびエージェント型ウェブ検索(BrowseComp)で向上を示しました。
音声AIの三世代:ここまでの歩み
音声AIがどれほど進化したかを理解するには、GPT-Liveへと至る三世代を振り返ると役立ちます:
| 世代 | アーキテクチャ | ターン処理 | 発話中の聞き取り | レイテンシ体感 |
|---|---|---|---|---|
| カスケード型(2023) | STT → LLM → TTS(3モデル) | 離散的ターン | 不可 | 遅く、不自然 |
| ターンベース型(2024) | 単一モデル、ネイティブ音声 | 離散的、無音ベース | 不可 | 高速化したが依然硬直的 |
| フルデュプレックス型(2026) | 単一モデル+委任 | 連続処理、秒単位で判断 | 可能 | 高速、自然、表現豊か |
開発者側の動き:GPT-Realtime-2.1とAPIの今後
GPT-Live-1が世界中のChatGPTユーザーに展開される一方で、OpenAIは7月6日に開発者向けRealtime APIをGPT-Realtime-2.1およびGPT-Realtime-2.1-miniへ更新しました。このアップデートでは英数字認識が向上し、注文番号や電話番号、確認コードの読み上げにおいて重要な改善がなされています。また、無音およびノイズ処理の改善、より信頼性の高い割り込み動作も実現しています。p95レイテンシの少なくとも25%の削減は、モデルサイズの変更ではなくキャッシュの改善によるものです。
両モデルは現在Realtime APIを通じて利用可能で、完全機能と大量利用ケース間のコスト差を反映した価格設定となっています:
| 価格(100万トークンあたり) | GPT-Realtime-2.1 | GPT-Realtime-2.1-mini |
|---|---|---|
| テキスト入力 | $4.00 | $0.60 |
| テキスト出力 | $24.00 | $2.40 |
| 音声入力 | $32.00 | $10.00 |
| 音声出力 | $64.00 | $20.00 |
miniモデルの音声料金は、入力100万トークンあたり$32のフルモデルに対して$10であり、最大限の推論深度よりも速度とコストが重要な大量音声トラフィックには明らかに適しています。OpenAIはまた、GPT-LiveがAPIにも提供されることを確認しており、アクセス開始時に通知を受け取る登録が可能です。
アプリ開発者への意味
音声ネイティブAIが目新しさからインフラへと移行する中で、アプリ開発者は新たな発見課題に直面しています。競争が激化する市場で、ユーザーはどのようにしてあなたの音声対応アプリを見つけるのでしょうか。AIアプリカテゴリーは急速に成長しており、目立つためには巧妙な機能だけでなく、AI主導の検索行動に合わせた戦略的なASOとユーザー獲得戦略が必要です。
ASOWorldのAIアプリマーケティングソリューションは、AI分野における競合キーワードポートフォリオの分析と、ロングテールキーワードから主要キーワードまで段階的なランキング戦略の実行を支援し、拡大する音声アプリエコシステムの中で持続的な可視性を構築します。
競争環境:誰もが「話したい」
自然な音声の追求において、OpenAIは唯一の存在ではありません。AppleはSiriを文脈理解と会話能力の向上でアップデートしました。Amazonも同様にAlexaを強化しています。Oculus共同創業者Brendan Iribe氏が設立したSesameのようなスタートアップは、バックグラウンドでタスクを完了しながらより自然な会話を実現するAIアシスタントを発表しています。DSTおよびLux Capitalから4,000万ドルのシード資金を調達したMonogramは、音声アシスタントをよりインタラクティブにするため視覚的応答に注力しています。
市場機会は非常に大きいものです。The Business Research Companyによると、世界の音声アシスタントアプリケーション市場は2025年の72.1億ドルから2026年には96.2億ドルへ成長すると予測されています。より広範なAI音声アシスタント市場は442.6億ドルに達する見込みです。世界で84億台のアクティブな音声アシスタントが存在し、音声コマースが1,000億ドルに迫る中、OpenAIが構築しているインフラ(消費者向けおよび開発者向けの両方)は、急速に拡大するエコシステムの中心に位置しています。
次に来るもの
OpenAIのビジョンはChatGPTをはるかに超えています。Eleti氏は、音声が複雑で長時間にわたるエージェント的作業、つまり現在CodexやChatGPTで行っているようなタスクにおいて「コンピューティングの主要インターフェース」になる可能性を示唆しました。また、OpenAIが今年AI搭載イヤーバッドを発表する可能性があるとの報道もありますが、説明会ではハードウェア製品の詳細は明らかにされませんでした。
この新しい音声モードにも制限はあります。ライブデモでは、ヒンディー語翻訳機能が強いアメリカ英語アクセントと不自然で書き言葉的な口調で発話しました。OpenAIはモデルが「最も話されている言語」に最適化されていると述べましたが、具体的な言語は明示していません。動画、画面共有、完全な多言語対応はリリース時点では利用できません。
それでも、アーキテクチャの転換は現実のものです。音声対話と推論を分離し、フルデュプレックス会話をプレミアム機能ではなく標準にしたことで、OpenAIはアプリ開発者が構築できるもの、そしてユーザーが今後のあらゆる音声体験に期待するものを根本的に変えました。




