업계 정보
뉴스 핫스팟

OpenAI의 새로운 GPT-Live 모델이 AI 음성 대화를 자연스럽게 만듭니다

OpenAI의 GPT-Live는 1억 5천만 명 이상의 사용자에게 풀 듀플렉스 음성 AI를 제공합니다. 새로운 모델과 Realtime API 업데이트가 앱 개발자에게 무엇을 의미하는지 살펴보세요.
공개 날짜: Jul 9, 2026
업데이트 날짜: Jul 9, 2026
OpenAI의 새로운 GPT-Live 모델이 AI 음성 대화를 자연스럽게 만듭니다

2026년 7월 8일, OpenAI는 동시에 듣고 말할 수 있는 풀듀플렉스 음성 모델인 GPT-Live-1과 GPT-Live-1 mini를 출시했다 — 이는 ChatGPT의 Advanced Voice Mode를 대체하며, 지금까지 AI 음성 기술에서 가장 중요한 아키텍처 전환을 의미한다. 이번 출시는 회사가 개발자용 Realtime API를 GPT-Realtime-2.1로 업데이트해 p95 지연 시간을 최소 25% 단축하고 인터럽트 처리 성능을 개선한 지 불과 이틀 만에 이루어졌다. 이러한 일련의 조치는 텍스트가 아닌 음성이 AI 기반 애플리케이션의 주요 인터페이스가 될 것이라는 OpenAI의 가장 분명한 베팅을 보여준다.

 

이미 1억 5천만 명 이상이 매주 ChatGPT Voice와 Dictation을 사용하고 있다. GPT-Live를 통해 OpenAI는 이 수치가 크게 증가하고, 음성 기반 앱을 구축하는 개발자들도 뒤따를 것이라 기대하고 있다.

 

턴테이킹의 종말: 풀듀플렉스의 실제 의미

 

GPT-Live의 핵심 기술적 진보는 OpenAI가 "풀듀플렉스 아키텍처"라고 부르는 것이다. 통신 분야에서 풀듀플렉스란 전화 통화 중 양측이 동시에 말하고 들을 수 있음을 의미한다. 이를 AI에 적용하면, 모델이 자신의 음성 응답을 생성하는 동안에도 들어오는 오디오를 지속적으로 처리한다는 뜻이다 — 사용자가 말을 끝냈는지 판단하기 위해 완전한 침묵 구간을 기다릴 필요가 없다.

 

“별도의 메시지 시퀀스를 처리하는 대신, GPT-Live는 출력을 생성하는 동안에도 입력을 지속적으로 처리합니다,”라고 OpenAI는 발표문에서 밝혔다. “따라서 모델은 초당 여러 번 상호작용 결정을 내릴 수 있습니다: 말할지, 계속 들을지, 멈출지, 끼어들지, 또는 도구를 호출할지 등을 말입니다.”

 

실제로 이는 사용자가 아직 말하는 중에도 “음,” “네,” “알겠어요”와 같은 대화적 반응을 삽입하고, 성급하게 끼어들지 않으면서 자연스러운 멈춤을 인식하며, 빠른 인터럽트도 대화를 방해하지 않고 처리할 수 있는 음성 비서를 의미한다. 2024년에 유료 사용자 대상으로 출시된 OpenAI의 이전 Advanced Voice Mode는 단일 모델 내에서 오디오를 처리했지만 여전히 경직된 턴 기반 상호작용에 의존했다. 회사가 인정했듯이, “턴 감지가 침묵에 기반하기 때문에 짧은 멈춤이나 배경 소음도 턴의 종료로 오인되어 부자연스러운 시점에 모델이 끼어들 수 있었다.”

 

언론 브리핑에서 ChatGPT Voice 제품 책임자 Atty Eleti는 산책 중 음성 기능과 30~40분 길이의 대화를 나눈 적이 있다고 밝혔다 — 이는 이전 세대의 취약한 턴 감지 방식으로는 불가능했던 사용 사례다.

 

이중 계층 아키텍처: 음성과 추론의 결합

 

GPT-Live는 또 하나의 구조적 변화를 도입했으며, 이는 그에 못지않게 중요한 의미를 가질 수 있다: 음성 상호작용 계층과 추론 계층을 분리한 것이다. 사용자가 간단한 질문을 하면 GPT-Live가 직접 처리한다. 그러나 웹 검색, 심층 추론, 복잡한 에이전트 작업이 필요한 경우 GPT-Live는 해당 작업을 백그라운드에서 실행되는 최첨단 모델 — 출시 시점에는 GPT-5.5 — 에 위임하고, 계산이 비동기적으로 진행되는 동안에도 사용자와의 대화를 이어간다.

 

이 위임 모델은 의미 있는 아키텍처적 선택이다. 대화적 유창함과 깊은 지능을 모두 갖춘 단일 거대 음성 모델을 구축하는 대신, OpenAI는 문제를 두 부분으로 나누었다: 실시간 상호작용에 최적화된 음성 전용 모델과, 기술 발전에 따라 교체 가능한 별도의 추론 엔진이다. OpenAI는 “새로운 최첨단 모델을 출시할 때마다 GPT-Live에서 사용하는 모델을 지속적으로 업데이트할 것”이라고 밝혔다.

 

인간 평가에서 GPT-Live-1과 GPT-Live-1 mini는 전반적 선호도, 턴테이킹, 인터럽트 처리, 흐름, 자연스러움 등 모든 지표에서 Advanced Voice Mode보다 강한 선호를 받았다. 자동화된 벤치마크에서는 GPT-Live-1이 전문가 수준의 과학 추론(GPQA)과 에이전트 기반 웹 검색(BrowseComp)에서 향상된 성능을 보였다.

 

음성 AI의 세 세대: 여기까지의 여정

 

음성 AI가 얼마나 발전했는지 이해하려면 GPT-Live로 이어진 세 세대를 살펴보는 것이 도움이 된다:

세대 아키텍처 턴 처리 말하는 동안 듣기 지연 체감
계단식 (2023) STT → LLM → TTS (3개 모델) 분리된 턴 아니오 느리고 부자연스러움
턴 기반 (2024) 단일 모델, 네이티브 오디오 분리됨, 침묵 기반 아니오 더 빠르지만 여전히 경직됨
풀듀플렉스 (2026) 단일 모델 + 위임 연속 처리, 초당 결정 빠르고 자연스러우며 표현력 있음

 

개발자 측면: GPT-Realtime-2.1과 API에 추가될 기능

 

GPT-Live-1이 전 세계 ChatGPT 사용자에게 순차적으로 제공되는 가운데, OpenAI는 7월 6일 개발자용 Realtime API를 GPT-Realtime-2.1 및 GPT-Realtime-2.1-mini로 업데이트했다. 이번 업데이트는 주문 번호, 전화번호, 확인 코드 등을 읽어줄 때 중요한 영숫자 인식 성능을 개선했으며, 침묵 및 소음 처리와 인터럽트 동작의 신뢰성도 향상시켰다. 최소 25%의 p95 지연 시간 감소는 모델 크기 변경이 아닌 캐싱 개선에서 비롯되었다.

 

두 모델 모두 현재 Realtime API를 통해 사용할 수 있으며, 전체 기능 모델과 대량 사용 사례 간 비용 차이를 반영한 가격이 적용된다:

가격 (1M 토큰당) GPT-Realtime-2.1 GPT-Realtime-2.1-mini
텍스트 입력 $4.00 $0.60
텍스트 출력 $24.00 $2.40
오디오 입력 $32.00 $10.00
오디오 출력 $64.00 $20.00

 

mini 모델의 오디오 요금 — 백만 입력 토큰당 $10, 전체 모델은 $32 — 은 속도와 비용이 최대 추론 깊이보다 중요한 대량 음성 트래픽에 있어 명확한 선택지를 제공한다. OpenAI는 또한 GPT-Live가 API에 추가될 예정임을 확인했으며, 개발자는 접근이 시작될 때 알림을 신청할 수 있다.

 

앱 개발자에게 의미하는 바

 

음성 네이티브 AI가 새로운 기능에서 인프라로 전환됨에 따라, 앱 개발자들은 새로운 발견 과제에 직면한다: 점점 더 혼잡해지는 시장에서 사용자가 여러분의 음성 기반 앱을 어떻게 찾을 수 있을까? AI 앱 카테고리는 빠르게 성장하고 있으며, 돋보이기 위해서는 단순한 기능 이상의 것이 필요하다 — AI 기반 검색 행동에 맞춘 전략적 ASO 및 사용자 확보 전략이 필요하다.

 

ASOWorld's AI App Marketing solutions는 개발자가 AI 분야 경쟁사의 키워드 포트폴리오를 분석하고, 롱테일 키워드에서 핵심 키워드까지 단계별 순위 전략을 실행하여 음성 앱 생태계 확장에 따라 지속 가능한 가시성을 구축하도록 지원한다.

 

경쟁 환경: 모두가 말하고 싶어 한다

 

자연스러운 음성을 추구하는 것은 OpenAI만이 아니다. Apple은 Siri를 더 나은 맥락 처리와 대화 기능으로 업데이트했다. Amazon 역시 Alexa를 업그레이드했다. Oculus 공동 창립자 Brendan Iribe가 설립한 Sesame과 같은 스타트업은 백그라운드에서 작업을 수행하면서 보다 자연스러운 대화를 지향하는 AI 어시스턴트를 출시했다. DST와 Lux Capital로부터 4천만 달러의 시드 투자를 유치한 Monogram은 음성 비서를 더 상호작용적으로 만들기 위해 시각적 응답에 집중하고 있다.

 

시장 기회는 상당하다. The Business Research Company에 따르면 글로벌 음성 비서 애플리케이션 시장은 2025년 72억 1천만 달러에서 2026년 96억 2천만 달러로 성장할 것으로 예상되며, 더 광범위한 AI 음성 비서 시장 전망은 442억 6천만 달러에 이른다. 전 세계적으로 84억 개의 활성 음성 비서가 존재하고, 음성 커머스가 1,000억 달러에 근접하는 가운데, OpenAI가 구축 중인 인프라 — 소비자용과 개발자용 모두 — 는 빠르게 확장되는 생태계의 중심에 위치하게 한다.

 

다음 단계

 

OpenAI의 비전은 ChatGPT를 훨씬 넘어선다. Eleti는 음성이 Codex와 ChatGPT를 통해 현재 수행되는 복잡하고 장기적인 에이전트 작업에 있어 “컴퓨팅의 주요 인터페이스”가 될 수 있다고 시사했다. 또한 OpenAI가 올해 AI 기반 이어버드를 출시할 수 있다는 보도도 있었지만, 회사는 브리핑 중 하드웨어 제품에 대한 세부 사항 제공을 거부했다.

 

새로운 음성 모드에도 한계는 있다. 라이브 데모 중 힌디어 번역 기능은 강한 미국식 억양과 부자연스럽고 책 같은 어조의 음성을 생성했다. OpenAI는 모델이 “대부분의 구어”에 최적화되어 있다고 밝혔지만, 구체적인 언어는 명시하지 않았다. 출시 시점에는 비디오, 화면 공유, 완전한 다국어 동등성은 제공되지 않는다.

 

그럼에도 불구하고, 아키텍처 전환은 분명하다. 음성 상호작용과 추론을 분리하고, 풀듀플렉스 대화를 프리미엄 기능이 아닌 기본값으로 설정함으로써 OpenAI는 앱 개발자가 구축할 수 있는 것 — 그리고 사용자가 앞으로 모든 음성 기반 경험에서 기대하게 될 것 — 을 근본적으로 변화시켰다.

주제:
ASO World
ASO World
앱 스토어 최적화(ASO) 서비스 제공업체
앱 설치, 키워드 설치, 앱 리뷰 & 평점, 보장된 앱 순위 상승으로 당신의 앱을 성장시키세요!
ASO World
ASO World
ASO World
ASO World