OpenAI는 수요일에 GPT-Live를 출시하여 기존 고급 음성 모드를 대체하는 두 가지 새로운 음성 모델을 선보였습니다. GPT-Live-1 및 GPT-Live-1 mini 모델은 사람의 대화를 모방하여 듣기와 말하기를 동시에 허용합니다. GPT-Live-1은 Go, Plus 및 Pro 계층의 유료 사용자를 위한 기본값이고, GPT-Live-1 mini는 무료 계층 사용자를 위한 것입니다.

출시는 iOS, Android 및 ChatGPT.com에서 전 세계적으로 시작됩니다. OpenAI는 개발자를 위해 모델을 API에 통합할 계획입니다. GPT-Live는 2년 이내에 개발된 ChatGPT의 3세대 음성 기술을 대표합니다.

GPT-Live의 핵심 기능은 응답을 생성하는 동안 실시간 오디오 처리가 가능한 ‘전이중 아키텍처’입니다. OpenAI는 블로그 게시물에서 “GPT-Live는 일련의 개별 메시지를 처리하는 대신 출력을 생성하는 동안 계속해서 입력을 처리합니다”라고 밝혔습니다. 이를 통해 “mhmm”과 같은 대화식 승인이 가능하고 교환 중 중단을 방지할 수 있습니다.

2024년 9월에 출시된 이전 고급 음성 모드는 엄격한 턴바이턴 교환 방식으로 작동하여 사용자 경험에 불만을 불러일으켰습니다. 배경 소음은 조기에 반응을 유발하여 대화 흐름에 영향을 미칠 수 있습니다.

  OpenAI는 Codex 사용이 지식 작업으로 확산되고 있다고 말합니다.

GPT-Live는 또한 대화를 원활하게 계속하면서 복잡한 쿼리를 백그라운드 모델, 즉 GPT-5.5에 위임하여 추론과 음성 상호 작용을 분리합니다. OpenAI는 “작동하는 동안 GPT-Live는 사용자와 계속 대화하고 대화의 흐름을 유지할 수 있습니다.”라고 설명했습니다.

2023년에 출시된 ChatGPT의 원래 목소리는 모델 전반에 걸쳐 지연 시간과 정보 손실을 초래하는 복잡한 파이프라인에 의존했습니다. 이 설정은 프로세스를 간소화하려고 시도했지만 여전히 어색한 일시 중지 및 중단을 초래하는 고급 음성 모드에서 개선되었습니다.

OpenAI는 특히 여배우 스칼렛 요한슨의 목소리와 닮은 ‘스카이’ 목소리에서 비롯된 과거 성대모사 논란에 대한 우려를 완화하기 위해 노력하고 있습니다. 회사는 GPT-Live가 명의 도용을 방지하고 실제 사람의 목소리를 모방하는 것에 대한 보호 장치를 포함하고 있다고 강조했습니다.

현재 총 9억 명의 활성 사용자 중 일부인 1억 5천만 명 이상의 사용자가 매주 ChatGPT의 음성 기능을 사용하고 있습니다. GPT-Live를 통해 사용자는 풍부한 시각적 카드에 액세스하고 즉시, 중간, 높음의 세 가지 응답 추론 수준 중에서 선택할 수 있습니다. 이 시스템은 또한 대화 중 배경 소음 및 사용자 방해를 관리하는 데 있어서 향상된 성능을 약속합니다.

  Threads의 Meta AI 출시로 인해 광범위한 좌절감 유발

새로운 모델과 함께 안전 조치도 진화했습니다. OpenAI는 광범위한 평가를 실시하여 자해 및 증오심 표현을 포함한 범주에서 GPT-Live의 향상된 성능을 입증하고 실시간 음성 상호 작용과 관련된 고유한 위험을 해결했습니다.

OpenAI가 음성 기술을 발전시키는 동안 Google, ByteDance, Nvidia와 같은 경쟁업체도 최근 자체 전이중 시스템을 출시했습니다. GPT-Live에는 현재 음성 AI 제품의 표준이 되고 있는 비디오 상호 작용이나 화면 공유와 같은 특정 기능이 부족합니다.

전반적으로 GPT-Live는 AI 통신에서 보다 자연스럽고 에이전트적인 기능을 목표로 음성을 인공 지능의 기본 상호 작용 계층으로 지정한다는 점에서 OpenAI의 중요한 발전을 나타냅니다.

<시간 />

추천 이미지 크레딧