대화형 인공지능의 사용성을 극적으로 끌어올리는 중요한 진전으로, OpenAI가 iOS 및 안드로이드 기기의 ChatGPT 플러스와 ChatGPT 팀 유료 구독자를 대상으로 '고급 음성 모드(Advanced Voice Mode / AVM)'의 대대적인 배포를 시작했다. 이번 출시는 회사의 주력 모델인 GPT-4o의 네이티브 음성 멀티모달 역량을 일상에서 직접 체감할 수 있게 한다.
음성을 텍스트로 변환(STT)한 뒤 언어 모델이 답변을 작성하고 이를 다시 음성으로 합성(TTS)하던 기존의 번거로운 3단계 방식과 달리, 고급 음성 모드는 오디오 신호 자체를 입력부터 출력까지 엔드투엔드로 직접 처리한다.
엔드투엔드 오디오 지능과 1초 미만의 초고속 응답
이러한 통합 아키텍처 덕분에 응답 지연 시간은 최저 232밀리초, 평균 약 320밀리초 수준으로 대폭 단축되었다. 이는 사람 사이의 실제 대화 리듬과 거의 일치하는 속도로, 사용자가 인공지능의 답변 도중 자연스럽게 말을 끊고 끼어들어도 끊김 없이 반응한다.
또한 시스템은 수십 가지의 지역별 억양을 식별해 자연스럽게 반응하며, 사용자의 요청에 따라 목소리를 낮춰 속삭이거나 말의 속도를 조절하고 음성에 담긴 감정적 뉘앙스(흥분, 망설임, 유머)까지 감지해낸다.
“고급 음성 모드는 인간과 컴퓨터 간의 상호작용 방식에 근본적인 전환점을 마련했습니다. 오디오 신호를 직접 처리함으로써 유머, 박자, 미세한 억양까지 실시간으로 파악합니다.”
풍부한 표현력, 억양 맞춤 대응 및 철저한 보안 장벽
OpenAI는 전문 성우들과 협력하여 개발한 9가지의 다채로운 합성 음성(Arbor, Breeze, Cove, Ember, Juniper, Maple, Sol, Spruce, Vale)을 탑재했으며, 허가받지 않은 특정 인물의 음성 복제나 저작권 위반을 방지하는 엄격한 안전 필터를 적용했다.
다만 유럽 지역 이용자들은 정식 서비스 이용까지 다소 시간이 걸릴 예정이다. OpenAI는 유럽연합 일반개인정보보호법(GDPR)과 EU AI법 등 까다로운 규제 준수 요건을 검토하기 위해 유럽연합, 유럽경제지역, 스위스, 영국에서의 출시를 일시적으로 보류했다.




Comments (0)
Log in to join the discussion.