OpenAI는 2026년 9월 24일, 유료 서비스인 ChatGPT Plus 및 ChatGPT Team 구독자를 대상으로 차세대 대화 기능인 '고급 음성 모드(Advanced Voice Mode, AVM)'의 대규모 정식 배포를 개시했다. 이번 업데이트는 인공지능과의 상호작용을 단순한 음성 명령에서 즉각적이고 생생한 대화로 전환시킨다.
기존 시스템이 음성 인식(STT), 텍스트 생성, 음성 합성(TTS) 단계를 거치며 지연 시간이 발생했던 것과 달리, 고급 음성 모드는 GPT-4o의 네이티브 옴니모달 신경망 구조에서 직접 작동한다. 음성을 텍스트 변환 없이 토큰 단위로 직접 처리해 목소리 톤의 변화, 속삭임, 감정적 뉘앙스 및 짧은 호흡까지 완벽히 포착한다.
네이티브 옴니모달 아키텍처와 인간 수준의 대화 유연성
사용자는 Arbor, Maple, Sol, Spruce 등 새롭게 추가된 프로필을 포함해 총 9가지의 풍부한 음성 중에서 선택할 수 있다. 특히 AI가 답변하는 도중 사용자가 말을 끊고 새로운 질문이나 의견을 제시해도 끊김 없이 즉각 반응하는 실시간 인터럽트 기능을 구현했다.
또한 사용자가 사전에 등록한 '커스텀 인스트럭션'과도 유기적으로 연동되어, 선호하는 대화 톤이나 어휘 수준, 말하는 속도를 세션이 바뀌어도 지속적으로 유지한다.
“고급 음성 모드는 이전에는 불가능했던 대화의 자연스러움을 제공합니다. 오디오를 네이티브로 처리함으로써 GPT-4o는 뉘앙스와 침묵, 톤을 정밀하게 감지하여 유려한 대화를 전달합니다.”
저작권 및 음성 보안 필터링과 향후 배포 계획
보안과 윤리적 가이드라인도 대폭 강화되었다. 공인이나 타인의 목소리를 무단으로 흉내 내는 딥페이크 위협이나 저작권이 있는 음악 콘텐츠의 재생을 실시간으로 감지하고 차단하는 전용 안전 필터가 내장되었다.
이번 배포는 iOS 및 안드로이드 모바일 애플리케이션을 통해 우선 순차 적용되며, 향후 기업용 엔터프라이즈 및 교육용 계정으로도 서비스 범위가 넓어질 예정이다.




Comments (0)
Log in to join the discussion.