対話型人工知能の新たな地平を切り拓く動きとして、OpenAIはiOSおよびAndroidのChatGPT PlusおよびChatGPT Team有料加入者を対象に、「高度音声モード(Advanced Voice Mode / AVM)」の大規模な一般提供を開始した。同社の主力モデルであるGPT-4oのネイティブ音声マルチモーダル能力が、いよいよ一般ユーザーの手に渡ることになる。

音声をテキストに変換し、大規模言語モデルで処理した上で再び音声合成を行うという従来の3段階パイプラインとは異なり、高度音声モードは音声信号を入力から出力まで一貫して直接処理する。

エンドツーエンドの音声知能と1秒未満の応答性

この統合アーキテクチャにより、応答遅延は最短で232ミリ秒、平均でも約320ミリ秒という驚異的な短縮を達成した。これは人間同士のテンポ良い会話とほぼ同等であり、AIが話している最中にユーザーが言葉を挟んで遮っても、違和感なくスムーズに聞き取って反応できる。

さらに、多数の地域アクセントを識別して自然な抑揚で応答する能力や、指示に応じて「ささやき声」で話す機能、相手の声のトーンから皮肉や興奮、ためらいといった感情の機微を察知する表現力を備えている。

“高度音声モードは、人とコンピューターの対話における根本的な進化です。エンドツーエンドで音声を直接処理することで、ユーモアやリズム、微妙なアクセントをリアルタイムに理解できます。”

豊かな表現力、アクセント適応、そして厳格な安全性

プロの声優との協力により開発された9種類の専用合成音声(Arbor、Breeze、Cove、Ember、Juniper、Maple、Sol、Spruce、Vale)が用意され、特定個人の声の無断クローンや著作権侵害を防ぐ厳格な安全フィルターが組み込まれた。

ただし、欧州地域での展開には慎重な姿勢が取られている。OpenAIは、欧州連合(EU)、欧州経済領域(EEA)、スイス、英国において、一般データ保護規則(GDPR)およびEU AI法に基づくプライバシー審査が完了するまで本機能の提供を一時見合わせている。

Sources

OpenAI ChatGPT 人工知能 高度音声モード GPT-4o 音声認識