OpenAIは2026年9月24日、有料プランであるChatGPT PlusおよびChatGPT Teamの加入者を対象に、次世代音声機能「高度な音声モード(Advanced Voice Mode)」の大規模な一般提供を正式に開始した。これにより、従来のぎこちないやり取りから、極めて人間らしく滑らかな音声対話へと進化を遂げた。

音声を一度テキストに書き起こし、言語モデルで回答を生成した後に音声へ再変換していた従来の手法と異なり、本機能はGPT-4oのネイティブなオムニモーダルニューラルネットワーク上で直接動作する。音声をそのままトークンとして処理することで、声のピッチ、ささやき声、感情のニュアンス、呼吸の間などを極めて低い遅延で再現する。

ネイティブオムニモーダル処理による圧倒的な低遅延と自然な対話

利用者は「Arbor」「Maple」「Sol」「Spruce」などの新作を含む全9種の表情豊かな音声から好みのトーンを選択できる。さらに、AIが話している最中にユーザーが言葉を挟んで話を遮る「リアルタイム割り込み」にも完全対応し、思考の修正や素早いブレインストーミングが可能となった。

カスタムインストラクションの設定も音声セッションに反映されるため、ユーザーが指定した会話のテンポや専門用語の使い方、口調の好みをAIがセッションを超えて記憶する。

“高度な音声モードは、これまでにない会話の自然さを実現します。音声をネイティブに処理することで、GPT-4oはニュアンスや間、声のトーンを正確に捉え、滑らかな対話を実現します。”

著作権保護・安全性対策とグローバル展開のスケジュール

安全性と倫理面にも細心の配慮がなされている。著作権で保護された音源や楽曲の無断再生、公人や一般人の声を不当に模倣するディープフェイク行為を遮断するリアルタイム音声フィルターが常時作動している。

本機能はiOSおよびAndroidのモバイルアプリを通じて数日中に順次有効化され、今後はエンタープライズや教育機関向けプランへの展開も予定されている。

Sources

OpenAI ChatGPT 人工知能 高度な音声モード GPT-4o 音声合成 テクノロジー