OpenAI hat am 24. September 2026 mit der breiten Einführung des hochentwickelten Erweiterten Sprachmodus (Advanced Voice Mode) für alle Abonnenten von ChatGPT Plus und ChatGPT Team begonnen. Dieses Upgrade hebt die sprachbasierte Mensch-Maschine-Interaktion auf ein bisher unerreichtes Niveau an Reaktionsschnelligkeit.
Bisherige Sprachsysteme kombinierten separate Module für Sprache-zu-Text, Textanalyse und Sprachsynthese, was zu spürbaren Verzögerungen führte. Der neue Modus basiert hingegen auf der nativen Audioverarbeitung von GPT-4o, die Tonhöhen, Flüstern und Pausen ohne Zwischenschritte direkt interpretiert.
Native Omnimodalität und flüssige Dialogführung in Echtzeit
Den Anwendern stehen neun sorgfältig modulierte synthetische Stimmen zur Verfügung, darunter neue Profile wie Arbor, Maple, Sol und Spruce. Eine zentrale Neuerung ist die fließende Unterbrechung: Nutzer können dem Modell ins Wort fallen, woraufhin die KI sofort innehält und auf den Einwurf reagiert.
Zusätzlich greift die Sprachfunktion auf hinterlegte benutzerdefinierte Anweisungen zurück, sodass ChatGPT bevorzugte Tonalitäten und persönliche Einstellungen sitzungsübergreifend beibehält.
“Der Erweiterte Sprachmodus bietet eine natürliche Gesprächsdynamik, die zuvor undenkbar war. Durch die native Audioverarbeitung erfasst GPT-4o feine Nuancen und Tonlagen perfekt.”
Sicherheitsmaßnahmen und schrittweise globale Verfügbarkeit
Großes Augenmerk legte das Entwicklerteam auf ethische Leitplanken. Echtzeitfilter unterbinden Versuche, fremde Stimmen bekannter Persönlichkeiten nachzuahmen oder urheberrechtlich geschützte Musikpassagen wiederzugeben.
Die Bereitstellung erfolgt gestaffelt über die mobilen Anwendungen für iOS und Android, während Firmenkunden und Bildungseinrichtungen in nachfolgenden Phasen bedient werden.




Comments (0)
Log in to join the discussion.