Dalam lompatan besar bagi kecerdasan buatan percakapan, OpenAI secara resmi memulai peluncuran luas Mode Suara Lanjutan (Advanced Voice Mode / AVM) bagi pelanggan berbayar ChatGPT Plus dan ChatGPT Team di iOS dan Android. Pembaruan ini membawa interaksi suara yang ditenagai langsung oleh arsitektur multimodal GPT-4o.
Berbeda dari asisten suara konvensional yang mengandalkan alur bertahap — mentranskripsikan suara ke teks, memproses jawaban di model bahasa, lalu membacakannya lewat sintesis suara —, sistem baru ini memproses data audio secara langsung dari awal hingga akhir.
Kecerdasan Audio Terintegrasi dan Latensi di Bawah Satu Detik
Pendekatan terpadu ini memangkas jeda respons hingga mencapai 232 milidetik, dengan rata-rata sekitar 320 milidetik. Kecepatan ini setara dengan ritme percakapan antarmanusia, memungkinkan pengguna memotong pembicaraan AI di tengah kalimat secara mulus tanpa gangguan audio.
Sistem ini juga mampu mengenali puluhan aksen percakapan daerah, berbisik jika diminta, serta menyesuaikan gaya bertutur dengan nuansa emosi pengguna, seperti antusiasme, kebingungan, atau sindiran halus.
“Mode Suara Lanjutan merupakan transformasi mendasar dalam interaksi manusia dan komputer. Dengan bekerja langsung pada gelombang suara, model memahami humor, intonasi, dan aksen secara instan.”
Infleksi Emosional, Adaptasi Aksen, dan Sistem Keamanan
Pengguna dapat memilih sembilan opsi suara sintetis baru hasil kerja sama dengan pengisi suara profesional: Arbor, Breeze, Cove, Ember, Juniper, Maple, Sol, Spruce, dan Vale. Filter keamanan ketat dipasang untuk mencegah peniruan suara tokoh publik tanpa izin.
Namun, peluncuran ini belum mencakup kawasan Uni Eropa, Wilayah Ekonomi Eropa, Swiss, dan Inggris Raya. OpenAI menyatakan masih menyelesaikan asesmen kepatuhan data privasi bersama regulator di bawah kerangka GDPR dan EU AI Act.




Comments (0)
Log in to join the discussion.