في خطوة فارقة في تطور الذكاء الاصطناعي التوليدي والمحادثة الطبيعية، أعلنت شركة OpenAI بدء التوزيع العام لميزة 'الوضع الصوتي المتقدم' (Advanced Voice Mode) لجميع المشتركين في خطتي ChatGPT Plus وChatGPT Team عبر تطبيقي iOS وأندرويد. وتعتمد هذه الميزة على قدرات المعالجة الصوتية الأصلية لنموذج GPT-4o الرائد.

وعلى خلاف المساعدات الصوتية التقليدية التي تعتمد على مسار بطيء من ثلاث مراحل — تحويل الصوت إلى نص، ثم معالجة النص لغوياً، ثم تحويل الناتج إلى كلام صناعي — يقوم النظام الجديد بمعالجة تدفقات الصوت بشكل مباشر وفوري بين المدخلات والمخرجات.

ذكاء صوتي شامل وزمن استجابة يقل عن أجزاء من الثانية

وأتاح هذا الابتكار تقليص زمن الاستجابة إلى نحو 232 مللي ثانية فقط، بمعدل وسطي يبلغ 320 مللي ثانية. ويحاكي هذا الأداء وتيرة التخاطب بين البشر، مما يتيح للمستخدم مقاطعة الذكاء الاصطناعي في منتصف حديثه دون أي ارتباك أو توقف مؤقت للصوت.

كما يتميز النظام بقدرات فريدة على استيعاب عشرات اللهجات الإقليمية وتعديل نبرة الصوت من التفكير الهادئ والهمس إلى الحماس والردود السريعة، مع استشعار المشاعر المتباينة كالتردد والمرح والسخرية في صوت المتحدث.

“يمثل الوضع الصوتي المتقدم نقلة نوعية في التفاعل بين الإنسان والحاسوب؛ فمن خلال معالجة الصوت من البداية إلى النهاية، يدرك النموذج النبرة واللهجات في التو واللحظة.”

تعبير نغمي وتكيف مع اللهجات وضوابط أمان مشددة

ويتضمن التحديث تسعة أصوات اصطناعية تم تطويرها بالتعاون مع فنانين محترفين: أربور، بريز، كوف، إمبر، جونيبر، مابل، سول، سبروس، وفيل. وطبقت الشركة تدابير أمان صارمة لمنع محاكاة أصوات الشخصيات العامة أو استنساخ الأصوات المحمية بحقوق الملكية.

ومع ذلك، استثنت الشركة مؤقتاً مستخدمي الاتحاد الأوروبي والمنطقة الاقتصادية الأوروبية وسويسرا وبريطانيا من هذا الإطلاق، ريثما تستكمل الشركة تقييمات الامتثال لقوانين الخصوصية وحماية البيانات (GDPR) وقانون الذكاء الاصطناعي الأوروبي.

Sources