يعتقد هؤلاء المسؤولون التنفيذيون أن الذكاء الاصطناعي الصوتي لم يصل إلى لحظته بعد في ChatGPT
اكتسبت النظرية القائلة بأن الصوت هو الواجهة الكبيرة التالية زخمًا كبيرًا، حيث ضخ المستثمرون مليارات الدولارات في شركات الذكاء الاصطناعي الصوتية الناشئة التي تعمل في مجالات تتراوح من صانعي النماذج إلى موفري خدمة العملاء في المؤسسات، ومن مدونين الملاحظات للاجتماعات إلى الإملاء المدعوم بالذكاء الاصطناعي.
في كل أسبوع، يظهر نموذج جديد أو إصدار واحد من الأداة يدعي أنه يبدو بشريًا ويتحدث مثله. ومع ذلك، في الواقع، قد لا يكون هذا هو الحال. يعتقد Shawn Wen، المدير التنفيذي للتكنولوجيا في منصة PolyAI للذكاء الاصطناعي الصوتي للمؤسسات، أنه على الرغم من إصدار نماذج ثنائية الاتجاه - والتي يمكنها التحدث أثناء الاستماع إليك - فإن الذكاء الاصطناعي الصوتي لم يحصل بعد على "لحظة ChatGPT".
"لقد وصلنا إلى مرحلة تطوير نماذج الإرسال المزدوج الكامل. والتحدي التالي هو جعل التفكير سريعًا للغاية، حتى تتمكن النماذج من الحصول على الإجابات بسرعة وتبدو المحادثة طبيعية،" أخبرني على المسرح في مؤتمر HumanX الشهر الماضي.
وقال أيضًا إن وكلاء خدمة العملاء الذين يستخدمون الذكاء الاصطناعي لا ينبغي أن يبدوا آليين ويجب أن يمنحوا المتصلين الثقة الكافية في قدرتهم على حل المشكلات.
"أعتقد أن الخطوة التالية ستكون مختلفة بعض الشيء، لأنه بمجرد أن يكون الصوت جيدًا بما فيه الكفاية، على سبيل المثال، ويكون العميل مستعدًا للتفاعل معه في أول جولتين أو ثلاث جولات، يبدأ في اكتساب الثقة، وبمرور الوقت، سيشعرون أنني ربما لا أحتاج إلى التحدث إلى إنسان إذا كان الوكيل قادرًا على حل مشكلتي،" قال. قال.
يعتقد Alex Gay، مدير التسويق في شركة Otter لتدوين الملاحظات في الاجتماع، أن تحديد المتحدث وتسجيل النية واستخلاص ذلك من خلال الرؤى التنظيمية يعد خطوة أساسية في تمكين التشغيل الآلي. تعمل الشركة أيضًا على التوائم الرقمية التي يمكنها تمثيل الأشخاص في الاجتماعات. بالنسبة لهذه التكنولوجيا، قال إنه من الضروري أن يعطي الإخراج الصوتي نفس التعبيرات العاطفية كما هو الحال عند التحدث إلى إنسان في اجتماع. "لا يمكنك الحصول على ذلك باستخدام الصورة الرمزية، لذلك فهو مجرد q وchatbot"، أشار جاي.
فهم وشفافية الذكاء الاصطناعي الصوتي
على الرغم من تحسن نماذج الذكاء الاصطناعي الصوتي، إلا أن مساعدي الذكاء الاصطناعي غالبًا لا يفهمون المستخدمين أو اجتماعك. يعرض مدون الملاحظات نصًا أو ملخصًا سيئًا.
يعتقد وين أن نماذج التعرف التلقائي على الكلام (ASR) غالبًا ما تفوت الكلمات الرئيسية المهمة، مما يخلق مشكلة في التقاط السياق الكامل.
وافق جاي من Otter على ذلك، مضيفًا أن الشركة تواصل العمل على تحسين النسخ قال أيضًا أن اللغة هي مجال تحتاج فيه نماذج الصوت إلى التحسين.
"بالنسبة لـ Otter، كما تعلم، لم يكن النسخ هو نقطة النهاية أبدًا. كانت هذه مجرد الطبقة التي يمكننا من خلالها البدء في تحقيق بعض مكاسب الإنتاجية. ولكن إذا لم يكن النسخ الأصلي الخاص بك بالدقة التي تحتاجها، فإن أي إجراءات متابعة قمت بها كانت معيبة. وبمجرد أن تبدأ التمثيل، فمن الخطأ. تفقد الثقة في المنصة. قال: "من الضروري بالنسبة لنا مواصلة تحسين نموذج ASR لأن جميع التأثيرات النهائية مهمة". مع الأدوات الصوتية الجديدة، هناك أيضًا مشكلة تتعلق بالشفافية. يجب أن تعلن الأدوات للعملاء أنه يتم تسجيلهم أو التحدث إلى الذكاء الاصطناعي. قال Otter إنه يريد غرس الثقة في أولئك الذين يحضرون الاجتماع. لذلك، حتى بالنسبة للاجتماع الذي لا يوجد فيه الروبوت، فإنه يريد تجربة طرق مثل إخطار الجميع في الدردشة بأن الاجتماع يتم تسجيله. وقال وين من PolyAI أيضًا إنه من المهم إنشاء أن الأشخاص يتحدثون إلى الذكاء الاصطناعي أثناء مكالمات العمل.