تتجه الأنظار بقوة نحو تقنيات الصوت باعتبارها الواجهة المقبلة التي ستغير قواعد اللعبة، حيث تتدفق مليارات الدولارات لدعم الشركات الناشئة العاملة في مجالات متنوعة، تشمل تطوير النماذج، وخدمة عملاء الشركات، وتدوين ملاحظات الاجتماعات، وصولاً إلى أدوات الإملاء المدعومة بالذكاء الاصطناعي. وعلى الرغم من الوتيرة المتسارعة التي تُصدر بها أدوات ونماذج جديدة تدعي قدرتها على التحدث بطلاقة تشبه البشر، يرى الخبراء أن الواقع قد يكون مغايراً تماماً لتلك الوعود البراقة.
ما وراء حاجز النماذج مزدوجة الاتجاه
في الوقت الذي يُحتفل فيه بالوصول إلى مرحلة النماذج مزدوجة الاتجاه (Full-duplex) القادرة على التحدث والاستماع في آن واحد، يؤكد شاون وين، المدير التقني لمنصة «PolyAI»، أن هذا الإنجاز لا يعني بحال من الأحوال أن الذكاء الاصطناعي الصوتي قد بلغ «لحظة تشات جي بي تي» الخاصة به. فالتحدي الأكبر يكمن حالياً في تسريع عمليات الاستدلال لتتمكن النماذج من جلب الإجابات بسرعة فائقة تضمن انسيابية المحادثة وطبيحيتها.
يشير الخبراء إلى أن وكلاء الذكاء الاصطناعي في قطاع خدمة العملاء يجب أن يتجاوزوا مرحلة الأداء الآلي البحت، بحيث يمنحون المتصلين الثقة الكافية بقدرتهم الفعلية على حل المشكلات. وعندما يصل الصوت إلى مستوى الجودة المطلوبة، سيبدأ العملاء بالاعتماد عليهم بشكل كامل، لدرجة تغنيهم عن التحدث إلى البشر متى ما أثبت الوكيل الذكي كفاءته في تجاوز العقبات الأولى.
دقة النسخ والشفافية: عقبات في طريق الثقة
من جهة أخرى، يرى أليكس غاي، مدير التسويق في منصة «Otter»، أن التقاط نبرات المتحدث وتحديد مقاصده وربطها بالمعرفة التنظيمية يمثل خطوة محورية نحو تحقيق الأتمتة المنشودة. وتعمل المنصة حالياً على تطوير ما يُعرف بـ «التوائم الرقمية»، وهي تقنية تتطلب أن تمنح المخرجات الصوتية نفس التعبيرات العاطفية التي يختبرها الإنسان خلال الاجتماعات الواقعية، وإلا تحولت الأدوات إلى مجرد روبوتات دردشة تقليدية للإجابة عن الأسئلة.
لكن على أرض الواقع، لا تزال المساعدات الصوتية تعاني من قصور في الفهم، وغالباً ما تنتج برامج تدوين الملاحظات نصوصاً أو ملخصات غير دقيقة. ويوضح شاون وين أن نماذج التعرف التلقائي على الكلام (ASR) تفوت غالباً كلمات مفتاحية رئيسية، مما يؤدي إلى الإخلال بالسياق العام للمحادثة. ويوافقه أليكس غاي الرأي مؤكداً أن الاعتماد على نسخ غير دقيق يجعل كافة الخطوات اللاحقة معيبة، مما يفقد المستخدمين الثقة الكاملة في المنصة.
إلى جانب دقة الأداء، تبرز مسألة الشفافية كعنصر حاسم في بناء الثقة؛ إذ يتفق القائمون على القطاع على ضرورة إبلاغ العملاء بوضوح بأنهم يتحدثون إلى نظام ذكاء اصطناعي أو أن مكالماتهم مسجلة، سواء عبر الإشعارات الفورية أو بالطرق المباشرة لضمان الشفافية المطلقة في بيئة العمل.
رأي XoneGold
إذا نظرنا إلى هذا الابتكار من زاوية تأثيره على مستقبل المستخدم، نجد أن الذكاء الاصطناعي الصوتي يعيش مرحلة مخاض حقيقية تفصل بين الطموحات التسويقية والواقع التقني المعقد. إن بناء الثقة الرقمية لا يتوقف عند جودة المحاكاة الصوتية وحدها، بل يرتبط ارتباطاً وثيقاً بمدى دقة المعالجة وفهم السياق البشري العميق. فهل تنجح هذه التقنيات في سد الفجوة بين الأداء الآلي والدفء الإنساني قريباً، أم أن سقف التوقعات سيبقى أعلى بكثير من قدرات الخوارزميات الحالية؟
