
الذكاء الاصطناعي الصوتي هو برنامج يفهم اللغة المنطوقة ويجيب بصوت طبيعي منطوق، ويجري محادثة في الوقت الفعلي عبر مكالمة هاتفية أو تطبيق. فهي تجمع بين التعرف على الكلام، وفهم اللغة (الذي يتمثل عادةً الآن في نموذج لغوي ضخم)، وتوليف الكلام، بحيث يتحدث المتصلون بعباراتهم الخاصة بدلاً من الضغط على مفاتيح القائمة.
تضاعف متوسط وقت الاستجابة في مراكز الاتصال منذ عام 2019 ليصل إلى أكثر من 90 ثانية، ويشير 40% من الفرق الآن إلى تزايد الطلب على الدعم على مدار الساعة (Calabrio، 2025). وتعد تقنية الذكاء الاصطناعي الصوتي الوسيلة التي يلجأ إليها عدد متزايد من الشركات لتلبية هذا الطلب دون زيادة عدد الموظفين: يبلغ حجم سوق الذكاء الاصطناعي التخاطبي في الهند بالفعل ما بين 3800 و5600 كرور روبية هندية، ويشهد نموًا بنسبة 25% سنويًّا، وفقًا لـ غراند فيو ريسيرتش. يشرح هذا المقال ما هو «الذكاء الاصطناعي الصوتي»، وكيف يعمل، وكيف يختلف عن قوائم الهواتف القديمة، وأين تستخدمه الشركات، وما هي تكلفته، وكيف يلتزم بالقوانين في الهند.
في هذه الصفحة
يقوم نظام «A Voice AI» بتحويل الطلب الصوتي إلى إجراء ورد صوتي عبر مسار قصير، وتستغرق كل مرحلة منه أجزاء من الثانية، مما يجعل التفاعل يبدو طبيعيًا. وقد قطعت تقنية التعرف على الكلام شوطًا طويلاً: فهي حققت دقة تضاهي دقة البشر في اختبار أداء قياسي للنسخ الصوتي أُجري عام 2017، حيث بلغ معدل الخطأ 5.9٪، وهذا هو السبب في أن الروبوتات الصوتية الحديثة تفهم المتصلين بهذه الدرجة من الدقة.
هناك عاملان يميزان العنصر التفاعلي الطبيعي عن العنصر غير السلس. الأول هو زمن الاستجابة: فالرد في غضون 300 إلى 800 مللي ثانية يبدو طبيعيًّا، لأن الناس أنفسهم لا يتوقفون إلا لمدة تتراوح بين 200 و300 مللي ثانية تقريبًا بين كل دور وآخر (Ultravox، 2025). والثاني هو التناوب في الكلام، والذي يشمل «المقاطعة» (التي تتيح لك المقاطعة في منتصف الجملة) و«إنهاء الجملة» (معرفة متى تنتهي من الكلام). تنتقل نماذج تحويل الكلام إلى كلام الأحدث مباشرةً من الإدخال الصوتي إلى الإخراج الصوتي، مما يقلل من الخطوات في مسار المعالجة لتقليل التأخير. عند تقييم منصة ما، اسأل عن زمن الاستجابة الفعلي من البداية إلى النهاية وما إذا كانت تدعم المقاطعة؛ فهذان الرقمان يتنبآن بمدى طبيعية تجربة المتصلين.
تعتمد قوائم الهواتف القديمة على نظام الاستجابة الصوتية التفاعلية (IVR)، حيث يتنقل المستخدم عبر شجرة خيارات ثابتة عن طريق الضغط على المفاتيح أو نطق كلمات منفردة، مثل «اضغط على 1 للمبيعات». أما الذكاء الاصطناعي الصوتي فيلغي الحاجة إلى القائمة: فما عليك سوى التعبير عما تريده بكلماتك الخاصة، فيفهم النظام طلبك ويستجيب له. وهذا الاختلاف هو السبب في أن الذكاء الاصطناعي الصوتي يقلل من أوقات الانتظار الطويلة وأوقات التنقل التي تدفع المتصلين إلى إنهاء المكالمة. مبني على الاتصالات الهاتفية السحابية، حيث يمكن تشغيل كليهما على نفس رقم الهاتف، لذا يمكنك استبدال القائمة بمحادثة دون تغيير الطريقة التي يتصل بها العملاء بك.
| نظام الرد الآلي التقليدي (IVR) | الذكاء الاصطناعي الصوتي |
|---|---|
| شجرة القائمة الثابتة (“اضغط على 1 للمبيعات”) | محادثة مفتوحة بعبارات المتصل نفسه |
| يتعرف على ضغطات المفاتيح أو الكلمات المفتاحية الفردية | يفهم الجمل الكاملة والمقصود منها |
| نص واحد للجميع | يتكيف مع السياق وسجل المكالمات للمتصل |
| ينتظر المتصلون حتى يتم اختيار كل خيار | يذكر المتصلون الهدف ويحصلون على إجابة مباشرة |
| من الصعب إجراء تغيير دون إعادة بناء الشجرة | تم التحديث عن طريق تعديل المطالبات والبيانات المرتبطة بها |
هذه هي المصطلحات التي ستصادفها في أغلب الأحيان عند تقييم أو تطوير تقنية الذكاء الاصطناعي الصوتي. احتفظ بهذا كمرجع سريع.
| المصطلح | ماذا يعني ذلك |
|---|---|
| التعرف التلقائي على الكلام (ASR)، أو تحويل الكلام إلى نص (STT) | يحول الصوت المنطوق إلى نص. |
| تحويل النص إلى كلام (TTS) | يحول النص إلى صوت طبيعي يشبه الكلام المنطوق. |
| معالجة اللغة الطبيعية (NLP) | المجال الواسع المتمثل في تعليم الآلات التعامل مع اللغة البشرية. |
| فهم اللغة الطبيعية (NLU) | الجزء من البرمجة اللغوية العصبية (NLP) الذي يستخلص المعنى والنية والكيانات من كلام الشخص. |
| نموذج لغوي ضخم (LLM) | نموذج ذكاء اصطناعي تم تدريبه على كميات ضخمة من النصوص، ويقوم بإنشاء ردود تشبه ردود البشر، ويشكل أساس عملية الاستدلال في أنظمة الذكاء الاصطناعي الصوتية الحديثة. |
| القصد | الهدف من طلب ما، مثل «حجز موعد» أو «التحقق من رصيدي». |
| الكيان | تفصيل محدد في الطلب، مثل تاريخ أو اسم أو مبلغ. |
| التدخل المفاجئ | القدرة على مقاطعة النظام في منتصف الجملة، تمامًا كما تقاطع شخصًا ما. |
| تحديد النقاط النهائية | الكشف عن اللحظة التي ينتهي فيها المتصل من الكلام، حتى يعرف النظام متى يجب عليه الرد. |
| زمن الاستجابة | الفترة الزمنية الفاصلة بين انتهاء المتصل من جملته ورد النظام. فكلما انخفض زمن الاستجابة، كانت المحادثة أكثر طبيعية. |
| معدل الاحتواء | نسبة المكالمات التي يتولى الروبوت معالجتها من البداية إلى النهاية دون إحالتها إلى موظف بشري. |
| من الكلام إلى الكلام | نهج أحدث يتم فيه توصيل نموذج واحد مباشرة من مدخل الصوت إلى مخرج الصوت، مما يقلل من عدد الخطوات في مسار المعالجة. |
تثبت تقنية الذكاء الاصطناعي الصوتي جدارتها في التعامل مع المكالمات المتكررة ذات الحجم الكبير، تلك التي تشغل موظفي خدمة العملاء دون الحاجة إلى تدخل بشري. ففي القطاع المصرفي، تعامل الروبوت الصوتي «كييا» التابع لبنك كوتاك ماهيندرا مع أكثر من 3.5 مليون استفسار من أكثر من مليون مستخدم باللغتين الإنجليزية والهندية، بنسبة دقة بلغت حوالي 93% (RoboticsBiz). ويتكرر هذا النمط في مختلف القطاعات.
النقطة الأساسية: ابدأ بتطبيق الذكاء الاصطناعي الصوتي على نية واحدة أو نيتين تتميزان بحجم كبير من الاستخدامات ومستوى منخفض من التعقيد، وأثبت معدل الاحتواء، ثم قم بتوسيع نطاق التطبيق.
تعد العوامل الاقتصادية السبب وراء الانتشار السريع لتقنية الذكاء الاصطناعي الصوتي. ففي الهند، تبلغ تكلفة الموظف البشري الذي يجري المكالمات الهاتفية حوالي 40 إلى 120 روبية لكل اتصال يتم حله، في حين تبلغ تكلفة الوكيل الصوتي الذي يعمل بالذكاء الاصطناعي حوالي 12 إلى 25 روبية، وهو ما يمثل انخفاضًا بنسبة تتراوح بين 60% و80% تقريبًا (Caller.digital، 2026). وتشير معظم الشركات الهندية إلى انخفاض بنسبة 30% إلى 40% في تكلفة كل اتصال خلال السنة الأولى من بدء تشغيل هذه الخدمة.
لا تكون التكلفة مجدية إلا إذا نجح الروبوت فعليًّا في حل المشكلات المتعلقة بالمكالمات. المؤشر الذي يجب مراقبته هو معدل الاحتواء، أي نسبة المكالمات التي يتم التعامل معها من البداية إلى النهاية دون تدخل بشري. عادةً ما تبدأ نسبة الاحتواء عند الروبوتات بين 20% و40%، وتصل في حالات النشر الناضجة إلى 70% إلى 90% (Calabrio، 2025)، ولكن يجب السعي وراء الجودة بدلاً من النسبة الإجمالية: فمعدل احتواء بنسبة 90% مع مستوى رضا يبلغ 60% أسوأ من معدل احتواء بنسبة 70% مع مستوى رضا يبلغ 85%. تتوقع شركة «غارتنر» الذكاء الاصطناعي الوكيل لحل 80% من المشكلات الشائعة في خدمة العملاء بشكل مستقل بحلول عام 2029.
فيما يتعلق بالجداول الزمنية، يمكن إطلاق روبوت بسيط للأسئلة الشائعة أو لتوجيه المكالمات في غضون أسبوعين إلى أربعة أسابيع، في حين يستغرق النشر على نطاق المؤسسة — مع تكامل نظام إدارة علاقات العملاء (CRM) ودعم عدة لغات — حوالي شهرين إلى أربعة أشهر. قبل التوقيع على العقد، قم بحساب التكلفة الإجمالية (الخدمات الهاتفية، والتكامل، والضبط، وطبقة التصعيد البشري)، وليس فقط السعر للدقيقة الواحدة.
يمكن أن تكون تقنية الذكاء الاصطناعي الصوتي متوافقة تمامًا مع المعايير، لكن الامتثال ينبع من الطريقة التي تتعامل بها مع البيانات، وليس من تقنية الذكاء الاصطناعي نفسها. قانون حماية البيانات الشخصية الرقمية في الهند لعام 2023 يتطلب الحصول على موافقة حرة ومحددة ومستنيرة قبل معالجة البيانات الشخصية، ويشمل ذلك تسجيلات المكالمات ونصوصها. كما يتعين عليك تقديم إشعار باللغة البسيطة للمتصلين يوضح ما الذي تقوم بجمعه وأسباب ذلك.
تخضع المكالمات الصادرة لقواعدها الخاصة. تنص لوائح الاتصالات التجارية الصادرة عن هيئة تنظيم الاتصالات في الهند (TRAI)، والتي تم تعديلها في فبراير 2025، على إدراج المكالمات التي يتم إجراؤها تلقائيًا أو بواسطة الذكاء الاصطناعي ضمن إطار الاتصالات غير المرغوب فيها، مع اشتراط الحصول على موافقة صريحة، واستخدام سلاسل أرقام محددة، وفرض غرامات تصل إلى ₹10 lakh في حالة المخالفة. لا يوجد في الهند حتى الآن قانون راسخ يُلزم الروبوت بالإعلان عن كونه يعمل بالذكاء الاصطناعي، على الرغم من أن الهيئة التنظيمية تجري مشاورات حول هذا الأمر؛ لذا، يُنصح اعتبار الإفصاح الواضح ممارسة جيدة.
اللغة هي الاختبار الآخر الذي يخص الهند على وجه الخصوص. يوجد في البلاد 22 لغة رسمية، وهناك نماذج مفتوحة مثل AI4Bharat تغطي هذه الخدمات الآن 13 لغة أو أكثر في مجال التعرف على الكلام، لذا فإن روبوتات الصوت باللغات المحلية أصبحت أمراً عملياً، وليست مجرد حلم. قبل الإطلاق، تأكد من الحصول على الموافقة، ومعالجة البيانات، وتغطية اللغات مع مزود الخدمة الخاص بك.
تقوم شركة Exotel بتطوير تقنية الذكاء الاصطناعي الصوتي على منصة الاتصالات السحابية الخاصة بها، لذا فإن الروبوت الصوتي ليس أداة منفصلة تم إضافتها لاحقًا؛ بل إنه جزء لا يتجزأ من النظام الذي يقوم بالفعل بتوجيه مكالماتك. الـ روبوت صوتي مدعوم بتقنية الذكاء الاصطناعي العام يتحدث الهندية والإنجليزية و«الهينجليش»، ويعمل على مدار الساعة طوال أيام الأسبوع، ويكتشف نية المتصل والمقاطعات، ويحيل المكالمة إلى موظف بشري مع ملخص كامل والتفاصيل التي جمعها كلما دعت الحاجة إلى تدخل بشري.
ويوجد أسفل ذلك AgentStream، وهي طبقة البث الصوتي في الوقت الفعلي من Exotel التي تربط وكيل الذكاء الاصطناعي بالمتصلين عبر خطوط الهاتف وواتساب والتطبيقات. تشير Exotel إلى زمن انتقال أقل من 20 مللي ثانية لطبقة النقل هذه؛ وهي بمثابة البنية التحتية التي تحافظ على شعور المحادثة بأنها مباشرة، وهي منفصلة عن زمن الاستجابة من طرف إلى طرف الذي يتراوح بين 300 و800 مللي ثانية والذي تمت مناقشته سابقًا. ونظرًا لأن الوكيل الصوتي ومركز الاتصال الخاص بك يشتركان في منصة واحدة، فإنك ترى كل محادثة في مكان واحد، سواء تمت معالجتها بواسطة روبوت أو شخص.
لا. يتعامل «الروبوت التخاطبي» مع النصوص، وعادةً ما يكون ذلك على موقع إلكتروني أو تطبيق مراسلة. أما الذكاء الاصطناعي الصوتي فيتعامل مع المحادثات المنطوقة عبر مكالمة هاتفية أو جهاز ما، لذا فهو يضم ميزات التعرف على الكلام، وتوليف الكلام، وتبادل الأدوار في الوقت الفعلي. ويشترك كلاهما في نفس «الدماغ» المسؤول عن فهم اللغة، ولهذا السبب تعمل العديد من الشركات على تشغيلهما معًا.
عادةً ما يتم تحديد الأسعار على أساس الدقيقة المتصلة، وتتراوح بين 3 و15 روبية، أو ما بين 12 و25 روبية لكل اتصال تم حله، مقارنةً بـ40 إلى 120 روبية في حالة الاتصال الهاتفي البشري. وتشمل التكلفة الفعلية أيضًا تكاليف الاتصالات الهاتفية، والتكامل، والضبط، وطبقة التصعيد البشري؛ لذا، يجب وضع نموذج يراعي هذا المزيج بدلاً من الاعتماد على سعر الدقيقة وحدها.
نعم. يشمل التعرف على الكلام وتوليفه باللغات الهندية الآن اللغة الهندية والإنجليزية و«الهينجليش» (مزيج من الهندية والإنجليزية) واللغات الإقليمية الرئيسية، مع وجود نماذج مفتوحة مثل AI4Bharat التي تغطي 13 لغة أو أكثر. وتبلغ الدقة أقصى مستوياتها في المهام المحددة بوضوح، مثل التحقق من الرصيد أو حالة الطلبات، لذا يُنصح باختبارها باستخدام كلام عملائك قبل توسيع نطاق الاستخدام.
ليس بشكل شامل. فهي تتولى معالجة المكالمات المتكررة وذات الحجم الكبير، مثل الاستفسارات عن حالة الطلبات، ورموز OTP، والتذكيرات، مما يتيح للموظفين التركيز على المهام المعقدة أو الحساسة. وتتوقع شركة «جارتنر» أن يتمكن الذكاء الاصطناعي الذي يعمل من خلال الموظفين من حل حوالي 80% من مشكلات الخدمة الشائعة بحلول عام 2029، لكن النموذج المستدام يجمع بين الذكاء الاصطناعي والموظفين البشريين ويقوم بتحويل المكالمات إليهم بسلاسة.
تتطلب المحادثة الطبيعية ردًا في غضون حوالي 300 إلى 800 مللي ثانية، حيث إن الناس لا يتوقفون إلا لمدة تتراوح بين 200 و300 مللي ثانية بين كل دور وآخر. وتحقق الأنظمة الحديثة ذلك من خلال التعرف على الكلام المتدفق، ونموذج لغوي سريع، وإخراج الكلام المتدفق، بالإضافة إلى ميزة «المقاطعة» التي تتيح للمتصلين المقاطعة. أما إذا استغرق الرد أكثر من ثانية، فإن المحادثة تبدأ في أن تبدو آلية.
يمكن أن يكون الأمر كذلك، شريطة أن يتم تنفيذه بشكل صحيح. ينص قانون DPDP الهندي لعام 2023 على ضرورة الحصول على موافقة حرة ومحددة ومستنيرة قبل معالجة البيانات الشخصية، بما في ذلك التسجيلات والنصوص المكتوبة، بالإضافة إلى إشعار واضح بالخصوصية. كما تنظم قواعد هيئة تنظيم الاتصالات في الهند (TRAI) المكالمات الصادرة الآلية. ويعتمد الامتثال على طريقة الحصول على الموافقة ومعالجة البيانات، وليس على الذكاء الاصطناعي وحده.
يعمل الذكاء الاصطناعي الصوتي بأفضل أداء عندما تعامله كزميل في الفريق خلال المكالمات الأكثر ازدحامًا وتكرارًا، وتقيس مدى قدرته على احتواء المكالمات بصدق، وتحرص على تسليم المكالمات إلى الموظفين بشكل سلس في جميع الحالات الأخرى. ابدأ بنية واحدة ذات حجم مكالمات كبير، وأثبت فعاليتها من خلال الأرقام الموجودة في بياناتك الخاصة، ثم قم بالتوسع انطلاقًا من ذلك. لمعرفة كيف يبدو الوكيل الصوتي الذي يتحدث باللغة العامية ويتميز بزمن استجابة منخفض على منصة واحدة، استكشف Exotel’s روبوت صوتي مدعوم بتقنية الذكاء الاصطناعي العام.
الجهات الحكومية والرقابية
البحث والصناعة
التقنية والأكاديمية
مثال من القطاع الصناعي
تقوم شركة Exotel بتطوير تقنيات الاتصالات التي تُبسط المحادثات التجارية. تأسست الشركة في عام 2011، وتدعم أكثر من 25 مليار محادثة مع العملاء سنويًّا لأكثر من 7,000 شركة عبر خدمات الصوت والدردشة والروبوتات ومراكز الاتصال، كل ذلك من خلال منصة سحابية واحدة، كما تتعاون مع علامات تجارية مثل Swiggy وUber. وبالنسبة لتقنية الذكاء الاصطناعي الصوتي على وجه التحديد، تتيح تقنية Voicebot المدعومة بتقنية Gen AI وطبقة البث AgentStream للفرق تشغيل وكلاء صوتيين يتحدثون باللغة المحلية وذوي زمن استجابة منخفض جنبًا إلى جنب مع مركز الاتصال الخاص بهم.