مولد الصوت بالذكاء الاصطناعي

مولد الصوت بالذكاء الاصطناعي

ما هو مُولِّد الصوت بالذكاء الاصطناعي؟

مولد الصوت بالذكاء الاصطناعي هو نظام يقوم بتوليف كلام شبيه بالكلام البشري انطلاقًا من مدخلات، وعادةً ما تكون نصوصًا مكتوبة، على الرغم من أن الأنظمة المتقدمة تقبل أيضًا الإرشادات الصوتية لأغراض استنساخ الصوت أو تحويل الكلام إلى كلام. وتكون النتيجة تدفقًا صوتيًا يبدو طبيعيًا يمكن تقديمه في الوقت الفعلي (لأغراض الذكاء الاصطناعي التخاطبي ومراكز الاتصال) أو تخزينه كملف (لإنتاج المحتوى، والكتب الصوتية، والتعلم الإلكتروني).

وقد مرت هذه التكنولوجيا بثلاث مراحل متميزة:

  • تحويل النص إلى كلام (TTS) التسلسلي (قبل عام 2016): مقاطع صوتية مسجلة مسبقًا تم ربطها معًا بواسطة أنظمة تعتمد على القواعد. وكان الصوت الناتج آليًا ويفتقر إلى الإيقاع الطبيعي.
  • نظام تحويل النص إلى كلام إحصائي بارامتري (2016-2019): أنتجت النماذج الإحصائية معلمات صوتية، مما أدى إلى إخراج أكثر سلاسة، لكنه لا يزال يبدو صوتًا اصطناعيًّا.
  • تقنية تحويل النص إلى كلام العصبية / توليد الصوت بالذكاء الاصطناعي (2019 حتى الآن): تقوم الشبكات العصبية العميقة، التي تم تدريبها على ساعات من الكلام البشري الحقيقي، بتوليد صوت من الصفر، مع التقاط النغمة والتشديد والفروق العاطفية الدقيقة وأسلوب الكلام. وغالبًا ما يتعذر التمييز بين الناتج والكلام البشري في اختبارات الاستماع العمياء.

كيف يعمل مولد الصوت القائم على الذكاء الاصطناعي: خطوة بخطوة

الخطوة 1: المعالجة المسبقة للنص والتحليل اللغوي يتم توحيد النص المدخل، مع توسيع الأرقام والاختصارات والرموز (فيصبح «Rs. 1,200» «ألف ومائتا روبية»). ويتم تحليل بنية الجملة لتحديد حدود العبارات، كما تعمل خرائط التحويل من الحروف إلى الأصوات (G2P) على ربط الكلمات المكتوبة بتمثيلاتها الصوتية، مع معالجة الاستثناءات والنطق الذي يعتمد على السياق.

الخطوة 2: التنبؤ بالنغمة يتنبأ نموذج عصبي بنغمة الكلام: أي المقاطع يجب التشديد عليها، وأين يجب التوقف، وكيف يرتفع النبرة وينخفض على مدار الجملة. وهذا هو ما يميز صوت الذكاء الاصطناعي الذي يبدو طبيعيًا عن الصوت الآلي. تتعلم نماذج النغمة القائمة على «ترانسفورمر» هذه الأنماط من آلاف الساعات من الكلام البشري المُعلَّم.

الخطوة 3: النمذجة الصوتية يتم تمرير تسلسل الفونيمات المُشَرَّح من حيث الإيقاع إلى نموذج صوتي (مثل FastSpeech 2 أو VITS أو بنية عصبية خاصة) يقوم بإنشاء مخطط طيفي ميل، وهو تمثيل مرئي لمحتوى الترددات الصوتية بمرور الوقت.

الخطوة 4: توليف الموجات الصوتية (فوكودر) يقوم جهاز الترميز الصوتي العصبي (WaveNet أو HiFi-GAN أو ما شابههما) بتحويل الطيف الصوتي الميل إلى شكل موجي صوتي خام، أي ملف الصوت الفعلي. وتنتج أجهزة الترميز الصوتي الحديثة صوتًا بجودة البث بمعدلات أخذ عينات تبلغ 22 كيلوهرتز أو 44 كيلوهرتز.

الخطوة 5: التسليم يتم توصيل الصوت المُركَّب عبر البث المباشر (WebSocket للتطبيقات التي تعمل في الوقت الفعلي) أو تنزيل الملفات (WAV، MP3 لإنتاج المحتوى). وتهدف أنظمة الصوت القائمة على الذكاء الاصطناعي التي تعمل في الوقت الفعلي إلى الحفاظ على زمن انتقال الجزء الأول من الصوت أقل من 300 مللي ثانية للحفاظ على انسيابية المحادثة.

أنواع توليد الصوت باستخدام الذكاء الاصطناعي

  • تحويل النص إلى كلام (TTS): يحول النص المكتوب إلى كلام باستخدام نموذج صوتي جاهز. الحالات الرئيسية للاستخدام: نظام الرد الآلي (IVR)، الروبوتات الصوتية، سرد المحتوى.
  • استنساخ الصوت: تقوم بتقليد صوت متحدث معين استنادًا إلى عينة صوتية قصيرة (لا تزيد مدتها عن 30 ثانية). الاستخدام الرئيسي: إنشاء صوت العلامة التجارية، والمساعدات الشخصية.
  • تحويل الكلام إلى كلام: يحول كلام صوت ما إلى صوت آخر في الوقت الفعلي، دون المرور بالنص. الاستخدام الرئيسي: تحويل الصوت المباشر، والدبلجة.
  • تحويل النص إلى كلام (TTS) الذي يتم التحكم فيه عاطفيًا: يُنتج كلامًا بنبرة عاطفية محددة (متعاطفة، حازمة، متحمسة). الحالة الاستخدامية الرئيسية: روبوتات خدمة العملاء، التعلم الإلكتروني.
  • تحويل النص إلى كلام متعدد اللغات: نموذج واحد يُنتج الكلام بعدة لغات ولهجات. الحالة الاستخدامية الرئيسية: مراكز الاتصال العالمية، وأنظمة الرد الآلي متعددة اللغات.

المزايا الرئيسية لمولدات الصوت القائمة على الذكاء الاصطناعي

  • يلغي الاعتماد على التسجيل: يمكن إنتاج المحتوى الذي كان يتطلب في السابق جلسات تسجيل في الاستوديو وممثلين صوتيين برمجيًّا في غضون ثوانٍ، مما يقلل مدة الإنتاج من أيام إلى دقائق.
  • قابلية التوسع اللامحدودة: يمكن لمولد الصوت القائم على الذكاء الاصطناعي معالجة مكالمة واحدة أو مليون مكالمة في آن واحد، دون أي انخفاض في الجودة أو الاتساق. ويُعد هذا أمرًا أساسيًّا لأتمتة مراكز الاتصال على نطاق واسع.
  • اتساق الصوت عبر نقاط التفاعل: يضمن صوت العلامة التجارية الموحد — سواء تم استنساخه أو تصميمه — اتساق النبرة والإيقاع والشخصية عبر نظام الرد الآلي (IVR)، والمكالمات الصادرة، والردود الصوتية لروبوتات الدردشة، والمحتوى التسويقي.
  • تغطية متعددة اللغات دون الحاجة إلى إعادة التسجيل: يُنتج نموذج الصوت نفسه كلامًا باللغات الهندية والتاميلية والتيلوغوية والكانادية والإنجليزية ولغات أخرى انطلاقًا من نفس النص المدخل، مما يتيح التفاعل مع العملاء على المستوى الإقليمي دون الحاجة إلى إعادة إنشاء موارد الصوت.
  • خفض التكاليف: يُغني توليد الصوت باستخدام الذكاء الاصطناعي عن تكاليف المذيعين بالدقيقة، واستئجار الاستوديوهات، وعمليات التحرير في مرحلة ما بعد الإنتاج. وبالنسبة لتطبيقات مراكز الاتصال ذات الحجم الكبير، تنخفض تكلفة الدقيقة الصوتية بنسبة 90% أو أكثر مقارنةً بالتوجيهات المسجلة.
  • التخصيص في الوقت الفعلي: يمكن لتقنية تحويل النص إلى كلام (TTS) الديناميكية إدراج البيانات الخاصة بالعميل (الاسم، رقم الحساب، مبلغ المعاملة) في الكلام المُولَّد صوتياً في الوقت الفعلي، مما يتيح إجراء تفاعلات صوتية مخصصة على نطاق واسع، وهو ما يتعذر تحقيقه باستخدام التسجيلات الصوتية المسبقة.
  • التكرار السريع: لا يتطلب تحديث موجه نظام الرد الآلي (IVR) أو رسالة إعلامية سوى تعديل النص وإعادة توليفه، دون الحاجة إلى جلسة تسجيل جديدة. ويمكن للشركات تحديث المحتوى الصوتي في غضون ساعات بدلاً من أسابيع.

حالات استخدام مولد الصوت بالذكاء الاصطناعي

نظام الرد الآلي (IVR) في مراكز الاتصال وروبوتات الصوت تحل الأصوات التي يُنتجها الذكاء الاصطناعي محل التوجيهات المسجلة مسبقًا في نظام الرد الآلي (IVR)، مما يتيح إنشاء قوائم ديناميكية تراعي السياق، قادرة على التكيف مع مدخلات المتصل، وتخصيص الردود باستخدام اسم المتصل أو بيانات حسابه، والتحديث الفوري عند تغير المعلومات الخاصة بالشركة. وعلى عكس التوجيهات المسجلة، لا يبدو نظام الرد الآلي (IVR) القائم على تقنية تحويل النص إلى كلام (TTS) قديمًا أو غير ملائم أبدًا.

حملات الإخطارات الصادرة تستخدم البنوك وشركات الخدمات اللوجستية ومقدمو خدمات الرعاية الصحية مولدات الصوت القائمة على الذكاء الاصطناعي لإجراء ملايين المكالمات الصادرة، بما في ذلك تذكيرات السداد وتأكيدات المواعيد وإشعارات التسليم، مع صوت مُصنَّع يتم تخصيصه حسب كل مستلم، ويتم تقديمه بتكلفة للمكالمة أقل بكثير من البدائل التي تعتمد على موظفين بشريين أو الرسائل الصوتية المسجلة.

وكلاء الذكاء الاصطناعي التخاطبيون يحتاج كل مساعد صوتي وروبوت صوتي إلى محرك تحويل النص إلى كلام (TTS) للرد على المستخدمين. وتحدد جودة مولد الصوت القائم على الذكاء الاصطناعي بشكل مباشر ما إذا كان التفاعل يبدو طبيعيًا أم مزعجًا. ويشكل محرك TTS العصبي ذو زمن الاستجابة المنخفض الفارق بين المحادثة السلسة وتلك التي تتخللها فترات توقف آلية.

التعلم الإلكتروني ومحتوى التدريب تستخدم فرق التعلم والتطوير (L&D) برامج توليد الصوت القائمة على الذكاء الاصطناعي لإنتاج وحدات تدريبية مصحوبة بتعليق صوتي، يتم تحديثها بمحتوى جديد كلما طرأت تغييرات على السياسات أو المنتجات، دون الحاجة إلى الاستعانة بمعلقين جدد عند كل تعديل.

إمكانية الوصول توفر برامج قراءة الشاشة التي تعمل بتقنية تحويل النص إلى كلام (TTS) العصبية للمستخدمين ذوي الإعاقة البصرية تجربة أفضل بكثير مقارنةً بالكلام المركب الآلي، مما يحسّن الفهم ويقلل من العبء المعرفي.

إنتاج المحتوى يستخدم مقدمو البودكاست ومنتجو الفيديو والناشرون تقنية توليد الصوت بالذكاء الاصطناعي من أجل السرد السريع، وإنتاج نسخ صوتية مترجمة للمحتوى المكتوب، والتعليق الصوتي في الأسواق التي تكون فيها خدمات المذيعين البشريين باهظة التكلفة أو غير متوفرة.

مولد الصوت بالذكاء الاصطناعي مقابل تحويل النص إلى كلام (TTS): ما الفرق بينهما؟

تُعد «تحويل النص إلى كلام» (TTS) فئة تقنية أوسع نطاقًا، تشمل أي نظام يقوم بتحويل النص إلى كلام. أما «مولد الصوت بالذكاء الاصطناعي» فهو مصطلح أكثر تحديدًا ويركز على القدرات، ويشير إلى أنظمة TTS العصبية المُعززة بميزات مثل استنساخ الصوت، والتحكم في العواطف، والتوليف متعدد اللغات. تستخدم جميع مولدات الصوت الحديثة القائمة على الذكاء الاصطناعي تقنية TTS كمحرك أساسي لها، ولكن ليست جميع أنظمة TTS مؤهلة لتصنف على أنها مولدات صوت كاملة تعتمد على الذكاء الاصطناعي.

  • جودة الصوت: يُعتبر نظام تحويل النص إلى كلام (TTS) الأساسي مقبولاً، لكنه محدود من حيث الطابع الطبيعي؛ أما مولد الصوت القائم على الذكاء الاصطناعي فهو شبيه بالصوت البشري ويتميز بالتعبير العاطفي.
  • استنساخ الصوت: غير مدعوم في ميزة تحويل النص إلى كلام (TTS) الأساسية؛ مدعوم في مولدات الأصوات التي تعمل بالذكاء الاصطناعي (بحد أدنى 30 ثانية من التسجيل الصوتي).
  • التحكم في العواطف: لا تتوفر هذه الميزة في أنظمة تحويل النص إلى كلام (TTS) الأساسية؛ لكنها قابلة للتكوين في مولدات الأصوات التي تعتمد على الذكاء الاصطناعي (التعاطف، الإلحاح، الحماس).
  • اللغات: تتميز تقنية تحويل النص إلى كلام (TTS) الأساسية بمحدودية إمكانياتها وبلكنة ثقيلة؛ أما مولدات الأصوات التي تعمل بالذكاء الاصطناعي فهي متعددة اللغات وتتميز بنمذجة طبيعية لللكنة.
  • زمن الاستجابة: تكون سرعة تحويل النص إلى كلام (TTS) الأساسية أعلى، وغالبًا ما تكون متاحة فقط في وضع المعالجة الدفعية؛ أما مولدات الأصوات القائمة على الذكاء الاصطناعي، فتوفر بثًا بسرعة أقل من 300 مللي ثانية للاستخدام في الوقت الفعلي.
  • التخصيص: تعد تقنية تحويل النص إلى صوت (TTS) الأساسية عملية ثابتة؛ أما مولدات الأصوات القائمة على الذكاء الاصطناعي فهي ديناميكية وتتيح إدراج الأسماء والبيانات.

المؤشرات الرئيسية لقياس جودة مولد الصوت القائم على الذكاء الاصطناعي

  • متوسط درجة الرأي (MOS): درجة «الطبيعية» وفقًا لتقييم المستمعين على مقياس من 1 إلى 5. يبلغ معدل «الطبيعية» للكلام البشري حوالي 4.5. أما أفضل أنظمة تحويل النص إلى كلام (TTS) العصبية فتتراوح درجاتها بين 4.2 و4.4.
  • معدل أخطاء الكلمات (WER) في مرحلة ما بعد التعرف الصوتي (ASR): مؤشر يوضح مدى دقة أنظمة التعرف الصوتي الآلي (ASR) في تحويل الكلام الذي تم إنشاؤه بواسطة تقنية تحويل النص إلى كلام (TTS) إلى نص مكتوب. كلما انخفضت القيمة، كان ذلك أفضل.
  • زمن الوصول إلى المقطع الأول: الوقت المستغرق من طلب واجهة برمجة التطبيقات (API) حتى أول بايت صوتي. الهدف: أقل من 300 مللي ثانية للاستخدام في المحادثات في الوقت الفعلي.
  • عامل الوقت الفعلي (RTF): نسبة وقت الإنشاء إلى مدة الصوت. إذا كانت قيمة RTF أقل من 1.0، فهذا يعني أن عملية الإنشاء أسرع من التشغيل، وهو ما يُعد شرطًا أساسيًا للبث المباشر.
  • درجة تشابه استنساخ الصوت: مدى التشابه الجيبي بين تمثيلات المتحدث للصوت الأصلي والصوت المستنسخ. تحقق أفضل الأنظمة درجة تشابه تزيد عن 0.85.

توليد الأصوات باستخدام الذكاء الاصطناعي في الهند: السياق السوقي والتنظيمي

  • يتطلب التنوع اللغوي في الهند، الذي يضم 22 لغة معترف بها رسميًا ومئات اللهجات، نماذج صوتية تم تدريبها على بيانات تمثل مختلف المناطق، وليس فقط على اللغة الهندية أو الإنجليزية بشكل عام.
  • يُعد التبديل بين اللغات (الخلط بين الهندية والإنجليزية في منتصف الجملة) أمرًا معتادًا في اللهجة الحضرية الهندية، ويجب أن تتعامل أنظمة تحويل النص إلى كلام (TTS) الخاصة بالمؤسسات مع ذلك برشاقة.
  • تنظم إرشادات هيئة تنظيم الاتصالات في الهند (TRAI) الاتصالات الصوتية الآلية، بما في ذلك متطلبات الحصول على الموافقة فيما يتعلق بالمكالمات الصادرة التي يتم إنشاؤها بواسطة الذكاء الاصطناعي.
  • ينطبق قانون DPDP الهندي (2023) على البيانات الصوتية المستخدمة في استنساخ الصوت؛ ويجب الالتزام بمبادئ الموافقة وتقليل البيانات إلى الحد الأدنى.

Keep exploring

key-9

Elevate Customer Experiences with GenAI powered Voice Bot

Transform customer engagement with our AI Voice Assistant. More than a bot, it’s your conversational partner, fluent in Hindi, English, and Hinglish. Available 24/7, it learns continuously for meaningful, personalised interactions.

key-10

Hub of advanced AI technologies for modern conversational AI.

Utilizing Gen AI and Natural Language Processing (NLP) capabilities, the House of AI transforms customer conversations into engaging, human-like experiences. It goes deep into understanding context, sentiment, and intent, enabling dynamic, personalized responses that boost engagement and loyalty.

key-11

Enabling conversations with documents and knowledge bases to enhance productivity.

At Exotel, we understand the frustration of support engineers, service managers, IT personnel, sales representatives and customers when placed on hold. ExoInsights provides users with just the right and relevant answer, tailored to their specific queries. It simplifies access to accurate information, making the decision-making process more efficient and user-friendly.

key-12

AI-powered Conversation Quality Analysis tool

Automate cross-channel conversation quality analysis against your SOPs and KPIs to maintain top-tier service quality and agent efficiency, effortlessly.