
مولد الصوت بالذكاء الاصطناعي هو نظام يقوم بتوليف كلام شبيه بالكلام البشري انطلاقًا من مدخلات، وعادةً ما تكون نصوصًا مكتوبة، على الرغم من أن الأنظمة المتقدمة تقبل أيضًا الإرشادات الصوتية لأغراض استنساخ الصوت أو تحويل الكلام إلى كلام. وتكون النتيجة تدفقًا صوتيًا يبدو طبيعيًا يمكن تقديمه في الوقت الفعلي (لأغراض الذكاء الاصطناعي التخاطبي ومراكز الاتصال) أو تخزينه كملف (لإنتاج المحتوى، والكتب الصوتية، والتعلم الإلكتروني).
وقد مرت هذه التكنولوجيا بثلاث مراحل متميزة:
الخطوة 1: المعالجة المسبقة للنص والتحليل اللغوي يتم توحيد النص المدخل، مع توسيع الأرقام والاختصارات والرموز (فيصبح «Rs. 1,200» «ألف ومائتا روبية»). ويتم تحليل بنية الجملة لتحديد حدود العبارات، كما تعمل خرائط التحويل من الحروف إلى الأصوات (G2P) على ربط الكلمات المكتوبة بتمثيلاتها الصوتية، مع معالجة الاستثناءات والنطق الذي يعتمد على السياق.
الخطوة 2: التنبؤ بالنغمة يتنبأ نموذج عصبي بنغمة الكلام: أي المقاطع يجب التشديد عليها، وأين يجب التوقف، وكيف يرتفع النبرة وينخفض على مدار الجملة. وهذا هو ما يميز صوت الذكاء الاصطناعي الذي يبدو طبيعيًا عن الصوت الآلي. تتعلم نماذج النغمة القائمة على «ترانسفورمر» هذه الأنماط من آلاف الساعات من الكلام البشري المُعلَّم.
الخطوة 3: النمذجة الصوتية يتم تمرير تسلسل الفونيمات المُشَرَّح من حيث الإيقاع إلى نموذج صوتي (مثل FastSpeech 2 أو VITS أو بنية عصبية خاصة) يقوم بإنشاء مخطط طيفي ميل، وهو تمثيل مرئي لمحتوى الترددات الصوتية بمرور الوقت.
الخطوة 4: توليف الموجات الصوتية (فوكودر) يقوم جهاز الترميز الصوتي العصبي (WaveNet أو HiFi-GAN أو ما شابههما) بتحويل الطيف الصوتي الميل إلى شكل موجي صوتي خام، أي ملف الصوت الفعلي. وتنتج أجهزة الترميز الصوتي الحديثة صوتًا بجودة البث بمعدلات أخذ عينات تبلغ 22 كيلوهرتز أو 44 كيلوهرتز.
الخطوة 5: التسليم يتم توصيل الصوت المُركَّب عبر البث المباشر (WebSocket للتطبيقات التي تعمل في الوقت الفعلي) أو تنزيل الملفات (WAV، MP3 لإنتاج المحتوى). وتهدف أنظمة الصوت القائمة على الذكاء الاصطناعي التي تعمل في الوقت الفعلي إلى الحفاظ على زمن انتقال الجزء الأول من الصوت أقل من 300 مللي ثانية للحفاظ على انسيابية المحادثة.
نظام الرد الآلي (IVR) في مراكز الاتصال وروبوتات الصوت تحل الأصوات التي يُنتجها الذكاء الاصطناعي محل التوجيهات المسجلة مسبقًا في نظام الرد الآلي (IVR)، مما يتيح إنشاء قوائم ديناميكية تراعي السياق، قادرة على التكيف مع مدخلات المتصل، وتخصيص الردود باستخدام اسم المتصل أو بيانات حسابه، والتحديث الفوري عند تغير المعلومات الخاصة بالشركة. وعلى عكس التوجيهات المسجلة، لا يبدو نظام الرد الآلي (IVR) القائم على تقنية تحويل النص إلى كلام (TTS) قديمًا أو غير ملائم أبدًا.
حملات الإخطارات الصادرة تستخدم البنوك وشركات الخدمات اللوجستية ومقدمو خدمات الرعاية الصحية مولدات الصوت القائمة على الذكاء الاصطناعي لإجراء ملايين المكالمات الصادرة، بما في ذلك تذكيرات السداد وتأكيدات المواعيد وإشعارات التسليم، مع صوت مُصنَّع يتم تخصيصه حسب كل مستلم، ويتم تقديمه بتكلفة للمكالمة أقل بكثير من البدائل التي تعتمد على موظفين بشريين أو الرسائل الصوتية المسجلة.
وكلاء الذكاء الاصطناعي التخاطبيون يحتاج كل مساعد صوتي وروبوت صوتي إلى محرك تحويل النص إلى كلام (TTS) للرد على المستخدمين. وتحدد جودة مولد الصوت القائم على الذكاء الاصطناعي بشكل مباشر ما إذا كان التفاعل يبدو طبيعيًا أم مزعجًا. ويشكل محرك TTS العصبي ذو زمن الاستجابة المنخفض الفارق بين المحادثة السلسة وتلك التي تتخللها فترات توقف آلية.
التعلم الإلكتروني ومحتوى التدريب تستخدم فرق التعلم والتطوير (L&D) برامج توليد الصوت القائمة على الذكاء الاصطناعي لإنتاج وحدات تدريبية مصحوبة بتعليق صوتي، يتم تحديثها بمحتوى جديد كلما طرأت تغييرات على السياسات أو المنتجات، دون الحاجة إلى الاستعانة بمعلقين جدد عند كل تعديل.
إمكانية الوصول توفر برامج قراءة الشاشة التي تعمل بتقنية تحويل النص إلى كلام (TTS) العصبية للمستخدمين ذوي الإعاقة البصرية تجربة أفضل بكثير مقارنةً بالكلام المركب الآلي، مما يحسّن الفهم ويقلل من العبء المعرفي.
إنتاج المحتوى يستخدم مقدمو البودكاست ومنتجو الفيديو والناشرون تقنية توليد الصوت بالذكاء الاصطناعي من أجل السرد السريع، وإنتاج نسخ صوتية مترجمة للمحتوى المكتوب، والتعليق الصوتي في الأسواق التي تكون فيها خدمات المذيعين البشريين باهظة التكلفة أو غير متوفرة.
تُعد «تحويل النص إلى كلام» (TTS) فئة تقنية أوسع نطاقًا، تشمل أي نظام يقوم بتحويل النص إلى كلام. أما «مولد الصوت بالذكاء الاصطناعي» فهو مصطلح أكثر تحديدًا ويركز على القدرات، ويشير إلى أنظمة TTS العصبية المُعززة بميزات مثل استنساخ الصوت، والتحكم في العواطف، والتوليف متعدد اللغات. تستخدم جميع مولدات الصوت الحديثة القائمة على الذكاء الاصطناعي تقنية TTS كمحرك أساسي لها، ولكن ليست جميع أنظمة TTS مؤهلة لتصنف على أنها مولدات صوت كاملة تعتمد على الذكاء الاصطناعي.

Transform customer engagement with our AI Voice Assistant. More than a bot, it’s your conversational partner, fluent in Hindi, English, and Hinglish. Available 24/7, it learns continuously for meaningful, personalised interactions.

Utilizing Gen AI and Natural Language Processing (NLP) capabilities, the House of AI transforms customer conversations into engaging, human-like experiences. It goes deep into understanding context, sentiment, and intent, enabling dynamic, personalized responses that boost engagement and loyalty.

At Exotel, we understand the frustration of support engineers, service managers, IT personnel, sales representatives and customers when placed on hold. ExoInsights provides users with just the right and relevant answer, tailored to their specific queries. It simplifies access to accurate information, making the decision-making process more efficient and user-friendly.

Automate cross-channel conversation quality analysis against your SOPs and KPIs to maintain top-tier service quality and agent efficiency, effortlessly.