TTS (تحويل النص إلى كلام)

TTS (تحويل النص إلى كلام)

ما هو نظام تحويل النص إلى كلام (TTS)؟

TTS هي اختصار لعبارة «Text-to-Speech». الصيغة الكاملة هي «text-to-speech»، وتُكتب أيضًا «text to speech» أو يُشار إليها باسم «توليف الكلام». وهي التقنية التي تمكّن جهازًا أو تطبيقًا من تحويل النص المكتوب إلى مخرجات صوتية مسموعة.

تُعد تقنية TTS عكس تقنية ASR (التعرف التلقائي على الكلام)، التي تعمل على تحويل الكلام إلى نص. وتشكل هاتان التقنيتان معًا طبقات الإدخال والإخراج في التفاعل الصوتي بين الإنسان والحاسوب. تقوم تقنية ASR بالتقاط ما يقوله الشخص، بينما تقدم تقنية TTS استجابة النظام في شكل صوتي.

نشأت تقنية TTS كتقنية مساعدة في سبعينيات وثمانينيات القرن الماضي، حيث صُممت لمساعدة المستخدمين ذوي الإعاقة البصرية على الوصول إلى المحتوى المكتوب. وهي اليوم تقنية أساسية في المؤسسات، تُستخدم على نطاق واسع في مراكز الاتصال وأنظمة الملاحة ومكبرات الصوت الذكية ومنصات التعلم الإلكتروني ووكلاء الذكاء الاصطناعي التخاطبي.

كيفية عمل تقنية تحويل النص إلى كلام (TTS): مسار المعالجة

المرحلة الأولى: تحليل النص (الواجهة الأمامية) تتم معالجة النص المدخل الخام من خلال مسار تحليل لغوي:

  • توحيد النص: يتم تحويل الأرقام والعملات والتواريخ والاختصارات والرموز إلى نظائرها المنطوقة. فـ«3/12/2024» تصبح «الثالث من ديسمبر عام ألفين وأربعة وعشرين»؛ و«Rs. 500» تصبح «خمسمائة روبية».
  • الكشف عن حدود الجمل: يحدد النظام أين تبدأ الجمل وأين تنتهي، مما يساعد في تحديد مواضع التوقفات في المقطع الصوتي الناتج.
  • تصنيف أجزاء الكلام: يتم تصنيف الكلمات إلى أسماء وأفعال وصفات وما إلى ذلك، مما يحدد أنماط التشديد والتأكيد.
  • تحويل الحروف إلى أصوات (G2P): يتم تحويل الأحرف المكتوبة إلى تسلسلات من الفونيمات، وهي الوحدات الأساسية للصوت. وهذا يتيح التعامل مع حالات التهجئة غير المنتظمة والنطق الذي يعتمد على السياق.

المرحلة الثانية: التنبؤ بالنغمة يتم توقع «البروسودي» — أي إيقاع الكلام وتشديده ونغمته — بواسطة نموذج عصبي. ويحدد الناتج المقاطع التي يجب التشديد عليها، وأين يرتفع النبرة وينخفض، ومدة التوقفات. وهذه المرحلة هي ما يميز نظام تحويل النص إلى كلام (TTS) الذي يبدو طبيعيًا عن الناتج الآلي.

المرحلة الثالثة: النمذجة الصوتية يتم تمرير تسلسل الفونيمات المزود بتعليقات إيقاعية إلى نموذج صوتي يقوم بإنشاء طيف ميل، وهو تمثيل زمني-ترددي للإشارة الصوتية. وتستخدم النماذج الصوتية الحديثة (FastSpeech 2، VITS، Tacotron 2) بنى قائمة على «المحول» أو «التدفق»، تم تدريبها من البداية إلى النهاية على آلاف الساعات من الكلام البشري.

المرحلة الرابعة: توليد شكل الموجة (جهاز فوكودر) يقوم جهاز الترميز الصوتي العصبي (WaveNet، HiFi-GAN، UnivNet) بتحويل الطيف الصوتي الميل إلى شكل موجي صوتي خام. وهذا هو الملف الصوتي الفعلي القابل للتشغيل. تعمل أجهزة الترميز الصوتي العصبية على التخلص من التشويشات والجودة المكتومة التي كانت تتميز بها أجهزة الترميز الصوتي القديمة التي تعتمد على معالجة الإشارات.

المرحلة الخامسة: تسليم المخرجات يتم توصيل الموجة الصوتية كدفق (في الوقت الفعلي، للتطبيقات التفاعلية) أو كملف (WAV، MP3، OGG لإنشاء المحتوى). وبالنسبة لتطبيقات مراكز الاتصال، يُعد البث المباشر أمرًا ضروريًا؛ حيث يجب أن يظل زمن انتقال الصوت الأول أقل من 300 مللي ثانية للحفاظ على تدفق المحادثة بشكل طبيعي.

أنواع أنظمة تحويل النص إلى كلام

  • تحويل النص إلى كلام متسلسل: يقوم تطبيق «Stitches» بدمج مقاطع صوتية مسجلة مسبقًا. جودة الصوت متوسطة، ويبدو متقطعًا عند نقاط الربط، مع مرونة محدودة تقتصر على الكلمات المسجلة.
  • تحويل النص إلى كلام بارامتري: تُنتج النماذج الإحصائية معلمات الكلام. وتكون جودة الصوت أقل من جودة الصوت البشري والصوت الاصطناعي، مع مرونة متوسطة.
  • تحويل النص إلى كلام عصبي: تقوم الشبكات العصبية العميقة بتوليد الكلام من البداية إلى النهاية. وتتميز جودة الصوت بأنها شبيهة بالصوت البشري، مع إيقاع صوتي طبيعي ومرونة عالية.
  • تحويل النص إلى كلام عصبي مع استنساخ الصوت: نظام تحويل النص إلى كلام عصبي (TTS) يعتمد على تمثيل صوتي لمتحدث معين. تتميز جودة الصوت بأنها شبيهة بالصوت البشري ومتوافقة مع صوت المتحدث، مع مرونة عالية جدًا.
  • تحويل النص إلى كلام مع مراعاة العواطف: نظام تحويل النص إلى كلام عصبي (TTS) مع أسلوب عاطفي قابل للتحكم. تتميز جودة الصوت بأنها شبيهة بالصوت البشري ومعبرة، مع مرونة عالية جدًّا.

المزايا الرئيسية لتقنية تحويل النص إلى كلام (TTS) للشركات

  • يلغي الاعتماد على التوجيهات المسجلة: تتطلب أنظمة الرد الآلي (IVR) التي تستخدم مقاطع صوتية مسجلة مسبقًا إجراء جلسات إعادة تسجيل كلما تغير المحتوى. أما تقنية تحويل النص إلى كلام (TTS)، فهي تتيح إجراء تحديثات فورية بمجرد تعديل النص، دون الحاجة إلى استوديو أو مذيع صوتي أو أي تأخير.
  • التخصيص الديناميكي على نطاق واسع: تقوم تقنية تحويل النص إلى كلام (TTS) بتوليد الكلام في الوقت الفعلي من نص يتم إنشاؤه ديناميكيًا، مع إدراج اسم العميل أو رصيد الحساب أو رقم الطلب في الرد الصوتي. وهذا أمر مستحيل مع التسجيلات الصوتية المسجلة مسبقًا.
  • النشر متعدد اللغات من منصة واحدة: تقوم منصة واحدة لتحويل النص إلى كلام (TTS) قائمة على الشبكات العصبية بتوليد إخراج صوتي بعشرات اللغات من خلال نفس مسار معالجة النص، مما يمكّن مراكز الاتصال من خدمة العملاء الإقليميين بلغتهم الأم دون الحاجة إلى الاحتفاظ بمكتبات صوتية منفصلة لكل لغة.
  • الكفاءة من حيث التكلفة: تقضي تقنية تحويل النص إلى كلام (TTS) تمامًا على تكاليف المذيعين لكل جلسة. وبالنسبة لحملات الرد الصوتي التفاعلي (IVR) والحملات الصوتية الصادرة ذات الحجم الكبير، فإن هذا يمثل خفضًا كبيرًا في التكاليف، لا سيما بالنسبة للمؤسسات التي تجري ملايين المكالمات الآلية شهريًّا.
  • نبرة متسقة للعلامة التجارية: تقدم تقنية تحويل النص إلى كلام (TTS) نفس جودة الصوت واللكنة وسرعة النطق في كل مكالمة وفي كل مرة، دون أن تتأثر بالتعب أو المرض أو تقلبات الحالة المزاجية.
  • تحديثات فورية للمحتوى: عندما تتغير الإقرارات التنظيمية أو تفاصيل المنتج أو معلومات الأسعار، يتم تحديث المحتوى الصوتي القائم على تقنية TTS فورًا بمجرد تعديل النص، وهو أمر بالغ الأهمية للقطاعات التي تولي أهمية كبيرة للامتثال التنظيمي، مثل قطاع الخدمات المالية والمصرفية والرعاية الصحية.
  • الامتثال لمعايير إمكانية الوصول: تتيح تقنية تحويل النص إلى كلام العصبية (Neural TTS) استخدام برامج قراءة الشاشة والواجهات الصوتية التي تفي بمعايير إمكانية الوصول (WCAG 2.1، ADA)، مما يجعل المنتجات الرقمية قابلة للاستخدام من قبل المستخدمين ذوي الإعاقة البصرية والمصابين بعُسر القراءة.

حالات استخدام تحويل النص إلى كلام في مراكز الاتصال

التوجيهات الصوتية لنظام الرد الآلي (IVR) يتم تقديم كل رسالة صوتية يسمعها المتصل في نظام الرد الآلي (IVR)، بما في ذلك عبارات الترحيب وخيارات القائمة ورسائل الانتظار وردود الأخطاء، عبر تقنية تحويل النص إلى كلام (TTS) في مراكز الاتصال السحابية الحديثة. وتحل تقنية TTS العصبية محل التسجيلات الصوتية بعبارات صوتية يتم إنشاؤها ديناميكيًا، مما يتيح تقديم عبارات ترحيب مخصصة وتحديثات للمحتوى في الوقت الفعلي.

ردود روبوت الصوت والذكاء الاصطناعي التخاطبي تعد تقنية تحويل النص إلى صوت (TTS) الصوت الذي يعبر به كل موظف في مركز الاتصال المدعوم بالذكاء الاصطناعي. فعندما يرد روبوت صوتي على استفسار ما، يتم تحويل النص الذي تولده طبقة فهم اللغة الطبيعية (NLU) أو طبقة إدارة الحوار إلى صوت بواسطة تقنية TTS قبل إرساله إلى المتصل. ويؤثر زمن الاستجابة لتقنية TTS بشكل مباشر على مدى طبيعية المحادثة من وجهة نظر المستخدم.

المكالمات الصادرة الآلية تستخدم الحملات الصادرة الخاصة بتذكيرات السداد وتأكيدات المواعيد وإشعارات التسليم تقنية تحويل النص إلى كلام (TTS) لتوليد رسائل مخصصة لكل مستلم: «صباح الخير، بريا. القسط الشهري البالغ ثلاثة آلاف روبية مستحق السداد في الخامس عشر من الشهر»، وذلك بتكلفة ونطاق لا يمكن تحقيقهما باستخدام موظفين بشريين أو تسجيلات صوتية مسبقة.

استطلاعات الرأي بعد المكالمة تستخدم استطلاعات رضا العملاء القائمة على نظام الرد الآلي (IVR) تقنية تحويل النص إلى كلام (TTS) لتقديم أسئلة الاستطلاع. وعلى عكس الاستطلاعات المسجلة، يمكن للاستطلاعات القائمة على تقنية TTS تكييف صياغة الأسئلة بشكل ديناميكي وتحديثها على الفور دون الحاجة إلى إعادة التسجيل.

مساعد الوكيل – القراءة بصوت عالٍ تقوم تقنية تحويل النص إلى كلام (TTS) بقراءة الردود المقترحة أو مقالات قاعدة المعرفة أو نصوص الامتثال بصوت عالٍ للموظفين عبر سماعات الرأس الخاصة بهم، مما يتيح لهم التركيز على المحادثة بدلاً من النظر إلى الشاشة.

إمكانية الوصول وبرامج قراءة الشاشة تعمل تقنية تحويل النص إلى كلام (TTS) على تشغيل برامج قراءة الشاشة المدمجة في التطبيقات المصرفية والبوابات الحكومية وبرامج المؤسسات، مما يتيح للمستخدمين ذوي الإعاقة البصرية التنقل في المنتجات الرقمية من خلال الإخراج الصوتي.

التحويل الصوتي النصي مقابل التسجيل الصوتي المسبق: متى يستخدم كل منهما

  • جودة الصوت: يُعد الصوت المسجل مسبقًا هو الأفضل (تسجيل بشري)؛ أما تقنية تحويل النص إلى كلام (TTS) فهي تقترب من المستوى البشري بفضل تقنية TTS العصبية.
  • المحتوى الديناميكي: لا يمكن ذلك مع الملفات الصوتية المسجلة مسبقًا؛ لكنه مدعوم بالكامل مع تقنية تحويل النص إلى كلام (TTS).
  • مدة إنجاز التحديث: يستغرق التسجيل الصوتي المسبق عدة أيام (جلسة إعادة التسجيل)؛ بينما تستغرق تقنية تحويل النص إلى كلام ثوانٍ معدودة (تحرير النص).
  • التكلفة لكل رسالة: تكلفة التسجيل الصوتي المسبق مرتفعة (الاستوديو + المذيع)؛ أما تكلفة تحويل النص إلى كلام (TTS) فهي شبه معدومة عند الاستخدام على نطاق واسع.
  • اللغات التي يغطيها الموقع: يحتاج الصوت المسجل مسبقًا إلى تسجيل واحد لكل لغة؛ بينما يستخدم نظام تحويل النص إلى كلام (TTS) نموذجًا واحدًا لعدة لغات.
  • الأفضل لـ: يُعد الصوت المسجل مسبقًا مناسبًا للمحتوى ذي التأثير الكبير الذي لا يتغير إلا نادرًا (مثل مقدمات العلامات التجارية، والإخلاءات القانونية)؛ بينما تُعد تقنية تحويل النص إلى كلام (TTS) مناسبة للمحتوى الصوتي الديناميكي ذي الحجم الكبير الذي يتم تحديثه بشكل متكرر.

مقاييس جودة تحويل النص إلى كلام

  • متوسط درجة الرأي (MOS): تقييم موحد من قبل المستمعين لدرجة الطبيعة والوضوح على مقياس من 1 إلى 5. تحقق أنظمة تحويل النص إلى كلام (TTS) العصبية درجات تتراوح بين 4.0 و4.4 على مقياس MOS؛ بينما يبلغ متوسط الكلام البشري حوالي 4.5.
  • معدل أخطاء الأحرف (CER): دقة النطق، وهي قياس عدد المرات التي يخطئ فيها نظام تحويل النص إلى كلام (TTS) في نطق الأحرف أو الفونيمات مقارنةً بالمخرجات المتوقعة.
  • زمن الوصول إلى المقطع الأول: الوقت المستغرق من طلب التخليق حتى ظهور أول بايت صوتي. الهدف المحدد للاستخدام في مراكز الاتصال في الوقت الفعلي: أقل من 300 مللي ثانية.
  • عامل الوقت الفعلي (RTF): إذا كانت قيمة RTF أقل من 1.0، يتم إنشاء الصوت بسرعة أكبر من سرعة تشغيله، مما يتيح البث بزمن انتقال منخفض دون الحاجة إلى التخزين المؤقت.
  • درجة الوضوح: يتم قياس ذلك من خلال عرض مخرجات نظام تحويل النص إلى كلام (TTS) على مستمعين بشريين أو أنظمة تحويل الكلام إلى نص (ASR) لاحقة، وقياس دقة التعرف.

هندسة تكنولوجيا تحويل النص إلى كلام (TTS): الطريقة التسلسلية مقابل الطريقة العصبية

تعمل تقنية تحويل النص إلى كلام (TTS) التسلسلية عن طريق تقسيم الكلام المسجل للممثل الصوتي إلى آلاف الوحدات الصغيرة، التي تُعرف بالـ«ديفونات» أو «التريفونات»، ثم ربطها معًا لتشكيل عبارات جديدة. تكون الجودة محدودة لأن الانتقالات بين المقاطع المجمعة تنتج تشويشات مسموعة، كما أن نطاق التعبير يقتصر على ما تم تسجيله في الأصل. تعمل تقنية تحويل النص إلى كلام العصبية (Neural TTS) على تدريب نموذج التعلم العميق مباشرةً على تسجيلات الكلام. يتعلم النموذج توليد الكلام من الصفر، حيث يتنبأ بالخصائص الصوتية ودرجة الصوت وتوقيت كل صوت بدلاً من تجميع أجزاء مسجلة مسبقًا. والنتيجة هي كلام سلس ومعبّر ذو إيقاع طبيعي يمكن تطبيقه على أي نص مدخل، بما في ذلك الكلمات التي لم تُسمع مطلقًا أثناء التدريب. كما تتيح تقنية TTS العصبية استنساخ الصوت: من خلال تكييف نموذج التوليف مع «تضمين المتحدث» المستمد من عينة قصيرة من صوت المتحدث المستهدف، يقوم النظام بتوليد كلام جديد يتطابق مع الخصائص الصوتية للمتحدث، ونبرة صوته، ولهجته، وإيقاعه، وأسلوبه.

تقنية تحويل النص إلى كلام (TTS) في الهند: الاعتبارات اللغوية والتنظيمية

  • إن التنوع اللغوي في الهند، الذي يضم 22 لغة معترف بها رسميًا ومئات اللهجات، فضلاً عن التبديل الشائع بين اللغتين الهندية والإنجليزية، يجعل اختيار نموذج تحويل النص إلى كلام (TTS) أمرًا بالغ الأهمية. وتُظهر أنظمة تحويل النص إلى كلام (TTS) العامة باللغة الإنجليزية أداءً ضعيفًا عند التعامل مع الأسماء والأماكن الهندية والجمل المختلطة اللغويًّا.
  • تتطلب عمليات نشر أنظمة تحويل النص إلى كلام (TTS) على مستوى المؤسسات في الهند نماذج تم تدريبها على بيانات لغوية هندية تمثل المنطقة، مع قواميس مخصصة لأسماء المنتجات والمصطلحات المالية والمصطلحات التنظيمية.
  • تنظم لوائح هيئة تنظيم الاتصالات في الهند (TRAI) محتوى المكالمات الصوتية الآلية. ويجب أن تمتثل الرسائل الصوتية التي يتم إنشاؤها بواسطة تقنية تحويل النص إلى كلام (TTS) في الحملات الصادرة لمتطلبات الموافقة المنصوص عليها في قانون الاتصالات والاتصالات السلكية واللاسلكية لعام 2008 (TCCCPR) والتزامات استبعاد أرقام “لا تزعج” (DND).
  • تندرج تسجيلات المكالمات الخاصة بالتفاعلات التي تتم عبر تقنية تحويل النص إلى كلام (TTS) ضمن نطاق قانون حماية البيانات الشخصية (DPDP) الهندي (2023) والمبادئ التوجيهية المعمول بها الخاصة بالاحتفاظ بالبيانات في كل قطاع على حدة الصادرة عن بنك الاحتياطي الهندي (RBI) وهيئة تنظيم التأمين في الهند (IRDAI).

Keep exploring

key-5

Give Voice to Your Business with Exotel's Voice Platform

Scale business communication with the most reliable and easy-to-use Voice Platform. Begin today to transform your communication, making every conversation a step towards greater success.

key-6

Voice Streaming: Real-Time Call Broadcasting, Quality Monitoring, and Intelligent Bot Building

Instant Voice Bot Deployment and Maintenance-Free Experience: Optimize your Workforce and Enhance Call Outcomes with Real-Time Voice Streaming Technology

key-7

Unplug with Smart Cloud SIP Trunk

Get started Smart cloud SIP trunk capable of next gen features like ai summary, sentiment analysis and host of features on any of the channels like PSTN, Digital voice, App2app instantly with a flexible, reliable and scalable platform - all on the cloud with Exotel - Veeno’s Smart Cloud SIP Trunk to ensure compliance

key-8

Voice Call API

Programmatically control voice calls. Make, receive, and monitor calls using Exotel’s RESTful APIs.