يعد القياس الآلي لجودة نماذج تحويل النص إلى كلام (TTS) أمرًا صعبًا للغاية. يعد تقييم طبيعة الصوت ونبرة الصوت مهمة تافهة بالنسبة للبشر، ولكنها أكثر صعوبة بالنسبة للذكاء الاصطناعي. ولهذا السبب، يسعدنا اليوم أن نعلن عن TTS Arena. مستوحاة من Chatbot Arena الخاص بـ LMSys لـ LLMs، قمنا بتطوير أداة تسمح لأي شخص بمقارنة نماذج TTS جنبًا إلى جنب بسهولة. ما عليك سوى إرسال بعض النصوص، والاستماع إلى نموذجين مختلفين يتحدثان عن ذلك، والتصويت على النموذج الذي تعتقد أنه الأفضل. سيتم تنظيم النتائج في لوحة صدارة تعرض النماذج الأعلى تقييمًا في المجتمع.

تحفيز

لقد افتقر مجال تركيب الكلام منذ فترة طويلة إلى طريقة دقيقة لقياس جودة النماذج المختلفة. المقاييس الموضوعية مثل WER (معدل خطأ الكلمات) هي مقاييس غير موثوقة لجودة النموذج، والمقاييس الذاتية مثل MOS (متوسط ​​درجة الرأي) عادة ما تكون تجارب صغيرة الحجم يتم إجراؤها مع عدد قليل من المستمعين. ونتيجة لذلك، فإن هذه القياسات ليست مفيدة بشكل عام لمقارنة نموذجين لهما نفس الجودة تقريبًا. ولمعالجة هذه العيوب، فإننا ندعو المجتمع إلى تصنيف النماذج في واجهة سهلة الاستخدام. من خلال فتح هذه الأداة ونشر النتائج للجمهور، نهدف إلى إضفاء الطابع الديمقراطي على كيفية تصنيف النماذج وجعل مقارنة النماذج واختيارها في متناول الجميع.

ساحة تي تي إس

إن التصنيف البشري لأنظمة الذكاء الاصطناعي ليس نهجًا جديدًا. في الآونة الأخيرة، طبقت LMSys هذه الطريقة في Chatbot Arena الخاصة بها وحققت نتائج رائعة، حيث جمعت أكثر من 300000 تصنيف حتى الآن. ونظرًا لنجاحه، اعتمدنا إطارًا مشابهًا للوحة المتصدرين الخاصة بنا، حيث قمنا بدعوة أي شخص لتصنيف الصوت المركب.

تسمح لوحة المتصدرين للمستخدم بإدخال النص، والذي سيتم تجميعه بواسطة نموذجين. بعد الاستماع إلى كل عينة، سيقوم المستخدم بالتصويت على النموذج الذي يبدو أكثر طبيعية. ونظرًا لمخاطر التحيز البشري وإساءة الاستخدام، لن يتم الكشف عن أسماء النماذج إلا بعد تقديم التصويت.

نماذج مختارة

لقد اخترنا العديد من نماذج SOTA (حالة الفن) للوحة المتصدرين الخاصة بنا. في حين أن معظمها عبارة عن نماذج مفتوحة المصدر، فقد قمنا أيضًا بتضمين العديد من النماذج الخاصة للسماح للمطورين بمقارنة حالة تطوير المصادر المفتوحة مع النماذج الخاصة.

النماذج المتوفرة عند الإطلاق هي:

  • ElevenLabs (ملكية خاصة)
  • ميتافويس
  • صوت مفتوح
  • فيمي
  • WhisperSpeech
  • XTTS

على الرغم من وجود العديد من النماذج الأخرى مفتوحة ومغلقة المصدر المتاحة، فقد اخترنا هذه النماذج لأنها مقبولة بشكل عام باعتبارها النماذج الأعلى جودة المتاحة للجمهور.

لوحة المتصدرين TTS

سيتم إتاحة نتائج التصويت في الساحة للجمهور في لوحة صدارة مخصصة. علماً أنها ستكون فارغة في البداية حتى يتم تجميع العدد الكافي من الأصوات، ثم ستظهر النماذج تدريجياً. عندما يرسل المقيمون أصواتًا جديدة، سيتم تحديث لوحة المتصدرين تلقائيًا.

على غرار Chatbot Arena، سيتم تصنيف النماذج باستخدام خوارزمية مشابهة لنظام التصنيف Elo، الشائع الاستخدام في الشطرنج والألعاب الأخرى.

خاتمة

نأمل أن تثبت TTS Arena أنها مصدر مفيد لجميع المطورين. نحن نحب أن نسمع تعليقاتك! من فضلك لا تتردد في إعلامنا إذا كان لديك أي أسئلة أو اقتراحات عن طريق إرسال لنا X/ تويتر رسالة مباشرةأو عن طريق فتح مناقشة في علامة تبويب المجتمع في المساحة.

الاعتمادات

شكر خاص لجميع الأشخاص الذين ساعدوا في جعل هذا ممكنا، بما في ذلك كليمنتين فورييه, لوسيان بوجيه, يواش لاكومب, الحصان الرئيسيوفريق Hugging Face. على وجه الخصوص، أود أن أشكر VB لوقته والمساعدة الفنية. وأود أيضا أن أشكر سانشيت غاندي و أبوليناريو باسوس لملاحظاتهم ودعمهم أثناء عملية التطوير.



شاركها.
اترك تعليقاً