🚀 أول معيار مفتوح لـ ASR بعيد المدى: تقييم موجه من المجتمع عبر 14 غرفة محاكاة، تم التحقق من صحته مقابل قياسات العالم الحقيقي: https://huggingface.co/spaces/treble-technologies/ffasr

📉 الفجوة حقيقية وهي كبيرة: في جميع النماذج المقدمة، تكون نسبة WER للمجال البعيد عند نسبة إشارة إلى ضوضاء (SNR) منخفضة أعلى عدة مرات بشكل ثابت من نسبة WER للمجال القريب في نفس محتوى الكلام

🔬 المنهجية التي يمكنك الوثوق بها: محاكاة قائمة على الموجات الهجينة، والتحقق من صحة المحاكاة إلى الواقع، وتقسيمات المصدر المتحرك في النسخة التجريبية، والصوت المثبت، وأجهزة التقييم الموحدة عبر جميع التقديمات

الدقة والسرعة معا: تقوم مخططات Pareto الأمامية بمتوسط ​​WER مقابل RTFx حتى تتمكن من تقييم المقايضة المناسبة للنشر الخاص بك

👀 المزيد قادم: توجد سيناريوهات متعددة المتحدثين ودعم مجموعة الميكروفون وإلغاء الصدى على خريطة الطريق

تعد الفجوة بين الأداء المعياري والنشر في العالم الحقيقي واحدة من أكثر الإحباطات المستمرة في تطوير ASR. غالبًا ما تتصرف النماذج التي تحقق نتائج جيدة في التقييمات القياسية بشكل مختلف بمجرد تضمين صوتيات الغرفة الحقيقية: الصدى، وضوضاء الخلفية، ومسافة الميكروفون. وتؤثر التفاعلات المعقدة بين هذه العوامل على الأداء بطرق لا تستطيع مقاييس الكلام النظيف التقاطها. إن لوحة المتصدرين FFASR هي محاولتنا لتحديد هذه الفجوة.

تطلق Treble Technologies وHugging Face لوحة المتصدرين لـ Far-Field ASR (FFASR)، وهو أول معيار مفتوح يحركه المجتمع مصمم لتقييم نماذج ASR في ظل ظروف صوتية بعيدة المدى واقعية. لقد أصبح الآن مباشرًا، ونحن ندعو المجتمع إلى إرسال النماذج واستكشاف النتائج والمساعدة في تشكيل ما سيأتي بعد ذلك.

لماذا يهم التقييم الميداني البعيد

لقد توسعت الواجهات الصوتية إلى ما هو أبعد من سماعات الرأس والهاتف الذكي. إن عملاء الذكاء الاصطناعي الصوتي، ونسخ غرف الاجتماعات، والمساعدين داخل السيارة، والروبوتات البشرية، والنظارات الذكية، والأدوات التي تعمل بدون استخدام اليدين، كلها تشهد اعتماداً سريعاً. القاسم المشترك بينها هو أنها تعمل في بيئات معقدة صوتيًا: الصدى، والضوضاء الخلفية، والأصوات المتداخلة، والميكروفون الذي قد يكون في أي مكان من متر واحد إلى عدة أمتار من مكبر الصوت.

ولم يتمكن نموذج تقييم ASR المهيمن من اللحاق بهذا الواقع. تظل معايير الميكروفونات الواضحة هي المعيار، وعلى الرغم من أنها مفيدة لقياس جودة التعرف الأساسي، إلا أنها لا تتنبأ بالأداء في المجال البعيد. قد يتدهور النموذج الذي يعمل بشكل جيد على LibriSpeech أو مجموعات المجال القريب الأخرى بشكل كبير بمجرد دخول صوتيات الغرفة الحقيقية إلى الصورة. على الرغم من وجود العديد من الجهود البحثية حول تقييم الكلام البعيد المدى والصاخب – بما في ذلك CHiME وURGENT وNOIZEUS – إلا أن المجتمع لم يكن لديه طريقة موحدة ومفتوحة لقياس هذا التدهور بشكل متسق عبر النماذج في تنسيق لوحة المتصدرين الذي يتم تحديثه باستمرار. هذا هو ما تم تصميم FFASR من أجله.

التحدي الرئيسي للتقييم الميداني البعيد هو توافر البيانات. يعد جمع التسجيلات بعيدة المدى عبر نطاق تمثيلي لأنواع الغرف ومسافات الميكروفون وظروف الضوضاء على نطاق واسع أمرًا مكلفًا للغاية مع القياسات المادية وحدها. تتيح المحاكاة تغطية تلك المساحة بشكل منهجي وتوسيع التغطية بمرور الوقت دون زيادة مقابلة في تكلفة القياس.

الهدف الآخر لـ FFASR هو تشجيع تطوير النماذج التي تكون قوية بشكل واضح لهذه الظروف. لقد كانت لوحات المتصدرين فعالة تاريخياً في توجيه الجهود البحثية. من خلال جعل الأداء بعيد المدى مرئيًا وقابلاً للمقارنة، نأمل في رفع أولوية القوة الصوتية في العالم الحقيقي عبر المجال.

كيف يتم بناء المعيار

تقوم لوحة المتصدرين FFASR بتقييم النماذج عبر تسعة شروط. الأربعة التي تحدد درجة التصنيف الأولية هي (اعتبارًا من 22 يونيو 2026):

  • المجال القريب (الجاف) – كلام نظيف يتم قياسه في غرفة كاتمة للصدى (على غرار Librispeech ولكن مع الحد الأدنى من الصدى)
  • نسبة الإشارة إلى الضوضاء (SNR) عالية المجال البعيد (أعلى من 14 ديسيبل)
  • المجال البعيد لنسبة الإشارة إلى الضوضاء (SNR) (من 8 إلى 12 ديسيبل)
  • نسبة الإشارة إلى الضوضاء (SNR) منخفضة المجال البعيد (أقل من 6 ديسيبل)

ولإعطاء فكرة عما تبدو عليه هذه الظروف فعليًا، تتيح لك العينات أدناه سماع نفس نطق الكلام مثل الصوت الجاف عديم الصدى، ثم يتم دمجه مع استجابة نبضية للغرفة، وأخيرًا مع إضافة الضوضاء في كل طبقة من مستويات SNR. يعد الفرق بين التسجيل الجاف وحالة المجال البعيد ذات نسبة الإشارة إلى الضوضاء (SNR) المنخفضة مؤشرًا معقولاً لحجم المشكلة التي تقيسها لوحة المتصدرين.

يعمل عمودان إضافيان، تم قياسهما معملًا ومحاكاة معملهما، بمثابة مسار التحقق من المحاكاة إلى الواقع. تشتمل لوحة المتصدرين أيضًا على تقسيمات للمصادر المتحركة، وهي حاليًا في مرحلة تجريبية، والتي تقوم بتقييم النماذج مقابل الصوت حيث يكون مكبر الصوت متحركًا وليس ثابتًا. تعكس هذه الحالة حالات الاستخدام مثل الروبوتات البشرية، والكلام داخل السيارة، والمساعدين الصوتيين المحمولين حيث تتغير الهندسة الصوتية بين مكبر الصوت والميكروفون بشكل مستمر.

يتم إنشاء البيانات الصوتية باستخدام محرك المحاكاة الهجين الخاص بـ Treble، والذي يجمع بين محلل قائم على الموجات عند الترددات المنخفضة إلى المتوسطة مع النمذجة الصوتية الهندسية عند الترددات الأعلى. يلتقط هذا النهج الظواهر الفيزيائية التي غالبًا ما تفوتها طرق المحاكاة الأبسط: الحيود، والتشتت، والتداخل، والسلوك النموذجي. والنتيجة هي بيانات محاكاة تتطابق بشكل وثيق مع الظروف الصوتية المقاسة، والتي يؤكدها العمودان Lab Measured وLab Simulated مباشرة عن طريق إجراء نفس التقييم على كليهما.

تم تضمين أربعة عشر غرفة مفروشة بالكامل في المعيار، تتراوح مساحتها من 20 إلى 470 مترًا مكعبًا وتغطي الحمامات وغرف المعيشة مع الممرات والمكاتب والفصول الدراسية ومساحات المطاعم. يحتوي كل مشهد صوتي على مكبر صوت مستهدف واحد، يتم تسجيله في غرفة كاتمة للصدى لتجنب آثار الصدى من بيئة التسجيل، وما يصل إلى ثلاثة مصادر ضوضاء. يشتمل كل مشهد على مصدر ضوضاء عابر مثل السعال ومصدر ضوضاء مستمر مثل التدفئة والتهوية وتكييف الهواء (HVAC)، عند ثلاثة مستويات من نسبة الإشارة إلى الضوضاء (SNR). تم تصميم هذه التغطية لتعكس التنوع الفعلي للمساحات التي تعمل فيها الأنظمة الصوتية المنتشرة.

إلى جانب WER، تُبلغ لوحة المتصدرين عن RTFx (ثواني الصوت لكل ثانية استدلال) لكل إرسال، ويتم تقييمها على وحدة معالجة الرسومات NVIDIA L4 في ظل ظروف مماثلة. إن الدقة ووقت الاستجابة معًا هما ما يهم في عمليات النشر الحقيقية، كما أن عرض Pareto الأمامي في علامة التبويب “التحليل” يجعل هذه المقايضة واضحة.

تم بناء هذا المعيار على مساحات صوتية محاكاة عبر محرك محاكاة الملكية لشركة Treble Technologies. يمكن العثور على مثال على مخرجات enge في مجموعة بيانات Treble10 التي تم إصدارها العام الماضي، والتي أنشأت خط أنابيب المحاكاة وجعلت سجلات RIR البعيدة المدى متاحة للتدريب والبحث. يقوم FFASR بتوسيع هذا الأساس إلى إطار تقييم موحد مع مجموعة اختبار محتجزة، وتطبيع متسق، وتسجيل تلقائي.

ما تظهره البيانات بالفعل

مع ظهور لوحة المتصدرين، يظهر نمط ثابت عبر جميع النماذج المقدمة: الفجوة بين أداء المجال القريب وأداء المجال البعيد كبيرة، وتنمو بشكل ملحوظ مع انخفاض نسبة الإشارة إلى الضوضاء (SNR). تبدو قيم WER القريبة من المجال، في الكلام النظيف والجاف، قابلة للمقارنة مع ما تحققه نفس النماذج وفقًا للمعايير المحددة. وتحكي WER للمجال البعيد عند مستوى SNR منخفض قصة مختلفة، وغالبًا ما تكون أعلى عدة مرات. يجعل المعيار المعياري هذا التدهور مرئيًا وقابلاً للمقارنة بطريقة كان من الصعب في السابق القيام بها خارج خطوط التقييم الخاصة.

إن واجهة Pareto لمتوسط ​​WER ضد RTFx كاشفة أيضًا. هناك مجموعة حقيقية من الأساليب الممثلة في التقديمات الحالية: النماذج التي تعطي الأولوية للسرعة على حساب بعض الدقة، والنماذج التي تدفع الدقة على حساب الإنتاجية، وعدد أقل يحقق موقعًا تنافسيًا على كلا المحورين. إن تصور هذه المقايضات مقابل دقة المجال البعيد بدلاً من دقة الكلام النظيف ينتج صورة مختلفة ماديًا عن مكان وجود الاختلافات الحقيقية بين الأنظمة. تستحق علامة التبويب “التحليل” الاستكشاف خارج جدول التصنيف الرئيسي.

إحدى الملاحظات التي تستحق تسليط الضوء عليها للمطورين: تشير لوحة المتصدرين إلى كل من WER للمجال القريب (الجاف) والمجال البعيد جنبًا إلى جنب. وهذا الفصل مقصود ومفيد. إنه يجعل من الممكن التمييز بين نموذج دقيق حقًا ونموذج دقيق ولكنه هش بالنسبة للظروف الصوتية، وهو أمر مهم لتحديد ما إذا كان يجب الاستثمار في الضبط الدقيق للمجال البعيد، أو المعالجة المسبقة لتحسين الكلام، أو بنية مختلفة تمامًا.

كيفية التقديم

افتح علامة التبويب “إرسال” في لوحة المتصدرين FFASR، والصق معرف نموذج Hugging Face، ويتم تشغيل التقييم من جانب الخادم مقابل مجموعة البيانات المحفوظة. يدعم خط الأنابيب متغيرات Whisper، وIBM Granite Speech، وCohere Transcribe، وWav2Vec2، وHuBERT CTC، وSpeechBrain ASR، ومعظم بنيات ASR الأخرى على Hub دون أي تكوين مخصص.

بالنسبة للفرق التي تستخدم مجموعات استدلالية أكثر تعقيدًا، بما في ذلك الأنظمة التي تجمع بين تحسين الكلام مع ASR، يتيح لك خيار المُقيم المخصص تحديد ما يناسبك evaluate() وظيفة. يعمل المقيمون المخصصون على Hub Jobs بعد مراجعة المشرف، ويُعد حقل ملاحظات الإرسال مكانًا جيدًا لتوثيق أي خطوات معالجة مسبقة بحيث يمكن للآخرين تفسير النتائج.

طريقة التقييم المخصصة

تستخدم مجموعة التقييم المعلقة 2000 عينة كلام عديمة الصدى عبر 14 غرفة في ثلاث مستويات من نسبة الإشارة إلى الضوضاء (SNR)، ما يقرب من 8 ساعات من الصوت لكل حالة، مع تطبيق تطبيع النص بنمط Whisper بشكل متسق. لا يتم عرض الصوت لمرسليه، لتجنب تلوث مجموعة الاختبار.

ما هو القادم

تشمل الظروف التي نستكشفها بنشاط للمسارات المستقبلية سيناريوهات المتحدثين المتعددين، حيث يكون أكثر من مكبر صوت نشطًا في وقت واحد، وتقييم مجموعة الميكروفون، وتغطية تكوين الشعاع وأساليب التصفية المكانية، وإلغاء الصدى، ذات الصلة بأي جهاز يقوم بتشغيل الصوت أثناء الاستماع أيضًا.

ما نبنيه بعد ذلك سيعتمد على المكان الذي يخبرنا فيه المجتمع بأن الفجوات أكبر. إذا كنت تعمل على بيئة نشر أو حالة استخدام لم يتم تمثيلها بشكل جيد في المعيار الحالي، فنحن نريد أن نسمع منك. تم تصميم لوحة المتصدرين FFASR لتنمو، ويجب أن يعكس الاتجاه الذي تنمو به الاحتياجات الحقيقية.

أرسل نموذجك، واستكشف علامة التبويب “تحليل”، وانشر أفكارك واقتراحاتك في منتدى FFASR، وساعدنا في بناء معيار مفيد بالفعل للمشكلات التي يعمل عليها هذا المجال.

شاركها.
اترك تعليقاً