يتعاون المعهد الهندي للعلوم IISc وARTPARK مع Hugging Face لتمكين المطورين في جميع أنحاء العالم من الوصول إلى Vaani، مجموعة البيانات المفتوحة المصدر الأكثر تنوعًا ومتعددة الوسائط واللغات في الهند. تشترك المنظمتان في الالتزام ببناء تقنيات ذكاء اصطناعي شاملة وسهلة الوصول ومتطورة تحترم التنوع اللغوي والثقافي.

شراكة

تهدف الشراكة بين Hugging Face وIISc/ARTPARK إلى زيادة إمكانية الوصول إلى مجموعة بيانات Vaani وتحسين إمكانية استخدامها، وتشجيع تطوير أنظمة الذكاء الاصطناعي التي تفهم بشكل أفضل لغات الهند المتنوعة وتلبي الاحتياجات الرقمية لشعبها.

حول مجموعة بيانات فاني

تم إطلاق مشروع Vaani في عام 2022 بواسطة IISc/ARTPARK وGoogle، وهو عبارة عن مبادرة رائدة تهدف إلى إنشاء مجموعة بيانات متعددة الوسائط مفتوحة المصدر تمثل حقًا التنوع اللغوي في الهند. تعتبر مجموعة البيانات هذه فريدة من نوعها في نهجها المتمركز حول الأرض، مما يسمح بجمع اللهجات واللغات المستخدمة في المناطق النائية بدلاً من التركيز فقط على اللغات السائدة.

يهدف Vaani إلى جمع أكثر من 150,000 ساعة من الكلام و15,000 ساعة من البيانات النصية المكتوبة من مليون شخص في جميع المقاطعات البالغ عددها 773 مقاطعة، مما يضمن التنوع في اللغة واللهجات والتركيبة السكانية.

يتم بناء مجموعة البيانات على مراحل، حيث تغطي المرحلة الأولى 80 منطقة، وهي مفتوحة المصدر بالفعل. المرحلة الثانية جارية حاليًا، لتوسيع مجموعة البيانات إلى 100 منطقة أخرى، مما يزيد من تعزيز وصول فاني وتأثيره عبر المشهد اللغوي المتنوع في الهند.


أبرز النقاط في مجموعة بيانات فاني مفتوحة المصدر حتى الآن: (اعتبارًا من 15-02-2025)

توزيع اللغة الحكيمة للمنطقة

تُظهر مجموعة بيانات فاني توزيعًا غنيًا للغات عبر مقاطعات الهند، مما يسلط الضوء على التنوع اللغوي على المستوى المحلي. تعتبر هذه المعلومات ذات قيمة للباحثين ومطوري الذكاء الاصطناعي ومبتكري تكنولوجيا اللغة الذين يتطلعون إلى بناء نماذج كلام مصممة خصيصًا لمناطق ولهجات محددة. لاستكشاف التوزيع التفصيلي للغة على مستوى المنطقة، قم بزيارة: Vaani Dataset على HuggingFace

مجموعة فرعية مكتوبة

إذا كنت بحاجة إلى الوصول إلى البيانات المكتوبة فقط وترغب في تخطي البيانات الصوتية فقط غير المكتوبة، فقد تم فتح مجموعة فرعية من مجموعة البيانات الأكبر هنا. تحتوي مجموعة البيانات هذه على 790 ساعة من الصوت المكتوب، من مكبرات صوت بسعة 7 لتر تقريبًا تغطي 70 ألف صورة. يتضمن هذا المورد وحدات صوتية أصغر حجمًا ومجزأة ومتطابقة مع النسخ الدقيق، مما يسمح بمهام مختلفة بما في ذلك:

  • التعرف على الكلام: نماذج تدريبية لتدوين اللغة المنطوقة بدقة.
  • نمذجة اللغة: بناء نماذج لغوية أكثر دقة.
  • مهام التقسيم: تحديد وحدات الكلام المميزة لتحسين دقة النسخ.

تكمل مجموعة البيانات الإضافية هذه مجموعة بيانات Vaani الرئيسية، مما يجعل من الممكن تطوير أنظمة شاملة للتعرف على الكلام وحلول الذكاء الاصطناعي الأكثر استهدافًا.

فائدة فاني في عصر LLMs

توفر مجموعة بيانات Vaani العديد من المزايا الرئيسية، بما في ذلك التغطية اللغوية الواسعة (54 لغة)، والتمثيل عبر مناطق جغرافية متنوعة، وخلفية تعليمية واجتماعية واقتصادية متنوعة، وتغطية كبيرة جدًا للمتحدثين، وبيانات الكلام التلقائي، وبيئات جمع البيانات الواقعية. يمكن لهذه الميزات تمكين نماذج الذكاء الاصطناعي الشاملة من أجل:

  • تحويل الكلام إلى نص وتحويل النص إلى كلام: ضبط هذه النماذج لكل من LLM والتطبيقات غير المستندة إلى LLM. بالإضافة إلى ذلك، تتيح علامات النسخ إمكانية تطوير نماذج ASR لتبديل التعليمات البرمجية (باللغة الهندية والإنجليزية).
  • نماذج الكلام التأسيسية للغات الهندية: تدعم التغطية اللغوية والجغرافية الهامة لمجموعة البيانات تطوير نماذج أساسية قوية للغات الهندية.
  • نماذج تحديد هوية المتحدث/التحقق منها: مع بيانات من أكثر من 80.000 متحدث، تعد مجموعة البيانات مناسبة تمامًا لتطوير نماذج قوية لتحديد هوية المتحدث والتحقق منها.
  • نماذج تعريف اللغة: تمكن من إنشاء نماذج تعريف اللغة لمختلف تطبيقات العالم الحقيقي.
  • أنظمة تحسين الكلام: يدعم نظام وضع العلامات الخاص بمجموعة البيانات تطوير تقنيات تحسين الكلام المتقدمة.
  • تعزيز LLMs متعدد الوسائط: إن النهج الفريد لجمع البيانات يجعله ذا قيمة لبناء وتحسين قدرات الوسائط المتعددة في LLMs عند دمجه مع مجموعات البيانات متعددة الوسائط الأخرى.
  • قياس الأداء: تعد مجموعة البيانات خيارًا مثاليًا لقياس نماذج الكلام نظرًا لتنوع خصائص البيانات اللغوية والجغرافية والواقعية.

يمكن لنماذج الذكاء الاصطناعي هذه تشغيل مجموعة واسعة من تطبيقات الذكاء الاصطناعي للمحادثة. من الأدوات التعليمية إلى منصات التطبيب عن بعد، وحلول الرعاية الصحية، وخطوط مساعدة الناخبين، وتوطين الوسائط، والأجهزة الذكية متعددة اللغات، يمكن لمجموعة بيانات Vaani أن تغير قواعد اللعبة في سيناريوهات العالم الحقيقي.

ما هي الخطوة التالية

قام IISc/ARTPARK وGoogle بتوسيع الشراكة إلى المرحلة الثانية (100 منطقة إضافية). مع هذا، يغطي فاني جميع الولايات في الهند! نحن متحمسون لتقديم مجموعة البيانات هذه لكم جميعًا.

خريطة المناطق التي تم جمع البيانات فيها
تسلط الخريطة الضوء على المناطق في جميع أنحاء الهند حيث تم جمع البيانات اعتبارًا من 5 فبراير 2025

كيف يمكنك المساهمة

المساهمة الأكثر أهمية التي يمكنك تقديمها هي استخدام مجموعة بيانات Vaani. سواء كنت تقوم بإنشاء تطبيقات جديدة للذكاء الاصطناعي، أو إجراء الأبحاث، أو استكشاف حالات الاستخدام المبتكرة، فإن مشاركتك تساعد في تحسين المشروع وتوسيعه.

سنكون سعداء أن نسمع منك إذا كانت لديك تعليقات أو رؤى حول استخدام مجموعة البيانات. يرجى التواصل مع vaanicontact@gmail.com لمشاركة تجاربك/الاستفسار عن فرص التعاون أو يرجى ملء نموذج التعليقات هذا.

صُنع باستخدام ❤️ من أجل التنوع اللغوي في الهند

شاركها.
اترك تعليقاً