شارك مجتمع الذكاء الاصطناعي والتعلم الآلي أكثر من 180.000 مجموعة بيانات عامة على The Hugging Face Dataset Hub. يستخدم الباحثون والمهندسون مجموعات البيانات هذه في مهام مختلفة، بدءًا من تدريب حاملي شهادة الماجستير في القانون إلى الدردشة مع المستخدمين وحتى تقييم التعرف التلقائي على الكلام أو أنظمة الرؤية الحاسوبية. تعد قابلية اكتشاف مجموعة البيانات وتصورها من التحديات الرئيسية أمام السماح لمنشئي الذكاء الاصطناعي بالعثور على مجموعات البيانات واستكشافها وتحويلها لتناسب حالات الاستخدام الخاصة بهم.
في Hugging Face، نقوم ببناء Dataset Hub كمكان للمجتمع للتعاون في مجموعات البيانات المفتوحة. لذلك قمنا ببناء أدوات مثل Dataset Search وDataset Viewer، بالإضافة إلى نظام بيئي غني بالأدوات مفتوحة المصدر. نعلن اليوم عن أربع ميزات جديدة من شأنها أن تنقل البحث في مجموعة البيانات على المركز إلى المستوى التالي.
البحث حسب الطريقة
تتوافق طريقة مجموعة البيانات مع نوع البيانات الموجودة داخل مجموعة البيانات. على سبيل المثال، أكثر أنواع البيانات شيوعًا في Hugging Face هي البيانات النصية والصورية والصوتية والبيانات الجدولية.
لقد أصدرنا مجموعة من المرشحات التي تسمح لك بتصفية مجموعات البيانات التي تحتوي على طريقة واحدة أو أكثر من بين هذه القائمة:
- نص
- صورة
- صوتي
- مجدول
- السلسلة الزمنية
- 3D
- فيديو
- الجغرافية المكانية
على سبيل المثال، من الممكن البحث عن مجموعات البيانات التي تحتوي على بيانات نصية وبيانات صورية:
يتم اكتشاف طرائق كل مجموعة بيانات تلقائيًا بناءً على محتويات الملف وامتداداته.
البحث حسب الحجم
لقد أصدرنا مؤخرًا ميزة جديدة في الواجهة لإظهار عدد صفوف كل مجموعة بيانات:

بعد ذلك، أصبح من الممكن الآن البحث في مجموعات البيانات حسب عدد الصفوف عن طريق تحديد الحد الأدنى والحد الأقصى لعدد الصفوف. سيتيح لك ذلك البحث عن مجموعات البيانات ذات الحجم الصغير لأكبر مجموعات البيانات الموجودة (على سبيل المثال، تلك المستخدمة للتدريب المسبق لماجستير إدارة الأعمال).
تتوفر المعلومات حول عدد الصفوف لجميع مجموعات البيانات بالتنسيقات المدعومة. حتى بالنسبة لأكبر مجموعات البيانات التي لم يتم تضمين عدد صفوفها في بيانات التعريف، يتم تقدير إجمالي عدد الصفوف بدقة بناءً على محتوى أول 5 جيجابايت.
على سبيل المثال، إذا كنت تنظر إلى مجموعات البيانات التي تحتوي على أكبر عدد من الصفوف في Hugging Face، فيمكنك البحث عن مجموعات البيانات التي تحتوي على أكثر من 10B (1010) الصفوف:

البحث حسب التنسيق
يمكن تخزين مجموعة البيانات نفسها في العديد من التنسيقات المختلفة. على سبيل المثال، غالبًا ما تكون مجموعات البيانات النصية بتنسيق Parquet أو JSON Lines، ولكنها يمكن أن تكون في ملفات نصية، وغالبًا ما تكون مجموعات بيانات الصور دليلًا واحدًا للصور، ولكن يمكن أن تكون بتنسيق WebDataset (تنسيق يعتمد على أرشيفات TAR).
كل شكل له إيجابياته وسلبياته. على سبيل المثال، يوفر Parquet دعمًا للبيانات المتداخلة، على عكس ملف CSV، وتصفية/تحليلات فعالة، ونسبة ضغط جيدة، ولكن الوصول إلى صف واحد محدد يتطلب فك تشفير مجموعة صفوف كاملة. مثال آخر هو WebDataset، الذي يوفر أعلى سرعة لتدفق البيانات ولكنه يفتقر إلى بعض البيانات الوصفية، مثل عدد الصفوف لكل ملف، والتي غالبًا ما تكون مطلوبة لتوزيع البيانات بكفاءة في إعدادات التدريب متعددة العقد.
وبالتالي، يشير تنسيق مجموعة البيانات إلى حالات الاستخدام المفضلة وما إذا كنت ستحتاج إلى إعادة تنسيق البيانات لتناسب احتياجاتك.
هنا يمكنك رؤية مجموعات البيانات بتنسيق WebDataset:

البحث عن طريق المكتبة
هناك العديد من المكتبات والأدوات الجيدة لتحميل مجموعات البيانات وإعدادها للتدريب، مثل مكتبة Pandas أو Dask أو 🤗 Datasets Library. يتيح لك Hub استخدام أدواتك المفضلة وتصفية مجموعات البيانات المتوافقة مع أي مكتبة، على سبيل المثال يمكنك البحث عن مجموعات البيانات المتوافقة مع Pandas:

يعتمد توافق مجموعة البيانات على تنسيق مجموعة البيانات وحجمها (على سبيل المثال، يمكن لـ Dask تحميل مجموعة بيانات JSON Lines الكبيرة، على عكس Pandas، الذي يتطلب تحميل مجموعة البيانات الكاملة في الذاكرة). بالإضافة إلى ذلك، نوفر أيضًا مقتطف التعليمات البرمجية لتحميل أي مجموعة بيانات في أداتك المفضلة:

إذا كنت ترغب في ظهور مكتبتك في قائمة المكتبات المدعومة، فلا تتردد في فتح مناقشة على Huggingface.js!
الجمع بين المرشحات
يمكن استخدام أدوات البحث الأربع الجديدة هذه معًا ومع عوامل التصفية الأخرى الموجودة مثل اللغة والمهام والتراخيص. من خلال الجمع بين هذه المرشحات وشريط البحث عن النص، يمكنك البحث عن مجموعة البيانات المحددة التي تبحث عنها:
