في Hugging Face، لاحظنا اتجاهًا مثيرًا للقلق في مجموعات بيانات التعلم الآلي (ML) المستضافة على مركزنا: المعلومات الخاصة غير الموثقة عن الأفراد. وهذا يطرح بعض التحديات الفريدة لممارسي تعلم الآلة. في منشور المدونة هذا، سنستكشف أنواعًا مختلفة من مجموعات البيانات التي تحتوي على نوع من المعلومات الخاصة المعروفة باسم معلومات التعريف الشخصية (PII)، والمشكلات التي تطرحها، وميزة جديدة نجربها في Dataset Hub للمساعدة في معالجة هذه التحديات.
أنواع مجموعات البيانات مع معلومات تحديد الهوية الشخصية (PII).
لقد لاحظنا نوعين من مجموعات البيانات التي تحتوي على معلومات تحديد الهوية الشخصية:
- مجموعات بيانات معلومات تحديد الهوية الشخصية (PII) المشروحة: تم تصميم مجموعات البيانات مثل PII-Masking-300k بواسطة Ai4Privacy خصيصًا لتدريب نماذج اكتشاف معلومات تحديد الهوية الشخصية (PII)، والتي تُستخدم لاكتشاف معلومات تحديد الهوية الشخصية (PII) وإخفائها. على سبيل المثال، يمكن لهذه النماذج أن تساعد في الإشراف على المحتوى عبر الإنترنت أو توفير قواعد بيانات مجهولة المصدر.
- مجموعات بيانات ما قبل التدريب: هذه مجموعات بيانات واسعة النطاق، غالبًا ما يصل حجمها إلى تيرابايت، ويتم الحصول عليها عادةً من خلال عمليات زحف الويب. على الرغم من أن مجموعات البيانات هذه تتم تصفيتها بشكل عام لإزالة أنواع معينة من معلومات تحديد الهوية الشخصية، إلا أنه لا يزال من الممكن أن تتسلل كميات صغيرة من المعلومات الحساسة عبر الشقوق بسبب الحجم الهائل للبيانات والعيوب في نماذج اكتشاف معلومات تحديد الهوية الشخصية.
تحديات تحديد الهوية الشخصية في مجموعات بيانات تعلم الآلة
يمكن أن يؤدي وجود معلومات تحديد الهوية الشخصية (PII) في مجموعات بيانات تعلم الآلة إلى خلق العديد من التحديات للممارسين. أولاً وقبل كل شيء، فإنه يثير مخاوف تتعلق بالخصوصية ويمكن استخدامه لاستنتاج معلومات حساسة عن الأفراد. بالإضافة إلى ذلك، يمكن أن تؤثر معلومات تحديد الهوية الشخصية (PII) على أداء نماذج تعلم الآلة إذا لم يتم التعامل معها بشكل صحيح. على سبيل المثال، إذا تم تدريب النموذج على مجموعة بيانات تحتوي على معلومات تحديد الهوية الشخصية (PII)، فقد يتعلم ربط بعض معلومات تحديد الهوية الشخصية (PII) بنتائج محددة، مما يؤدي إلى تنبؤات متحيزة أو إنشاء معلومات تحديد الهوية الشخصية (PII) من مجموعة التدريب.
تجربة جديدة على مركز مجموعة البيانات: تقارير Presidio
للمساعدة في مواجهة هذه التحديات، نقوم بتجربة ميزة جديدة في Dataset Hub التي تستخدم Presidio، وهي أداة حديثة ومفتوحة المصدر للكشف عن معلومات تحديد الهوية الشخصية (PII). تعتمد Presidio على أنماط الكشف ونماذج التعلم الآلي لتحديد معلومات تحديد الهوية الشخصية (PII).
باستخدام هذه الميزة الجديدة، سيتمكن المستخدمون من رؤية تقرير يقدر مدى وجود معلومات تحديد الهوية الشخصية في مجموعة البيانات. يمكن أن تكون هذه المعلومات ذات قيمة لممارسي تعلم الآلة، حيث تساعدهم على اتخاذ قرارات مستنيرة قبل تدريب النموذج. على سبيل المثال، إذا كان التقرير يشير إلى أن مجموعة البيانات تحتوي على معلومات تحديد الهوية الشخصية (PII) الحساسة، فقد يختار الممارسون تصفية مجموعة البيانات بشكل أكبر باستخدام أدوات مثل Presidio.
يمكن لمالكي مجموعات البيانات أيضًا الاستفادة من هذه الميزة باستخدام التقارير للتحقق من صحة عمليات تصفية معلومات تحديد الهوية الشخصية (PII) الخاصة بهم قبل إصدار مجموعة البيانات.
مثال على تقرير Presidio
دعونا نلقي نظرة على مثال لتقرير Presidio لمجموعة بيانات ما قبل التدريب هذه:
في هذه الحالة، اكتشف Presidio كميات صغيرة من رسائل البريد الإلكتروني ومعلومات تحديد الهوية الشخصية الحساسة في مجموعة البيانات.
خاتمة
يمثل وجود معلومات تحديد الهوية الشخصية (PII) في مجموعات بيانات تعلم الآلة تحديًا متطورًا لمجتمع تعلم الآلة. في Hugging Face، نحن ملتزمون بالشفافية ومساعدة الممارسين على التغلب على هذه التحديات. من خلال تجربة الميزات الجديدة مثل تقارير Presidio على Dataset Hub، نأمل في تمكين المستخدمين من اتخاذ قرارات مستنيرة وبناء نماذج تعلم الآلة أكثر قوة وأخلاقية.
كما نشكر CNIL للمساعدة في الامتثال للقانون العام لحماية البيانات. لقد كانت توجيهاتهم لا تقدر بثمن في التعامل مع تعقيدات الذكاء الاصطناعي وقضايا البيانات الشخصية. تحقق من أوراق كيفية استخدام الذكاء الاصطناعي المحدثة هنا.
ترقبوا المزيد من التحديثات حول هذا التطور المثير!