تقديم “مولد البيانات الاصطناعية”، وهو تطبيق سهل الاستخدام يتبع نهجًا بدون تعليمات برمجية لإنشاء مجموعات بيانات مخصصة باستخدام نماذج اللغات الكبيرة (LLMs). أفضل ما في الأمر: عملية بسيطة خطوة بخطوة، مما يجعل إنشاء مجموعة البيانات أمرًا سهلاً غير تقني، مما يسمح لأي شخص بإنشاء مجموعات بيانات ونماذج في دقائق وبدون أي تعليمات برمجية.
فيديو تجريبي قصير
ما هي البيانات الاصطناعية ولماذا هي مفيدة؟
البيانات الاصطناعية هي معلومات يتم إنشاؤها بشكل مصطنع وتحاكي بيانات العالم الحقيقي. يسمح بالتغلب على قيود البيانات من خلال توسيع مجموعات البيانات أو تحسينها.
من الموجه إلى مجموعة البيانات إلى النموذج
يأخذ منشئ البيانات الاصطناعية وصفًا للبيانات التي تريدها (الموجه المخصص الخاص بك) ويعيد مجموعة بيانات لحالة الاستخدام الخاصة بك، باستخدام مسار البيانات الاصطناعية. في الخلفية، يتم تشغيل هذا بواسطة distilabel وواجهة برمجة تطبيقات Hugging Face المجانية لإنشاء النصوص، لكن لا داعي للقلق بشأن هذه التعقيدات ويمكننا التركيز على استخدام واجهة المستخدم.
المهام المدعومة
تدعم الأداة حاليًا تصنيف النص ومجموعات بيانات الدردشة. ستحدد هذه المهام نوع مجموعة البيانات التي ستقوم بإنشائها، ويتطلب التصنيف فئات، بينما تتطلب بيانات الدردشة محادثة. بناءً على الطلب، سنضيف مهام مثل التقييم ومجموعة RAG بمرور الوقت.
تصنيف النص
يعد تصنيف النص أمرًا شائعًا لتصنيف النصوص مثل مراجعات العملاء أو منشورات الوسائط الاجتماعية أو المقالات الإخبارية. يعتمد إنشاء مجموعة بيانات التصنيف على خطوتين مختلفتين نتناولهما مع LLMs. نقوم أولاً بإنشاء نصوص متنوعة، ثم نضيف إليها تسميات. من الأمثلة الجيدة على مجموعة بيانات تصنيف النص الاصطناعي هو argilla/synthetic-text-classification-news، الذي يصنف المقالات الإخبارية الاصطناعية إلى 8 فئات مختلفة.
مجموعات بيانات الدردشة
يمكن استخدام هذا النوع من مجموعات البيانات للضبط الدقيق تحت الإشراف (SFT)، وهي التقنية التي تسمح لـ LLMs بالعمل مع بيانات المحادثة، مما يسمح للمستخدم بالتفاعل مع LLMs عبر واجهة الدردشة. من الأمثلة الجيدة على مجموعة بيانات الدردشة الاصطناعية هو argilla/synthetic-sft-customer-support-single-turn، والذي يسلط الضوء على مثال LLM مصمم للتعامل مع دعم العملاء. في هذا المثال، موضوع دعم العملاء هو منشئ البيانات الاصطناعية نفسه.
بشكل عام، يمكننا إنشاء 50 و20 عينة في الدقيقة لتصنيف النص والدردشة، على التوالي. يتم تشغيل كل هذا بواسطة Hugging Face API المجانية، ولكن يمكنك توسيع نطاق ذلك باستخدام حسابك الخاص واختيار النماذج المخصصة أو موفري واجهة برمجة التطبيقات أو تكوينات الإنشاء. سنعود إلى هذا لاحقًا ولكن دعنا نتعمق في الأساسيات أولاً.
دعونا ننشئ مجموعة البيانات الأولى لدينا
سنقوم بإنشاء مجموعة بيانات الدردشة الأساسية. عند زيارتك للمولد، يتعين عليك تسجيل الدخول للسماح للأداة بالوصول إلى المؤسسات التي تريد إنشاء مجموعات بيانات لها. سيسمح هذا للأداة بتحميل مجموعات البيانات التي تم إنشاؤها. في حالة فشل المصادقة، يمكنك دائمًا إعادة تعيين الاتصال.
بعد تسجيل الدخول، ترشدك واجهة المستخدم خلال عملية مباشرة من ثلاث خطوات:
1. قم بوصف مجموعة البيانات الخاصة بك
ابدأ بتقديم وصف لمجموعة البيانات التي تريد إنشاءها، بما في ذلك أمثلة لحالات الاستخدام لمساعدة المولد على فهم احتياجاتك. تأكد من وصف هدف ونوع المساعد بأكبر قدر ممكن من التفاصيل. عندما تضغط على الزر “إنشاء”، سيتم إنشاء مجموعة بيانات نموذجية، ويمكنك المتابعة بالخطوة 2.
2. التكوين والتحسين
قم بتحسين مجموعة البيانات النموذجية التي تم إنشاؤها عن طريق ضبط system prompt، والتي تم إنشاؤها بناءً على الوصف الخاص بك وعن طريق ضبط الإعدادات الخاصة بالمهمة. سيساعدك هذا في الوصول إلى النتائج المحددة التي تسعى إليها. يمكنك التكرار على هذه التكوينات عن طريق الضغط على الزر “حفظ” وإعادة إنشاء مجموعة البيانات النموذجية الخاصة بك. عندما تكون راضيًا عن التكوين، تابع إلى الخطوة 3.

3. التوليد والدفع
املأ معلومات عامة حول اسم مجموعة البيانات وتنظيمها. بالإضافة إلى ذلك، يمكنك تحديد عدد العينات المراد توليدها ودرجة الحرارة المستخدمة للتوليد. تمثل درجة الحرارة هذه إبداع الأجيال. دعونا نضغط على زر “إنشاء” لبدء جيل كامل. سيتم حفظ الإخراج مباشرة في Argilla وHugging Face Hub.

يمكننا الآن النقر فوق الزر “فتح في Argilla” والتعمق مباشرة في مجموعة البيانات التي تم إنشاؤها.
مراجعة مجموعة البيانات
حتى عند التعامل مع البيانات الاصطناعية، من المهم فهم بياناتك والنظر فيها، ولهذا السبب أنشأنا تكاملًا مباشرًا مع Argilla، وهي أداة تعاون لمهندسي الذكاء الاصطناعي وخبراء المجال لبناء مجموعات بيانات عالية الجودة. يتيح لك ذلك استكشاف مجموعة البيانات الاصطناعية وتقييمها بشكل فعال من خلال ميزات قوية مثل البحث الدلالي والمرشحات القابلة للتركيب. يمكنك معرفة المزيد عنها في هذا الدليل. بعد ذلك، يمكننا تصدير مجموعة البيانات المنسقة إلى Hugging Face Hub، ومواصلة ضبط النموذج باستخدامها.

تدريب نموذج
لا تقلق؛ حتى إنشاء نماذج ذكاء اصطناعي قوية يمكن إجراؤها بدون تعليمات برمجية في الوقت الحاضر باستخدام AutoTrain. لفهم AutoTrain، يمكنك الاطلاع على وثائقه. هنا، سنقوم بإنشاء نشر AutoTrain الخاص بنا وتسجيل الدخول كما فعلنا من قبل لمولد البيانات الاصطناعية.
هل تتذكر مجموعة بيانات argilla/synthetic-text-classification-news من البداية؟ دعونا ندرب نموذجًا يمكنه تصنيف هذه الأمثلة بشكل صحيح. نحتاج إلى تحديد مهمة “تصنيف النص” وتوفير “مصدر مجموعة البيانات” الصحيح. ثم اختر اسمًا جميلاً للمشروع واضغط على تشغيل! يمكن تجاهل النافذة المنبثقة التي تحذر من التكاليف لأننا لا نزال نعمل على أجهزة Hugging Face CPU المجانية، وهي أكثر من أجهزة كافية لمثال تصنيف النص هذا.

وها هو، بعد بضع دقائق، أصبح لدينا نموذجنا الخاص! كل ما تبقى هو نشرها كخدمة مباشرة أو استخدامها كمسار لتصنيف النصوص مع الحد الأدنى من كود بايثون.
الميزات المتقدمة
على الرغم من أنه يمكنك الانتقال من المطالبات إلى النماذج المخصصة دون معرفة أي شيء عن البرمجة، فقد يرغب بعض الأشخاص في خيار تخصيص وتوسيع نطاق نشرهم باستخدام بعض الميزات التقنية الأكثر تقدمًا.
تحسين السرعة والدقة
يمكنك تحسين السرعة والدقة عن طريق إنشاء النشر الخاص للأداة وتكوينها لاستخدام معلمات أو نماذج مختلفة. أولاً، يجب عليك تكرار منشئ البيانات الاصطناعية. تأكد من أنك تقوم بإنشائها كمساحة خاصة لضمان عدم تمكن أي شخص آخر من الوصول إليها. بعد ذلك، يمكنك تغيير القيم الافتراضية لبعض متغيرات البيئة. دعنا نتناول بعض السيناريوهات:
- استخدم نموذجًا مجانيًا مختلفًا لـ Hugging Face. يمكنك القيام بذلك عن طريق تغيير
MODELمن القيمة الافتراضيةmeta-llama/Llama-3.1-8B-Instructإلى نموذج مختلف، مثلmeta-llama/Llama-3.1-70B-Instruct. - استخدم نموذج OpenAI. يمكنك القيام بذلك عن طريق ضبط
BASE_URLلhttps://api.openai.com/v1/وMODELلgpt-4o. - زيادة حجم الدفعة، والتي سوف تولد المزيد من العينات في الدقيقة الواحدة. يمكنك القيام بذلك عن طريق تغيير
BATCH_SIZEمن القيمة الافتراضية5إلى قيمة أعلى، مثل10. ضع في اعتبارك أن موفري واجهة برمجة التطبيقات (API) لديك قد يكون لديهم حدود لعدد الطلبات في الدقيقة. - مثيل أرجيلا الخاص. يمكنك القيام بذلك عن طريق ضبط
ARGILLA_URLوARGILLA_API_KEYإلى عنوان URL ومفتاح واجهة برمجة التطبيقات (API) لمثيل Argilla المجاني الخاص بك.
النشر المحلي
إلى جانب استضافة الأداة على Hugging Face Spaces، فإننا نقدمها أيضًا كأداة مفتوحة المصدر بموجب ترخيص Apache 2، مما يعني أنه يمكنك الانتقال إلى GitHub واستخدامها وتعديلها وتكييفها كيفما تشاء. يمكنك تثبيته كحزمة بايثون من خلال عملية بسيطة pip install synthetic-dataset-generator. تأكد من تكوين متغيرات البيئة الصحيحة عند الكرياتين
تخصيص خطوط الأنابيب
يعتمد كل مسار بيانات تركيبية على distilabel، وهو إطار عمل البيانات الاصطناعية وتعليقات الذكاء الاصطناعي. Distilabel مفتوح المصدر؛ الشيء الرائع في كود خط الأنابيب هو أنه قابل للمشاركة وقابل للتكرار. يمكنك، على سبيل المثال، العثور على المسار لمجموعة بيانات argilla/synthetic-text-classification-news داخل المستودع الموجود على Hub. وبدلاً من ذلك، يمكنك العثور على العديد من مجموعات البيانات الأخرى القابلة للتوزيع بالإضافة إلى خطوط الأنابيب الخاصة بها.
ما هي الخطوة التالية؟
يوفر “مولد البيانات الاصطناعية” بالفعل العديد من الميزات الرائعة التي تجعله مفيدًا لأي محب للبيانات أو النماذج. ومع ذلك، لدينا بعض التوجيهات المثيرة للاهتمام لإجراء تحسينات على GitHub، ونحن ندعوك للمساهمة، وترك نجمة، وفتح القضايا أيضًا! بعض الأشياء التي نعمل عليها هي:
- الجيل المعزز للاسترجاع (RAG)
- تقييمات مخصصة مع LLMs كقاض
البدء في التوليف