يُصدر مجتمع Data is Better Together مجموعة بيانات مهمة أخرى لتطوير المصادر المفتوحة. نظرًا لعدم وجود مجموعات بيانات تفضيلية مفتوحة لإنشاء تحويل النص إلى صورة، فقد شرعنا في إصدار مجموعة بيانات مرخصة Apache 2.0 لإنشاء تحويل النص إلى صورة. تركز مجموعة البيانات هذه على أزواج تفضيلات تحويل النص إلى صورة عبر فئات توليد الصور الشائعة، مع مزج عائلات النماذج المختلفة والتعقيدات السريعة المتنوعة.

ليرة تركية؟ يمكن العثور على جميع النتائج في هذه المجموعة على Hugging Face Hub ويمكن العثور على التعليمات البرمجية للمعالجة المسبقة واللاحقة في مستودع GitHub هذا. والأهم من ذلك، أن هناك مجموعة بيانات تفضيلية جاهزة للاستخدام وFlux-dev-lora-finetune. إذا كنت تريد إظهار دعمك بالفعل، فلا تنس الإعجاب والاشتراك ومتابعتنا قبل مواصلة القراءة.

هل أنت غير معتاد على مجتمع “البيانات أفضل معًا”؟

[Data is Better Together](https://huggingface.co/data-is-better-together) هو تعاون بين 🤗 Hugging Face ومجتمع الذكاء الاصطناعي مفتوح المصدر. نحن نهدف إلى تمكين مجتمع المصادر المفتوحة من بناء مجموعات بيانات مؤثرة بشكل جماعي. يمكنك متابعة المؤسسة للبقاء على اطلاع بأحدث مجموعات البيانات والنماذج والسباقات السريعة للمجتمع.

جهود مماثلة

لقد كانت هناك العديد من الجهود لإنشاء مجموعة بيانات تفضيلات الصور المفتوحة ولكن جهودنا فريدة من نوعها نظرًا لاختلاف التعقيد وفئات المطالبات، إلى جانب انفتاح مجموعة البيانات والتعليمات البرمجية لإنشائها. وفيما يلي بعض الجهود:

- [yuvalkirstain/pickapic_v2](https://huggingface.co/datasets/yuvalkirstain/pickapic_v2)
- [fal.ai/imgsys](https://imgsys.org/)
- [TIGER-Lab/GenAI-Arena](https://huggingface.co/spaces/TIGER-Lab/GenAI-Arena)
- [artificialanalysis image arena](https://artificialanalysis.ai/text-to-image/arena)

مجموعة بيانات الإدخال

للحصول على مجموعة بيانات مدخلات مناسبة لهذا السباق، بدأنا ببعض المطالبات الأساسية، والتي قمنا بتنظيفها وتصفيتها للتأكد من سميتها وحقنها بالفئات والتعقيدات باستخدام توليد البيانات الاصطناعية مع distilabel. وأخيرًا، استخدمنا نماذج Flux وStable Diffusion لإنشاء الصور. أدى ذلك إلى ظهور open-image-preferences-v1.

مطالبات الإدخال

Imgsys عبارة عن ساحة لنماذج الصور التوليدية تستضيفها fal.ai، حيث يقدم الأشخاص مطالبات ويتمكنون من الاختيار بين جيلين من النماذج لتقديم التفضيلات. للأسف، لا يتم نشر الصور التي تم إنشاؤها علنًا، ومع ذلك، تتم استضافة المطالبات المرتبطة بها على Hugging Face. تمثل هذه المطالبات استخدامًا حقيقيًا لتوليد الصور يحتوي على أمثلة جيدة تركز على الإنشاء اليومي، ولكن هذا الاستخدام الواقعي يعني أيضًا أنه يحتوي على مطالبات مكررة وسامة، وبالتالي كان علينا إلقاء نظرة على البيانات وإجراء بعض التصفية.

تقليل السمية

نحن نهدف إلى إزالة جميع مطالبات وصور NSFW من مجموعة البيانات قبل بدء المجتمع. لقد استقرنا على نهج متعدد النماذج حيث استخدمنا مصنفين قائمين على النص ومصنفين قائمين على الصور كمرشحات. بعد التصفية، قررنا إجراء فحص يدوي لكل صورة للتأكد من عدم ترك أي محتوى سام، ولحسن الحظ وجدنا أن أسلوبنا قد نجح.

استخدمنا خط الأنابيب التالي:

  • تصنيف الصور على أنها NSFW
  • إزالة كافة العينات الإيجابية
  • يقوم فريق Argilla بمراجعة مجموعة البيانات يدويًا
  • كرر على أساس المراجعة

تعزيز فوري الاصطناعية

يعد تنوع البيانات مهمًا لجودة البيانات، ولهذا السبب قررنا تعزيز مجموعة البيانات الخاصة بنا عن طريق إعادة كتابة المطالبات بشكل تركيبي استنادًا إلى فئات وتعقيدات مختلفة. وقد تم ذلك باستخدام خط أنابيب distilabel.

يكتب اِسْتَدْعَى صورة
تقصير قيثارة بدون أي أوتار
منمنمة قيثارة بدون أوتار، بأسلوب أنمي، بتفاصيل معقدة وخطوط انسيابية، على خلفية باستيل حالمة صورة القيثارة منمنمة
جودة قيثارة بدون أوتار، بأسلوب الرسوم المتحركة، بتفاصيل معقدة وخطوط متدفقة، على خلفية حالمة باستيل، مغمورة بضوء الساعة الذهبية الناعمة، مع مزاج هادئ وأنسجة غنية، دقة عالية، واقعية صورة القيثارة الجودة

فئات موجهة

يصف InstructGPT فئات المهام الأساسية لإنشاء تحويل النص إلى نص، ولكن لا يوجد مكافئ واضح لذلك لإنشاء تحويل النص إلى صورة. للتخفيف من هذه المشكلة، استخدمنا مصدرين رئيسيين كمدخلات لفئاتنا: google/sdxl وMicrosoft. وأدى ذلك إلى الفئات الرئيسية التالية: [“Cinematic”, “Photographic”, “Anime”, “Manga”, “Digital art”, “Pixel art”, “Fantasy art”, “Neonpunk”, “3D Model”, “Painting”, “Animation” “Illustration”]. علاوة على ذلك، اخترنا أيضًا بعض الفئات الفرعية التي يستبعد بعضها بعضًا للسماح لنا بزيادة تنويع المطالبات. تم أخذ عينات عشوائية من هذه الفئات والفئات الفرعية وبالتالي يتم توزيعها بالتساوي تقريبًا عبر مجموعة البيانات.

التعقيدات الفورية

أثبتت ورقة ديتا أن التعقيد المتطور وتنوع المحفزات يؤدي إلى أجيال نموذجية أفضل وضبط دقيق، ومع ذلك، لا يأخذ البشر دائمًا وقتًا لكتابة مطالبات واسعة النطاق. لذلك قررنا استخدام نفس الموجه بطريقة معقدة ومبسطة كنقطتي بيانات لأجيال تفضيلية مختلفة.

توليد الصورة

يعرض التحليل الاصطناعي/لوحة المتصدرين لتحويل النص إلى صورة نظرة عامة على أفضل نماذج الصور أداءً. نحن نختار اثنين من أفضل النماذج أداءً بناءً على ترخيصهما ومدى توفرهما على Hub. بالإضافة إلى ذلك، حرصنا على أن ينتمي النموذج إلى عائلات نموذجية مختلفة حتى لا نسلط الضوء على الأجيال عبر فئات مختلفة. ولذلك، اخترنا الاستقرار/stable-diffusion-3.5-large وblack-forest-labs/FLUX.1-dev. تم بعد ذلك استخدام كل من هذه النماذج لإنشاء صورة لكل من الموجه المبسط والمعقد ضمن نفس الفئات الأسلوبية.

توليد الصورة

النتائج

يحتوي التصدير الأولي لجميع البيانات المشروحة على ردود على الاختيار المتعدد، حيث يختار كل معلق ما إذا كان أحد النموذجين أفضل، أو كان أداء كلا النموذجين جيدًا أو كان أداء كلا النموذجين سيئًا. بناءً على ذلك، علينا أن نلقي نظرة على محاذاة الحواشي وأداء النموذج عبر الفئات وحتى إجراء ضبط دقيق للنموذج، والذي يمكنك اللعب به بالفعل على المحور! يوضح ما يلي مجموعة البيانات المشروحة:

محاذاة الحواشي

اتفاقية التعليق التوضيحي هي طريقة للتحقق من صحة المهمة. عندما تكون المهمة صعبة للغاية، قد لا تتم محاذاة التعليقات التوضيحية، وعندما تكون المهمة سهلة جدًا، فقد تتم محاذاتها أكثر من اللازم. يعد تحقيق التوازن أمرًا نادرًا، لكننا تمكنا من تحقيقه خلال هذا السباق. لقد أجرينا هذا التحليل باستخدام وحدة تحكم SQL لمجموعات بيانات Hugging Face. بشكل عام، كان من المرجح أن يفوز SD3.5-XL ضمن إعداد الاختبار الخاص بنا.

أداء النموذج

نظرًا لمحاذاة التعليقات التوضيحية، أثبت كلا النموذجين أداءً أفضل في حدود حقوقهما الخاصة، لذلك أجرينا تحليلًا إضافيًا لمعرفة ما إذا كانت هناك اختلافات عبر الفئات. باختصار، يعمل FLUX-dev بشكل أفضل مع الرسوم المتحركة، ويعمل SD3.5-XL بشكل أفضل مع السيناريوهات الفنية والسينمائية.

  • التعادل: التصوير الفوتوغرافي، الرسوم المتحركة
  • FLUX-dev أفضل: نموذج ثلاثي الأبعاد، أنمي، مانغا
  • SD3.5-XL أفضل: سينمائي، الفن الرقمي، الفن الخيالي، الرسم التوضيحي، Neonpunk، الرسم، فن البكسل

دقة النموذج

للتحقق من جودة مجموعة البيانات، مع عدم إنفاق الكثير من الوقت والموارد، قررنا إجراء ضبط دقيق لـ LoRA لنموذج black-forest-labs/FLUX.1-dev استنادًا إلى مثال الناشرين على GitHub. خلال هذه العملية، قمنا بتضمين العينة المختارة كإكمالات متوقعة لنموذج FLUX-dev واستبعدنا العينات المرفوضة. ومن المثير للاهتمام أن النماذج المضبوطة المختارة تؤدي أداءً أفضل بكثير في السيناريوهات الفنية والسينمائية حيث كانت تفتقر إليها في البداية! يمكنك اختبار المحول المضبوط هنا.

اِسْتَدْعَى إبداعي ضبط دقيق
قارب في قنوات البندقية، مطلي بالغواش بضربات فرشاة ناعمة متدفقة وألوان نابضة بالحياة وشفافة، يلتقط الانعكاس الهادئ على الماء تحت أجواء ضبابية، بأنسجة غنية ومنظور ديناميكي البندقية الأصلية فينيتون البندقية
زهرة خشخاش برتقالية نابضة بالحياة، محاطة بإطار ذهبي مزخرف، على خلفية سوداء، تم تقديمها بأسلوب الرسوم المتحركة مع خطوط عريضة وتفاصيل مبالغ فيها وإضاءة تشياروسكورو درامية. الزهرة الأصلية زهرة فينتون
لقطة محببة لروبوت يطبخ في المطبخ، مع ظلال ناعمة وملمس فيلم يبعث على الحنين. روبوت أصلي روبوت فينتون

المجتمع

باختصار، قمنا بتعليق 10 آلاف زوج من التفضيلات مع تداخل التعليقات التوضيحية بنسبة 2/3، مما أدى إلى أكثر من 30 ألف استجابة في أقل من أسبوعين مع أكثر من 250 عضوًا في المجتمع! تُظهر لوحة المتصدرين للصور أن بعض أعضاء المجتمع يقدمون أكثر من 5 آلاف تفضيلات. نريد أن نشكر كل من شارك في هذا السباق مع شكر خاص لأفضل 3 مستخدمين، الذين سيحصلون جميعًا على عضوية Hugging Face Pro لمدة شهر. تأكد من متابعتهم على المركز: aashish1904، prithivMLmods، Malalatiana.

المتصدرين

ما هو التالي؟

بعد سباق مجتمعي ناجح آخر، سنواصل تنظيمهم على Hugging Face Hub. تأكد من متابعة منظمة Data Is Better Together لتبقى على اطلاع دائم. نحن أيضًا نشجع أعضاء المجتمع على اتخاذ الإجراءات بأنفسهم ويسعدنا توجيههم وإعادة مشاركتهم على مواقع التواصل الاجتماعي وداخل المؤسسة على المركز. يمكنك المساهمة بعدة طرق:

  • الانضمام والمشاركة في سباقات السرعة الأخرى.
  • اقترح سباقات السرعة الخاصة بك أو طلبات مجموعات البيانات عالية الجودة.
  • قم بضبط النماذج أعلى مجموعة البيانات المفضلة. تتمثل إحدى الأفكار في إجراء ضبط SFT كامل لـ SDXL أو FLUX-schnell. هناك فكرة أخرى تتمثل في إجراء ضبط دقيق لـ DPO/ORPO.
  • قم بتقييم الأداء المحسن لمحول LoRA مقارنة بنماذج SD3.5-XL وFLUX-dev الأصلية.

شاركها.
اترك تعليقاً