نحن متحمسون لإصدار IDEFICS (أنابركه علم دcom.ecoder هتم تحسينه على غرار ذلك فلامينغو مع أنامعشق جروس الاهتمامس)، نموذج لغة مرئية مفتوح الوصول. يعتمد IDEFICS على Flamingo، وهو نموذج لغة بصرية متطور تم تطويره في البداية بواسطة DeepMind، والذي لم يتم إصداره للعامة. على غرار GPT-4، يقبل النموذج تسلسلات عشوائية من مدخلات الصور والنص وينتج مخرجات نصية. تم بناء IDEFICS فقط على البيانات والنماذج المتاحة للعامة (LLaMA v1 وOpenCLIP) ويأتي في نوعين مختلفين – الإصدار الأساسي والإصدار الموجه. يتوفر كل متغير بأحجام معلمات تبلغ 9 مليارات و80 مليارًا.
وينبغي أن يكون تطوير نماذج الذكاء الاصطناعي الحديثة أكثر شفافية. هدفنا مع IDEFICS هو إعادة إنتاج وتزويد مجتمع الذكاء الاصطناعي بأنظمة تتوافق مع قدرات النماذج الكبيرة المملوكة مثل Flamingo. على هذا النحو، اتخذنا خطوات مهمة للمساهمة في تحقيق الشفافية في أنظمة الذكاء الاصطناعي هذه: استخدمنا فقط البيانات المتاحة للجمهور، وقدمنا الأدوات لاستكشاف مجموعات بيانات التدريب، وشاركنا الدروس الفنية والأخطاء المتعلقة ببناء مثل هذه القطع الأثرية وقمنا بتقييم مدى ضرر النموذج من خلال التحريض عليه بشكل عدائي قبل إطلاقه. نأمل أن يكون IDEFICS بمثابة أساس متين لمزيد من الأبحاث المفتوحة في أنظمة الذكاء الاصطناعي متعددة الوسائط، جنبًا إلى جنب مع نماذج مثل OpenFlamingo – وهو نسخة مفتوحة أخرى من Flamingo بمقياس 9 مليار معلمة.
جرب العرض التوضيحي والنماذج الموجودة على Hub!
ما هو المعرفات؟
IDEFICS هو نموذج متعدد الوسائط يضم 80 مليار معلمة يقبل تسلسلات الصور والنصوص كمدخلات ويولد نصًا متماسكًا كمخرجات. يمكنه الإجابة على أسئلة حول الصور، ووصف المحتوى المرئي، وإنشاء قصص ترتكز على صور متعددة، وما إلى ذلك.
IDEFICS عبارة عن نسخة مفتوحة الوصول من Flamingo ويمكن مقارنتها في الأداء بالنموذج الأصلي مغلق المصدر عبر معايير فهم نص الصورة المختلفة. يأتي في نوعين مختلفين – 80 مليار معلمة و9 مليار معلمة.
نحن نقدم أيضًا إصدارات مضبوطة تمامًا من idefics-80B-instruct وidifics-9B-instruct التي تم تكييفها لحالات الاستخدام التحادثي.
بيانات التدريب
تم تدريب IDEFICS على مزيج من مجموعات البيانات المتاحة بشكل مفتوح: Wikipedia، وPublic Multimodal Dataset، وLAION، بالإضافة إلى مجموعة بيانات 115B رمزية جديدة تسمى OBELICS التي أنشأناها. يتكون OBELICS من 141 مليون مستند نصي مصور معشق تم استخراجه من الويب ويحتوي على 353 مليون صورة.
نحن نقدم تصورًا تفاعليًا لـ OBELICS يسمح باستكشاف محتوى مجموعة البيانات باستخدام Nomic AI.

تتوفر تفاصيل بنية IDEFICS ومنهجية التدريب والتقييمات، بالإضافة إلى معلومات حول مجموعة البيانات، في بطاقة النموذج وورقة البحث الخاصة بنا. بالإضافة إلى ذلك، قمنا بتوثيق الرؤى الفنية والدروس المستفادة من تدريب النموذج، مما يوفر منظورًا قيمًا حول تطوير IDEFICS.
التقييم الأخلاقي
في بداية هذا المشروع، ومن خلال مجموعة من المناقشات، قمنا بتطوير ميثاق أخلاقي من شأنه أن يساعد في توجيه القرارات المتخذة خلال المشروع. يحدد هذا الميثاق القيم، بما في ذلك النقد الذاتي والشفافية والعدالة التي سعينا إلى اتباعها في كيفية تعاملنا مع المشروع وإصدار النماذج.
كجزء من عملية الإصدار، قمنا بتقييم النموذج داخليًا بحثًا عن التحيزات المحتملة من خلال تحفيز النموذج بشكل عدائي باستخدام الصور والنصوص التي قد تثير استجابات لا نريدها من النموذج (عملية تُعرف باسم الفريق الأحمر).
يرجى تجربة IDEFICS مع العرض التوضيحي، والتحقق من بطاقات النماذج المقابلة وبطاقة مجموعة البيانات وإخبارنا بتعليقاتك باستخدام علامة تبويب المجتمع! نحن ملتزمون بتحسين هذه النماذج وإتاحة نماذج الذكاء الاصطناعي الكبيرة متعددة الوسائط لمجتمع التعلم الآلي.
رخصة
تم بناء النموذج على أعلى نموذجين مدربين مسبقًا: laion/CLIP-ViT-H-14-laion2B-s32B-b79K وhuggyllama/llama-65b. تم إصدار الأول بموجب ترخيص معهد ماساتشوستس للتكنولوجيا (MIT)، في حين تم إصدار الثاني بموجب ترخيص غير تجاري محدد يركز على الأغراض البحثية. وعلى هذا النحو، يجب على المستخدمين الالتزام بهذا الترخيص من خلال التقدم مباشرة إلى نموذج Meta.
يرتبط النموذجان المدربان مسبقًا ببعضهما البعض من خلال المعلمات التي تمت تهيئتها حديثًا والتي نقوم بتدريبها. لا تعتمد هذه على أي من النموذجين الأساسيين المتجمدين اللذين يشكلان النموذج المركب. نقوم بإصدار الأوزان الإضافية التي قمنا بتدريبها بموجب ترخيص معهد ماساتشوستس للتكنولوجيا.
الشروع في العمل مع IDEFICS
تتوفر نماذج IDEFICS على Hugging Face Hub وهي مدعومة في الإصدار الأخير transformers إصدار. فيما يلي نموذج التعليمات البرمجية لتجربته:
import torch
from transformers import IdeficsForVisionText2Text, AutoProcessor
device = "cuda" if torch.cuda.is_available() else "cpu"
checkpoint = "HuggingFaceM4/idefics-9b-instruct"
model = IdeficsForVisionText2Text.from_pretrained(checkpoint, torch_dtype=torch.bfloat16).to(device)
processor = AutoProcessor.from_pretrained(checkpoint)
prompts = [
[
"User: What is in this image?",
"https://upload.wikimedia.org/wikipedia/commons/8/86/Id%C3%A9fix.JPG",
"<end_of_utterance>",
"\nAssistant: This picture depicts Idefix, the dog of Obelix in Asterix and Obelix. Idefix is running on the ground.<end_of_utterance>",
"\nUser:",
"https://static.wikia.nocookie.net/asterix/images/2/25/R22b.gif/revision/latest?cb=20110815073052",
"And who is that?<end_of_utterance>",
"\nAssistant:",
],
]
inputs = processor(prompts, add_end_of_utterance_token=False, return_tensors="pt").to(device)
exit_condition = processor.tokenizer("<end_of_utterance>", add_special_tokens=False).input_ids
bad_words_ids = processor.tokenizer(["<image>", "<fake_token_around_image>"], add_special_tokens=False).input_ids
generated_ids = model.generate(**inputs, eos_token_id=exit_condition, bad_words_ids=bad_words_ids, max_length=100)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
for i, t in enumerate(generated_text):
print(f"{i}:\n{t}\n")