نماذج الصقر 2
يطلق معهد دراسات الترجمة جيلًا جديدًا من النماذج، Falcon 2، الذي يركز على تزويد مجتمع المصادر المفتوحة بسلسلة من النماذج الأصغر ذات الأداء المحسن والدعم متعدد الوسائط. هدفنا هو تمكين الاستدلال الأرخص وتشجيع تطوير المزيد من التطبيقات النهائية مع تحسين سهولة الاستخدام.
قدم الجيل الأول من نماذج Falcon، التي تضم Falcon-40B وFalcon-180B، مساهمة كبيرة في مجتمع المصادر المفتوحة، حيث شجع إطلاق شهادات LLM المتقدمة بتراخيص متساهلة. يمكن العثور على مزيد من المعلومات التفصيلية حول الجيل السابق من نماذج Falcon في أبحاث RefinedWeb وPenedo et al., 2023 وThe Falcon Series of Open Language Models، وAlmazrouei et al.، 2023، ومنشورات مدونة Falcon and Falcon-180B.
ويركز الجيل الثاني من النماذج على زيادة قابلية الاستخدام والتكامل، وبناء نظام بيئي متعدد الوسائط. نبدأ هذه الرحلة بإطلاق ليس فقط نموذج 11B LLM الأساسي، ولكن أيضًا نموذج 11B VLM الذي يشتمل على إمكانات فهم الصورة. سيسمح نموذج لغة الرؤية، أو VLM، للمستخدمين بالمشاركة في محادثات حول المحتوى المرئي باستخدام النص.
كما هو الحال مع عملنا السابق، تقدم النماذج الدعم بشكل أساسي باللغة الإنجليزية ولكنها تتمتع بقدرات جيدة بعشر لغات أخرى، بما في ذلك الإسبانية والفرنسية والألمانية.
جدول المحتويات
فالكون 2-11 بي إل إل إم
بيانات التدريب
تم تدريب Falcon2-11B على أكثر من 5000 GT (مليار رمز) من RefinedWeb، وهي مجموعة بيانات ويب تمت تصفيتها وإلغاء تكرارها عالية الجودة، ومُعززة بمجوعات منسقة. واتبعت استراتيجية التدريب من أربع مراحل. ركزت المراحل الثلاث الأولى على زيادة طول السياق، من 2048 إلى 4096 وأخيراً إلى 8192 رمزًا. وتهدف المرحلة الأخيرة إلى زيادة تعزيز الأداء باستخدام بيانات عالية الجودة فقط.
وبشكل عام، تضمنت مصادر البيانات RefinedWeb-English، وRefinedWeb-Europe (خدمات العملاء, دي, وفاق, الاب, هو – هي, nl, رر, نقطة, ريال عماني, القديس)، بيانات فنية عالية الجودة، وبيانات التعليمات البرمجية، وبيانات المحادثة المستخرجة من المصادر العامة.
وجاءت مراحل التدريب على النحو التالي:
| منصة | طول السياق | جي تي |
|---|---|---|
| المرحلة 1 | 2048 | 4500 |
| المرحلة 2 | 4096 | 250 |
| المرحلة 3 | 8192 | 250 |
| المرحلة 4 | 8192 | 500 |
تم ترميز البيانات باستخدام الرمز المميز Falcon2-11B، وهو نفس الرمز المميز لنماذج Falcon السابقة.
العمارة النموذجية
يلخص الجدول التالي بعض التفاصيل الهامة حول بنية النموذج:
| اختيار التصميم | قيمة |
|---|---|
| عدد كتل المحولات | 60 |
| عدد رؤوس الاستعلام | 32 |
| عدد رؤوس المفاتيح/القيمة | 8 |
| أبعاد الرأس | 128 |
| الاهتمام الموازي | نعم |
| MLP عامل الراقي | 4 |
إجراءات التدريب
تم تدريب Falcon2-11B على 1024 وحدة معالجة رسوميات A100 سعة 40 جيجابايت لمعظم التدريب، باستخدام استراتيجية التوازي ثلاثي الأبعاد (TP=8، PP=1، DP=128) جنبًا إلى جنب مع ZeRO وFlash-Attention 2.
تدريب المعلمات الفائقة
| المعلمة المفرطة | قيمة |
|---|---|
| دقة | bfloat16 |
| محسن | آدم دبليو |
| ماكس إل آر | 3.7ه-4 |
| مين إل آر | 1.89هـ-5 |
| جدول LR | اضمحلال كوس (المرحلة 1) |
| طول السياق | 8192 (المرحلتان 3 و 4) |
| اضمحلال الوزن | 1ه-1 |
| خسارة Z | 1ه-4 |
| حجم الدفعة | عامل |
تقييم فالكون 2-11 بي
أداء اللغة الإنجليزية
الأداء في مهام لوحة المتصدرين المفتوحة LLM:
| نقطة تفتيش | جي تي | هيلا سواج-10 | فينوجراندي-5 | قوس التحدي-25 | تروثفولQA-0 | مملو-5 | GSMK8k-5 | متوسط |
|---|---|---|---|---|---|---|---|---|
| فالكون 2-11 ب | 5500 | 82.91 | 78.30 | 59.73 | 52.56 | 58.37 | 53.83 | 64.28 |
| فالكون-40ب | 1000 | 85.28 | 81.29 | 61.86 | 41.65 | 56.89 | 21.46 | 58.07 |
| فالكون-7ب | 1500 | 78.13 | 72.38 | 47.87 | 34.26 | 27.79 | 4.62 | 44.17 |
| جيما-7ب | 6000 | 82.47 | 78.45 | 61.09 | 44.91 | 66.03 | 52.77 | 64.29 |
| اللاما3-8ب | 15000 | 82.09 | 77.35 | 59.47 | 43.90 | 66.69 | 44.79 | 62.38 |
| ميسترال-7ب | لا يوجد | 83.31 | 78.37 | 59.98 | 42.15 | 64.16 | 37.83 | 60.97 |
قدم فريق Hugging Face Leaderboard تقييمًا رسميًا لنموذجنا فيما يتعلق بمهام Open LLM Leaderboard. يعمل النموذج بشكل أفضل من نماذج مثل Llama3-8B (التي تم تدريبها على بيانات أكثر بثلاث مرات) وMistral-7B، وعلى قدم المساواة مع Gemma-7b.
أداء صفر طلقة:
| نقطة تفتيش | جي تي | هيلاسواج | آرسي إيزي | فينوغراندي | تحدي القوس |
|---|---|---|---|---|---|
| فالكون 2-11 ب | 5500 | 82.07 | 77.78 | 78.30 | 50.17 |
| فالكون-40ب | 1000 | 82.82 | 81.86 | 76.4 | 54.69 |
| فالكون-7ب | 1500 | 76.31 | 74.74 | 67.17 | 43.43 |
تظهر نتائج التقييم أن Falcon2-11B يُظهر أداءً مشابهًا لـ Falcon-40B، بحجم نموذج أصغر أربع مرات!
قدرات متعددة اللغات
باستخدام لوحة المتصدرين Multilingual LLM، قمنا بمقارنة نموذج Falcon2-11B بنموذج Llama-7B وBloom-7B. كمرجع، نقوم أيضًا بتضمين Falcon-40B (الذي يدعم نفس اللغات)، وFalcon-7B (الذي يدعم الفرنسية) وMistral-7B.
| نموذج | معرف اللغة | قوس التحدي-25 | هيلاسواج | إم إل يو 25 | TQA | متوسط |
|---|---|---|---|---|---|---|
| فالكون 2-11 ب | دي | 43.7 | 67.96 | 38.3 | 47.53 | 49.37 |
| وفاق | 46.2 | 73.63 | 37.9 | 46.43 | 51.06 | |
| الاب | 45.8 | 72.41 | 39.53 | 47.30 | 51.27 | |
| هو – هي | 45.6 | 70.83 | 38.05 | 47.14 | 50.42 | |
| nl | 41.7 | 69.05 | 38.29 | 48.81 | 49.47 | |
| ريال عماني | 42.4 | 66.24 | 38.01 | 45.53 | 48.04 | |
| فالكون-40ب | دي | 45.1 | 68.3 | 36.2 | 39.8 | 47.4 |
| وفاق | 48.5 | 73.9 | 37.2 | 39.0 | 49.6 | |
| الاب | 47.6 | 72.9 | 37.3 | 38.5 | 49.1 | |
| هو – هي | 46.3 | 70.2 | 36.4 | 40.7 | 48.4 | |
| nl | 42.9 | 68.4 | 36.5 | 40.9 | 47.1 | |
| ريال عماني | 43.2 | 66.0 | 35.7 | 39.8 | 46.2 | |
| فالكون-7ب | الاب | 37.3 | 64.1 | 28.4 | 34.0 | 40.9 |
| ميسترال-7ب | دي | 41.2 | 58.7 | 40.5 | 44.9 | 46.3 |
| وفاق | 44.2 | 65.3 | 42.4 | 43.1 | 48.7 | |
| الاب | 44.9 | 64.4 | 41.9 | 43.0 | 48.6 | |
| هو – هي | 43.2 | 60.9 | 39.7 | 43.1 | 46.7 | |
| nl | 40.0 | 57.9 | 41.4 | 43.3 | 45.7 | |
| ريال عماني | 40.7 | 53.6 | 39.3 | 43.6 | 44.3 | |
| لاما-7ب | دي | 35.1 | 49.9 | 29.9 | 38.3 | 38.3 |
| وفاق | 36.8 | 56.4 | 30.3 | 37.0 | 40.1 | |
| الاب | 37.3 | 55.7 | 30.5 | 39.9 | 40.9 | |
| هو – هي | 35.8 | 52.0 | 29.9 | 39.6 | 39.3 | |
| nl | 33.6 | 48.7 | 29.8 | 40.0 | 38.0 | |
| ريال عماني | 32.4 | 44.9 | 29.7 | 37.0 | 36.0 | |
| بلوم-7ب | دي | 26.3 | 32.4 | 28.1 | 43.7 | 32.6 |
| وفاق | 38.1 | 56.7 | 28.9 | 40.4 | 41.0 | |
| الاب | 36.7 | 56.6 | 29.9 | 40.9 | 41.0 | |
| هو – هي | 29.0 | 40.8 | 27.6 | 43.7 | 35.3 | |
| nl | 23.1 | 31.7 | 27.5 | 42.7 | 31.3 | |
| ريال عماني | 26.9 | 31.8 | 27.4 | 46.1 | 33.1 |
تماشيًا مع روح نماذج Falcon الأصلية، تم تدريب Falcon2-11B ليس فقط على البيانات الإنجليزية ولكن أيضًا على عشر لغات أخرى. تظهر نتائج تقييمنا متعدد اللغات أن النموذج يقدم قدرات جيدة في اللغات الست (دي, وفاق, الاب, هو – هي, nl, ريال عماني) ظهرت في Multilingual LLM Leaderboard وتُظهر في الواقع أداءً أعلى من Falcon-40B والعديد من النماذج الأخرى متعددة اللغات في جميع اللغات المذكورة.
سنصدر قريبًا نتائج تقييم أكثر شمولاً لقدرات متعددة اللغات في بطاقة طراز Falcon2-11B!
قدرات توليد التعليمات البرمجية
نحن نتحقق من أداء النموذج عند إنشاء التعليمات البرمجية مقابل BigCode Leaderboard في معيار HumanEval للغة Python، حيث حصلنا على pass@1 بنسبة 29.59%.
باستخدام Falcon2-11B
from transformers import AutoTokenizer
import transformers
import torch
model = "tiiuae/falcon-11B"
tokenizer = AutoTokenizer.from_pretrained(model)
pipeline = transformers.pipeline(
"text-generation",
model=model,
torch_dtype=torch.bfloat16,
device_map="auto",
)
وبعد ذلك، يمكنك تشغيل إنشاء النص باستخدام كود مثل ما يلي:
sequences = pipeline(
"Can you explain the concept of Quantum Computing?",
max_length=200,
do_sample=True,
top_k=10,
num_return_sequences=1,
eos_token_id=tokenizer.eos_token_id,
)
for seq in sequences:
print(f"Result: {seq['generated_text']}")
فالكون 2-11 بي إل إم
Falcon2-11B VLM هو نموذج لغة رؤية (VLM) مبني على أعلى LLM، والذي يتعامل بالإضافة إلى ذلك مع مدخلات الصور ويكون قادرًا على الإجابة على الاستفسارات حول الصور. ولتحقيق ذلك، قمنا بدمج جهاز تشفير الرؤية CLIP ViT-L/14 المُدرب مسبقًا مع نموذج الدردشة Falcon2-11B المضبوط بدقة، والتدريب باستخدام بيانات نص الصورة.
لتعزيز إدراك VLM للتفاصيل الدقيقة التي تتضمن كائنات صغيرة في الصور، فإننا نستخدم آلية تشفير ديناميكية بدقة عالية لمدخلات الصور، على غرار LLaVA-Next.
تمرين
يتم التدريب على مرحلتين: التدريب المسبق والضبط الدقيق. في كلتا المرحلتين، يتم الاحتفاظ بأوزان التشفير البصري مجمدة. في مرحلة ما قبل التدريب، يتم الاحتفاظ بـ LLM مجمداً، ويتم تدريب جهاز العرض متعدد الوسائط فقط على 558 ألف زوج من تعليقات الصور. وهذا يمكّن جهاز العرض متعدد الوسائط من تعلم رسم الخرائط من المساحة المرئية إلى مساحة تضمين النص. أثناء الضبط الدقيق، يتم تدريب كل من أوزان جهاز العرض وLLM على مجموعة مكونة من 1.2 مليون بيانات تعليمات نصية مصورة من مجموعات البيانات العامة، والتي تتضمن أيضًا محادثات متعددة الجولات.
تقييم Falcon2-11B VLM
| نموذج | وزارة البلدية والبيئة | GQA | SQA | البابا | VQAv2 | TextVQA | مم مقعد | SEED-IMG | متوسط |
|---|---|---|---|---|---|---|---|---|---|
| فالكون 2-11 بي إل إم | 1589/343 | 64.5 | 74.9 | 88.4 | 82.1 | 66.7 | 72.0 | 72.3 | 74.4 |
| LLaVA-1.6 (فيكونا-7B) | 1519/332 | 64.2 | 70.1 | 86.5 | 81.8 | 64.9 | 67.4 | 70.2 | 72.1 |
| LLaVA-1.6 (فيكونا-13B) | 1575/326 | 65.4 | 73.6 | 86.2 | 82.8 | 67.1 | 70.0 | 71.9 | 73.8 |
| LLaVA-1.6 (ميسترال-7B) | 1498/321 | 64.8 | 72.8 | 86.7 | 82.2 | 65.7 | 68.7 | 72.2 | 73.3 |
باستخدام Falcon2-11B-FalconVLM
from transformers import LlavaNextForConditionalGeneration, LlavaNextProcessor
from PIL import Image
import requests
import torch
processor = LlavaNextProcessor.from_pretrained("tiiuae/falcon-11B-vlm")
model = LlavaNextForConditionalGeneration.from_pretrained("tiiuae/falcon-11B-vlm", torch_dtype=torch.bfloat16)
url = "https://merzougabirding.com/wp-content/uploads/2023/09/falcon-size.jpg"
falcon_image = Image.open(requests.get(url, stream=True).raw)
prompt = "User: <image>\nWhat's special about this bird's vision?"
inputs = processor(prompt, images=falcon_image, return_tensors="pt", padding=True).to('cuda:0')
model.to('cuda:0')
output = model.generate(**inputs, max_new_tokens=256)
prompt_length = inputs['input_ids'].shape[1]
generated_captions = processor.decode(output[0], skip_special_tokens=True).strip()
print(generated_captions)
معلومات الترخيص
تتوفر نماذج Falcon 2 بموجب ترخيص TII Falcon 2، وهو ترخيص برمجي قائم على Apache 2.0 يتضمن سياسة استخدام مقبولة تشجع الاستخدام المسؤول للذكاء الاصطناعي. تمت صياغة هذا الترخيص في إطار روح التزام معهد دراسات الترجمة تجاه مجتمع المصادر المفتوحة.