نقدم لكم Falcon3، وهي عائلة من نماذج اللغات الكبيرة المخصصة لوحدة فك التشفير فقط والتي تحتوي على 10 مليارات معلمة، والتي طورها معهد الابتكار التكنولوجي (TII) في أبو ظبي. من خلال دفع حدود الأداء وكفاءة التدريب، يعكس هذا الإصدار التزامنا المستمر بتطوير نماذج الأساس الكبيرة المفتوحة والتي يمكن الوصول إليها.

يمثل Falcon3 تطورًا طبيعيًا عن الإصدارات السابقة، مع التركيز على توسيع قدرات النماذج العلمية والرياضية والتعليمات البرمجية.

يتضمن هذا التكرار خمسة نماذج أساسية:

  1. فالكون 3-1بي-بيس
  2. Falcon3-3B-Base
  3. فالكون 3 – مامبا – 7 بي – بيس
  4. Falcon3-7B-Base
  5. Falcon3-10B-Base

في تطوير هذه النماذج، قمنا بدمج العديد من الابتكارات الرئيسية التي تهدف إلى تحسين أداء النماذج مع تقليل تكاليف التدريب:

  • تدريب مسبق واحد للنماذج القائمة على المحولات: لقد أجرينا تدريبًا مسبقًا واحدًا واسع النطاق على الطراز 7B، باستخدام شرائح GPU 1024 H100، مع الاستفادة من 14 تريليون رمز يتميز بالويب والتعليمات البرمجية والعلوم والتكنولوجيا والهندسة والرياضيات (STEM) وبيانات منسقة عالية الجودة ومتعددة اللغات.
  • توسيع نطاق العمق لتحسين التفكير: بناءً على الدراسات الحديثة حول تأثيرات عمق النموذج، قمنا بترقية نموذج 7B إلى نموذج معلمات 10B عن طريق تكرار الطبقات المتكررة ومواصلة التدريب المسبق باستخدام 2 تريليون رمز من البيانات عالية الجودة. أدى هذا إلى إنتاج Falcon3-10B-Base الذي يحقق أداء متطور بدون طلقة وبضع طلقات للنماذج تحت معلمات 13B.
  • تقطير المعرفة لنماذج صغيرة أفضل: ولتوفير بدائل مدمجة وفعالة، قمنا بتطوير Falcon3-1B-Base وFalcon3-3B-Base من خلال الاستفادة من تقنيات التقليم والتقطير المعرفي، باستخدام أقل من 100 جيجا طن من البيانات المنسقة عالية الجودة، وبالتالي إعادة تعريف كفاءة ما قبل التدريب.
  • SSM النقي: لقد قمنا بتعزيز Falcon Mamba 7B بشكل أكبر من خلال التدريب على 1.5 تريليون رمز إضافي من البيانات عالية الجودة، مما أدى إلى Falcon3-Mamba-7B-Base. ومن الجدير بالذكر أن النموذج المحدث يوفر قدرات تفكيرية ورياضية محسنة بشكل كبير.
  • المتغيرات الأخرى: تتوفر جميع الطرز في عائلة Falcon3 بأشكال مختلفة مثل Instruct وGGUF وGPTQ-Int4 وGPTQ-Int8 وAWQ و1.58 بت، مما يوفر مرونة لمجموعة واسعة من التطبيقات.

النقاط الرئيسية

أظهر Falcon3 الحدود ضمن النطاقات الصغيرة والمتوسطة لنماذج اللغات الكبيرة من خلال إظهار الأداء العالي وفقًا للمعايير المشتركة:

  • يتفوق Falcon3-1B-Base على SmolLM2-1.7B وهو على قدم المساواة مع Gemma-2-2b.
  • يتفوق Falcon3-3B-Base على النماذج الأكبر حجمًا مثل Llama-3.1-8B وMinitron-4B-Base، مما يسلط الضوء على فوائد التدريب المسبق مع استخلاص المعرفة.
  • يُظهر Falcon3-7B-Base أعلى أداء، على قدم المساواة مع Qwen2.5-7B، بين النماذج تحت مقياس 9B.
  • يعد Falcon3-10B-Base بمثابة أحدث طراز يحقق نتائج قوية في فئة أقل من 13 عامًا.
  • تتوافق جميع نماذج Falcon3 القائمة على المحولات مع بنية Llama مما يسمح بتكامل أفضل في النظام البيئي للذكاء الاصطناعي.
  • يستمر Falcon3-Mamba-7B في الريادة باعتباره نموذج لغة الفضاء الحكومية (SSLM) الأفضل أداءً، حيث يطابق أو حتى يتفوق على LLMs الرائدة القائمة على المحولات على مقياس 7B، إلى جانب دعم طول سياق أطول يبلغ 32 كيلو بايت. وباستخدام نفس بنية Falcon Mamba 7B الأصلية، يمكن للمستخدمين دمج Falcon3-Mamba-7B بسلاسة دون أي جهد إضافي.
  • تُظهر إصدارات التعليمات الخاصة بمجموعة النماذج الأساسية الخاصة بنا أيضًا أداءً رائعًا عبر معايير مختلفة مع تفوق Falcon3-7B-Instruct وFalcon3-10B-Instruct على جميع نماذج التعليمات ضمن مقياس 13B على لوحة المتصدرين المفتوحة.

القدرات المحسنة

قمنا بتقييم النماذج من خلال خط التقييم الداخلي الخاص بنا (استنادًا إلى أداة تقييم المعرفة) وقمنا بالإبلاغ عن النتائج الأولية. تسلط تقييماتنا الضوء على المجالات الرئيسية التي تتفوق فيها عائلة نماذج Falcon3، مما يعكس التركيز على تعزيز الأداء في المجالات العلمية والاستدلال وقدرات المعرفة العامة:

  • قدرات الرياضيات: يحقق Falcon3-10B-Base 22.9 على MATH-Lvl5 و83.0 على GSM8K، مما يعرض التفكير المعزز في المهام المعقدة التي تركز على الرياضيات.
  • قدرات الترميز: حقق Falcon3-10B-Base 73.8 على MBPP، في حين حصل Falcon3-10B-Instruct على 45.8 على Multipl-E، مما يعكس قدراتهم على التعميم عبر المهام المتعلقة بالبرمجة.
  • طول السياق الممتد: تدعم النماذج الموجودة في عائلة Falcon3 ما يصل إلى 32 ألف رمز مميز (باستثناء 1B الذي يدعم ما يصل إلى 8 كيلو سياق)، مع تحسينات وظيفية مثل تسجيل 86.3 على BFCL (Falcon3-10B-Instruct).
  • تحسين المنطق: يحقق Falcon3-7B-Base وFalcon3-10B-Base 51.0 و59.7 على BBH، مما يعكس قدرات الاستدلال المحسنة، مع إظهار نموذج 10B أداء استدلالًا محسنًا مقارنة بالطراز 7B.
  • توسيع المعرفة العلمية: يوضح الأداء في معايير MMLU التقدم في المعرفة المتخصصة، مع درجات 67.4/39.2 (MMLU/MMLU-PRO) لـ Falcon3-7B-Base و73.1/42.5 (MMLU/MMLU-PRO) لـ Falcon3-10B-Base على التوالي.

مواصفات النماذج والنتائج المعيارية

تم تلخيص المواصفات التفصيلية لعائلة طرازات Falcon3 في الجدول التالي. تتميز بنية Falcon3-7B-Base ببعد رأس يبلغ 256 مما ينتج عنه إنتاجية عالية عند استخدام FlashAttention-3 حيث تم تحسينه لهذا البعد. تمتد نماذج وحدة فك التشفير هذه من 18 إلى 40 طبقة للنماذج القائمة على المحولات، و64 طبقة لطبقة مامبا، وتشترك جميع النماذج في وظيفة تنشيط SwiGLU، مع حجم مفردات يصل إلى 131 ألف رمز (65 ألف لـ Mamba-7B). تم تدريب Falcon3-7B-Base على أكبر كمية من البيانات لضمان تغطية شاملة للمفاهيم والمعرفة، بينما تتطلب المتغيرات الأخرى بيانات أقل بكثير.

كفاءة التدريب

يسلط الجدول أدناه الضوء على أداء Falcon3-7B-Base وFalcon3-10B-Base وفقًا للمعايير الرئيسية التي توضح الأداء التنافسي بشكل عام، ومجالات الرياضيات والتفكير والفهم السليم. لا تتردد في إلقاء نظرة على بطاقات النماذج حيث نقدم نتائج تقييم إضافية (على سبيل المثال، MT-Bench، Alpaca، إلخ).

كفاءة التدريب

تُظهر نماذج التعليمات أيضًا أداءً تنافسيًا وفائقًا مع نماذج مكافئة وصغيرة الحجم كما هو موضح في الجداول أدناه.

إرشاد النماذج

يحقق كل من Falcon3-1B-Instruct وFalcon3-3B-Instruct أداءً قويًا عبر المعايير التي تم تقييمها. على وجه التحديد، يحقق Falcon3-1B نتائج تنافسية في IFEval (54.4)، وMUSR (40.7)، وSciQ (86.8)، بينما يُظهر Falcon3-3B المزيد من المكاسب – خاصة في MMLU-PRO (29.7) وMATH (19.9) – مما يظهر تأثيرات تحجيم واضحة. على الرغم من أنها لا تتفوق على جميع النماذج المنافسة في كل مقياس، إلا أن نماذج Falcon تظهر أداءً قويًا في التفكير والفهم السليم مقارنة بكل من Qwen وLlama. في مسار التقييم الداخلي لدينا:

  • نحن نستخدم أداة تقييم lm.
  • نحن نبلغ الدرجات الخام تم الحصول عليها عن طريق تطبيق قالب الدردشة بدون عدد قليل من اللقطات_as_multiturn (على عكس Llama3.1).
  • نحن نستخدم نفس حجم الدفعة في جميع الموديلات.
كفاءة التدريب

علاوة على ذلك، يُظهر Falcon3-7B وFalcon3-10B أداءً قويًا عبر المعايير التي تم تقييمها. يحقق Falcon3-7B درجات تنافسية في الاستدلال (Arc Challenge: 65.9، MUSR: 46.4) والرياضيات (GSM8K: 79.1)، بينما يُظهر Falcon3-10B المزيد من التحسينات، لا سيما في GSM8K (83.1) وIFEval (78)، مما يشير إلى فوائد التوسع الواضحة.

كفاءة التدريب

التزام المصدر المفتوح

تماشيًا مع مهمتنا المتمثلة في تعزيز إمكانية الوصول والتعاون في مجال الذكاء الاصطناعي، تم إصدار جميع الطرازات في عائلة Falcon3 تحت عنوان رخصة فالكون LLM. نأمل أن يجد مجتمع الذكاء الاصطناعي هذه النماذج ذات قيمة للبحث وتطوير التطبيقات وإجراء المزيد من التجارب. إن Falcon3 ليس تتويجًا، بل هو استمرار لجهودنا لإنشاء نماذج أساس أكثر قدرة وكفاءة وتخصصًا. وفي يناير 2025، سنصدر نماذج أخرى من عائلة Falcon3 تتميز بقدرات محسنة متعددة الوسائط بما في ذلك دعم الصور والفيديو والصوت، بالإضافة إلى تقرير فني كامل يغطي منهجياتنا. نحن نرحب بالتعليقات والتعاون من المجتمع بينما نواصل تحسين هذه التقنيات وتطويرها.

روابط مفيدة

شكر وتقدير

نشكر بحرارة الأشخاص المذكورين أدناه على دعمهم السلس وتكاملهم داخل النظام البيئي.

الاقتباس

إذا كانت مجموعة نماذج Falcon3 مفيدة لعملك، فلا تتردد في إعطائنا اقتباسًا منها.

@misc{Falcon3,
    title = {The Falcon 3 Family of Open Models},
    url = {https://huggingface.co/blog/falcon3},
    author = {Falcon-LLM Team},
    month = {December},
    year = {2024}
}

شاركها.
اترك تعليقاً