تم تصميم لوحة المتصدرين LLM العربية المفتوحة (OALL) لتلبية الحاجة المتزايدة للمعايير المتخصصة في مجال معالجة اللغة العربية. مع تقدم مجال معالجة اللغات الطبيعية (NLP)، غالبًا ما يظل التركيز منحرفًا بشدة نحو اللغة الإنجليزية، مما يترك فجوة كبيرة في الموارد المخصصة للغات الأخرى. تهدف OALL إلى تحقيق التوازن في ذلك من خلال توفير منصة مخصصة لتقييم ومقارنة أداء نماذج اللغة العربية الكبيرة (LLMs)، وبالتالي تعزيز البحث والتطوير في البرمجة اللغوية العصبية العربية.

وتكتسب هذه المبادرة أهمية خاصة لأنها تخدم بشكل مباشر أكثر من 380 مليون ناطق باللغة العربية في جميع أنحاء العالم. من خلال تعزيز القدرة على تقييم وتحسين ماجستير اللغة العربية بدقة، نأمل أن تلعب OALL دورًا حاسمًا في تطوير النماذج والتطبيقات التي يتم ضبطها بدقة لتناسب الفروق الدقيقة في اللغة العربية والثقافة والتراث.

المعايير والمقاييس والإعداد الفني

مجموعات البيانات المرجعية

تستخدم لوحة المتصدرين العربية المفتوحة LLM (OALL) مجموعة واسعة ومتنوعة من مجموعات البيانات القوية لضمان التقييم الشامل للنموذج.

  • معيار غافا: تم إنشاؤه من قبل فريق TII LLM بهدف تقييم النماذج على مجموعة من القدرات بما في ذلك فهم القراءة، وتحليل المشاعر، والإجابة على الأسئلة. تم تقديمه في البداية مع 11 مجموعة بيانات باللغة العربية الأصلية وتم توسيعه لاحقًا ليشمل 11 مجموعة بيانات إضافية هي ترجمات للمعايير الأخرى المعتمدة على نطاق واسع داخل مجتمع البرمجة اللغوية العصبية الإنجليزية.
  • معايير ACVA وAceGPT: تحتوي على 58 مجموعة بيانات من الورقة البحثية “AceGPT، تعريب نماذج اللغات الكبيرة باللغة العربية”، والإصدارات المترجمة من معايير MMLU وEXAMS لتوسيع نطاق التقييم وتغطية مجموعة شاملة من المهام اللغوية. تم تنسيق هذه المعايير بدقة وتضم مجموعات فرعية متنوعة تلتقط بدقة تعقيدات اللغة العربية وخفاياها.

مقاييس التقييم

نظرًا لطبيعة المهام، التي تتضمن أسئلة الاختيار من متعدد وأسئلة نعم/لا، تستخدم لوحة المتصدرين في المقام الأول دقة احتمالية السجل القياسية لجميع المهام. تم اختيار هذا المقياس لقدرته على توفير قياس واضح وعادل لأداء النموذج عبر أنواع مختلفة من الأسئلة.

الإعداد الفني

يستخدم الإعداد الفني لـ Open Arab LLM Leaderboard (OALL) ما يلي:

  • الواجهة الأمامية والخلفية مستوحاة من demo-leaderboard، مع تشغيل الواجهة الخلفية محليًا على مجموعة TII
  • ال lighteval مكتبة لتشغيل التقييمات. لقد تم تقديم مساهمات كبيرة لدمج المعايير العربية التي تمت مناقشتها أعلاه lightevalلدعم التقييمات غير التقليدية للنماذج العربية للمجتمع (انظر PR #44 و PR #95 على GitHub لمزيد من التفاصيل).

الاتجاهات المستقبلية

لدينا العديد من الأفكار حول توسيع نطاق لوحة المتصدرين العربية المفتوحة LLM. تم وضع خطط لتقديم لوحات صدارة إضافية ضمن فئات مختلفة، مثل واحدة لتقييم ماجستير اللغة العربية في سيناريوهات الجيل المعزز للاسترجاع (RAG) وأخرى كساحة لروبوتات الدردشة التي تحسب درجات ELO لروبوتات الدردشة العربية المختلفة بناءً على تفضيلات المستخدم.

علاوة على ذلك، نهدف إلى توسيع معاييرنا لتشمل مهام أكثر شمولاً من خلال تطوير معيار OpenDolphin، والذي سيتضمن حوالي 50 مجموعة بيانات وسيكون بمثابة تكرار مفتوح للعمل الذي قام به Nagoudi et al. في ورقة بحثية بعنوان “دولفين: معيار صعب ومتنوع للـ NLG العربية”. للراغبين في إضافة معاييرهم أو التعاون في مشروع OpenDolphin، يرجى الاتصال بنا من خلال علامة تبويب المناقشة أو على عنوان البريد الإلكتروني هذا.

نود أن نرحب بمساهمتك في هذه النقاط! نحن نشجع المجتمع على المساهمة من خلال تقديم النماذج أو اقتراح معايير جديدة أو المشاركة في المناقشات. نحن أيضًا نشجع المجتمع على الاستفادة من أفضل النماذج في لوحة المتصدرين الحالية لإنشاء نماذج جديدة من خلال الضبط الدقيق أو أي تقنيات أخرى قد تساعد نموذجك على الصعود في التصنيف إلى المركز الأول! يمكنك أن تكون بطل النماذج العربية المفتوحة القادم!

نأمل أن يشجع OALL التقدم التكنولوجي ويسلط الضوء على الخصائص اللغوية والثقافية الفريدة المتأصلة في اللغة العربية، وأن يكون إعدادنا الفني وتعلمنا من نشر لوحة صدارة واسعة النطاق خاصة بلغة معينة مفيدًا لمبادرات مماثلة في اللغات الأخرى الممثلة تمثيلاً ناقصًا. سيساعد هذا التركيز على سد الفجوة في الموارد والأبحاث، التي تهيمن عليها تقليديًا النماذج التي تركز على اللغة الإنجليزية، مما يثري المشهد العالمي للبرمجة اللغوية العصبية بأدوات أكثر تنوعًا وشمولاً، وهو أمر بالغ الأهمية مع تزايد دمج تقنيات الذكاء الاصطناعي في الحياة اليومية في جميع أنحاء العالم.

إرسال النموذج الخاص بك!

عملية تقديم النموذج

لضمان عملية تقييم سلسة، يجب على المشاركين الالتزام بإرشادات محددة عند إرسال النماذج إلى لوحة المتصدرين العربية المفتوحة LLM:

  1. ضمان محاذاة دقة النموذج: ومن الأهمية بمكان أن تتوافق دقة النماذج المقدمة مع دقة النماذج الأصلية. قد تؤدي الاختلافات في الدقة إلى تقييم النموذج ولكن لا يتم عرضه بشكل صحيح على لوحة الصدارة.

  2. فحوصات ما قبل التقديم:

    • نموذج التحميل والرمز المميز: تأكد من أنه يمكن تحميل النموذج والرمز المميز الخاص بك بنجاح باستخدام AutoClasses. استخدم الأوامر التالية:

      from transformers import AutoConfig, AutoModel, AutoTokenizer
      config = AutoConfig.from_pretrained("your model name", revision=revision)
      model = AutoModel.from_pretrained("your model name", revision=revision)
      tokenizer = AutoTokenizer.from_pretrained("your model name", revision=revision)
      

      إذا واجهت أخطاء، فقم بمعالجتها باتباع رسائل الخطأ للتأكد من تحميل النموذج الخاص بك بشكل صحيح.

    • رؤية النموذج: تأكد من ضبط النموذج الخاص بك على الرؤية العامة. بالإضافة إلى ذلك، لاحظ أنه إذا كان النموذج الخاص بك يتطلب use_remote_code=True، هذه الميزة غير مدعومة حاليًا ولكنها قيد التطوير.

  3. تحويل الأوزان النموذجية إلى أدوات الأمان:

    • قم بتحويل أوزان النموذج الخاص بك إلى أدوات الأمان، وهو تنسيق أكثر أمانًا وسرعة لتحميل الأوزان واستخدامها. يتيح هذا التحويل أيضًا تضمين عدد معلمات النموذج في ملف Extended Viewer.
  4. الترخيص وبطاقة النموذج:

    • الترخيص المفتوح: تأكد من أن النموذج الخاص بك مرخص بشكل علني. تعمل لوحة المتصدرين هذه على تعزيز إمكانية الوصول إلى LLMs المفتوحة لضمان سهولة الاستخدام على نطاق واسع.
    • بطاقة النموذج الكاملة: املأ بطاقة النموذج الخاصة بك بالمعلومات التفصيلية. سيتم استخراج هذه البيانات تلقائيًا وعرضها بجانب النموذج الخاص بك على لوحة المتصدرين.

في حالة فشل النموذج

إذا ظهر النموذج الخاص بك في فئة “فشل”، فهذا يشير إلى أن التنفيذ قد توقف. قم بمراجعة الخطوات الموضحة أعلاه لاستكشاف أية مشكلات وإصلاحها وحلها. بالإضافة إلى ذلك، اختبر البرنامج النصي التالي على النموذج الخاص بك محليًا للتأكد من وظائفه قبل إعادة الإرسال.

شكر وتقدير

ونعرب عن امتناننا لجميع المساهمين والشركاء والرعاة، ولا سيما معهد الابتكار التكنولوجي وHugging Face لدعمهم الكبير في هذا المشروع. وقد قدم معهد دراسات الترجمة الموارد الحسابية الأساسية بسخاء، وذلك تماشيًا مع التزامه بدعم المشاريع المجتمعية وتطوير العلوم المفتوحة في مجال البرمجة اللغوية العصبية باللغة العربية، في حين ساعدت شركة Hugging Face في دمج وتخصيص إطار التقييم الجديد ونموذج لوحة المتصدرين.

نود أيضًا أن نعرب عن شكرنا لشركة Upstage على عملهم في لوحة المتصدرين Open Ko-LLM، والتي كانت بمثابة مرجع قيم ومصدر إلهام لجهودنا. لقد كانت مساهماتهم الرائدة مفيدة في توجيه نهجنا لتطوير لوحة المتصدرين العربية الشاملة والجامعة في LLM.

الاستشهادات والمراجع

@misc{OALL,
  author = {El Filali, Ali and Alobeidli, Hamza and Fourrier, Clémentine and Boussaha, Basma El Amel and Cojocaru, Ruxandra and Habib, Nathan and Hacid, Hakim},
  title = {Open Arabic LLM Leaderboard},
  year = {2024},
  publisher = {OALL},
  howpublished = "\url{https://huggingface.co/spaces/OALL/Open-Arabic-LLM-Leaderboard}"
}

@inproceedings{almazrouei-etal-2023-alghafa,
    title = "{A}l{G}hafa Evaluation Benchmark for {A}rabic Language Models",
    author = "Almazrouei, Ebtesam  and
      Cojocaru, Ruxandra  and
      Baldo, Michele  and
      Malartic, Quentin  and
      Alobeidli, Hamza  and
      Mazzotta, Daniele  and
      Penedo, Guilherme  and
      Campesan, Giulia  and
      Farooq, Mugariya  and
      Alhammadi, Maitha  and
      Launay, Julien  and
      Noune, Badreddine",
    editor = "Sawaf, Hassan  and
      El-Beltagy, Samhaa  and
      Zaghouani, Wajdi  and
      Magdy, Walid  and
      Abdelali, Ahmed  and
      Tomeh, Nadi  and
      Abu Farha, Ibrahim  and
      Habash, Nizar  and
      Khalifa, Salam  and
      Keleg, Amr  and
      Haddad, Hatem  and
      Zitouni, Imed  and
      Mrini, Khalil  and
      Almatham, Rawan",
    booktitle = "Proceedings of ArabicNLP 2023",
    month = dec,
    year = "2023",
    address = "Singapore (Hybrid)",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2023.arabicnlp-1.21",
    doi = "10.18653/v1/2023.arabicnlp-1.21",
    pages = "244--275",
    abstract = "Recent advances in the space of Arabic large language models have opened up a wealth of potential practical applications. From optimal training strategies, large scale data acquisition and continuously increasing NLP resources, the Arabic LLM landscape has improved in a very short span of time, despite being plagued by training data scarcity and limited evaluation resources compared to English. In line with contributing towards this ever-growing field, we introduce AlGhafa, a new multiple-choice evaluation benchmark for Arabic LLMs. For showcasing purposes, we train a new suite of models, including a 14 billion parameter model, the largest monolingual Arabic decoder-only model to date. We use a collection of publicly available datasets, as well as a newly introduced HandMade dataset consisting of 8 billion tokens. Finally, we explore the quantitative and qualitative toxicity of several Arabic models, comparing our models to existing public Arabic LLMs.",
}
@misc{huang2023acegpt,
      title={AceGPT, Localizing Large Language Models in Arabic}, 
      author={Huang Huang and Fei Yu and Jianqing Zhu and Xuening Sun and Hao Cheng and Dingjie Song and Zhihong Chen and Abdulmohsen Alharthi and Bang An and Ziche Liu and Zhiyi Zhang and Junying Chen and Jianquan Li and Benyou Wang and Lian Zhang and Ruoyu Sun and Xiang Wan and Haizhou Li and Jinchao Xu},
      year={2023},
      eprint={2309.12053},
      archivePrefix={arXiv},
      primaryClass={cs.CL}
}
@misc{lighteval,
  author = {Fourrier, Clémentine and Habib, Nathan and Wolf, Thomas and Tunstall, Lewis},
  title = {LightEval: A lightweight framework for LLM evaluation},
  year = {2023},
  version = {0.3.0},
  url = {https://github.com/huggingface/lighteval}
}

شاركها.
اترك تعليقاً