لماذا 3LM؟
شهدت نماذج اللغة العربية الكبيرة (LLMs) تقدمًا ملحوظًا في السنوات الأخيرة، إلا أن المعايير الحالية لا تزال قاصرة عندما يتعلق الأمر بتقييم الأداء في المجالات التقنية عالية القيمة. ركزت معظم التقييمات حتى الآن على المهام ذات الأغراض العامة مثل التلخيص، أو تحليل المشاعر، أو الإجابة على الأسئلة العامة. ومع ذلك، فإن التفكير العلمي والبرمجة ضروريان لمجموعة واسعة من تطبيقات العالم الحقيقي، بدءًا من التعليم وحتى حل المشكلات التقنية.
ولمعالجة هذه الفجوة، نقدم 3LM (علم)، وهو معيار متعدد المكونات مصمم لتقييم ماجستير اللغة العربية في موضوعات العلوم والتكنولوجيا والهندسة والرياضيات وإنشاء الأكواد البرمجية. يعد 3LM هو المعيار الأول من نوعه، وهو مصمم خصيصًا لاختبار النماذج العربية في التفكير المنظم والمنطق الرسمي وهي المجالات التي يتم تمثيلها بشكل ناقص تقليديًا في البرمجة اللغوية العصبية العربية.
ماذا يوجد في المعيار؟
تتكون 3LM من ثلاث مجموعات بيانات، تستهدف كل منها محور تقييم محدد: أسئلة العلوم والتكنولوجيا والهندسة والرياضيات (STEM) متعددة الاختيارات في العالم الحقيقي (MCQs)، وأسئلة العلوم والتكنولوجيا والهندسة والرياضيات (STEM) الاصطناعية عالية الصعوبة، ومهام إنشاء التعليمات البرمجية المترجمة.
1. العلوم والتكنولوجيا والهندسة والرياضيات الأصلية
يتكون اختبار Native STEM من 865 سؤالاً متعدد الأسئلة مستخرجة من محتوى تعليمي عربي أصيل، بما في ذلك الكتب المدرسية وأوراق العمل وبنوك الامتحانات للصفوف من الثامن إلى الثاني عشر. وتغطي الأسئلة خمسة مواضيع أساسية: الفيزياء والكيمياء والأحياء والرياضيات والجغرافيا.
يتم شرح كل سؤال باستخدام البيانات الوصفية بما في ذلك المجال والصعوبة (على مقياس من 1 إلى 10). تم الحصول على البيانات باستخدام مسار يجمع بين التعرف الضوئي على الحروف (بما في ذلك تحليل رياضيات LaTeX عبر Pix2Tex)، واستخراج الأسئلة والأجوبة بمساعدة LLM، والمراجعة اليدوية. توفر مجموعة البيانات هذه اختبارًا واقعيًا لتقييم الفهم الواقعي والمفاهيمي في النماذج العربية باستخدام مواد تعليمية حقيقية.
2. الجذعية الاصطناعية
ولتقديم المزيد من التحدي والتنوع، أنشأنا مجموعة فرعية تركيبية مكونة من 1,744 سؤالًا متعدد الأسئلة باستخدام مسار YourBench. يستمد هذا المكون من نص الكتاب المدرسي باللغة العربية، والذي تم تقسيمه وتلخيصه واستخدامه كمدخل لنظام توليد الأسئلة المعتمد على LLM. والنتيجة هي مجموعة منسقة من الأسئلة التي تركز على الاستدلال ذو الصعوبة المتوسطة إلى العالية، بما في ذلك المشكلات المفاهيمية والتحليلية والقائمة على التطبيق.
توفر العلوم والتكنولوجيا والهندسة والرياضيات (STEM) الاصطناعية توازنًا مهمًا للأسئلة المتعددة الأسئلة (MCQs) الأصلية من خلال استكشاف مهارات التفكير الأعمق وتقليل تحيز الإجابة. خضعت جميع الأسئلة التي تم إنشاؤها للتصفية بناءً على الوضوح والبنية وصلاحية المحتوى، يليها ضمان الجودة من خلال المراجعة اليدوية.
3. معايير الكود العربي
يستهدف المكون الثالث من 3LM إنشاء الأكواد وهو مجال متزايد لتقييم LLM. قمنا بترجمة وتكييف معايير HumanEval+ وMBPP+ المستخدمة على نطاق واسع إلى اللغة العربية، وإنشاء أول مجموعات بيانات برمجية تختبر شهادات LLM باللغة العربية بناءً على مطالبات اللغة الطبيعية للبرمجة.
استخدمنا GPT-4o للترجمة السريعة وتحققنا من صحة النتائج باستخدام خط أنابيب للترجمة العكسية، ورفضنا العينات منخفضة الجودة بناءً على عتبات ROUGE-L F1 (<0.8). تضمن التصفية البشرية الإضافية الوضوح والصحة الفوريين. تظل مجموعات التعليمات البرمجية والاختبار دون تغيير للحفاظ على دقة التسجيل. تستخدم التقييمات إطار عمل EvalPlus لمقاييس pass@1 وpass@1+.
بناء المعيار
مرت كل مجموعة بيانات في 3LM بعملية تطوير متعددة المراحل لضمان جودة البيانات وعدالتها وتمثيلها.

ل الجذعية الأصلية، قمنا بجمع مصادر PDF باللغة العربية وطبقنا نهج التعرف الضوئي على الحروف المزدوج لاستعادة كل من النص العادي والصيغ الرياضية. تم استخراج الأسئلة باستخدام التجزئة المستندة إلى LLM والتعرف على الأنماط، متبوعة بالتصنيف إلى تنسيق MCQ مع ترتيب الإجابات العشوائية. تمت مراجعة العينات النهائية من قبل متحدثين باللغة العربية يتمتعون بخبرة في العلوم والتكنولوجيا والهندسة والرياضيات للتأكد من صحة الإجابة وسهولة قراءتها.
ل الجذعية الاصطناعية، تم تكييف خط أنابيب YourBench للإدخال العربي. تم تلخيص المستندات المصدر بعد الاستيعاب أولاً وتجزئتها ومن ثم إدخالها في مولد يتم التحكم فيه بالكود لإنشاء MCQ. لقد قمنا بتصفية المحتوى المعتمد على الصورة أو المحتوى الغامض، واحتفظنا فقط بالأسئلة التي تقع ضمن نطاقات الصعوبة المستهدفة. والنتيجة هي مجموعة من الأسئلة MCQs العربية الاصطناعية عالية الجودة الخاصة بمجال العلوم والتكنولوجيا والهندسة والرياضيات.
ل معايير الكودكان هدفنا هو عزل فهم اللغة مع الحفاظ على منطق الكود. تمت معالجة الترجمة الفورية بواسطة GPT-4o مع التحقق عبر الترجمة العكسية. لم يتم المساس بالرمز والاختبارات للسماح بتكافؤ التقييم مع الإصدارات الإنجليزية. والنتيجة هي معيار حيث يمكن تقييم المطالبات العربية مباشرة باستخدام سلسلة أدوات EvalPlus.
النتائج الرئيسية
قمنا بتقييم أكثر من 40 ماجستير في القانون، بما في ذلك النماذج الأساسية للغة العربية أولاً ومتعددة اللغات والأغراض العامة والنماذج المضبوطة للتعليمات. تم إجراء التقييم باستخدام دقة الاختيار من متعدد ومقاييس الإكمال التوليدي.

في إعداد MCQ، حقق Qwen2.5-72B-Instruct أعلى أداء عبر كل من المجموعات الفرعية الأصلية (71.8%) والصناعية (67.0%) في مجالات العلوم والتكنولوجيا والهندسة والرياضيات. ل مهام الإنجاز، أظهر Gemma-3-27B أقوى النتائج بدقة 43.2% على إجابات العلوم والتكنولوجيا والهندسة والرياضيات.
في توليد الكود، أظهر GPT-4o الأداء الأفضل في فئته على كل من HumanEval-ar (83.5% pass@1+) وMBPP-ar (63.6% pass@1+). تسلط هذه النتائج الضوء على الارتباط القوي (~0.97) بين درجات النجاح في اللغتين العربية والإنجليزية، مما يشير إلى أن الجودة السريعة الخاصة باللغة المحددة لها تأثير كبير على نتائج النموذج.

لقد فحصنا أيضا المتانة تحت اضطراب التشتيتمما يكشف أن النماذج المضبوطة للتعليمات أكثر استقرارًا بشكل ملحوظ من نظيراتها الأساسية. كما تبين أيضًا أن الهندسة السريعة والتصميم الصفري يؤثران بشكل كبير على أداء العلوم والتكنولوجيا والهندسة والرياضيات باللغة العربية.
أدوات التقييم
لقد قمنا ببناء المعيار ليكون قابلاً للتكرار بسهولة باستخدام الأدوات القياسية:
lightevalيتعامل مع تقييم الأسئلة متعددة الاختيارات والمفتوحة لمجموعات بيانات العلوم والتكنولوجيا والهندسة والرياضيات.evalplusيعمل على تشغيل تسجيل التعليمات البرمجية القوي pass@1 وpass@1+ باستخدام اختبار مستوى الوظيفة.
تتوفر جميع البرامج النصية والتكوينات وخطوط التقييم في مستودع GitHub الخاص بنا، ويمكن تكييفها لتقييم أي نموذج متوافق مع HuggingFace Transformers أو OpenAI APIs.
الوصول إلى مجموعات البيانات
جميع مجموعات البيانات الثلاثة مفتوحة المصدر ويتم استضافتها على HuggingFace Datasets:
الاقتباس
إذا كنت تستخدم 3LM في بحثك، يرجى ذكرنا:
@inproceedings{boussaha-etal-2025-3lm,
title = "3{LM}: Bridging {A}rabic, {STEM}, and Code through Benchmarking",
author = "Boussaha, Basma El Amel and
Al Qadi, Leen and
Farooq, Mugariya and
Alsuwaidi, Shaikha and
Campesan, Giulia and
Alzubaidi, Ahmed and
Alyafeai, Mohammed and
Hacid, Hakim",
booktitle = "Proceedings of The Third Arabic Natural Language Processing Conference",
month = nov,
year = "2025",
address = "Suzhou, China",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2025.arabicnlp-main.4/",
doi = "10.18653/v1/2025.arabicnlp-main.4",
pages = "42--63",
ISBN = "979-8-89176-352-4",
}