منذ 3 أسابيع، أظهرنا مدى صعوبة تقييم أداء LLM بشكل صحيح في مسائل الرياضيات، وقدمنا ​​Math-Verify، وهو حل أفضل للتحقق من صحة النماذج في الرياضيات (اقرأ المزيد في الإعلان)!

اليوم، يسعدنا أن نشارك أننا استخدمنا Math-Verify لإعادة تقييم شامل لجميع النماذج البالغ عددها 3,751 نموذجًا التي تم إرسالها إلى Open LLM Leaderboard، لإجراء مقارنات أكثر عدلاً وقوة للنماذج!

لماذا تم كسر تقييم الرياضيات في Open LLM Leaderboard

تعد لوحة المتصدرين Open LLM هي لوحة المتصدرين الأكثر استخدامًا في Hugging Face Hub: فهي تقارن أداء نماذج اللغات الكبيرة المفتوحة (LLM) عبر المهام المختلفة. إحدى هذه المهام، والتي تسمى MATH-Hard، تتعلق على وجه التحديد بمشاكل الرياضيات: فهي تقيم مدى نجاح طلاب LLM في حل مشاكل الرياضيات على مستوى المدرسة الثانوية والجامعة. يستخدم 1,324 مسألة ذات صعوبة عالية (المستوى 5) من مجموعة بيانات Hendrycks MATH موزعة على 7 موضوعات (ما قبل حساب التفاضل والتكامل، ما قبل الجبر، الجبر، الجبر المتوسط، العد/الاحتمالات ونظرية الأعداد)، باستخدام منهج 5 لقطات (يتم تقديم النموذج مع 5 أمثلة في الموجه لعرض كيف يجب أن يجيب).

السؤال النموذجي يبدو كالتالي:

For all real numbers $r$ and $s$, define the mathematical operation $\#$ such that the following conditions apply: $r\ \#\ 0 = r, r\ \#\ s = s\ \#\ r$, and $(r + 1)\ \#\ s = (r\ \#\ s) + s + 1$. What is the value of $11\ \#\ 5$?

والذي سيكون الجواب عليه:

71

في لوحة المتصدرين، يجب على النماذج إنهاء إجاباتها بسلسلة محددة جدًا (بعد ورقة Minerva-Math):

“Final answer is [ANSWER]. I hope it is correct.”

ستحاول لوحة المتصدرين بعد ذلك التحليل [ANSWER] باستخدام SymPy لتحويله إلى تمثيل رمزي (وتبسيط القيم إذا لزم الأمر)، قبل مقارنته في النهاية بالهدف الذهبي.

ومع ذلك، أبلغ المستخدمون عن عدد من المشكلات المتعلقة بما ورد أعلاه.

في البداية، كانت المشكلة المتكررة هي عدم قدرة بعض النماذج على اتباع تنسيق الإجابة المتوقع من الأمثلة: فقد قاموا بإخراج جمل أخرى بدلاً من ذلك لتقديم إجاباتهم. نظرًا لعدم اتباع التنسيق، تم وضع علامة على الإجابات كخطأ حتى لو كانت صحيحة بالفعل! (وهي مشكلة إذا كان ما يهمك هو “مدى جودة النموذج في الرياضيات” على وجه التحديد).

📄 مثال ❗️المشكلة ✅ التحقق من الرياضيات 🛑 المتصدرين القديمة
وبالتالي، فإن محيط أحد هذه المثلثات هو $14 + 7\sqrt{2}$ بوصة، معبرًا عنه بأبسط صورة جذرية. فشل الاستخراج 7*sqrt(2) + 14 لا أحد
وبالتالي فإن مجموع المتسلسلة الهندسية اللانهائية هو (\frac{7}{9}). فشل الاستخراج 7/9 لا أحد
( p(n) ) و ( p(n+1) ) يشتركان في عامل مشترك أكبر من 1 هو (\boxed{41}). فشل الاستخراج 4 لا أحد
لذا فهو \frac{1}{9} فشل الاستخراج 1/9 لا أحد
استنتج أنه يمتلك \box{5} سيارات فشل الاستخراج 5 لا أحد

الخطوة التالية، التحويل [ANSWER] إلى التمثيل الرمزي أيضًا بعض المشكلات، هذه المرة مرتبطة بتحليل SymPy:

📄 مثال ❗️المشكلة ✅ التحقق من الرياضيات 🛑 المتصدرين القديمة
الإجابة النهائية هي $2x + 4y + z – 19 = 0 $. آمل أن يكون صحيحا. التحليل الجزئي للمعادلة البارامترية مكافئ(2س + 4ص + ض – 19، 0) 0
(23) فشل الاستخراج بسبب حدود اللاتكس 23 لا أحد
((- \infty, -14) \كوب (-3, \infty)). فشل الاستخراج بسبب الفاصل الزمني الاتحاد (Interval.open(-oo, -14), Interval.open(-3, oo)) لا أحد
100% فشل الاستخراج بسبب رمز غير صالح 1 لا أحد
\بداية{pmatrix}\frac{1}{50}&\frac{7}{50}\frac{7}{50}&\frac{49}{50}\end{pmatrix} فشل الاستخراج بسبب المصفوفة مصفوفة([[1/50, 7/50], [7/50, 49/50]]) لا أحد

في الخطوة الأخيرة، عند مقارنة الإجابة المستخرجة بالتعبير الهدف، حدث أيضًا عدد من المشكلات:

📄 مثال ❗️المشكلة ✅ التحقق من الرياضيات 🛑 المتصدرين القديمة
1/3 == 0.333333 لا يوجد دعم التقريب حقيقي خطأ شنيع
sqrt(1/2)*7 == sqrt(0.5)*7 لا يوجد دعم للتقييم العددي حقيقي خطأ شنيع
ك = 1 == 1 لا يوجد دعم مهمة متغيرة حقيقي خطأ شنيع
Matrix.ones == Matrix.ones لا يوجد دعم لمعادلة المصفوفة حقيقي خطأ شنيع
{1} \الاتحاد {1,4} == {1,4} لا يوجد دعم للمقارنة المحددة حقيقي خطأ شنيع

تم الآن إصلاح كل هذه المشكلات تمامًا باستخدام محلل Math-Verify الجديد!

ما هو النموذج الأفضل في الرياضيات؟ إعادة توزيع كاملة للبطاقات بفضل التقييمات الأكثر عدالة

نظرًا لأن كل هذه المشكلات تميل إلى التراكم، فقد عانت بعض النماذج بشدة من هذا، وتم الاستهانة بأدائها بشدة… لذلك قمنا بإزالة المقيم السابق وأضفنا Math-Verify، والذي كان بسيطًا مثل تغيير 3 أسطر فقط من التعليمات البرمجية! (يمكنك تجربتها أيضًا في تقييمات الرياضيات الخاصة بك!)

وهذا يعني بالتالي إعادة تقييم جميع النماذج المقدمة منذ يونيو… وقد تم إجراء إصلاح شامل لأفضل 20 نموذجًا في مجموعة MATH الفرعية من لوحة المتصدرين.

تأثير التغيير

في المتوسط، تم حل النماذج 61 مشكلة أخرى في جميع المجالات، أي ما يعادل أ 4.66 نقطة زيادة في جميع المجالات!

المجموعتان الفرعيتان اللتان أظهرتا التحسن الأكثر أهمية كانتا مرتبطتين بالجبر (الجبر وPrealgebra) مع مكاسب 8.27 و 6.93، على التوالى. وفي الحالات القصوى، أظهرت بعض النماذج تحسينات تقارب 90 نقاط على هذه المجموعات الفرعية. نعتقد أن هذه المجموعات الفرعية شهدت أكبر قدر من التحسن لأنها تتضمن في كثير من الأحيان إجابات مقدمة كمجموعات (بسبب أسئلة ذات حلول متعددة) ومصفوفات. وقد عزز برنامج Math-Verify طريقة تعامله مع كلا النوعين من الإجابات، مما ساهم في تحقيق هذه المكاسب الملحوظة.

subset_change

تغييرات الأسرة النموذجية

لقد اكتشفنا في البداية مشكلات تقييم الرياضيات عند فحص نماذج Qwen، التي حصلت على درجات منخفضة بشكل غير عادي مقارنة بالأداء الذي تم الإبلاغ عنه ذاتيًا. بعد مقدمة Math-Verify، تضاعفت الدرجات لهذه النماذج، مما أظهر التقليل الشديد السابق للأداء.

لكن نماذج كوين ليست وحدها. عائلة كبيرة أخرى المتضررة هي ديب سيك. بعد التحول إلى Math-Verify، ضاعفت نماذج DeepSeek نتائجها ثلاث مرات تقريبًا! وذلك لأن إجاباتهم عادة ما تكون مغلفة في صندوق (\boxed{}) التدوينات التي لم يتمكن المقيم القديم من استخراجها.
model_family_change

التغييرات في لوحة المتصدرين MATH-Hard

كما ذكرنا في البداية، فإن تصنيفات العشرين الأوائل شهدت تحولًا كبيرًا، مع نفيديا AceMath تهيمن النماذج الآن على لوحة المتصدرين MATH-Hard. المستفيدون الرئيسيون الآخرون من هذا التغيير هم كوين المشتقات، والتي أصبحت الآن على وجه الحصر تقريبًا النماذج الوحيدة التي تحتل مرتبة أقل مباشرة من AceMath. فيما يلي الجدول الكامل الذي يقارن بين تصنيفات أفضل 20 متصدرًا القديمة والجديدة:

math_hard_leaderboard_change

التغييرات في المتصدرين

أخيرًا، قمنا بفحص كيفية تطور النتائج الإجمالية للمتصدرين. وفي حين ظلت المراكز الأربعة الأولى دون تغيير، فقد شهدت المراكز الباقية تحولات كبيرة. نظرًا لظهور مشتقات Qwen المتعددة في مجموعة MATH الفرعية، فقد أدى وجود نماذج Qwen بين أفضل 20 نموذجًا إلى نمو النماذج المشتقة بشكل أكبر في النتائج الإجمالية.
Leaderboard_change

كما قفزت العديد من العارضات الأخرى بشكل كامل في التصنيف، حيث حصلت على 200 مكان أو أكثر! يمكنك الاطلاع على النتائج بمزيد من التفاصيل في Open LLM Leaderboard.

التفاف

أدى تقديم Math-Verify إلى تحسين دقة ونزاهة تقييماتنا بشكل كبير على لوحة المتصدرين Open LLM. وقد أدى ذلك إلى تعديل لوحة المتصدرين، حيث أظهرت العديد من النماذج تحسينات كبيرة في نتائجها.

نحن نشجع جميع المطورين والباحثين على اعتماد Math-Verify في تقييماتهم الخاصة بالرياضيات. ومن خلال القيام بذلك، يمكنك التأكد من أن نماذجك يتم تقييمها بنتائج أكثر موثوقية. بالإضافة إلى ذلك، ندعوك لاستكشاف التصنيفات المحدثة ومعرفة كيف تغيرت نماذجك المفضلة في الأداء.

شاركها.
اترك تعليقاً