يسعدنا أن نقدم لوحة المتصدرين NPHardEval، باستخدام NPHardEval، وهو معيار متطور تم تطويره بواسطة باحثين من جامعة ميشيغان وجامعة روتجرز.
يقدم NPHardEval إطارًا ديناميكيًا قائمًا على التعقيد لتقييم القدرات الاستدلالية لنماذج اللغة الكبيرة (LLMs). إنه يطرح 900 سؤال خوارزمي يمتد إلى فئة التعقيد NP-Hard والأقل، وهو مصمم لاختبار LLMs بدقة، ويتم تحديثه على أساس شهري لمنع الإفراط في التجهيز!
نهج فريد لتقييم LLM
تتميز NPHardEval عن غيرها من خلال توظيف فئات التعقيد الحسابي، حيث تقدم مقياسًا قويًا وقابل للقياس لمهارات التفكير المنطقي في LLM. تعكس مهام المعيار تحديات صنع القرار في العالم الحقيقي، مما يعزز أهميته وإمكانية تطبيقه. تعمل التحديثات الشهرية المنتظمة لنقاط البيانات المعيارية على تقليل مخاطر فرط ملاءمة النموذج، مما يضمن إجراء تقييم موثوق به.
المساهمات الرئيسية لـ NPHardEval جديدة باستخدام استراتيجيات قياس الأداء الجديدة (اقتراح معيار تلقائي وديناميكي)، وإدخال طريقة جديدة لتقييم تفكير LLM.
فيما يتعلق باستراتيجيات قياس الأداء، يستخدم NPHardEval آلية آلية، لإنشاء الأسئلة والتحقق منها في المعيار. نظرًا لأنها تعتمد على مشكلات قابلة للحساب خوارزميًا، فإن التدخل البشري ليس مطلوبًا لتحديد صحة الردود من LLMs. وهذا يسمح أيضًا بأن يكون NPHardEval ملفًا المعيار الديناميكي: نظرًا لأنه يمكن إنشاء الأسئلة تلقائيًا، فيمكن تحديث المعيار على أساس شهري. يساعد هذا المعيار الذي يتم تحديثه شهريًا على منع الإفراط في ملاءمة النموذج حيث يمكننا دائمًا إنشاء أسئلة جديدة بمستويات صعوبة متفاوتة للتقييم.
تستخدم الأسئلة نفسها نظامًا جديدًا لتقييم استدلال LLM. ترتكز الأسئلة الواردة في المعيار على التسلسل الهرمي للتعقيد الحسابي، وهو مفهوم راسخ تمت دراسته على نطاق واسع في علوم الكمبيوتر النظرية. يمكّننا هذا الأساس من الاستفادة من الأبحاث الحالية لقياس مدى الاستدلال المنطقي لـ LLM بشكل صارم وكمي، من خلال تحديد المنطق عبر فئات التعقيد. يستبعد المعيار أيضًا بشكل متعمد الحساب العددي من الأسئلة، نظرًا لأنها مهمة صعبة للغاية بالنسبة لحملة الماجستير في القانون. التركيز على الأسئلة المنطقية يسمح بإجراء تقييم أكثر دقة لقدرة التفكير المنطقي الخالص في LLM، حيث يمكن للأسئلة العددية أن تحجب هذا التقييم.
تجميع البيانات
يستخدم NPHardEval 100 سؤال لكل من 9 خوارزميات مختلفة، مع 10 مستويات صعوبة، مما يؤدي إلى 900 سؤال عبر التعقيد والصعوبة. تتميز الخوارزميات التسعة، بما في ذلك الأسئلة 3P و3 NP-Complete و3 NP-hard، وفقًا لنظرية الحوسبة. يتم تجميع جميع الأسئلة الـ 900 وتحديثها شهريًا.
تتوفر المزيد من المعلومات الأساسية والأفكار في هذه الشرائح.
مقاييس التقييم
نحن نستخدم مقياسين لتقييم القدرة الاستدلالية لحاملي شهادة LLM: الدقة المرجحة ومعدل الفشل.
الدقة المرجحة (WA)
الدقة المرجحة (WA) يتم استخدامه لتقييم دقة حل المشكلات. يتم تطبيق هذه الطريقة على كل مشكلة، إما من خلال المقارنة مع الإجابة الصحيحة أو من خلال التحقق من النتائج خطوة بخطوة للمسائل التي لا تحتوي على إجابة واحدة. لتعكس الدقة المقارنة بشكل أكثر فعالية، نقوم بتعيين أوزان لمستويات صعوبة مختلفة. يتوافق وزن كل مستوى مع أهميته النسبية أو التحدي الذي يواجهه، حيث تتلقى مستويات الصعوبة الأعلى وزنًا أكبر في تقدم خطي (على سبيل المثال، المستوى 1 له وزن 1، والمستوى 2 له وزن 2، وهكذا).
صيغة الدقة الموزونة هي كما يلي:
في هذه المعادلة، يمثل الوزن المخصص لمستوى الصعوبة (تتراوح من 1 إلى 10)، و هي الدقة على هذا المستوى.
معدل الفشل (بالفرنسية)
مقياس حاسم آخر نعتبره هو معدل الفشل (بالفرنسية). يساعد هذا الإجراء في تقييم تكرار النتائج غير الناجحة عبر المشكلات ومستويات الصعوبة المختلفة. إنه مفيد بشكل خاص لتحديد الحالات التي لا تتطابق فيها نتيجة LLM مع تنسيق الإخراج المتوقع.
يتم حساب معدل الفشل من خلال النظر في نسبة المحاولات الفاشلة بالنسبة إلى إجمالي عدد المحاولات لكل مستوى صعوبة. يتم احتساب المحاولة على أنها فاشلة إذا قام النموذج بإنشاء نتائج لا يمكن تحليلها بنجاح في جميع استدعاءات نقطة النهاية. لقد حددنا الحد الأقصى لعدد المحاولات بـ 10. ولكل مشكلة، يتم بعد ذلك تجميع معدل الفشل عبر جميع مستويات الصعوبة، مع الأخذ في الاعتبار إجمالي 10 محاولات في كل مستوى.
التعريف الرسمي لمعدل الفشل هو:
هنا، يدل على عدد المحاولات الفاشلة على مستوى الصعوبة .
التجريب والرؤى
يتضمن المعيار تجارب شاملة لتحليل LLMs عبر مختلف فئات التعقيد ومستويات الصعوبة. إنه يتعمق في الفروق الدقيقة في أداء LLM، ويقدم رؤى قيمة حول نقاط القوة والقيود في التفكير. على العموم:
- تعمل النماذج مغلقة المصدر بشكل عام بشكل أفضل من النماذج مفتوحة المصدر، حيث يكون أداء GPT 4 Turbo هو الأفضل بشكل عام.
- تعمل النماذج عمومًا بشكل أفضل في الأسئلة الأقل تعقيدًا، أي فئات التعقيد الأسهل، بينما لا تنخفض دائمًا بشكل خطي في مستويات التعقيد. تقدم النماذج مثل Claude 2 أفضل أداء في الأسئلة NP-Complete (متوسطة التعقيد).
- يمكن لبعض النماذج مفتوحة المصدر أن تتفوق على النماذج قريبة المصدر في أسئلة محددة. تشمل النماذج الرائدة مفتوحة المصدر Yi-34b، وQwen-14b، وPhi-2، وMistral-7b.
إعادة إنتاج نتائج NPHardEval Benchmark على جهازك
لإعداد NPHardEval Benchmark، يلزمك اتباع بعض الخطوات:
- إعداد البيئة: بعد استنساخ المستودع على جهازك المحلي، قم بتثبيت مكتبة بايثون المطلوبة باستخدام
conda.conda create --name llm_reason python==3.10 conda activate llm_reason git clone https://github.com/casmlab/NPHardEval.git pip install -r requirements.txt - إعداد مفاتيح واجهة برمجة التطبيقات: جلب مفاتيح واجهة برمجة التطبيقات وتغيير الإدخالات المقابلة فيها
secrets.txt. - أمثلة على الأوامر: قم بتقييم النموذج الخاص بك باستخدام معيار NPHardEval!
على سبيل المثال، لاستخدام نموذج GPT 4 Turbo (GPT-4-1106-preview) ومشكلة مسافة التحرير (EDP) للتقييم:
- في تجربة Zeroshot، يمكننا استخدام:
cd Close/run
python run_p_EDP.py gpt-4-1106-preview
- في تجربتها القليلة،
cd Close/run
python run_p_EDP_few.py gpt-4-1106-preview self
نحن ندعم حاليًا أمثلة قليلة من نفس السؤال (الذاتي)، وقد ندعم أمثلة من أسئلة أخرى (أخرى) في المستقبل.
انضم إلى المحادثة
تتوفر لوحة المتصدرين NPHardEval ومجموعة البيانات والتعليمات البرمجية على Github وHugging Face للوصول إلى المجتمع والمساهمات.
يسعدنا أن نرى مساهمات المجتمع واهتماماته في مستودع NPHardEval GitHub وHugging Face Leaderboard.