تشتهر Hugging Face’s Open LLM Leaderboard (التي أنشأها في الأصل Ed Beeching وLewis Tunstall، ويديرها Nathan Habib وClémentine Fourrier) بتتبع أداء LLMs مفتوحة المصدر، ومقارنة أدائها في مجموعة متنوعة من المهام، مثل TruthfulQA أو HellaSwag.
لقد كان لهذا قيمة هائلة لمجتمع المصادر المفتوحة، لأنه يوفر وسيلة للممارسين لتتبع أفضل النماذج مفتوحة المصدر.
في أواخر عام 2023، قدمنا في Vectara نموذج تقييم الهلوسة Hughes (HHEM)، وهو نموذج مفتوح المصدر لقياس مدى هلوسة LLM (يولد نصًا غير منطقي أو غير مخلص لمحتوى المصدر المقدم). يغطي هذا النموذج كلا من النماذج مفتوحة المصدر مثل Llama 2 أو Mistral 7B، بالإضافة إلى النماذج التجارية مثل OpenAI’s GPT-4 أو Anthropic Claude أو Gemini من Google، وقد سلط الضوء على الاختلافات الصارخة الموجودة حاليًا بين النماذج من حيث احتمالية الهلوسة.
بينما نواصل إضافة نماذج جديدة إلى HHEM، كنا نبحث عن حل مفتوح المصدر لإدارة وتحديث لوحة المتصدرين في HHEM.
في الآونة الأخيرة، أصدر فريق المتصدرين Hugging Face قوالب المتصدرين (هنا وهنا). هذه إصدارات خفيفة الوزن من Open LLM Leaderboard نفسها، وهي مفتوحة المصدر وأسهل في الاستخدام من الكود الأصلي.
يسعدنا اليوم أن نعلن عن إصدار لوحة المتصدرين الجديدة في HHEM، والمدعومة بقالب لوحة المتصدرين في HF.
نموذج تقييم الهلوسة الخاص بـ Vectara’s Hughes (HHEM)
تم تخصيص لوحة المتصدرين لنموذج تقييم الهلوسة Hughes (HHEM) لتقييم تكرار الهلوسة في ملخصات المستندات التي تم إنشاؤها بواسطة نماذج اللغات الكبيرة (LLMs) مثل GPT-4 أو Google Gemini أو Meta’s Llama 2. لاستخدامها، يمكنك اتباع التعليمات هنا.
من خلال إصدار إصدار مفتوح المصدر لهذا النموذج، فإننا في Vectara نهدف إلى إضفاء الطابع الديمقراطي على تقييم هلوسة LLM، وزيادة الوعي بالاختلافات الموجودة في أداء LLM من حيث الميل إلى الهلوسة.
كان إصدارنا الأولي لـ HHEM عبارة عن نموذج Huggingface إلى جانب مستودع Github، لكننا أدركنا بسرعة أننا بحاجة إلى آلية تسمح بتقييم أنواع جديدة من النماذج. باستخدام قالب كود لوحة المتصدرين HF، تمكنا بسرعة من تجميع لوحة متصدرين جديدة تسمح بالتحديثات الديناميكية، ونحن نشجع مجتمع LLM على تقديم نماذج جديدة ذات صلة لتقييم HHEM.
في ملاحظة جانبية ذات معنى لنا هنا في Vectara، تم تسمية HHEM على اسم زميلنا سيمون هيوز، الذي وافته المنية في نوفمبر من عام 2023 دون إشعار لأسباب طبيعية؛ قررنا تسميته تكريما له نظرا لإرثه الدائم في هذا الفضاء.
إعداد HHEM باستخدام قالب لوحة المتصدرين LLM
لإعداد لوحة المتصدرين Vectara HHEM، كان علينا اتباع بعض الخطوات، وضبط رمز قالب لوحة المتصدرين HF وفقًا لاحتياجاتنا:
- بعد استنساخ مستودع المساحة لمؤسستنا، أنشأنا مجموعتي بيانات مرتبطتين: “الطلبات” و”النتائج”؛ تحتفظ مجموعات البيانات هذه بالطلبات المقدمة من المستخدمين لتقييم LLMs الجديدة، ونتائج هذه التقييمات، على التوالي.
- لقد قمنا بملء مجموعة بيانات النتائج بالنتائج الموجودة منذ الإطلاق الأولي، وقمنا بتحديث قسمي “حول” و”الاقتباسات”.
للحصول على لوحة صدارة بسيطة، حيث يتم دفع نتائج التقييمات من خلال الواجهة الخلفية لديك إلى مجموعة بيانات النتائج، هذا كل ما تحتاجه!
نظرًا لأن تقييمنا أكثر تعقيدًا، فقد قمنا بعد ذلك بتخصيص الكود المصدري ليناسب احتياجات لوحة المتصدرين HHEM – إليك التفاصيل:
leaderboard/src/backend/model_operations.py: يحتوي هذا الملف على فئتين أساسيتين –SummaryGeneratorوEvaluationModel. أ. الSummaryGeneratorينشئ ملخصات بناءً على مجموعة بيانات التقييم الخاصة HHEM ويحسب المقاييس مثل معدل الإجابة ومتوسط طول الملخص. ب. الEvaluationModelيقوم بتحميل نموذج تقييم الهلوسة Hughes (HHEM) الخاص بنا لتقييم هذه الملخصات، مما يؤدي إلى مقاييس مثل معدل الاتساق الفعلي ومعدل الهلوسة.leaderboard/src/backend/evaluate_model.py: يحددEvaluatorالطبقة التي تستخدم كليهماSummaryGeneratorوEvaluationModelلحساب النتائج وإرجاعها بتنسيق JSON.leaderboard/src/backend/run_eval_suite.py: يحتوي على وظيفةrun_evaluationالتي تستفيدEvaluatorللحصول على نتائج التقييم وتحميلها إلىresultsمجموعة البيانات المذكورة أعلاه، مما يجعلها تظهر في لوحة المتصدرين.leaderboard/main_backend.py: يدير طلبات التقييم المعلقة وينفذ التقييمات التلقائية باستخدام الفئات والوظائف المذكورة أعلاه. ويتضمن أيضًا خيارًا للمستخدمين لتكرار نتائج التقييم الخاصة بنا.
كود المصدر النهائي متاح في علامة التبويب “الملفات” في مستودع لوحة المتصدرين HHEM الخاص بنا. مع كل هذه التغييرات، أصبح لدينا الآن مسار التقييم جاهزًا للانطلاق، ويمكن نشره بسهولة كمساحة Huggingface Space.
ملخص
إن HHEM هو نموذج تصنيف جديد يمكن استخدامه لتقييم مدى هلوسة LLM. لقد وفر استخدامنا لقالب لوحة المتصدرين Hugging Face الدعم المطلوب بشدة للحاجة المشتركة لأي لوحة متصدرين: القدرة على إدارة تقديم طلبات تقييم النماذج الجديدة، وتحديث لوحة المتصدرين مع ظهور نتائج جديدة.
تحية كبيرة لفريق Hugging Face لجعل هذا الإطار القيم مفتوح المصدر ودعم فريق Vectara في التنفيذ. نتوقع إعادة استخدام هذا الرمز من قبل أعضاء المجتمع الآخرين الذين يهدفون إلى نشر أنواع أخرى من لوحات المتصدرين LLM.
إذا كنت ترغب في المساهمة في HHEM بنماذج جديدة، فيرجى إرسالها إلى لوحة المتصدرين – ونحن نقدر بشدة أي اقتراحات لتقييم النماذج الجديدة.
وإذا كانت لديك أية أسئلة حول الواجهة الأمامية لـ Hugging Face LLM أو Vectara، فلا تتردد في التواصل معنا عبر منتديات Vectara أو Huggingface.