تبرز سلسلة الأفكار كنمط تصميم قوي وفعال للتطبيقات والوكلاء المعتمدين على LLM. الفكرة الأساسية لتحفيز سلسلة الأفكار هي السماح للنموذج بإنشاء حل خطوة بخطوة (“تتبع السبب”) قبل الإجابة على سؤال أو اتخاذ قرار. باستخدام Open CoT Leaderboard، نقوم بتتبع قدرة LLMs على إنشاء آثار سلسلة أفكار فعالة لمهام التفكير الصعبة.

على عكس معظم لوحات المتصدرين القائمة على الأداء، فإننا لا نسجل الدقة المطلقة التي يحققها النموذج في مهمة معينة، ولكن الفرق بين الدقة مع وبدون المطالبة بتسلسل الأفكار:

accuracy gain Δ = accuracy with CoT – accuracy w/o CoT.

وهذا يسمح لنا بفحص تأثير سلسلة الأفكار على دقة النموذج.

ملحوظة: بدون مطالبة CoT، نستخدم دقة احتمالية السجل لتسجيل النموذج في تقييم الاختيار المتعدد.

ما هو الدافع وراء لوحة المتصدرين هذه لسلسلة الأفكار؟

يعد تحفيز سلسلة الأفكار بمثابة إستراتيجية تحفيز قابلة للتطبيق عالميًا والتي قد تعمل على تحسين إمكانية الشرح والدقة للتطبيقات والوكلاء المستندة إلى LLM (انظر، على سبيل المثال، هذه المجموعة للبحث والتطبيقات الحديثة)). باستخدام أطر عمل مثل Langchain أو LMQL، يكون من السهل إدراج سلاسل تفكير معقدة في تطبيقاتك. ولكن حتى لو لم تسمع عن تسلسل الأفكار من قبل، فربما لاحظت، أثناء استخدام ChatBot، أنه يميل إلى المتابعة خطوة بخطوة قبل الإجابة على استفسارك. لذا، فإن المقارنة المنهجية والحديثة لقدرة LLMs على إنشاء آثار سلسلة فكرية فعالة قد تفيد قرارات المنشئين والمستخدمين عند اختيار النموذج.

وبمرور الوقت، فإن المعايير الثابتة “القائمة على الدقة” تجازف بأن تصبح أقل إفادة: فهل يحقق النموذج نتائج جيدة بسبب مهارته المتفوقة، أو لأنه رأى الإجابات الصحيحة أثناء التدريب، أو لأنه تم تطويره في سياق تنافسي يحكمه هذا المعيار بالذات؟ تتم معالجة هذه المشكلات المعترف بها على نطاق واسع من خلال مناهج التقييم الحديثة مثل ساحات ChatBot، أو استخدام LLMs كحكام، أو المعايير الديناميكية مع المهام التي تم إنشاؤها برمجيًا. نأمل أن تساهم Open CoT Leaderboard في هذه الجهود، لا سيما من خلال كونها أكثر قوة في تدريب تلوث البيانات: معرفة الإجابة على سؤال لا تضمن إمكانية التفكير بشكل فعال حول هذا السؤال.

ما هي المهام المستخدمة؟

يقوم Open CoT Leaderboard بتقييم قدرة LLMs على إنشاء آثار فعالة لسلسلة التفكير للمهام التالية:

باستثناء الإصدار الأصلي من LogiQA، تعد كل هذه المهام جزءًا من معيار AGIEval، وتم إعادة نشرها باسم logikon-bench.

لقد اخترنا هذه المهام لأنها

  1. عامة، أي يمكن حلها من خلال الاستدلال وتتطلب فقط المعرفة المنطقية؛
  2. لا تزال صعبة نسبيًا حتى بالنسبة لأقوى حاملي شهادة الماجستير في القانون (مما يترك مجالًا كافيًا للتحسين من خلال سلسلة الأفكار)؛
  3. تم تقديمها كمعايير للذكاء الاصطناعي من قبل (في AGIEval) وتستخدم على نطاق واسع (على سبيل المثال، في مجموعة Nous Benchmarking).

يتم تقديم جميع المهام كمسائل متعددة الاختيارات، مع تعداد خيارات الإجابة في الموجه.

نحن نستخدم قالب المطالبة التالي لتقييم دقة خط الأساس ودقة CoT – مسارات الاستدلال (بدءًا بـ Reasoning) تتم إضافتها فقط في حالة “مع CoT”:

Answer the following question about the given passage. Base your answer on the reasoning below.

Passage: <passage>
    
Question: <question>

A. <choice1>
B. <choice2>
…

Reasoning: <reasoning>
        
Answer:

كيف يتم إنشاء آثار سلسلة الفكر؟

[#cot-generation]

لقد انتشرت الأدبيات المتعلقة بالتحفيز على تسلسل الأفكار في العام الماضي، وأصبحت ثروة استراتيجيات التحفيز لتكنولوجيا المعلومات (التي تتضمن، على سبيل المثال، فك التشفير، والصياغة الفورية، والسلاسل الفورية، والتحليل، والتجميع، ومراجعة آثار الاستدلال) مذهلة للغاية.

للتعامل مع هذا التنوع، يقوم مسار التقييم وراء Open CoT Leaderboard بتنفيذ إنشاء CoT من خلال سلاسل مطالبة معيارية وقابلة للتوسعة بسهولة. لقد قمنا حتى الآن بتنفيذ استراتيجيتين تحفيزيتين بسيطتين إلى حد ما:

  • الطريقة الكلاسيكية: عرض المشكلة متبوعًا بـ “دعونا نفكر خطوة بخطوة”. تعليمات.
  • التأمل: عرض المشكلة متبوعًا بالتعليمات للتفكير في المشكلة بشكل عام قبل حلها خطوة بخطوة.

دعونا نلقي نظرة على مثال. المشكلة التالية مأخوذة من معيار الاستدلال المنطقي LSAT.

Editorial: The structure of the present school calendar was established to satisfy the requirements of early-twentieth-century agricultural life. In those days, farmers needed their children to have long breaks during which they could remain at home and help with the harvest. The contemporary school year is thus made up of periods of study interspersed with long breaks. But agricultural life no longer occupies most of our citizens, so we can now make changes that serve the interests of children. Therefore, long breaks should be removed from the school calendar.

Which one of the following is an assumption on which the editorial's argument depends?
A) A change in the present school calendar that shortened breaks would serve the interests of agricultural life.
B) Children of farmers need to continue observing a school calendar made up of periods of study interspersed with long breaks.
C) Long breaks in the school calendar should be replaced with breaks that are no longer than workers' average vacations.
D) A school calendar made up of periods of study without long breaks would serve the interests of children more than a school calendar with long breaks.
E) During long breaks children have a tendency to forget what they have learned.

يعمل Mixtral-8x7B-Instruct-v0.1 بشكل جيد إلى حد ما في إنشاء آثار سلسلة الأفكار التالية:

مع استراتيجية المطالبة الكلاسيكية مع استراتيجية دافعة تعكس
وتقول الافتتاحية إن التقويم المدرسي الحالي، الذي يتضمن فترات راحة طويلة، تم تصميمه لاستيعاب الحياة الزراعية ولكن يجب تغييره الآن لأن الحياة الزراعية لم تعد تشغل معظم مواطنينا. ويخلص إلى أنه يجب إزالة فترات الراحة الطويلة من التقويم المدرسي.

والافتراض الذي تعتمد عليه الحجة هو الاعتقاد بأن إزالة فترات الراحة الطويلة من التقويم المدرسي من شأنه أن يخدم مصالح الأطفال أكثر من التقويم الحالي. لم يتم ذكر ذلك صراحة في الافتتاحية، لكن الافتراض الأساسي هو الذي يبرر التغيير المقترح.

ولذلك فإن الإجابة الصحيحة هي: د) التقويم المدرسي المكون من فترات دراسية بدون فترات راحة طويلة من شأنه أن يخدم مصلحة الأطفال أكثر من التقويم المدرسي الذي يحتوي على فترات راحة طويلة.

مشكلة القرار من الناحية المجردة هي تحديد الافتراض الذي تعتمد عليه حجة الافتتاحية.

تتضمن الأخطاء الشائعة لهذا النوع من المشكلات ما يلي:

  1. إساءة تفسير مقدمات الحجة أو استنتاجاتها.
  2. التغاضي عن المتطلبات المحددة لتحديد الافتراض.
  3. الخلط بين الافتراض والنتيجة أو الفرضية.

خطة لكيفية حل هذه المشكلة يمكن أن تكون:

  1. تحديد مقدمات الحجة واستنتاجها.
  2. اذكر الافتراضات المحتملة التي يمكن أن تسد الفجوة بين المقدمات والاستنتاجات.
  3. قم بتقييم كل افتراض لمعرفة ما إذا كان ضروريًا للحجة.

حل المشكلة خطوة بخطوة، باتباع الخطة:

  1. مقدمات الحجة هي:

    • تم إنشاء هيكل التقويم المدرسي الحالي لتلبية متطلبات الحياة الزراعية في أوائل القرن العشرين.
    • ولم تعد الحياة الزراعية تشغل معظم مواطنينا.
  2. خلاصة الحجة هي:

    • يجب إزالة فترات الراحة الطويلة من التقويم المدرسي.
  3. الافتراضات المحتملة يمكن أن تكون:

    • إن التقويم المدرسي الذي يتكون من فترات دراسية دون فترات راحة طويلة من شأنه أن يخدم مصالح الأطفال أكثر من التقويم المدرسي الذي يتضمن فترات راحة طويلة.
    • لم يعد أطفال المزارعين بحاجة إلى البقاء في المنزل والمساعدة في الحصاد خلال فترات الراحة الطويلة.
    • إن تغيير التقويم المدرسي الحالي بحيث تقصير فترات الراحة لن يخدم مصالح الحياة الزراعية.
  4. تقييم كل افتراض:

    • ولا تعتمد الحجة على افتراض مفاده أن أطفال المزارعين لم يعودوا بحاجة إلى البقاء في المنزل والمساعدة في الحصاد خلال فترات الراحة الطويلة، لأن الحجة تدور حول مصالح جميع الأطفال، وليس فقط مصالح المزارعين.
    • ولا تقوم الحجة على افتراض أن تغيير التقويم المدرسي الحالي الذي يقضي بتقصير فترات الراحة لن يخدم مصالح الحياة الزراعية، لأن الحجة تدور حول مصالح الأطفال، وليس الحياة الزراعية.
    • تعتمد الحجة على افتراض أن التقويم المدرسي الذي يتكون من فترات دراسية دون فترات راحة طويلة من شأنه أن يخدم مصالح الأطفال أكثر من التقويم المدرسي الذي يتضمن فترات راحة طويلة. وهذا هو الافتراض الذي يبرر الاستنتاج.

ولذلك فإن الافتراض الذي تعتمد عليه حجة الافتتاحية هو د) التقويم المدرسي المكون من فترات دراسية دون فترات راحة طويلة من شأنه أن يخدم مصالح الأطفال أكثر من التقويم المدرسي الذي يتضمن فترات راحة طويلة.

يتم دمج كل واحدة من إستراتيجيتي التحفيز لدينا — Classic وReflect — وتشغيلها باستخدام معلمات فك تشفير متعددة:

  • طماع.
  • بحث الشعاع (ن = 2).
  • أخذ العينات (T = .3).

وهذا يعطينا مجتمعة ستة “أنظمة توليد CoT”. عندما نقوم بتقييم نموذج ما، نسمح له بإنشاء، لكل مثال في مجموعات بيانات الاختبار، أثر واحد لسلسلة أفكار لكل نظام. يتم بعد ذلك توصيل الآثار التي تم إنشاؤها في قالب المطالبة الموضح أعلاه، والذي نستخدمه لتسجيل النماذج. وبالتالي نحصل على ستة درجات رقمية مختلفة للدقة مع سلسلة الأفكار (أي واحدة لكل نظام). في Open CoT Leaderboard، نقوم بالإبلاغ (لكل نموذج/مهمة) عن أفضل مكاسب دقة هامشية تم تحقيقها في ظل أي نظام.

ما هي أهم الوجبات السريعة حتى الآن؟

نحن نعمل تدريجيًا على توسيع لوحة صدارة Open CoT من خلال تقييم المزيد والمزيد من النماذج، ولكن النتائج الحالية (عدد النماذج = 30) تشير بالفعل إلى بعض الأفكار المثيرة للاهتمام.

  • الأقزام الأقوياء: لقد سررنا جدًا برؤية أن برامج LLM المفتوحة الصغيرة نسبيًا (7B) قادرة على التفكير الفعال، أي تحسين الدقة وتسلسل الأفكار، وفي بعض الحالات بمعدل أفضل من النموذج الأكبر. 🎉 على سبيل المثال، نموذج صغير مثل Phi-2 يستفيد أكثر من نموذج Mixtral من آثار CoT المضافة.
  • يساعد ضبط التعليمات والدردشة على تحقيق نتائج أفضل بكثير من النماذج الأساسية المقابلة لها. وبشكل أكثر تحديدًا، قد يؤدي الضبط الدقيق إلى تحسين دقة خط الأساس بدون CoT ومكاسب الدقة الهامشية التي يتم تحقيقها من خلال CoT.
  • التأثيرات المتغيرة والغامضة لـ CoT: بالتعمق أكثر، نرى أنه لا يوجد نظام واحد مفضل أو متفوق لتوليد CoT. ما يعمل بشكل أفضل مع نموذج واحد ومهمة واحدة قد لا يعمل مع نموذج آخر أو مهمة أخرى. وأحيانًا يقلل CoT من الدقة بدلاً من زيادتها. نحن نعتبر هذا بمثابة تذكير بأن العثور على تطبيق CoT فعال وموثوق وقوي عالميًا لا يزال يمثل مشكلة صعبة.

ما هي الخطوات التالية؟ – وكيفية المساهمة.

نحن نخطط للمضي قدما في اتجاهات مختلفة. والمساهمات في كل هذه الجهود هي موضع ترحيب كبير.

أولاً، نود أن نقوم بتقييم نماذجك! يمكنك 📬 إرسال أي ماجستير إدارة مفتوح للتقييم في مساحة Open CoT Leaderboard، باستخدام علامة التبويب “إرسال”!

بعد ذلك، نود الحصول على بعض المساعدة في مهام الترميز وتحليل البيانات التالية.

  • إجراء تحليل متعمق لنتائج التقييم الكاملة.
    على سبيل المثال، التحليل النوعي لتتبعات CoT التي تم إنشاؤها للتحقق مما إذا كانت تشير بالفعل إلى اختيار الإجابة الصحيحة. لقد قمنا بإنشاء دفتر ملاحظات يوضح كيفية الوصول إلى نتائج التقييم واستكشافها وتتبعات الاستدلال التي تدعم لوحة صدارة Open Cot. يمكنك البناء على ذلك ومشاركة تحليلاتك الخاصة في الريبو المقابل (أو في مكان آخر بالطبع). لا تتردد في فتح قضية مع اقتراحات أو أسئلة. في حال كنت تخطط لاستخدام البيانات في مشاريع بحثية وتريد الحصول على تعليقات، ما عليك سوى ترك ملاحظة.
  • إنشاء لوحة تحكم CoT مفتوحة.
    تتنافس لوحة المتصدرين Open CoT مع نماذج التصنيف وفقًا لمكاسب الدقة الهامشية. ولا يعرض دقة خط الأساس، والتباين، والدرجات الخاصة بأنظمة إنشاء CoT المختلفة، وخصائص آثار الاستدلال التي تم إنشاؤها (على سبيل المثال، الطول)، وما إلى ذلك. نعتقد أنه سيكون من المفيد للغاية استكمال لوحة المتصدرين بلوحة معلومات (على سبيل المثال، كعلامة تبويب إضافية أو مساحة HF منفصلة) تقدم كل هذه المعلومات ويمكن للمستخدمين استكشافها بشكل تفاعلي. إذا كنت مهتمًا ببناء لوحة معلومات Open CoT (معنا أو بدوننا)، فما عليك سوى التواصل معنا.
  • المزيد من سلاسل CoT.
    نحن نفكر في تنفيذ المزيد من أنظمة توليد CoT. المرشحون الواعدون هم، على سبيل المثال، الاتساق الذاتي، أو شجرة الأفكار، أو التدقيق الذاتي، أو المناقشة. هل تريد مساعدتنا في ذلك؟ تواصل معنا! (🤫: لماذا لا تختار مثل هذا المشروع لرسالة الماجستير أو البكالوريوس؟)
  • المزيد من المهام ومجموعات بيانات الاختبار.
    يمكن القول إن لوحة المتصدرين Open CoT مبنية على مجموعة ضيقة من المعايير. بمجرد حصولنا على موارد حوسبة مجانية، نود تضمين المزيد من المهام الاستدلالية الصعبة. سنكون سعداء بمعرفة المهام التي ترغب في رؤيتها مدرجة في لوحة المتصدرين لـ Open CoT.

هنا يمكننا تبادل أفكارنا والتعاون:

  • للحصول على اقتراحات وملاحظات غير فنية، انضم إلى المناقشة في مساحة HF الخاصة بلوحة المتصدرين.
  • للحصول على التعليقات والأسئلة الفنية، افتح مشكلة في GitHub repo الخاص بنا.

نتطلع الى الاستماع منك!

شاركها.
اترك تعليقاً