بواسطة مجموعة برامج Intel AI

DeepMath هو وكيل استدلال رياضي متوافق مبني عليه التفكير Qwen3-4B وضبطها مع GRPO (تحسين السياسة النسبية للمجموعة). بدلا من النص المطول، ينبعث النموذج مقتطفات بايثون الصغيرة بالنسبة للخطوات المتوسطة، يقوم بتشغيلها في بيئة اختبار آمنة، ثم يدمج النتائج مرة أخرى في منطقها، مما يقلل الأخطاء وطول المخرجات. يتم تنفيذ الوكيل باستخدام مكتبة سمولاجينتس.

نقوم بتقييم DeepMath على أربع مجموعات بيانات رياضية: MATH500، AIME، HMMT، وHLE، وإظهار أن:

  • 🤖 وكيل الرياضيات وحده يقلل من أطوال المخرجات بنسبة تصل إلى 66%، مع تحسين الدقة في كثير من الأحيان.

  • ⚡ يعمل تدريب GRPO على تحسين أداء الوكيل بشكل أكبر، في جميع المعايير تقريبًا.

👉 البرامج النصية للكود والتقييم: https://github.com/IntelLabs/DeepMath
👉 النموذج: https://huggingface.co/Intel/deepmath-v1

لماذا ديب ماث؟

تتمتع نماذج اللغة الكبيرة (LLMs) بقدرات تفكير متقدمة، ولكن حل المشكلات الرياضية يظل أمرًا صعبًا؛ يمكن أن تكون آثار سلسلة الأفكار طويلة وعرضة للأخطاء الحسابية. الأعمال الأخيرة[^1][^2] تثبت أن النماذج الصغيرة يمكن أن تصل إلى أداء قوي، ودراسات أخرى[^3] التحقيق في استخدام الأداة لتحسين الموثوقية. ما لا تؤكده هذه الأوراق عمومًا هو تقليل إسهاب التتبع أو تدريب النماذج بشكل صريح لتفضيل التتبعات القصيرة الموجهة نحو الحساب والتي يتم تنفيذها في بيئة مقيدة وقابلة للتدقيق.

ركزنا على هدفين:

  1. تفريغ الحساب الحتمي إلى منفذ آمن.

  2. تدريب النماذج على تفضيل التتبعات المختصرة والموجهة نحو الحساب على النص المطول.

ديب ماث يعالج هذا من خلال الجمع بين منفذ بايثون صغير وماجستير في القانون (LLM) مضبوط بدقة، مما يتيح تفكيرًا موجزًا ​​قائمًا على الحساب. يتعلم النموذج كيفية إنشاء مقتطفات بايثون قصيرة، والتي يتم تنفيذها في وضع الحماية وإعادة دمجها في السياق. يشجع ضبط GRPO هذا السلوك من خلال مكافأة الصحة وتشجيع المخرجات الأقصر.

كيف يعمل

  • النموذج الأساسي: تفكير Qwen3-4B.
  • قيود المنفذ: بيئة وضع الحماية، والقائمة المسموح بها للوحدات النمطية المستوردة، ومهلة كل مقتطف.
  • الاستدلال: بناءً على المواد الكيميائية، تم إنشاء وكيل رياضي. يتم استخدام vLLM كمحرك الاستدلال.
  • التدريب: استنادًا إلى مدرب GRPO في TRL، قمنا بتعديل عميل وخادم vLLM الخاص بـ TRL لإنشاء إكمالات GRPO باستخدام وكيل DeepMath الخاص بنا.

التغييرات على عميل وخادم vLLM في مكتبة TRL.
الشكل 1: تم تعديل عميل وخادم vLLM لاستخدام وكيل DeepMath في إنشاء المرشحين، أثناء استخدام الواجهة الخلفية لـ vLLM.

  • واجهة الوكيل: أثناء الاستدلال، يمكن للنموذج إخراج الرموز المميزة العادية أو استدعاءات الوكيل الخاص التي تحتوي على مقتطفات Python.

  • تنفيذ: يتم تشغيل المقتطفات في بيئة معزولة مع قيود أمان صارمة (لا يوجد إدخال/إخراج للملفات، ولا توجد شبكة، ومهلة زمنية).

  • أهداف التصميم:

    • الإيجاز: استبدل الحسابات النصية متعددة الأسطر بمقتطفات قصيرة ومركزة.

    • الحتمية والسلامة: فرض حدود التنفيذ الصارمة.

    • القابلية للتفسير: المقتطفات قابلة للقراءة والتدقيق.

مثال الإخراج: يحتوي على مقتطف قصير من بايثون بالإضافة إلى مخرجاته التي يتم استخدامها في عملية الاستدلال.
الشكل 2: مثال على الإخراج حيث يتم إنشاء كود بايثون وتقييمه وإدراج الإجابة في التتبع واستخدامها في السياق.

التدريب مع GRPO

نقوم بضبط النموذج باستخدام جربو، وهو تحسين قائم على المكافأة يوازن بين:

  • مكافأة الدقة: +1 للإجابات الصحيحة.

  • باستخدام مقتطفات التعليمات البرمجية: إجراء 1+ لإنشاء مقتطفات التعليمات البرمجية، بنسبة 10:1 مقابل مكافأة الدقة.

  • تقليل الطول: يتم تشجيع الأطوال الأقصر من خلال قصر المرشحين لإكمال GRPO على 5 آلاف رمز مميز.

  • جدولة درجة الحرارة: قمنا بتنفيذ جدولة درجة الحرارة الخطية (T = 1.2 → T = 0.7) لتحقيق التوازن بين الاستكشاف والاستقرار أثناء التدريب. يهدف هذا النهج إلى تعزيز التجريب خلال مراحل التدريب الأولية، وبالتالي تقليل درجة الحرارة أثناء تحسين كفاءتنا في المهارة.

  • التعلم في السياق: قمنا بتضمين 4 أمثلة تم حلها حيث يحتوي التتبع على استدعاءات الوكيل ومخرجات المنفذ، بحيث يتعلم النموذج بناء الجملة ونمط الاستدعاء/الاستجابة.

  • مجموعة البيانات: استخدمنا المجموعة الفرعية للاستدلال المتكامل للأدوات (TIR) ​​من مجموعة بيانات OpenMathReasoning. لاحظ أن GRPO يستخدم فقط مشكلة، وليس الحل في البيانات. تم اختيار مجموعة البيانات هذه لضمان استفادة المشكلات من الأداة الخارجية.

تقييم

قمنا بقياس DeepMath مقابل خطوط الأساس في أربع مجموعات بيانات. تشمل المقاييس ما يلي:

  • الأغلبية @ 16: المتانة عبر العينات، كما هو مستخدم في أعمال الاستدلال الرياضي السابقة، راجع المراجع.

  • متوسط ​​طول الإخراج: الاختصار.

جدول النتائج الرئيسية

  • قمنا بمقارنة التكوين الأساسي (Qwen3-4B-Thinking-2507، بدون وكيل) مع نموذج DeepMath الخاص بنا. كاستئصال، نقوم بتقييم إطار العمل الذي قمنا بتطويره باستخدام نموذج Qwen3 غير المدرّب، والذي يُشار إليه بـ + وكيل. بالإضافة إلى ذلك، فإننا نفحص ما إذا كان تدريب GRPO (للاستخدام الوكيل) يحسن الاستدلال غير الوكيل، والذي يشار إليه بـ +جربو. وبالتالي فإن الاجتثاثين مستقلان، وليسا إضافيين.

  • نلاحظ أن الاستدلال الوكيل يقلل من أطوال الإخراج، مع نتائج دقة مختلطة. تم تدريب نموذج DeepMath بواسطة GRPO ويتم تشغيله في الوضع الوكيل، ويظهر أعلى دقة مع آثار مختصرة. نستنتج هناك حاجة إلى كل من تدريب GRPO والاستدلال الوكيل للحصول على أفضل النتائج.

البصيرة الرئيسية: يقوم DeepMath بتقليل طول الإخراج بما يصل إلى 66% مع تحسين الدقة في مجموعات البيانات الصعبة.

لماذا يهم؟

  • دقة: يؤدي تفريغ الحساب إلى تقليل الأخطاء الحسابية.

  • كفاءة: تعني المخرجات الأقصر استنتاجًا أسرع وقابلية تفسير أسهل.

  • أمان: يؤدي تنفيذ وضع الحماية إلى تخفيف مخاطر تشغيل تعليمات برمجية عشوائية.

خاتمة

يعرض DeepMath طريقة عملية وخفيفة الوزن للجمع بين منفذ صغير وشهادة LLM وتدريب النموذج على تفضيل التتبعات القصيرة المعتمدة على العمليات الحسابية. يؤدي تفريغ الحسابات الحتمية إلى تقليل الأخطاء الحسابية والعددية وتقصير الآثار، ويشجع الضبط الدقيق لـ GRPO على الإجابات المختصرة والصحيحة. والنتيجة هي أداة أكثر دقة وأكثر قابلية للتفسير لحل الرياضيات دون الحاجة إلى نموذج ضخم أو أدوات خارجية ثقيلة الوزن.

جربه بنفسك

تحقق من GitHub repo وشارك بتعليقاتك! المساهمات موضع ترحيب. 🚀

الاقتباس

إذا كنت تستخدم DeepMath في بحثك، يرجى الاستشهاد بما يلي:

@software{deepmath2025,
  author = {Fleischer, Daniel and Berchansky, Moshe and Wasserblat, Moshe},
  title = {DeepMath: A Lightweight Math Reasoning Agent for LLMs},
  year = {2025},
  publisher = {Intel AI Labs},
  url = {https://github.com/IntelLabs/DeepMath}
}

القيود والعمل المستقبلي

  • نِطَاق: ركزنا على نموذج صغير وعلى التفكير الرياضي.

  • تعميم: تم تقييمها على أساس الرياضيات على غرار المسابقة؛ قد لا تنتقل النتائج إلى الإبداع الرياضي المفتوح أو البراهين الرسمية.

  • يعد تنفيذ التعليمات البرمجية التي تم إنشاؤها أمرًا محفوفًا بالمخاطر بطبيعته. يستخدم DeepMath وضع الحماية وحدودًا صارمة للموارد، ولكن يجب أن يقوم أي نشر بإدارة أسطح الهجوم بعناية وفرض حدود للمعدلات.

مراجع

[1] لو، مايكل، سيجون تان، جوستين وونغ، وآخرون. 2025. “DeepScaleR: تجاوز معاينة O1 بنموذج 1.5B عن طريق Scaling RL.” https://pretty-radio-b75.notion.site/DeepScaleR-Surpassing-O1-Preview-with-a-1-5B-Model-by-Scaling-RL-19681902c1468005bed8ca303013a4e2

[2] ليو، مينغجي، شيزهي دياو، شيمينغ لو، وآخرون. 2025. “ProRL: التعلم المعزز المطول يوسع حدود التفكير في نماذج اللغة الكبيرة.” أرخايف:2505.24864. نسخة أولية، arXiv، 30 مايو. https://doi.org/10.48550/arXiv.2505.24864

[3] موشكوف، إيفان، دراج هانلي، إيفان سوروكين، وآخرون. 2025. “الحل الفائز لـ AIMO-2: بناء أحدث نماذج الاستدلال الرياضي باستخدام مجموعة بيانات OpenMathReasoning.” أرخايف:2504.16891. نسخة أولية، arXiv، 23 أبريل. https://doi.org/10.48550/arXiv.2504.16891

شاركها.
اترك تعليقاً