ليرة تركية؛دكتور:

  • يعد Qwen3-8B واحدًا من أكثر الإصدارات الحديثة إثارةً – وهو نموذج يتمتع بقدرات وكيل أصلية، مما يجعله مناسبًا بشكل طبيعي لـ AIPC.

  • باستخدام OpenVINO.GenAI، تمكنا من تسريع عملية الإنشاء بمعدل 1.3× تقريبًا باستخدام فك التشفير التخميني باستخدام مسودة Qwen3-0.6B خفيفة الوزن.

  • باستخدام فك التشفير التخميني وتطبيق عملية تقليم بسيطة على المسودة، قمنا بزيادة التسريع إلى ~1.4×

  • لقد اختتمنا هذا بإظهار كيف يمكن استخدام هذه التحسينات لتشغيل وكيل ذكاء اصطناعي محلي سريع باستخدام 🤗 سمولاجينتس

كوين3

يعد Qwen3-8B جزءًا من أحدث عائلة Qwen، حيث تم تدريبه على سلوكيات وكيلة واضحة. وهو يدعم استدعاء الأداة، والتفكير متعدد الخطوات، وقدرات التعامل مع السياق الطويل، مما يجعله مناسبًا تمامًا لسير عمل الوكيل المعقد. عند دمجها مع أطر عمل مثل Hugging Face 🤗smolagents أو QwenAgent أو AutoGen، فإنها تتيح مجموعة واسعة من التطبيقات الوكيلة المبنية على استخدام الأدوات والتفكير المنطقي. على عكس روبوتات الدردشة أحادية المنعطف، تعتمد التطبيقات الوكيلة على نماذج التفكير التي تنتج آثار “التفكير بصوت عالٍ”، وهي خطوات وسيطة تعمل على توسيع استخدام الرمز المميز، مما يجعل سرعة الاستدلال أمرًا بالغ الأهمية للاستجابة. إن الجمع بين الاستدلال الأمثل والذكاء الوكيل المدمج يجعل Qwen3-8B أساسًا مقنعًا لعملاء الذكاء الاصطناعي من الجيل التالي.

تسريع Qwen3-8B على Intel® Core™ Ultra مع فك التشفير التخميني

لقد بدأنا بقياس أداء إصدار OpenVINO المحسّن 4 بت من Qwen3-8B على وحدة معالجة الرسومات المدمجة Intel Lunar Lake، مما جعل هذا بمثابة خط الأساس لدينا لمزيد من التسريع

فك التشفير التأملي هو وسيلة لتسريع توليد الانحدار التلقائي. إنه يعمل باستخدام نموذج أصغر وأسرع كمسودة لاقتراح رموز متعددة في تمريرة أمامية واحدة، والتي يتم التحقق من صحتها بعد ذلك بواسطة نموذج الهدف الأكبر في تمريرة أمامية واحدة. في الإعداد لدينا، كان Qwen3-8B بمثابة النموذج المستهدف بينما تم استخدام Qwen3-0.6B كمسودة. حقق هذا النهج سرعة بمعدل 1.3× فوق خط الأساس.

from openvino_genai import LLMPipeline, draft_model

target_path = "/path/to/target/Qwen3-8B-int4-ov"
draft_path = "/path/to/draft/Qwen3-0.6B-int8-ov"
device = "GPU"

model = LLMPipeline(target_path, device, draft_model=draft_model(draft_path, device))

streamer = lambda x: print(x, end="", flush=True)
model.generate("What is speculative decoding and how does it improve inference speed?", max_new_tokens=100, streamer=streamer)

قبل تهيئة LLMPipelineتأكد من تحويل كل من النموذج المستهدف والمسودة إلى OpenVINO. يمكنك إما تنزيل النماذج المحولة مسبقًا من الروابط المتوفرة أو اتباع هذه الإرشادات لتحويل النماذج الخاصة بك.

دفع الأداء إلى أبعد من ذلك

يعتمد تسريع فك التشفير على متوسط ​​عدد الرموز المميزة التي تم إنشاؤها لكل خطوة أمامية للهدف، γ \غاما وحجم نافذة التخمين، والنسبة بين زمن استجابة النماذج المستهدفة والمسودة ج ج . يمكن للمسودة الأصغر والأسرع (وإن كانت أقل دقة) أن توفر في كثير من الأحيان تسارعًا أكبر. وقد ألهمنا هذا لتقليص مسودة النموذج مع الحفاظ على جودته، أي ه(#زهنهصأرهد_رسكهنق) E(\# تم إنشاء\_الرموز المميزة) .

سصههدشص=ه(#زهنهصأرهد_رسكهنق)γج+1

السرعة = \frac{E(\# تم إنشاء\_الرموز)}{\gamma c + 1}

يُظهر عملنا الأخير أن عمق النموذج (عدد الطبقات) يعد مساهمًا رئيسيًا في زمن الوصول الاستدلالي. لقد استوحينا الإلهام من العمل الأخير المتعلق بالضغط الطبقي[1]. في نهجنا، نحدد كتل الطبقات التي تساهم بشكل قليل، والتي يتم قياسها باستخدام المسافة الزاوية، ونقوم بإزالتها. بعد التقليم، نقوم بإجراء الضبط الدقيق لاستعادة الدقة. باستخدام هذه الطريقة، قمنا بتقليم 6 طبقات من أصل 28 طبقة من نموذج مسودة Qwen3-0.6B. لاستعادة جودة نموذج المسودة المشذبة، قمنا بضبطه بشكل أكبر باستخدام البيانات الاصطناعية التي تم إنشاؤها بواسطة Qwen3-8B. تم إنتاج البيانات عن طريق إنشاء استجابات لمطالبات 500 ألف من مجموعة بيانات BAAI/Infinity-Instruct.

قدم نموذج المسودة المقطوع الناتج تسريعًا بمعدل 1.4x تقريبًا مقارنة بخط الأساس، وهو تحسن مقارنة بالكسب الذي تم تحقيقه بمعدل 1.3x تقريبًا باستخدام المسودة الأصلية. تتوافق هذه النتيجة مع التوقعات النظرية – حيث يؤدي تقليل زمن استجابة المسودة إلى تحسين التسريع الإجمالي، مما يتيح استدلالًا أسرع وأكثر كفاءة.

يوضح هذا كيف يمكن للتشذيب + فك التشفير التخميني أن يفتح استدلالًا أسرع وأكثر كفاءة، مما يجعل وكلاء الذكاء الاصطناعي المحليين أكثر عملية.

تحقق من دفتر الملاحظات ونموذج مسودة Qwen3-0.6B المشذب بعمق لإعادة إنتاج نتائجنا خطوة بخطوة

التكامل مع 🤗المواد الكيميائية

لعرض إمكانات العالم الحقيقي، قمنا بنشر إعدادنا الأمثل مع مكتبة 🤗smolagents. من خلال هذا التكامل، يمكن للمطورين توصيل Qwen3-8B (مقترنًا بمسودتنا المنقحة) لإنشاء وكلاء يقومون باستدعاء واجهات برمجة التطبيقات والأدوات الخارجية، وكتابة التعليمات البرمجية وتنفيذها، والتعامل مع التفكير طويل السياق، والتشغيل بكفاءة على Intel® Core™ Ultra. لا تقتصر الفوائد على Hugging Face، بل يمكن أيضًا استخدام نموذج الاقتران هذا بسلاسة مع أطر عمل مثل AutoGen أو QwenAgent، مما يزيد من تعزيز النظام البيئي الوكيل.

في العرض التوضيحي الخاص بنا، قمنا بتكليف الوكيل المتسارع المستند إلى Qwen3 بمهمة: 👉 تلخيص الميزات الرئيسية لسلسلة نماذج Qwen3 وتقديمها في مجموعة شرائح.

وإليك كيفية العمل: 1. استخدم الوكيل أداة بحث على الويب لجمع معلومات محدثة. 2. ثم انتقل بعد ذلك إلى مترجم بايثون لإنشاء شرائح باستخدام ملف python-pptx مكتبة. يسلط سير العمل البسيط هذا الضوء على جزء صغير فقط من الإمكانيات التي تم فتحها عندما تلتقي نماذج Qwen3 المتسارعة مع أطر عمل مثل 🤗smolagents، مما يضفي الحيوية على عوامل الذكاء الاصطناعي العملية والفعالة على جهاز كمبيوتر يعمل بالذكاء الاصطناعي. جربه هنا 🚀

مراجع

[1] جروموف، أ.، تيرومالا، ك.، شابوريان، إتش.، جلوريوسو، بي.، وروبرتس، DA (2025، 22 يناير). عدم الفعالية غير المعقولة للطبقات العميقة. تم تقديم الملصق في ICLR 2025. https://arxiv.org/abs/2403.17887

الأداء والإشعارات القانونية

  • تعتمد نتائج الأداء على قياس الأداء الداخلي باستخدام OpenVINO™ 2025.2 اعتبارًا من سبتمبر 2025، باستخدام تكوين مع معالج Intel® Core™ Ultra 7 268V 2.20 جيجا هرتز مع وحدة معالجة رسومات Intel® Arc™ 140V مدمجة، مقترنة بذاكرة DDR5 سعة 32 جيجابايت.
  • يختلف الأداء حسب الاستخدام والتكوين وعوامل أخرى. تعرف على المزيد على www.Intel.com/PerformanceIndex.
  • لا يمكن لأي منتج أو مكون أن يكون آمنًا تمامًا.
  • قد تختلف تكاليفك ونتائجك.
  • قد تتطلب تقنيات Intel تمكين الأجهزة أو البرامج أو تنشيط الخدمة.
  • © شركة إنتل. إن Intel وشعار Intel وعلامات Intel الأخرى هي علامات تجارية مملوكة لشركة Intel Corporation أو الشركات التابعة لها.
  • قد تتم المطالبة بأسماء وعلامات تجارية أخرى باعتبارها ملكًا للآخرين.

شاركها.
اترك تعليقاً