المؤلفون: إنزو رويداس, تيس بويفين
لقد مكنت التطورات الحديثة في نماذج اللغة الكبيرة من الانتقال من الاستدلال بالنص فقط إلى الاستدلال بالنص فقط أنظمة متعددة الوسائط. أولاً، مع دمج الإدراك البصري في نماذج الرؤية واللغة (VLMs)، ومؤخرًا مع إنشاء إجراءات الروبوت في نماذج الرؤية واللغة والعمل (VLA).. نشر هذه النماذج على المنصات الروبوتية المدمجة لا يزال يمثل تحديًا بسبب القيود الصارمة فيما يتعلق بالحوسبة والذاكرة والطاقة، بالإضافة إلى متطلبات التحكم في الوقت الفعلي.
في خطوط أنابيب التحكم المتزامنة، أثناء تشغيل VLA للاستدلال، يكون الذراع خاملاً في انتظار الأوامر التي تؤدي إلى سلوك متذبذب وتصحيحات متأخرة. ولمعالجة ذلك، يمكن للاستدلال غير المتزامن تمكين الحركة السلسة والمستمرة عن طريق فصل التوليد عن التنفيذ. ومع ذلك، لكي تكون فعالة، يجب يجب أن يظل زمن الوصول للاستدلال الشامل أقصر من مدة تنفيذ الإجراء. وبالتالي فإن هذا القيد الزمني يضع حدًا أعلى لإنتاجية النموذج.
إن جلب نماذج VLA إلى الأنظمة الأساسية المضمنة لا يعد مسألة ضغط للنموذج، ولكنه يمثل مشكلة معقدة في هندسة الأنظمة التحلل المعماري, جدولة الكمون مدركة، و التنفيذ المتوافق مع الأجهزة. يعد التصدي لهذه التحديات أمرًا ضروريًا لترجمة التطورات الحديثة في نماذج الأساس متعددة الوسائط إلى أنظمة روبوتية مدمجة عملية وقابلة للنشر.
يقدم هذا الدليل أفضل الممارسات العملية لـ NXP لتسجيل مجموعات البيانات الآلية الموثوقة، وضبط سياسات VLA (يمثل و سمولفلا)، ويسلط الضوء على الأداء في الوقت الحقيقي إن إكس بي آي إم إكس 95 شركة نفط الجنوب تحقق بعد التحسين.
🎥 تسجيل مجموعة البيانات: ما يهم بالفعل
عالية الجودة، ثابت تتفوق البيانات على البيانات “الأكثر فوضوية”. يحول هذا القسم الدروس المكتسبة بشق الأنفس إلى قوائم مرجعية ومخططات ملموسة.
في حالتنا، سجلنا مجموعة بيانات للمهمة: “ضع كيس الشاي في الكوب.”
1) الاتساق أولا
- كاميرات ثابتة: استخدم حوامل صلبة لتجنب انحراف الوضع. إذا تحركت كاميرا واحدة أو أكثر أثناء التسجيل أو التقييم بسبب اهتزازات الروبوت أو قيام المشغل بإعادة ضبط البيئة، فيمكنك ملاحظة فقدان شديد للدقة.
- الإضاءة التي يمكن التحكم فيها: قم بإعداد بيئتك حيث يمكنك التحكم في الإضاءة قدر الإمكان (مصدر (مصادر) الضوء الثابتة وبعيدًا عن ضوء الشمس الذي يختلف خلال النهار).
- تباين قوي: تجنب التدريب باستخدام “أبيض على أبيض” ما لم يكن هذا هو مجال النشر الخاص بك. تعظيم التباين بين الذراع والجسم والبيئة.
- معايرة ثابتة: تأكد من حصولك على نسخ احتياطية من معايرة الروبوت وعامل التشغيل عن بعد حتى لا تضطر إلى إعادة تسجيل حلقاتك السابقة في حالة تعطل الكود.
- لا تغش: لا تستخدم المعلومات التي لن يتمكن النموذج من الوصول إليها في وقت الاستدلال. أثناء تسجيل البيانات، من المغري للمشغل الاعتماد على المراقبة البصرية المباشرة للمشهد. ومع ذلك، يقدم هذا معلومات غائبة عن مجموعة البيانات. يجب أن يقتصر جمع مجموعة البيانات على نفس مدخلات الكاميرا التي ستكون متاحة للسياسة في وقت التشغيل.
2) استخدم كاميرا القابض (ينصح بها بشدة)
يؤدي الانتقال من عروض المشهد فقط إلى وجهات النظر المختلطة إلى زيادة الدقة العالمية، ولكن كلما زاد عدد الكاميرات لديك، زاد تأثر زمن الاستجابة. لذلك، يجب عليك اختيار التسوية الصحيحة. في حالتنا تم الوصول إلى هذا التوازن بثلاث كاميرات:
| قمة | القابض | غادر |
|---|---|---|
![]() |
![]() |
![]() |
| النظرة العالمية للمشهد بأكمله. | أقرب عرض لفهم دقيق ومحاذاة. | استكمل العرض العلوي للارتفاع والعمق. |
نوصي بشدة باستخدام كاميرا مثبتة على القابض. يعمل باستمرار على تحسين معدلات النجاح في مهام المعالجة الدقيقة من خلال توفير وجهة نظر قريبة وذات صلة بالمهمة. والأهم من ذلك، أن الكاميرا أيضًا هي التي تطبق ممارسات جمع البيانات الصحيحة بشكل أكثر فعالية، مما يسمح للمشغل بالاعتماد حصريًا على إدراك الروبوت بدلاً من مراقبة المشهد مباشرة.
عند تركيب كاميرا بمقبض، نوصي بتثبيت الكابل بها الفيلكرو أو دليل تخفيف الضغط لمنعها من إعاقة مجال الرؤية أو الانفصال أثناء الحركة.
3) تحسين prehension

تعديلات بسيطة على الأجهزة مثل أنابيب الانكماش الحراري تعمل المخالب فوق القابض على زيادة الاحتكاك، وتقليل الخشونة، وتقليل الانزلاق أثناء الحلقات، وزيادة معدل نجاح المهمة (عدد أقل من حلقات “النجاح تقريبًا”)، مما يحسن استقرار تعلم السياسات.
4) التنوع والانقسامات

عند تسجيل مجموعة بيانات، يجب عليك:
-
تختلف توزيع الحلقات: قم بتقسيم مساحة العمل الخاصة بك إلى مجموعات موضع البداية، وقم بتسجيل 10 حلقات على الأقل لكل مجموعة. أضف التنوع عن طريق تغيير موضع الكائن وتدويره.
قمنا بتقسيم مساحة العمل التي يمكن الوصول إليها بذراع الروبوت إلى 11 مجموعة، قياس كل منها 10 × 10 سم.
-
التفريق بين مجموعات التدريب والتحقق: يمكن أن تتداخل السياسات بسهولة مع مجموعة التدريب، لذا تأكد من أن مجموعة التحقق من الصحة غير مرئية للنموذج.
قمنا بإزالة المجموعة 6 من مجموعة التدريب.
-
سجل أكبر عدد ممكن من الحركات: تعرض نماذج VLA الصغيرة تعميمًا محدودًا على الحركة غير المرئية. ولذلك، قم بتسجيل الحلقات التي تغطي نطاقات أوسع من درجات الحرية.
أمسكنا كيس الشاي إما في وضع أفقي أو رأسي.
-
توقع الفشل: في بعض الأحيان لن تصل السياسة إلى الكائن في المرة الأولى وسيتعين عليها “الرجوع إليه”. لقد لاحظنا أن وجود 20% من جميع الحلقات التي تتوافق مع حالة العودة إلى الكائن يساعد النموذج على تحسين معدل النجاح الإجمالي.
حوالي 20% من مجموعة التدريب لدينا تتوافق مع حلقات التعافي.
يعكس هذا أفضل الممارسات عبر أوراق VLA وأدلة المجتمع. فيما يلي 3 أمثلة لتنوع البيانات داخل نفس المجموعة:
| موقف البداية 1 | موقف البداية 2 | حلقة التعافي |
|---|---|---|
![]() |
![]() |
![]() |
تتوافق مواضع البداية 1 و 2 مع مواضع مختلفة داخل نفس المجموعة. في المقابل، أثناء فترة التعافي، لا يبدأ الروبوت في “وضع البداية”؛ ولكنه بدلاً من ذلك قريب بالفعل من الكوب ويجب أن يتابع مباشرة لاسترداد كيس الشاي من هذا الموقع.
🎛️ ضبط VLAs بدقة

ما قمنا به عمليا:
- المهام: “أحضر كيس الشاي وضعه في الكوب.”
- مجموعة البيانات:
- 120 حلقة: 10 مجموعات × (10 أوضاع مختلفة لبدء أكياس الشاي + حلقتين للتعافي)
- 3 كاميرات (640 × 480 بكسل، 30 إطارًا في الثانية): أعلى، قابض، يسار
- تمت إزالة المجموعة رقم 6 للتحقق من صحتها
- حجم الدفعة: 8
- تمرين: تم اختيار نقطة تفتيش نموذجية ذات أقل خسارة للتحقق من الصحة بعد 200 ألف خطوة
تم العثور على النطاق الذي يوفر أفضل مفاضلة بين الدقة والتعميم وسلاسة الحركة عبر كل من مجموعات التدريب والتحقق من الصحة لـ ACT (100 إجراء لكل قطعة) ضمن خطوات تدريب تتراوح بين 100 ألف إلى 160 ألف. بالنسبة لتدريب SMolVLA (50 إجراء لكل قطعة)، تظهر المقايضة بعد العديد من خطوات التدريب الإضافية. لقد وجدنا أن التدريب المستمر بعد النقطة التي يبدأ فيها النموذج في التجاوز قليلاً يؤدي إلى تحسين الدقة الإجمالية.
القاعدة الأساسية: اختر نقطة التحقق النهائية من خلال تقييم النجاح في كل من التدريب ومجموعة التحقق من الصحة، وليس من خلال فقدان التدريب.
⚡ تحسين معالج التطبيقات NXP i.MX 95
ال ط.مكس 95 تدمج SoC 6× Arm Cortex-A55، وCortex-M7، وCortex M33 MCU، ووحدة معالجة الرسومات Mali، وNXP ISP الجديد، و eIQ® نيوترون NPU، استهداف استنتاج حافة فعال وآمن مع دعم الكاميرات المتعددة والإدخال/الإخراج القوي. [nxp.com]
1) فرق تسد
بدلاً من تشغيل النماذج كرسم بياني متجانس، نقوم بتحليل الرسم البياني VLA إلى مراحل منطقية: أجهزة التشفير وأجهزة فك التشفير وخبراء الإجراء. وبالتالي، السماح بتحسين كل مكون وجدولته ونشره بشكل مستقل.
من الناحية العملية، يتم تقسيم SmolVLA إلى الكتل الفرعية التالية:
- رؤية: يعالج إطارات كاميرا RGB وينتج تضمينات مرئية.
- LLM العمود الفقري: يُنشئ رموز الإجراءات من التضمينات المرئية والنصية.
- خبير العمل: يطبق مطابقة التدفق على عينات الإجراءات التي تقلل الضوضاء بشكل متكرر وإخراج أوامر التحكم النهائية.
يسمح هذا الفصل بإجراء تحسينات لكل كتلة. يمكن قياس تأثير كل تكميم كتلة لاختيار أفضل مقايضة بين زمن الوصول والدقة. كما أن عزل خبير الحركة عن VLM كان مثاليًا لتشغيله بتردد أقل.
2) التكميم
من أجل تحسين الاستدلال لـ i.MX 95 SoC، استكشفنا العديد من تقنيات التكميم على كتل مختلفة. لقد وجدنا أن تكميم تشفير الرؤية والملء المسبق لـ LLM كان له تأثير محدود على الدقة، في حين أن تكميم تدفق تقليل الضوضاء في خبير العمل يؤدي إلى تدهور الأداء بشكل كبير.
هذا السلوك متوقع، حيث تتراكم أخطاء القياس عبر خطوات تقليل الضوضاء التكرارية.
ولهذا السبب قررنا الحفاظ على هذه الكتلة بدقة أعلى للحفاظ على الاستقرار، بينما استكشفنا في الكتل الأخرى تكوينات تكميم مختلفة، من دقة مختلطة 8 بت إلى تكميم 4 بت، اعتمادًا على الطبقات.
بالإضافة إلى ذلك، قمنا بتطبيق التحسين الداخلي على الكتل المختلفة. وتظهر النتائج في الجدول أدناه، المشار إليه بـ النماذج الأمثل.
3) الاستدلال غير المتزامن: الجدولة المدركة للتحكم
في حلقة التحكم المتزامنة، يعمل خط الأنابيب على النحو التالي:
- التقاط الملاحظة
- تشغيل الاستدلال النموذجي الكامل
- تنفيذ الإجراء الذي تم إنشاؤه
أثناء الخطوة (2)، يظل الروبوت خاملاً. إذا كان زمن الوصول للاستدلال غير مهمل، فسينتج عن ذلك ما يلي:
- الفجوات الخاملة في الحركة
- التصحيحات التذبذبية بسبب الملاحظات القديمة
- انخفاض وتيرة التحكم الفعال
- سلوك التعافي السيئ
مع الاستدلال غير المتزامن، يتم إنشاء الإجراء بالتوازي مع التنفيذ:
- يقوم الروبوت بتنفيذ جزء الإجراء الحالي
- يتم حساب القطعة التالية في وقت واحد
وهذا يزيد من تكرار التحكم الفعال، ويقلل من ثبات الملاحظة، ويحسن سلوك الاسترداد.
في الأنظمة الأساسية المضمنة مثل i.MX 95 SoC، يعد الاستدلال غير المتزامن أمرًا ضروريًا – ولكنه فعال فقط إذا تم الاحتفاظ بزمن استجابة الاستدلال ضمن ميزانية أفق العمل: وقت الاستدلال < وقت التنفيذ
| الاستدلال المتزامن | الاستدلال غير المتزامن | |
|---|---|---|
| الإجراءات لكل قطعة | 100 | 100 |
| إطارا في الثانية | 60 | 60 |
| عتبة حجم القطعة | لا يوجد | 0.2 |
| الوظيفة الإجمالية | لا يوجد | مرجح_المتوسط |
| تطور طابور العمل | ![]() |
![]() |
| نتائج |
📊 ما نحققه بمعالج التطبيقات i.MX 95

يثبت
- المهام: “أحضر كيس الشاي وضعه في الكوب.”
- مجموعة الاختبار (20 حلقة): 2 مواقع عشوائية لكل مجموعة.
- مجموعة التحقق (10 حلقات): جميع المواقع العشرة في المجموعة رقم 6
| النظام الأساسي (وحدة المعالجة المركزية) | سياسة | شكل | الكمون الاستدلال | مجموعة اختبار الدقة (20) | مجموعة التحقق من الدقة (10) | الدقة العالمية (30) |
|---|---|---|---|---|---|---|
| ط.مكس 95 | يمثل | اونكس FP32 | 2.86 ثانية | 1.00 | 0.90 | 0.96 |
| ط.مكس 95 | يمثل | الأمثل | 0.32 ثانية | 1.00 | 0.60 | 0.89 |
| ط.مكس 95 | سمولفلا | اونكس FP32 | 29.1 ثانية | 0.50 | 0.40 | 0.47 |
⏩ الخطوات التالية
هدفنا المباشر هو تحسين دقة المهمة باستخدام SmolVLA (ONNX FP32). لقد أنشأنا بالفعل خطًا أساسيًا وقمنا بقياس زمن الوصول الأمثل للاستدلال على متن الطائرة 6.15 ثانية.
ستركز المرحلة التالية على تحسينات أعمق على وحدات NPU الخاصة بنا. بالتوازي، نهدف إلى الانتقال من إعداد المهمة الواحدة إلى سيناريوهات ذات أفق أطول وأكثر تعقيدًا. وللقيام بذلك، سوف نقدم:
- بيئات المحاكاة لتوليد بيانات قابلة للتطوير وقياس الأداء
- التعلم المعزز (RL) لتنقيح السياسات
- نقل سيم إلى ريال لسد فجوات المجال وتحسين الأداء في العالم الحقيقي
الهدف هو الانتقال من مهمة معالجة واحدة تم التحقق من صحتها نحو منهجية قابلة للتكرار لنشر سياسات VLA على الأنظمة الآلية المدمجة.
✅ قوائم المراجعة التي يمكنك إعادة استخدامها
تسجيل
تمرين
النشر على i.MX 95 SoC
📚 الموارد والإلهام








