اليوم في CES 2026، كشفت NVIDIA عن عالم من النماذج المفتوحة الجديدة لتمكين مستقبل العملاء، عبر الإنترنت وفي العالم الحقيقي. بدءًا من NVIDIA Nemotron Reasoning LLMs التي تم إصدارها مؤخرًا وحتى NVIDIA Isaac GR00T N1.6 نماذج الأساس العالمية لـ NVIDIA Isaac GR00T N1.6 وNVIDIA Cosmos العالمية، جميع العناصر الأساسية موجودة هنا اليوم لمنشئي الذكاء الاصطناعي لبناء وكلاء خاصين بهم.

ولكن ماذا لو كان بإمكانك جلب وكيلك الخاص إلى الحياة، مباشرة على مكتبك؟ صديق الذكاء الاصطناعي الذي يمكن أن يكون مفيدًا لك ويعالج بياناتك بخصوصية؟

في الكلمة الرئيسية لمعرض CES اليوم، أظهر لنا Jensen Huang كيف يمكننا القيام بذلك بالضبط، باستخدام قوة المعالجة لـ NVIDIA DGX Spark مع Reachy Mini لإنشاء مكتبك الصغير R2D2 الذي يمكنك التحدث معه والتعاون معه.

يقدم منشور المدونة هذا دليلاً خطوة بخطوة لتكرار هذه التجربة المذهلة في المنزل باستخدام DGX Spark وReachy Mini.

Reachy Mini وDGX Spark على المكتب

دعونا الغوص في!

مكونات

إذا كنت تريد البدء بالطهي على الفور، فإليك الكود المصدري للعرض التوضيحي.

سنستخدم ما يلي:

  1. نموذج منطقي: العرض التوضيحي يستخدم NVIDIA Nemotron 3 Nano
  2. نموذج الرؤية: العرض التوضيحي يستخدم NVIDIA Nemotron Nano 2 VL
  3. نموذج تحويل النص إلى كلام: يستخدم العرض التوضيحي ElevenLabs
  4. Reachy Mini (أو محاكاة Reachy Mini)
  5. بيئة بايثون v3.10+، مع الأشعة فوق البنفسجية

لا تتردد في تعديل الوصفة وجعلها خاصة بك – لديك العديد من الطرق لدمج النماذج في تطبيقك:

  1. النشر المحلي – يمكنك التشغيل على أجهزتك الخاصة (DGX Spark أو وحدة معالجة الرسومات المزودة بذاكرة VRAM كافية). يتطلب تنفيذنا مساحة قرص تبلغ 65 جيجابايت تقريبًا لنموذج الاستدلال، و28 جيجابايت تقريبًا لنموذج الرؤية.
  2. النشر السحابي – انشر النماذج على وحدات معالجة الرسومات السحابية، على سبيل المثال من خلال NVIDIA Brev أو Hugging Face Inference Endpoints.
  3. نقاط نهاية النموذج بدون خادم – أرسل الطلبات إلى NVIDIA أو Hugging Face Inference Providers.

منح صلاحيات وكيلة لـ Reachy

إن تحويل وكيل الذكاء الاصطناعي من واجهة دردشة بسيطة إلى شيء يمكنك التفاعل معه بشكل طبيعي يجعل المحادثات تبدو أكثر واقعية. عندما يتمكن عميل الذكاء الاصطناعي من الرؤية من خلال الكاميرا، والتحدث بصوت عالٍ، وتنفيذ الإجراءات، تصبح التجربة أكثر جاذبية. هذا ما يجعل Reachy Mini ممكنًا.

تم تصميم Reachy Mini ليكون قابلاً للتخصيص. من خلال الوصول إلى أجهزة الاستشعار والمحركات وواجهات برمجة التطبيقات، يمكنك توصيلها بسهولة إلى حزمة الوكيل الموجودة لديك، عن طريق المحاكاة أو الأجهزة الحقيقية التي يتم التحكم فيها مباشرة من Python.

يركز هذا المنشور على تكوين العناصر الأساسية الموجودة بدلاً من إعادة اختراعها. نحن نجمع بين النماذج المفتوحة للتفكير والرؤية، وإطار عمل وكيل للتنسيق، ومعالجات الأدوات للإجراءات. يقترن كل مكون بشكل غير محكم، مما يجعل من السهل تبديل النماذج أو تغيير منطق التوجيه أو إضافة سلوكيات جديدة.

وعلى عكس المساعدين الشخصيين المغلقين، يظل هذا الإعداد مفتوحًا بالكامل. يمكنك التحكم في النماذج والمطالبات والأدوات وإجراءات الروبوت. يصبح Reachy Mini ببساطة نقطة النهاية المادية لوكيلك حيث يجتمع الإدراك والتفكير والعمل معًا.

بناء الوكيل

في هذا المثال، نستخدم NVIDIA NeMo Agent Toolkit، وهي مكتبة مفتوحة المصدر مرنة وخفيفة الوزن ومستقلة عن إطار العمل، لتوصيل جميع مكونات الوكيل معًا. إنه يعمل بسلاسة مع أطر العمل الوكيلة الأخرى، مثل LangChain، وLangGraph، وCrewAI، ويتعامل مع كيفية تفاعل النماذج، وتوجيه المدخلات والمخرجات فيما بينها، وتسهيل تجربة تكوينات مختلفة أو إضافة إمكانات جديدة دون إعادة كتابة المنطق الأساسي. توفر مجموعة الأدوات أيضًا ميزات ملفات التعريف والتحسين المضمنة، مما يتيح لك تتبع كفاءة استخدام الرمز المميز ووقت الاستجابة عبر الأدوات والوكلاء، وتحديد الاختناقات، وضبط المعلمات الفائقة تلقائيًا لتحقيق أقصى قدر من الدقة مع تقليل التكلفة ووقت الاستجابة.

الخطوة 0: الإعداد والوصول إلى النماذج والخدمات

أولاً، قم باستنساخ المستودع الذي يحتوي على جميع التعليمات البرمجية التي ستحتاج إلى متابعتها:

git clone git@github.com/brevdev/reachy-personal-assistant
cd reachy-personal-assistant

للوصول إلى طبقة الذكاء الخاصة بك، المدعومة بنماذج NVIDIA Nemotron، يمكنك إما نشرها باستخدام NVIDIA NIM أو vLLM، أو الاتصال بها من خلال نقاط النهاية البعيدة المتوفرة على build.nvidia.com.

تفترض الإرشادات التالية أنك تصل إلى نماذج Nemotron عبر نقاط النهاية. قم بإنشاء ملف .env في الدليل الرئيسي باستخدام مفاتيح API الخاصة بك. بالنسبة لعمليات النشر المحلية، لا تحتاج إلى تحديد مفاتيح API ويمكنك تخطي هذه الخطوة.

NVIDIA_API_KEY=your_nvidia_api_key_here
ELEVENLABS_API_KEY=your_elevenlabs_api_key_here

الخطوة 1: بناء واجهة الدردشة

ابدأ بالحصول على سير عمل أساسي للدردشة LLM يتم تشغيله من خلال خادم واجهة برمجة التطبيقات الخاص بـ NeMo Agent Toolkit. تدعم مجموعة أدوات NeMo Agent تشغيل مهام سير العمل عبر خدمة nat وتوفير ملف التكوين. يحتوي ملف التكوين الذي تم تمريره هنا على جميع معلومات الإعداد الضرورية للوكيل، والتي تتضمن النماذج المستخدمة للدردشة وفهم الصور بالإضافة إلى نموذج جهاز التوجيه الذي يستخدمه الوكيل. يمكن لواجهة مستخدم NeMo Agent Toolkit الاتصال عبر HTTP/WebSocket حتى تتمكن من الدردشة مع سير العمل الخاص بك مثل منتج الدردشة القياسي. في هذا التنفيذ، يتم تشغيل خادم NeMo Agent Toolkit على المنفذ 8001 (حتى يتمكن الروبوت الخاص بك من الاتصال به، ويمكن لواجهة المستخدم أيضًا):

cd nat
uv venv
uv sync
uv run --env-file ../.env nat serve --config_file src/ces_tutorial/config.yml --port 8001

بعد ذلك، تأكد من أنه يمكنك إرسال مطالبة نصية عادية عبر محطة منفصلة للتأكد من إعداد كل شيء بشكل صحيح:

curl -s http://localhost:8001/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "test", "messages": [{"role": "user", "content": "What is the capital of France?"}]}'

بمراجعة تكوين الوكيل، ستلاحظ أنه يحدد إمكانيات أكثر بكثير من إكمال الدردشة البسيطة. سوف تستعرض الخطوات التالية هذه التفاصيل.

الخطوة 2: أضف وكيل ReAct المدمج في NeMo Agent Toolkit لاستدعاء الأداة

يعد استدعاء الأدوات جزءًا أساسيًا من وكلاء الذكاء الاصطناعي. تشتمل مجموعة أدوات NeMo Agent على وكيل ReAct مدمج يمكنه التفكير بين استدعاءات الأداة واستخدام أدوات متعددة قبل الرد. نقوم بتوجيه “طلبات الإجراء” إلى وكيل ReAct المسموح له باستدعاء الأدوات (على سبيل المثال، الأدوات التي تحفز سلوكيات الروبوت أو تجلب حالة الروبوت الحالية).

بعض الملاحظات العملية التي يجب وضعها في الاعتبار:

  • أبقِ مخططات الأداة محكمة (امسح الاسم/الوصف/الوسائط)، لأن هذا هو ما يستخدمه الوكيل ليقرر ما يجب الاتصال به.
  • ضع غطاءًا صلبًا على الخطوات (max_tool_calls) حتى لا يتمكن العامل من الدوران.
  • في حالة استخدام روبوت مادي، فكر في نمط “التأكيد قبل التشغيل” للإجراءات الجسدية لضمان سلامة الحركة.

ألقِ نظرة على هذا الجزء من التكوين فهو يحدد الأدوات (مثل بحث ويكيبيديا) ويحدد نمط وكيل ReAct المستخدم لإدارتها.

functions:
   wikipedia_search:
      _type: wiki_search
      max_results: 2
      
   ..
   react_agent:
      _type: react_agent
      llm_name: agent_llm
      verbose: true
      parse_agent_response_max_retries: 3
      tool_names: [wikipedia_search]

​​workflow:
   _type: ces_tutorial_router_agent
   agent: react_agent

الخطوة 3: إضافة جهاز توجيه لتوجيه الاستعلامات إلى نماذج مختلفة

الفكرة الأساسية: لا تستخدم نموذجًا واحدًا لكل شيء. بدلاً من ذلك، المسار يعتمد على النية:

  • يمكن للاستعلامات النصية استخدام نموذج نصي سريع
  • يجب تشغيل الاستعلامات المرئية من خلال VLM
  • يتم توجيه طلبات الإجراء/الأداة إلى وكيل ReAct + الأدوات

يمكنك تنفيذ التوجيه بعدة طرق (الاستدلال، أو مصنف خفيف الوزن، أو خدمة توجيه مخصصة). إذا كنت تريد إصدار “الإنتاج” من هذه الفكرة، فإن مثال مطور NVIDIA LLM Router هو التنفيذ المرجعي الكامل ويتضمن أنماط التقييم والمراقبة.

قد تعمل سياسة التوجيه الأساسية على النحو التالي:

  • إذا كان المستخدم يطرح سؤالاً حول بيئته، فأرسل الطلب إلى VLM مع صورة تم التقاطها من الكاميرا (أو Reachy).
  • إذا طرح المستخدم سؤالاً يتطلب معلومات في الوقت الفعلي، فأرسل الإدخال إلى وكيل ReACT لإجراء بحث على الويب عبر استدعاء الأداة.
  • إذا كان المستخدم يطرح أسئلة بسيطة، فأرسل الطلب إلى نموذج صغير وسريع مُحسّن للدردشة.

تحدد هذه الأقسام من التكوين طوبولوجيا التوجيه وتحدد طراز جهاز التوجيه.

functions:
   ..
   
   router:
      _type: router
      route_config:
        - name: other
          description: Any question that requires careful thought, outside information, image understanding, or tool calling to take actions.
        - name: chit_chat
          description: Any simple chit chat, small talk, or casual conversation.
        - name: image_understanding
          description: A question that requires the assistant to see the user eg a question about their appearance, environment, scene or surroundings. Examples what am I holding, what am I wearing, what do I look like, what is in my surroundings, what does it say on the whiteboard. Questions about attire eg what color is my shirt/hat/jacket/etc
      llm_name: routing_llm


llms:
   ..
   routing_llm: 
      _type: nim
      model_name: microsoft/phi-3-mini-128k-instruct
      temperature: 0.0


ملحوظة: إذا كنت تريد تقليل زمن الوصول/التكلفة أو التشغيل دون الاتصال بالإنترنت، فيمكنك استضافة أحد النماذج الموجهة ذاتيًا (عادةً نموذج “النص السريع”) والحفاظ على VLM عن بُعد. أحد الأساليب الشائعة هو الخدمة عبر NVIDIA NIM أو vLLM وتوجيه NeMo Agent Toolkit إلى نقطة نهاية متوافقة مع OpenAI.

الخطوة 4: أضف روبوت Pipecat للحصول على الصوت والرؤية في الوقت الفعلي

الآن نذهب في الوقت الحقيقي. Pipecat هو إطار عمل مصمم لوكلاء الصوت/متعددي الوسائط ذوي زمن الاستجابة المنخفض: فهو يقوم بتنسيق تدفقات الصوت/الفيديو وخدمات الذكاء الاصطناعي وعمليات النقل حتى تتمكن من إنشاء محادثات طبيعية. في هذا الريبو، تكون خدمة الروبوت مسؤولة عن:

  • التقاط الرؤية (كاميرا روبوتية)
  • التعرف على الكلام + تحويل النص إلى كلام
  • تنسيق حركة الروبوت والسلوكيات التعبيرية

ستجد جميع أكواد برنامج Pipecat bot في مجلد “reach-personal-assistant/bot”.

الخطوة 5: ربط كل شيء بـ Reachy (الأجهزة أو المحاكاة)

يكشف Reachy Mini عن برنامج خفي يتصل به باقي نظامك. يقوم الريبو بتشغيل البرنامج الخفي في المحاكاة افتراضيًا (–sim). إذا كان لديك حق الوصول إلى Reachy حقيقي، فيمكنك إزالة هذه العلامة وسيتحكم نفس الرمز في الروبوت الخاص بك.

تشغيل النظام بالكامل

ستحتاج إلى ثلاث محطات لتشغيل النظام بأكمله:

المحطة 1: الوصول إلى البرنامج الخفي

cd bot
# macOS:
uv run mjpython -m reachy_mini.daemon.app.main --sim --no-localhost-only

# Linux:
uv run -m reachy_mini.daemon.app.main --sim --no-localhost-only

إذا كنت تستخدم جهازًا فعليًا، فتذكر حذف علامة –sim من الأمر.

المحطة 2: خدمة الروبوت

cd bot
uv venv
uv sync
uv run --env-file ../.env python main.py

المحطة 3: خدمة مجموعة أدوات وكيل NeMo

إذا لم تكن خدمة NeMo Agent Toolkit قيد التشغيل بالفعل من الخطوة 1، فابدأ تشغيلها الآن في المحطة 3.

cd nat
uv venv
uv sync
uv run --env-file ../.env nat serve --config_file src/ces_tutorial/config.yml --port 8001


بمجرد إعداد جميع المحطات الطرفية، هناك نافذتان رئيسيتان لتتبعهما:

  1. الوصول إلى سيم – تظهر هذه النافذة تلقائيًا عند بدء تشغيل برنامج المحاكاة الخفي في الوحدة الطرفية 1. وينطبق هذا إذا كنت تقوم بتشغيل محاكاة Reachy mini بدلاً من الجهاز الفعلي.

  2. ملعب بيبيكات – هذه هي واجهة المستخدم من جانب العميل حيث يمكنك الاتصال بالوكيل وتمكين إدخالات الميكروفون والكاميرا وعرض النصوص المباشرة. في الوحدة الطرفية 2، افتح عنوان URL الذي كشفته خدمة الروبوت: http://localhost:7860/. انقر فوق “الاتصال” في المتصفح الخاص بك. قد يستغرق الأمر بضع ثوانٍ للتهيئة، وسيُطلب منك منح حق الوصول إلى الميكروفون (والكاميرا اختياريًا).

    بمجرد تشغيل كلا النافذتين:

  • يجب أن تظهر مؤشرات حالة العميل والوكيل جاهزًا
  • سوف يرحب بك الروبوت برسالة ترحيب “مرحبًا، كيف يمكنني مساعدتك اليوم؟”

عند هذه النقطة، يمكنك البدء في التفاعل مع وكيلك!

جرب هذه الأمثلة المطالبات

فيما يلي بعض المطالبات البسيطة لمساعدتك في اختبار مساعدك الشخصي. يمكنك البدء بهذه الأشياء ثم تجربتها بإضافة ما لديك لترى كيف يستجيب الوكيل!

المطالبات النصية فقط (التوجيهات إلى نموذج النص السريع)

  • “اشرح ما يمكنك فعله في جملة واحدة.”
  • “تلخيص آخر شيء قلته.”

مطالبات الرؤية (التوجيهات إلى VLM)

  • “ما الذي أحمله أمام الكاميرا؟”
  • “اقرأ النص الموجود في هذه الصفحة وقم بتلخيصه.”

أين تذهب بعد ذلك

بدلاً من مساعد “الصندوق الأسود”، يبني هذا أساسًا لنظام خاص قابل للاختراق حيث يمكنك التحكم في كل من الذكاء والأجهزة. يمكنك فحصه وتوسيعه وتشغيله محليًا، مع رؤية كاملة لتدفق البيانات وأذونات الأداة وكيفية إدراك الروبوت وتصرفه.

اعتمادًا على أهدافك، إليك بعض التوجيهات التي يمكنك استكشافها بعد ذلك:

  • تحسين الأداء: استخدم مثال مطور LLM Router لتحقيق التوازن بين التكلفة وزمن الوصول والجودة من خلال توجيه الاستعلامات بذكاء بين النماذج المختلفة.
  • تحقق من البرنامج التعليمي لبناء وكيل RAG يعمل بالصوت مع حواجز حماية باستخدام نماذج Nemotron المفتوحة.
  • إتقان الأجهزة: استكشف Reachy Mini SDK ومستندات المحاكاة لتصميم واختبار السلوكيات الآلية المتقدمة قبل نشرها على نظامك الفعلي.
  • استكشف وساهم في التطبيقات التي أنشأها المجتمع لصالح Reachy.

هل تريد تجربتها على الفور؟ نشر البيئة الكاملة هنا. نقرة واحدة وأنت قيد التشغيل.

شاركها.
اترك تعليقاً