ليرة تركية؛ د

على مدار الأسابيع القليلة الماضية، عملنا بلا كلل على جعل وكلاء واجهة المستخدم الرسومية (GUI) أكثر انفتاحًا، ويمكن الوصول إليهم، ويسهل دمجهم. على طول الطريق، أنشأنا أكبر مجموعة قياس الأداء لأداء وكلاء واجهة المستخدم الرسومية 👉 دعنا نقدم ScreenSuite.

نحن متحمسون جدًا لمشاركتها معك اليوم: ScreenSuite هي الطريقة الأكثر شمولاً والأسهل لتقييم نماذج لغة الرؤية (VLMs) عبر العديد من إمكانيات الوكلاء!

WTF هو وكيل واجهة المستخدم الرسومية؟

وكلاء واجهة المستخدم الرسومية أثناء العمل – مقدمة من OSWorld

باختصار، وكيل الذكاء الاصطناعي هو روبوت يعمل في العالم الافتراضي. (تعريف أكثر شمولاً هنا)

على وجه الخصوص، “وكيل واجهة المستخدم الرسومية” هو الوكيل الذي يعيش في واجهة المستخدم الرسومية. فكر في “وكيل يمكنه النقر والتنقل على سطح المكتب أو هاتفي”، على غرار كلود كمبيوتر استخدام.

وهذا يعني في جوهره أن نموذج الذكاء الاصطناعي الذي يقوم بتشغيل الوكيل سيتم تكليفه بمهمة مثل “ملء بقية عمود Excel هذا”، بالإضافة إلى لقطات شاشة لواجهة المستخدم الرسومية. وباستخدام هذه المعلومات، سيقرر بعد ذلك اتخاذ إجراء بشأن النظام: click(x=130, y=540) لفتح متصفح الويب، type(”Value for XYZ in 2025"), scroll(down=2) لقراءة المزيد… لرؤية وكيل واجهة المستخدم الرسومية أثناء العمل، يمكنك تجربة وكيل الكمبيوتر المفتوح لدينا، المدعوم بواسطة Qwen2.5-VL-72B.

سيتمكن وكيل واجهة المستخدم الرسومية الجيد من التنقل عبر جهاز الكمبيوتر تمامًا كما نفعل، وبالتالي فتح جميع مهام الكمبيوتر: التمرير عبر خرائط Google، وتحرير ملف، وشراء عنصر عبر الإنترنت. يتضمن ذلك مجموعة متنوعة من القدرات التي قد يكون من الصعب تقييمها.

تقديم ScreenSuite 🥳

الأدب، على سبيل المثال شو وآخرون. (2025) أو تشين وآخرون. (2025)، يقسم بشكل عام قدرات وكيل واجهة المستخدم الرسومية بين عدة فئات:

  1. الإدراك: إدراك المعلومات المعروضة على الشاشة بشكل صحيح
  2. التأريض: فهم موضع العناصر – وهذا أمر بالغ الأهمية للنقر على المكان الصحيح
  3. الإجراءات ذات الخطوة الواحدة: حل التعليمات بشكل صحيح من خلال إجراء واحد
  4. عوامل متعددة الخطوات: حل هدف عالي المستوى من خلال عدة إجراءات في بيئة واجهة المستخدم الرسومية.

لذا فإن مساهمتنا الأولى هي جمع وتوحيد مجموعة شاملة من 13 معيارًا تغطي النطاق الكامل لقدرات وكيل واجهة المستخدم الرسومية هذه.

إذا نظرت إلى الفئة الأخيرة المذكورة أعلاه، فإن تقييم قدرات الوكيل متعدد الخطوات يمثل تحديًا خاصًا لأنه يتطلب أجهزة افتراضية لتشغيل بيئة الوكيل، سواء كانت Windows أو Android أو Ubuntu… ولمعالجة ذلك، نقدم الدعم لكل من صناديق الحماية البعيدة لسطح المكتب E2B، وقمنا بإنشاء خيار جديد من الصفر لتشغيل أجهزة Ubuntu أو Android الافتراضية بسهولة في Docker!

تفاصيل التنفيذ

لقد صممنا مجموعة المعايير الخاصة بنا بعناية مع وضع الوحدات النمطية والاتساق في الاعتبار، مما يضمن التوافق القوي عبر المهام والبيئات. عند الحاجة، خاصة بالنسبة للمعايير عبر الإنترنت، فإننا نستفيد من Smolagans كطبقة إطارية لتبسيط تنفيذ الوكيل وتنسيقه.

لدعم إمكانية التكرار وسهولة الاستخدام، قمنا ببناء حاويات Dockerized مخصصة تسمح بالنشر المحلي للملفات الكاملة أوبونتو سطح المكتب أو أندرويد البيئات.

على عكس العديد من معايير واجهة المستخدم الرسومية الحالية التي تعتمد على أشجار إمكانية الوصول أو البيانات التعريفية الأخرى إلى جانب المدخلات المرئية، فإن مجموعتنا مصممة بشكل مقصود الرؤية فقط. في حين أن هذا يمكن أن يؤدي إلى درجات مختلفة في بعض لوحات المتصدرين القائمة، فإننا نرى أنه يخلق إعدادًا أكثر واقعية وتحديًا، وهو إعداد يعكس بشكل أفضل كيفية إدراك البشر للواجهات الرسومية وتفاعلهم معها.

– جميع أطر العمل الوكيلة (Android World، OSWorld، GAIAWeb، Mind2Web) تستخدم سمولاجينتس وتعتمد فقط على رؤية، دون إضافة أي شجرة إمكانية وصول أو DOM (على عكس إعدادات التقييم المذكورة في مصادر أخرى). – Mind2Web (متعدد الوسائط) تستخدم في الأصل اختيار متعدد الخيارات يعتمد على اسم العنصر استنادًا إلى شجرة إمكانية الوصول ولقطات الشاشة، ولكن تم تكييفها لاحقًا انقر فوق الدقة داخل المربعات المحيطة استخدام الرؤية فقطمما يزيد بشكل كبير من صعوبة المهمة.

ترتيب VLMs الرائدة على ScreenSuite 📊

لقد قمنا بتقييم VLMs الرائدة وفقًا للمعايير

  • سلسلة موديلات Qwen-2.5-VL من 3B إلى 72B. تُعرف هذه النماذج بقدراتها المذهلة على الترجمة، وبعبارة أخرى، فهي تعرف إحداثيات أي عنصر في الصورة مما يجعلها مناسبة لوكلاء واجهة المستخدم الرسومية (GUI) الذين يحتاجون إلى النقر بدقة.
  • UI-Tars-1.5-7B، البرنامج الشامل من ByteDance.
  • Holo1-7B، أحدث طراز من شركة H، يُظهر توطينًا عالي الأداء بالنسبة لحجمه.
  • جي بي تي-4o

نتائجنا تتفق بشكل عام مع النتائج الواردة في مصادر مختلفة! مع التنبيه بأننا نقيم على الرؤية فقط، مما يسبب بعض الاختلافات، راجع تفاصيل التنفيذ أعلاه.

💡 لاحظ أن ScreenSuite لا تنوي إعادة إنتاج المعايير المنشورة في الصناعة تمامًا: فنحن نقوم بتقييم النماذج عليها قدرات وكيل واجهة المستخدم الرسومية على أساس الرؤية. ونتيجة لذلك، في معايير مثل Mind2Web حيث أعطت معايير أخرى للوكيل رؤية للسياق الغني بالمعلومات مثل DOM أو شجرة إمكانية الوصول، فإن إعداد التقييم لدينا أصعب بكثير، وبالتالي لا يتطابق ScreenSuite مع المصادر الأخرى.

ابدأ تقييمك المخصص خلال الثلاثينيات ⚡️

توجه إلى المستودع.

  1. استنساخ المستودع مع الوحدات الفرعية: git clone --recurse-submodules git@github.com:huggingface/screensuite.git
  2. تثبيت الحزمة: uv sync --extra submodules --python 3.11
  3. يجري python run.py
    • بدلا من ذلك، تشغيل python examples/run_benchmarks.py لمزيد من التحكم الدقيق، مثل إجراء التقييمات لعدة نماذج بالتوازي.

المعايير المتعددة الخطوات يتطلب آلة معدنية عارية لتشغيل ونشر محاكيات بيئة سطح المكتب/الجوال* (راجع README.md)

الخطوات التالية 🚀

إن إجراء تقييمات متسقة وذات مغزى يسمح للمجتمع بسهولة بالتكرار وإحراز تقدم في هذا المجال، كما رأينا مع أداة تقييم Eleuther LM، وOpen LLM Leaderboard، وChatbot Arena.

نأمل أن نرى نماذج مفتوحة أكثر قدرة في الشهر القادم يمكنها تشغيل مجموعة واسعة من المهام بشكل موثوق وحتى تشغيلها محليًا!

لدعم هذا الجهد:

شاركها.
اترك تعليقاً