النطاق الزمني هو معيار مفتوح المصدر مصمم لقياس مدى فهم نماذج لغة الرؤية لمقاطع الفيديو الطويلة. ومن خلال إضافة مقاطع “إبرة” قصيرة إلى مقاطع فيديو تتراوح مدتها من دقيقة واحدة إلى 8 ساعات، يتم تقييم ثلاث مهارات:
- استرجاع موضعي،
- تركيب المعلومات،
- الإدراك الزمني الدقيق. يكشف Timescope أن العديد من النماذج الحديثة لا تزال تعاني من الفهم الزمني الحقيقي.
جدول المحتويات
أنتجت التطورات الحديثة في الذكاء الاصطناعي متعدد الوسائط نماذج تدعي أنها تفهم مقاطع الفيديو التي تبلغ مدتها ساعة. ويعكس هذا الاتجاه التقدم في نماذج لغة السياق الطويل، والتي تتفوق في التفكير في النصوص الطويلة. بعد ذلك، تعلن أنظمة لغة الرؤية الآن عن نوافذ السياق التي يمكنها التعامل مع آلاف الإطارات. لكن هذه الادعاءات تتطلب نظرة فاحصة: هل تُظهِر هذه النماذج حقًا فهمًا لتسلسل الأحداث؟ هل تقتصر على الاسترجاع/التعرف على مستوى السطح؟ من المهم أن نتساءل عما إذا كانت قدراتهم مبالغ فيها.
معايير النص مثل هيلم و حاكم لقد كشفت عن هشاشة المطالبات ذات السياق الطويل، موضحة أن النماذج غالبًا ما تواجه صعوبة عندما تتطلب المهام أكثر من مجرد استرجاع بسيط، مثل التفكير أو التجميع على أطوال سياقية طويلة. ومع ذلك، في مجال الفيديو، ما زلنا نلعب لعبة اللحاق بالركب. الاختبار الأكثر شيوعا، فيديو إبرة في كومة قش (فيديو)، يحقن الكهرباء الساكنة الصور مثل “الإبر” في مقاطع الفيديو، حيث تقيس البحث المرئي بشكل فعال بدلاً من الديناميكيات الزمنية الحقيقية. ونتيجة لذلك، نادرًا ما يتم تدريب النماذج عالية المستوى التي تعلن عن سعات إطارات ضخمة بما يتجاوز 256 إطارًا تقريبًا وتشهد انخفاضًا حادًا في معايير مثل فيديو-MME عندما دفعت أبعد من ذلك.
فجوة القياس هذه تجعلنا نتساءل: ماذا يعني حقًا أن “يفهم” النموذج مقاطع الفيديو الطويلة؟ لمعالجة هذه المشكلة، نحن متحمسون لتقديمها النطاق الزمني، وهو معيار جديد مفتوح المصدر مستضاف على Hugging Face. يستكشف TimeScope حدود إمكانيات الفيديو الطويل عن طريق إدخال عدة مقاطع فيديو قصيرة (حوالي 5 إلى 10 ثوانٍ) مقاطع فيديو– “إبرنا” – في مقاطع فيديو أساسية تتراوح مدتها من دقيقة واحدة إلى 8 ساعات. مع ثلاثة أنواع مختلفة من المهام، فإنه لا يقوم بتقييم الاسترجاع فحسب، بل أيضًا التوليف والتعريب وتحليل الحركة الدقيقة، مما يوفر رؤية أكثر شمولية للفهم الزمني.
لماذا تايم سكوب؟ تحفيز معيار أفضل للفيديو
يعد الوعد بالذكاء الاصطناعي في مقاطع الفيديو الطويلة بمثابة تحول، حيث يمكّن الوكلاء من تلخيص ساعات من اللقطات، واكتشاف الحالات الشاذة الدقيقة، والإجابة على الأسئلة المعقدة حول الروايات الممتدة. ومن خلال دمجها في الروبوتات، يمكن لهذه النماذج تحليل العمليات المطولة، والتكيف في الوقت الفعلي، ودفع عملية صنع القرار بشكل مستقل. ولا تقل قوة رؤية المساعد الشخصي الذي يفهم الحياة اليومية ويقدم تعليقات مستمرة وقابلة للتنفيذ.
وفي الممارسة العملية، يؤدي هذا إلى قدرات مبالغ فيها. قد تدعي النماذج أنها تعالج أكثر من 10000 إطار، لكن بيانات التدريب غالبًا ما تصل إلى 256 إطارًا لكل مقطع، مما يؤدي إلى انخفاض الأداء عند المدخلات الأطول. لقد رأينا هذا في التقييمات حيث تؤدي زيادة معدلات أخذ عينات الإطارات إلى تقليل الدقة في المهام التي تتطلب رؤية زمنية.
يقلب TimeScope النص من خلال التركيز على ثلاث ركائز لفهم الفيديو الطويل:
- استرجاع موضعي: هل يستطيع النموذج اكتشاف الأسئلة المتعلقة بجزء قصير محدد من مقطع فيديو ضخم والإجابة عنها؟
- توليف المعلومات: هل يمكنه جمع التفاصيل وطلبها من نقاط متعددة عبر المخطط الزمني؟
- الإدراك الزمني الدقيق: هل يمكنه تحليل الحركة والأحداث في الإبر التي تتطلب أخذ عينات كثيفة ومتعددة الإطارات؟
التصميم المرجعي
الفكرة الرئيسية لـ TimeScope هي استخدام مقاطع فيديو قصيرة كـ “إبر”، وبدلاً من مجرد تحديد الإبرة، فإنها تدفع العارضات إلى فهم الفيديو بأكمله بعمق. نبدأ بفيديو أساسي طويل (على سبيل المثال، فيلم وثائقي أو محاضرة أو لقطات محيطة) ونقوم بإدخال واحدة أو أكثر من إبرة الفيديو القصيرة المنسقة يدويًا (من 5 إلى 10 ثوانٍ لكل منها) في مواضع عشوائية. تحتوي هذه الإبر على المعلومات الأساسية اللازمة لحل المهمة، مما يجبر النماذج على معالجة المدخلات بالكامل دون اختصارات مثل أخذ العينات المتفرقة.
الشكل 1: نظرة عامة على عملية إدخال الإبرة في TimeScope. يعد الفيديو الأساسي الطويل (من دقيقة واحدة إلى 8 ساعات) بمثابة كومة قش، حيث نقوم بربط إبر الفيديو القصيرة (حوالي 5-10 ثوانٍ). تتطلب المهام اكتشاف أو تركيب أو تحليل المحتوى من هذه الإبر المدمجة على أعماق متفاوتة.
نقوم بالتقييم عبر ثلاثة أنواع من الإبر، يستهدف كل منها جانبًا مختلفًا من فهم الفيديو الطويل:
1. الاسترجاع الموضعي
يختبر هذا الاسترجاع الأساسي وفهم الحدث المحلي. يتم طرح الأسئلة بحيث يكفي أخذ عينة من الإطار ذي الصلة من الإبرة، مثل السؤال عن جزء أقصر في مقطع فيديو أطول.
مثال:
ما هي وسيلة النقل التي تظهر في الفيديو؟
2. تجميع المعلومات
هنا، نقوم بتضمين عدة إبر نصية (على سبيل المثال، 2-4 مقاطع قصيرة تعرض “الكلمات السرية” عبر النص الذي يظهر على الشاشة) في نقاط مختلفة في الفيديو. يجب أن يحدد النموذج جميع الكلمات ويبلغ عنها بالترتيب الزمني، ومحاكاة المهام مثل استخراج الطوابع الزمنية أو الحقائق الأساسية من المشاهد المتفرقة. وهذا يتطلب مسح الجدول الزمني الكامل وفهم المواقع النسبية.
3. الإدراك الزمني الدقيق
بالنسبة للأسئلة التي تركز على الحركة أو التسلسلات ضمن مقطع قصير، فإن أخذ العينات من إطار واحد لن يفي بالغرض – يحتاج النموذج إلى إدراك الديناميكيات عبر الإطارات. يستكشف هذا ما إذا كانت معالجة السياق الطويل تحافظ على الإخلاص الزمني.
مثال:
كم مرة لوح الرجل بفأسه؟ (أ) واحد (ب) اثنان (ج) ثلاثة (د) أربعة (هـ) خمسة (و) ستة
بفضل أطوال الفيديو المختلفة ومواضع الإبر المختلفة، يقيس TimeScope مقدار الفيديو الذي يمكن للنموذج التعامل معه بالفعل – ويوضح أن الأداء ينخفض مع زيادة طول الفيديو.
التقييمات والمتصدرين
لبدء الأمور، قمنا بتشغيل TimeScope على مجموعة من نماذج لغة الرؤية الرائدة، بدءًا من المفضلة مفتوحة المصدر وحتى العملاقة مثل Gemini 2.5-Pro. تؤكد النتائج على قيمة المعيار: فحتى النماذج التي تدعي أنها تتعامل مع مقاطع الفيديو الطويلة بشكل جيد لا تزال تعاني من مهام الفيديو الطويلة الحقيقية. تكشف هذه النتائج عن أنماط واضحة – منحدرات الأداء خلال فترات معينة، ونقاط القوة في الاسترجاع الثابت مقابل نقاط الضعف في تحليل الحركة – وتمهد الطريق لتحسينات مستهدفة في تدريب النماذج. للحصول على نتائج وتصورات مفصلة، تحقق من مساحة الوجه المعانقة المضمنة أعلاه.
ماذا تعلمنا؟
حجم النموذج ليس كل شيء. تعرض Qwen 2.5-VL 3B و7B، بالإضافة إلى نماذج InternVL 2.5 عند معلمات 2B و4B و8B، منحنيات فيديو طويلة لا يمكن تمييزها تقريبًا عن نظيراتها الأصغر. جميعها ثابتة عند نفس طول السياق تقريبًا، مما يوضح أن مجرد قياس المعلمات لا يمنح تلقائيًا أفقًا زمنيًا أطول.
Gemini 2.5-Pro هو في دوري خاص به. إنه النموذج الوحيد الذي يحافظ على دقة قوية في مقاطع الفيديو التي تزيد مدتها عن ساعة واحدة.
إن المفاضلات بين المهام مهمة. يتألق Qwen 2.5-VL في مهمة تركيب المعلومات (OCR) – تحديد وترتيب مقتطفات نصية متفرقة – إلا أنه يتخلف عن الإدراك الزمني الدقيق، حيث يلزم حساب دقيق للحركة.
الخلاصة – دعونا نرفع مستوى الذكاء الاصطناعي للفيديو الطويل
يوضح TimeScope أن “فهم الفيديو لمدة ساعة” لا يزال شعارًا أكثر منه حقيقة. من خلال الكشف عن أين تتعثر حتى النماذج الحديثة في التفكير الزمني، وتوليف المعلومات، وإدراك الحركة، يدعونا المعيار إلى إعادة التفكير في كيفية تدريب وتقييم الأنظمة متعددة الوسائط.
- قم بتشغيل العرض التوضيحي – استكشاف الفضاء العام: https://huggingface.co/spaces/Apollo-LMMs/TimeScope
- المعيار محليا – تقييم أي نموذج باستخدام أمرين سريعين:
pip install git+https://github.com/EvolvingLMMs-Lab/lmms-eval.git python -m lmms_eval --model-path <your-model> --benchmark timescope - انضم إلى المتصدرين – أرسل نتائجك وشاهد كيف يقارن نموذجك.
نأمل أن يساعد هذا المعيار المجتمع على تحقيق تقدم ثابت وقابل للقياس نحو النماذج التي تفهم الفيديو بشكل أفضل بمرور الوقت.
نحن مفتوح المصدر لجميع مكونات TimeScope: