الصورة الرمزية الخاصة بـ Andres Marafioti


أثناء تطوير Docmatix، لاحظنا أن الضبط الدقيق لـ Florence-2 عليه أدى إلى أداء رائع على DocVQA، ولكنه أدى إلى درجات منخفضة في المعيار. لتحسين الأداء، كان علينا تحسين النموذج بشكل أكبر على DocVQA لمعرفة بناء الجملة المطلوب للمعيار. ومن المثير للاهتمام، أن أداء هذا الضبط الدقيق الإضافي كان أسوأ وفقًا للمقيمين البشريين، ولهذا السبب استخدمناه في المقام الأول في دراسات الاستئصال وأصدرنا النموذج الذي تم تدريبه فقط على Docmatix للاستخدام على نطاق أوسع.

على الرغم من أن الإجابات التي تم إنشاؤها تتوافق لغويًا مع الإجابات المرجعية، كما هو موضح في الشكل 1، إلا أنها لا تزال تحصل على درجات منخفضة. وهذا يثير هذه الأسئلة: هل ينبغي لنا أن نضبط النماذج لتحسين هذه المقاييس، أم ينبغي علينا أن نطور مقاييس جديدة تتوافق بشكل أفضل مع الإدراك البشري؟

تقييم VQA

الشكل 1: تصور t-SNE للإجابات المولدة والمرجعية لـ Zero-Shot من مجموعة بيانات Docmatix

مقدمة

لقد ركز مجتمعنا مؤخرًا على التقييم خارج التوزيع (OOD)، وذلك باستخدام أساليب مثل النقل الصفري إلى مهام VQA غير المرئية أو الضبط الدقيق لمجموعة بيانات VQA وتقييم مجموعة أخرى. يرتبط هذا التحول بشكل متزايد مع ظهور مجموعات البيانات الاصطناعية مثل Docmatix وSciGraphQA وSimVQA المستخدمة لضبط نماذج لغة الرؤية (VLMs).

تقليديًا، كانت دقة VQA هي المقياس الرئيسي لتقييم أداء النموذج. ويعتمد على مطابقة السلسلة الدقيقة بين الإجابة المتوقعة للنموذج ومجموعة من الإجابات المرجعية المشروحة من قبل البشر. لقد نجح هذا المقياس بشكل جيد لأن تقييم VQA اتبع نموذجًا مستقلاً وموزعًا بشكل متماثل (IID)، حيث كانت عمليات توزيع بيانات التدريب والاختبار متشابهة، مما سمح للنماذج بالتكيف بشكل فعال، راجع التفاصيل هنا.

في إعدادات OOD، قد لا تتطابق الإجابات التي تم إنشاؤها مع الإجابات المرجعية على الرغم من كونها صحيحة بسبب الاختلافات في التنسيق أو التحديد أو التفسير. تم توضيح هذا النموذج بشكل مثالي في الشكل 1، حيث قمنا بمقارنة التسميات التوضيحية التي تم إنشاؤها بدون طلقة مقابل التسميات التوضيحية المرجعية من مجموعة البيانات الاصطناعية. وينطبق هذا بشكل خاص على مجموعات البيانات المولدة بالتعليمات ونظيراتها التي ينظمها الإنسان. لقد حاولت بعض الأساليب محاذاة تنسيقات الإجابات مع المراجع، ولكن هذا يعالج فقط الأعراض، وليس السبب الجذري لمقاييس التقييم المعيبة. ورغم أن التقييم البشري يمكن الاعتماد عليه، إلا أنه مكلف وغير قابل للتطوير، مما يسلط الضوء على الحاجة إلى مقاييس تتوافق بشكل أفضل مع الحكم البشري.

طريقة

Docmatix هي أكبر مجموعة بيانات اصطناعية DocVQA، تم إنشاؤها من مجموعة بيانات المستندات المنسقة، PDFA. إنها أكبر بمقدار 100 مرة من مجموعات البيانات المتوفرة سابقًا. النظير الذي يديره الإنسان هو DocVQA، والذي يعمل كمعيار تقييم لنماذج VQA لفهم المستندات. في هذه التدوينة سوف نستخدم المجموعة الفرعية من Docmatix والذي يتكون من حوالي 200 عينة اختبار، والتي يمكن تنزيلها هنا Docmatix-zero-shot-exp.

الصورة 1
الصورة 2

الشكل 2: أمثلة على أزواج الأسئلة والأجوبة من مجموعة اختبار Docmatix وDocVQA. ملحوظة: الصور المقابلة لا تظهر هنا.

على الرغم من أن محتوى أزواج الأسئلة والأجوبة في Docmatix وDocVQA متشابه، إلا أن أنماطهما تختلف بشكل كبير. يمكن أن تكون المقاييس التقليدية مثل CIDER وANLS وBLEU مقيدة بشكل مفرط للتقييم الصفري في هذا السياق. بدافع من تشابه التضمينات التي لوحظت في t-SNE (الشكل 1)، قررنا استخدام مقياس تقييم مختلف. في هذا المنشور، نأخذ في الاعتبار مقياس LAVE (تقييم VQA بمساعدة LLM) لتقييم التعميم بشكل أفضل على مجموعة البيانات غير المرئية ولكنها متشابهة لغويًا.

الشكل 3: تصور t-SNE لميزات الأسئلة والأجوبة والصورة من مجموعات بيانات Docmatix وDocVQA

الشكل 5: تصور t-SNE لميزات الأسئلة والأجوبة والصورة من مجموعات بيانات Docmatix وDocVQA

لتقييمنا، اخترنا MPLUGDocOwl1.5 كنموذج أساسي. يحقق هذا النموذج 84% من نقاط ANLS في مجموعة الاختبار الفرعية لمجموعة بيانات DocVQA الأصلية. قمنا بعد ذلك بتشغيل جيل بدون لقطة على مجموعة فرعية من Docmatix، تتكون من 200 صورة. استخدمنا Llama-2-Chat-7b لتقييم الإجابات.

حول لاف

لقد اتبعنا الإجراء الموضح في الورقة. تم تأطير تقييم VQA كمهمة تصنيف إجابات مناسبة للتعلم في السياق مع LLMs. استخدمنا مقياس تصنيف من 1 إلى 3 لمراعاة الأسئلة الغامضة أو الإجابات غير الكاملة. تضمنت المطالبة وصفًا للمهمة، والعديد من العروض التوضيحية للإدخال/الإخراج، والإدخال لمثال اختبار.

لقد قمنا بتنظيم وصف مهمتنا وأدرجنا التعليمات “أعط الأساس المنطقي قبل التقييم” لعرض مبرر للتقييم المعين. يتألف كل عرض توضيحي من سؤال، ومجموعة من الإجابات المرجعية، وإجابة المرشح، وتقييم الإجابة، وشرح للتقييم. نحن ندرج أيضا “تقديم تقييم واحد فقط” لتجنب تحليل الجملة على حدة، والذي أدى في بعض الأحيان إلى عدة تقييمات.

task_description = """You are given a question, a set of gold-standard reference answers written by
experts, and a candidate answer. Please rate the accuracy of the candidate answer for the question
considering the reference answers. Use a scale of 1-3, with 1 indicating an incorrect or irrelevant
answer, 2 indicating an ambiguous or incomplete answer, and 3 indicating a correct answer.
Give the rationale before rating. Provide only one rating.
THIS IS VERY IMPORTANT:
A binary question should only be answered with 'yes' or 'no',
otherwise the candidate answer is incorrect."""

demonstrations = [
    {
        "question": "What's the weather like?",
        "reference_answer": ["sunny", "clear", "bright", "sunny", "sunny"],
        "generated_answer": "cloudy"
    }
]

وظيفة التهديف

بالنظر إلى النص الذي تم إنشاؤه في LLM لمثال الاختبار، فقد استخرجنا التقييم من الحرف الأخير (إما 1 أو 2 أو 3) وقمنا بتعيينه إلى درجة في النطاق [0, 1]: [ s = \frac{r – 1}{2} ]

جدول النتائج

تم تلخيص نتائج تقييمنا في الجدول أدناه:

متري عصير التفاح بلو ANLS اغسل
نتيجة 0.1411 0.0032 0.002 0.58

أمثلة نوعية

تقييم VQA

الشكل 4: تصنيف اللاما والأساس المنطقي للإجابات التي تم إنشاؤها والمرجعية من مجموعة اختبار Docmatix الفرعية.

تقييم VQA

الشكل 5: تصنيف اللاما والأساس المنطقي للإجابات التي تم إنشاؤها والمرجعية من مجموعة اختبار Docmatix الفرعية.

هل نحن صارمون للغاية في تقييم أنظمة VQA وهل نحتاج إلى الضبط الدقيق؟

لقد حصلنا على دقة تصل إلى 50% تقريبًا عند استخدام LLMs لتقييم الإجابات، مما يشير إلى أن الإجابات يمكن أن تكون صحيحة على الرغم من عدم الالتزام بتنسيق صارم. ويشير هذا إلى أن مقاييس التقييم الحالية لدينا قد تكون صارمة للغاية. من المهم ملاحظة أن هذه ليست ورقة بحثية شاملة، وأن هناك حاجة إلى مزيد من دراسات الاستئصال لفهم فعالية المقاييس المختلفة بشكل كامل في تقييم الأداء بدون جرعة على مجموعة البيانات الاصطناعية. نأمل أن يكون هذا العمل بمثابة نقطة انطلاق لتوسيع نطاق التركيز البحثي الحالي على تحسين تقييم نماذج لغة الرؤية الصفرية في سياق مجموعات البيانات الاصطناعية واستكشاف أساليب أكثر كفاءة تتجاوز التعلم الفوري.

مراجع

@inproceedings{cascante2022simvqa,
  title={Simvqa: Exploring simulated environments for visual question answering},
  author={Cascante-Bonilla, Paola and Wu, Hui and Wang, Letao and Feris, Rogerio S and Ordonez, Vicente},
  booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition},
  pages={5056--5066},
  year={2022}
}

@article{hu2024mplug,
  title={mplug-docowl 1.5: Unified structure learning for ocr-free document understanding},
  author={Hu, Anwen and Xu, Haiyang and Ye, Jiabo and Yan, Ming and Zhang, Liang and Zhang, Bo and Li, Chen and Zhang, Ji and Jin, Qin and Huang, Fei and others},
  journal={arXiv preprint arXiv:2403.12895},
  year={2024}
}

@article{agrawal2022reassessing,
  title={Reassessing evaluation practices in visual question answering: A case study on out-of-distribution generalization},
  author={Agrawal, Aishwarya and Kaji{\'c}, Ivana and Bugliarello, Emanuele and Davoodi, Elnaz and Gergely, Anita and Blunsom, Phil and Nematzadeh, Aida},
  journal={arXiv preprint arXiv:2205.12191},
  year={2022}
}

@inproceedings{li2023blip,
  title={Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models},
  author={Li, Junnan and Li, Dongxu and Savarese, Silvio and Hoi, Steven},
  booktitle={International conference on machine learning},
  pages={19730--19742},
  year={2023},
  organization={PMLR}
}
@inproceedings{manas2024improving,
  title={Improving automatic vqa evaluation using large language models},
  author={Ma{\~n}as, Oscar and Krojer, Benno and Agrawal, Aishwarya},
  booktitle={Proceedings of the AAAI Conference on Artificial Intelligence},
  volume={38},
  number={5},
  pages={4171--4179},
  year={2024}
}

@article{li2023scigraphqa,
  title={Scigraphqa: A large-scale synthetic multi-turn question-answering dataset for scientific graphs},
  author={Li, Shengzhi and Tajbakhsh, Nima},
  journal={arXiv preprint arXiv:2308.03349},
  year={2023}
}

شاركها.
اترك تعليقاً