الصورة الرمزية الخاصة بـ Hugo Laurençon


من خلال هذه المدونة، نقوم بإصدار Docmatix – وهي مجموعة بيانات ضخمة للإجابة على الأسئلة المرئية للمستندات (DocVQA) وهي أكبر بمئات المرات مما كانت متاحة سابقًا. تُظهر عمليات الاجتثاث التي تستخدم مجموعة البيانات هذه لضبط فلورنس-2 زيادة بنسبة 20% في الأداء على DocVQA.

مثال من مجموعة البيانات
مثال من مجموعة البيانات

خطرت لنا فكرة إنشاء Docmatix لأول مرة عندما قمنا بتطوير The Cauldron، وهي مجموعة واسعة من 50 مجموعة بيانات لتحسين نموذج لغة الرؤية (VLM)، وIdefics2 على وجه الخصوص. من خلال هذه العملية، حددنا فجوة كبيرة في توفر مجموعات بيانات واسعة النطاق للإجابة على الأسئلة المرئية للمستندات (DocVQA). كانت مجموعة البيانات الأساسية التي اعتمدنا عليها في Idefics2 هي DocVQA، والتي تحتوي على 10000 صورة و39000 زوج من الأسئلة والأجوبة (Q/A). ومن خلال ضبط هذه المجموعة وغيرها من مجموعات البيانات، لا تزال النماذج مفتوحة المصدر تحتفظ بفجوة كبيرة في الأداء مقارنة بالنماذج مغلقة المصدر. لمعالجة هذا القيد، يسعدنا تقديم Docmatix، وهي مجموعة بيانات DocVQA تضم 2.4 مليون صورة و9.5 مليون زوج أسئلة/أجوبة مستمدة من 1.3 مليون مستند PDF. أ 240X زيادة في الحجم مقارنة بمجموعات البيانات السابقة.

مقارنة Docmatix بمجموعات بيانات DocVQA الأخرى
مقارنة Docmatix بمجموعات بيانات DocVQA الأخرى

هنا يمكنك استكشاف مجموعة البيانات بنفسك ومعرفة نوع المستندات وأزواج الأسئلة والأجوبة الموجودة في Docterix.

تم إنشاء Docmatix من PDFA، وهي مجموعة بيانات واسعة النطاق للتعرف الضوئي على الحروف تحتوي على 2.1 مليون ملف PDF. لقد أخذنا النسخ من PDFA واستخدمنا نموذج Phi-3-small لإنشاء أزواج الأسئلة والأجوبة. ولضمان جودة مجموعة البيانات، قمنا بتصفية الأجيال، وتخلصنا من 15% من أزواج الأسئلة والأجوبة التي تم تحديدها على أنها هلوسة. وللقيام بذلك، استخدمنا التعبيرات العادية لاكتشاف التعليمات البرمجية وقمنا بإزالة الإجابات التي تحتوي على الكلمة الأساسية “غير قابلة للإجابة”. تحتوي مجموعة البيانات على صف لكل ملف PDF. قمنا بتحويل ملفات PDF إلى صور بدقة 150 نقطة في البوصة، وقمنا بتحميل الصور المعالجة إلى Hugging Face Hub لسهولة الوصول إليها. يمكن إرجاع جميع ملفات PDF الأصلية في Docmatix إلى مجموعة بيانات PDFA الأصلية، مما يوفر الشفافية والموثوقية. ومع ذلك، قمنا بتحميل الصور التي تمت معالجتها لتسهيل الأمر لأن تحويل العديد من ملفات PDF إلى صور يمكن أن يتطلب الكثير من الموارد.

المعالجة لـ Docmatix
معالجة خط الأنابيب لإنشاء Docmatix

بعد معالجة الدفعة الصغيرة الأولى من مجموعة البيانات، أجرينا العديد من دراسات الاستئصال لتحسين المطالبات. لقد هدفنا إلى إنشاء حوالي أربعة أزواج من الأسئلة والأجوبة في كل صفحة. يشير عدد كبير جدًا من الأزواج إلى وجود تداخل كبير بينها، بينما يشير عدد قليل جدًا من الأزواج إلى نقص التفاصيل. بالإضافة إلى ذلك، كنا نهدف إلى أن تكون الإجابات شبيهة بالإجابات البشرية، مع تجنب الإجابات القصيرة أو الطويلة بشكل مفرط. كما أعطينا الأولوية للتنوع في الأسئلة، مما يضمن الحد الأدنى من التكرار. ومن المثير للاهتمام أنه عندما قمنا بتوجيه نموذج Phi-3 لطرح الأسئلة بناءً على المعلومات المحددة في الوثيقة (على سبيل المثال، “ما هي ألقاب جون دو؟”)، أظهرت الأسئلة عددًا قليلًا جدًا من التكرار. يعرض المخطط التالي بعض الإحصائيات الأساسية من تحليلنا:

تحليل سريع Docmatix
تحليل Docmatix لكل موجه

لتقييم أداء Docmatix، أجرينا دراسات الاستئصال باستخدام نموذج Florence-2. لقد قمنا بتدريب نسختين من النموذج للمقارنة. تم تدريب الإصدار الأول على عدة فترات على مجموعة بيانات DocVQA. تم تدريب الإصدار الثاني لفترة واحدة على Docmatix (20% من الصور و4% من أزواج الأسئلة والأجوبة)، متبوعة بفترة واحدة على DocVQA للتأكد من أن النموذج أنتج التنسيق الصحيح لتقييم DocVQA. وكانت النتائج مهمة: فقد أدى التدريب على هذا الجزء الصغير من Docmatix إلى تحسن نسبي بنسبة 20% تقريبًا. بالإضافة إلى ذلك، كان أداء نموذج 0.7B Florence-2 أسوأ بنسبة 5% فقط من نموذج 8B Idefics2 الذي تم تدريبه على مزيج من مجموعات البيانات وهو أكبر بكثير.

مجموعة البيانات ANSL على DocVQA حجم النموذج
تم ضبط فلورنس 2 على DocVQA 60.1 700 م
تم ضبط فلورنسا 2 على Docmatix 71,4 700 م
تعريف2 74,0 8 ب

خاتمة

في هذا المنشور، قدمنا ​​Docmatix، وهي مجموعة بيانات ضخمة لـ DocVQA. لقد أظهرنا أنه باستخدام Docmatix يمكننا تحقيق زيادة بنسبة 20% في أداء DocVQA عند ضبط فلورنس-2. من المفترض أن تساعد مجموعة البيانات هذه في سد الفجوة بين VLMs الخاصة وVLMs مفتوحة المصدر. نحن نشجع مجتمع المصادر المفتوحة على الاستفادة من Docmatix وتدريب نماذج DocVQA الجديدة والمذهلة! لا يمكننا الانتظار لرؤية نماذجك على 🤗 Hub!

موارد مفيدة

نود أن نشكر merve وleo على تعليقاتهم وصورهم المصغرة لهذه المدونة.

شاركها.
اترك تعليقاً