على مر السنين، برزت نماذج اللغات الكبيرة (LLMs) كتقنية رائدة ذات إمكانات هائلة لإحداث ثورة في مختلف جوانب الرعاية الصحية. وقد أظهرت هذه النماذج، مثل GPT-3 وGPT-4 وMed-PaLM 2، قدرات ملحوظة في فهم وإنشاء نص يشبه الإنسان، مما يجعلها أدوات قيمة لمعالجة المهام الطبية المعقدة وتحسين رعاية المرضى. لقد أظهروا نتائج واعدة بشكل ملحوظ في العديد من التطبيقات الطبية، مثل الإجابة على الأسئلة الطبية (QA)، وأنظمة الحوار، وتوليد النصوص. علاوة على ذلك، مع النمو الهائل للسجلات الصحية الإلكترونية (EHRs)، والأدبيات الطبية، والبيانات التي ينشئها المريض، يمكن أن تساعد LLM المتخصصين في الرعاية الصحية على استخلاص رؤى قيمة واتخاذ قرارات مستنيرة.

ومع ذلك، على الرغم من الإمكانات الهائلة لنماذج اللغات الكبيرة (LLMs) في مجال الرعاية الصحية، إلا أن هناك تحديات كبيرة ومحددة تحتاج إلى المعالجة.

عندما يتم استخدام النماذج لجوانب المحادثة الترفيهية، فإن الأخطاء لها تداعيات قليلة؛ لكن هذا ليس هو الحال بالنسبة للاستخدامات في المجال الطبي، حيث يمكن أن يكون للتفسيرات والإجابات الخاطئة عواقب وخيمة على رعاية المرضى ونتائجهم. يمكن أن تكون دقة وموثوقية المعلومات المقدمة من نماذج اللغة مسألة حياة أو موت، لأنها قد تؤثر على قرارات الرعاية الصحية والتشخيص وخطط العلاج.

على سبيل المثال، عند تقديم استفسار طبي (انظر أدناه)، أوصى GPT-3 بشكل غير صحيح بالتتراسيكلين لمريضة حامل، على الرغم من شرح موانع استخدامه بشكل صحيح بسبب الضرر المحتمل للجنين. إن التصرف بناءً على هذه التوصية غير الصحيحة قد يؤدي إلى مشاكل في نمو العظام لدى الطفل.

مصدر الصورة : [https://arxiv.org/pdf/2311.05112.pdf](https://arxiv.org/abs/2307.15343)

للاستفادة الكاملة من قوة LLM في مجال الرعاية الصحية، من الضروري تطوير النماذج ومقارنتها باستخدام إعداد مصمم خصيصًا للمجال الطبي. يجب أن يأخذ هذا الإعداد في الاعتبار الخصائص والمتطلبات الفريدة لبيانات وتطبيقات الرعاية الصحية. إن تطوير أساليب تقييم برنامج Medical-LLM ليس مجرد اهتمام أكاديمي، بل له أهمية عملية، نظرًا للمخاطر الواقعية التي تشكلها في قطاع الرعاية الصحية.

يهدف برنامج Open Medical-LLM Leaderboard إلى معالجة هذه التحديات والقيود من خلال توفير منصة موحدة لتقييم ومقارنة أداء نماذج اللغات الكبيرة المختلفة في مجموعة متنوعة من المهام الطبية ومجموعات البيانات. من خلال تقديم تقييم شامل للمعرفة الطبية لكل نموذج وقدرات الإجابة على الأسئلة، تهدف لوحة المتصدرين إلى تعزيز تطوير ماجستير في القانون الطبي أكثر فعالية وموثوقية.

تتيح هذه المنصة للباحثين والممارسين تحديد نقاط القوة والضعف في الأساليب المختلفة، ودفع المزيد من التقدم في هذا المجال، والمساهمة في نهاية المطاف في تحسين رعاية المرضى ونتائجهم.

مجموعات البيانات والمهام وإعداد التقييم

تتضمن لوحة المتصدرين Medical-LLM مجموعة متنوعة من المهام، وتستخدم الدقة كمقياس تقييم أساسي (تقيس الدقة النسبة المئوية للإجابات الصحيحة المقدمة من نموذج اللغة عبر مجموعات بيانات ضمان الجودة الطبية المختلفة).

MedQA

تتكون مجموعة بيانات MedQA من أسئلة متعددة الخيارات من امتحان الترخيص الطبي بالولايات المتحدة (USMLE). ويغطي المعرفة الطبية العامة ويتضمن 11450 سؤالًا في مجموعة التطوير و1273 سؤالًا في مجموعة الاختبار. يحتوي كل سؤال على 4 أو 5 اختيارات للإجابة، وتم تصميم مجموعة البيانات لتقييم المعرفة الطبية ومهارات التفكير المطلوبة للترخيص الطبي في الولايات المتحدة.

سؤال MedQA

MedMCQA

MedMCQA هي مجموعة بيانات ضمان الجودة متعددة الاختيارات واسعة النطاق مستمدة من اختبارات القبول الطبية الهندية (AIIMS/NEET). ويغطي 2.4 ألف موضوع رعاية صحية و21 موضوعًا طبيًا، مع أكثر من 187000 سؤال في مجموعة التطوير و6100 سؤال في مجموعة الاختبار. يحتوي كل سؤال على 4 اختيارات للإجابة ويكون مصحوبًا بشرح. يقوم MedMCQA بتقييم المعرفة الطبية العامة وقدرات الاستدلال للنموذج.

سؤال MedMCQA

PubMedQA

PubMedQA هي مجموعة بيانات ضمان الجودة مغلقة المجال، حيث يمكن الإجابة على كل سؤال من خلال النظر في السياق المرتبط (ملخص PubMed). وهو يتألف من 1000 زوج من الأسئلة والأجوبة التي تحمل علامة الخبراء. يكون كل سؤال مصحوبًا بملخص PubMed كسياق، وتتمثل المهمة في تقديم إجابة بنعم/لا/ربما بناءً على المعلومات الموجودة في الملخص. يتم تقسيم مجموعة البيانات إلى 500 سؤال للتطوير و500 للاختبار. يقوم PubMedQA بتقييم قدرة النموذج على الفهم والتفكير في الأدبيات الطبية الحيوية العلمية.

سؤال PubMedQA

مجموعات MMLU الفرعية (الطب والبيولوجيا)

يتضمن معيار MMLU (قياس فهم اللغة متعدد المهام الضخم) أسئلة متعددة الخيارات من مجالات مختلفة. بالنسبة إلى لوحة المتصدرين Open Medical-LLM، فإننا نركز على المجموعات الفرعية الأكثر صلة بالمعرفة الطبية:

  • المعرفة السريرية: 265 سؤالًا لتقييم المعرفة السريرية ومهارات اتخاذ القرار.
  • علم الوراثة الطبية: 100 سؤال يغطي موضوعات تتعلق بعلم الوراثة الطبية.
  • التشريح: 135 سؤالًا لتقييم المعرفة بالتشريح البشري.
  • الطب المهني: 272 سؤالًا لتقييم المعرفة المطلوبة للمهنيين الطبيين.
  • علم الأحياء في الكلية: 144 سؤالًا يغطي مفاهيم علم الأحياء على مستوى الكلية.
  • كلية الطب: 173 سؤالًا لتقييم المعرفة الطبية على مستوى الكلية.

تتكون كل مجموعة فرعية من MMLU من أسئلة متعددة الاختيارات مع 4 خيارات للإجابة وهي مصممة لتقييم فهم النموذج لمجالات طبية وبيولوجية محددة.

أسئلة MMLU

تقدم لوحة المتصدرين Open Medical-LLM تقييمًا قويًا لأداء النموذج عبر جوانب مختلفة من المعرفة الطبية والتفكير.

رؤى وتحليلات

يقوم برنامج Open Medical-LLM Leaderboard بتقييم أداء العديد من نماذج اللغات الكبيرة (LLMs) في مجموعة متنوعة من مهام الإجابة على الأسئلة الطبية. فيما يلي النتائج الرئيسية التي توصلنا إليها:

  • تحقق النماذج التجارية مثل GPT-4-base وMed-PaLM-2 باستمرار درجات دقة عالية عبر مجموعات البيانات الطبية المختلفة، مما يدل على أداء قوي في المجالات الطبية المختلفة.
  • تُظهر النماذج مفتوحة المصدر، مثل Starling-LM-7B، وgemma-7b، وMistral-7B-v0.1، وHermes-2-Pro-Mistral-7B، أداءً تنافسيًا في مجموعات بيانات ومهام معينة، على الرغم من وجود أحجام أصغر تبلغ حوالي 7 مليار معلمة.
  • تؤدي كل من النماذج التجارية والمفتوحة المصدر أداءً جيدًا في مهام مثل الفهم والتفكير في الأدبيات الطبية الحيوية العلمية (PubMedQA) وتطبيق المعرفة السريرية ومهارات اتخاذ القرار (مجموعة المعرفة السريرية MMLU الفرعية).

مصدر الصورة : [https://arxiv.org/abs/2402.07023](https://arxiv.org/abs/2402.07023)

يُظهر نموذج Google Gemini Pro أداءً قويًا في مختلف المجالات الطبية، ولا سيما التفوق في المهام كثيفة البيانات والمهام الإجرائية مثل الإحصاء الحيوي، وبيولوجيا الخلية، وأمراض النساء والتوليد. ومع ذلك، فإنه يُظهر أداءً متوسطًا إلى منخفضًا في المجالات الحيوية مثل التشريح وأمراض القلب والأمراض الجلدية، مما يكشف عن الثغرات التي تتطلب مزيدًا من التحسين للتطبيق الطبي الشامل.

مصدر الصورة : [https://arxiv.org/abs/2402.07023](https://arxiv.org/abs/2402.07023)

تقديم النموذج الخاص بك للتقييم

لإرسال النموذج الخاص بك للتقييم على لوحة المتصدرين Open Medical-LLM، اتبع الخطوات التالية:

1. تحويل الأوزان النموذجية إلى تنسيق Safetensors

أولاً، قم بتحويل أوزان النموذج الخاص بك إلى تنسيق أدوات الأمان. إن أدوات الأمان هي شكل جديد لتخزين الأوزان، وهو أكثر أمانًا وأسرع في التحميل والاستخدام. سيؤدي تحويل النموذج الخاص بك إلى هذا التنسيق أيضًا إلى السماح للوحة المتصدرين بعرض عدد معلمات النموذج الخاص بك في الجدول الرئيسي.

2. ضمان التوافق مع AutoClasses

قبل إرسال النموذج الخاص بك، تأكد من أنه يمكنك تحميل النموذج والرمز المميز الخاص بك باستخدام AutoClasses من مكتبة Transformers. استخدم مقتطف التعليمات البرمجية التالي لاختبار التوافق:

from transformers import AutoConfig, AutoModel, AutoTokenizer
config = AutoConfig.from_pretrained(MODEL_HUB_ID)
model = AutoModel.from_pretrained("your model name")
tokenizer = AutoTokenizer.from_pretrained("your model name")

إذا فشلت هذه الخطوة، فاتبع رسائل الخطأ لتصحيح النموذج الخاص بك قبل إرساله. من المحتمل أنه تم تحميل النموذج الخاص بك بشكل غير صحيح.

3. اجعل نموذجك عامًا

تأكد من أن النموذج الخاص بك متاح للجمهور. لا يمكن للوحة المتصدرين تقييم النماذج الخاصة أو التي تتطلب أذونات وصول خاصة.

4. تنفيذ التعليمات البرمجية عن بعد (قريبًا)

حاليًا، لا تدعم لوحة المتصدرين Open Medical-LLM النماذج التي تتطلب ذلك use_remote_code=True. ومع ذلك، يعمل فريق المتصدرين بنشاط على إضافة هذه الميزة، لذا ترقبوا التحديثات.

5. قم بإرسال النموذج الخاص بك عبر موقع المتصدرين

بمجرد أن يصبح النموذج الخاص بك بتنسيق أدوات الأمان، ومتوافقًا مع AutoClasses، ويمكن الوصول إليه بشكل عام، يمكنك إرساله للتقييم باستخدام “إرسال هنا!” لوحة على موقع Open Medical-LLM Leaderboard. قم بملء المعلومات المطلوبة، مثل اسم الموديل والوصف وأي تفاصيل إضافية، ثم انقر فوق زر إرسال.

سيقوم فريق المتصدرين بمعالجة طلبك وتقييم أداء النموذج الخاص بك على مجموعات بيانات ضمان الجودة الطبية المختلفة. بمجرد اكتمال التقييم، ستتم إضافة نتائج النموذج الخاص بك إلى لوحة المتصدرين، مما يسمح لك بمقارنة أدائه مع النماذج الأخرى المقدمة.

ما هي الخطوة التالية؟ توسيع لوحة المتصدرين الطبية المفتوحة LLM

تلتزم لوحة المتصدرين Open Medical-LLM بالتوسع والتكيف لتلبية الاحتياجات المتطورة لمجتمع البحث وصناعة الرعاية الصحية. تشمل مجالات التركيز الرئيسية ما يلي:

  1. دمج مجموعة واسعة من مجموعات البيانات الطبية التي تغطي جوانب متنوعة من الرعاية الصحية، مثل الأشعة وعلم الأمراض وعلم الجينوم، من خلال التعاون مع الباحثين ومنظمات الرعاية الصحية وشركاء الصناعة.
  2. تعزيز مقاييس التقييم وقدرات إعداد التقارير من خلال استكشاف مقاييس أداء إضافية تتجاوز الدقة، مثل نقاط Pointwise والمقاييس الخاصة بالمجال التي تلتقط المتطلبات الفريدة للتطبيقات الطبية.
  3. وهناك بعض الجهود الجارية بالفعل في هذا الاتجاه. إذا كنت مهتمًا بالتعاون في المعيار التالي الذي نخطط لاقتراحه، فيرجى الانضمام إلى مجتمع Discord لمعرفة المزيد والمشاركة. نود أن نتعاون ونطرح الأفكار!

إذا كنت شغوفًا بالتقاطع بين الذكاء الاصطناعي والرعاية الصحية، وبناء نماذج لمجال الرعاية الصحية، وتهتم بقضايا السلامة والهلوسة لحاملي شهادة الماجستير في الطب، فنحن ندعوك للانضمام إلى مجتمعنا النابض بالحياة على Discord.

الاعتمادات والتقديرات

الاعتمادات

شكر خاص لجميع الأشخاص الذين ساعدوا في جعل هذا ممكنًا، بما في ذلك كليمنتين فورييه وفريق Hugging Face. أود أن أشكر Andreas Motzfeldt وAryo Gema وLogesh Kumar Umapathi على مناقشتهم وتعليقاتهم على لوحة المتصدرين أثناء التطوير. خالص الامتنان للبروفيسور باسكوال مينيرفيني على وقته ومساعدته الفنية وتقديم دعم GPU من جامعة إدنبرة.

نبذة عن الذكاء الاصطناعي لعلوم الحياة المفتوحة

Open Life Science AI هو مشروع يهدف إلى إحداث ثورة في تطبيق الذكاء الاصطناعي في مجالات علوم الحياة والرعاية الصحية. إنه بمثابة مركز مركزي لقائمة النماذج الطبية ومجموعات البيانات والمعايير وتتبع المواعيد النهائية للمؤتمرات، وتعزيز التعاون والابتكار والتقدم في مجال الرعاية الصحية بمساعدة الذكاء الاصطناعي. نحن نسعى جاهدين لتأسيس Open Life Science AI كوجهة رئيسية لأي شخص مهتم بتقاطع الذكاء الاصطناعي والرعاية الصحية. نحن نقدم منصة للباحثين والأطباء وصانعي السياسات وخبراء الصناعة للمشاركة في الحوارات وتبادل الأفكار واستكشاف أحدث التطورات في هذا المجال.

شعار أولسا

الاقتباس

إذا وجدت تقييماتنا مفيدة، فيرجى التفكير في الاستشهاد بعملنا

الطبية-LLM المتصدرين

@misc{Medical-LLM Leaderboard,
author = {Ankit Pal, Pasquale Minervini, Andreas Geert Motzfeldt, Aryo Pradipta Gema and Beatrice Alex},
title = {openlifescienceai/open_medical_llm_leaderboard},
year = {2024},
publisher = {Hugging Face},
howpublished = "\url{https://huggingface.co/spaces/openlifescienceai/open_medical_llm_leaderboard}"
}

شاركها.
اترك تعليقاً