يتطلب بناء التطبيقات باستخدام شهادات LLM النظر في أكثر من مجرد الجودة: بالنسبة للعديد من حالات الاستخدام، تكون السرعة والسعر على نفس القدر من الأهمية أو أكثر.
بالنسبة لتطبيقات المستهلك وتجارب الدردشة، تعد السرعة والاستجابة أمرًا بالغ الأهمية لتفاعل المستخدم. يتوقع المستخدمون استجابات شبه فورية، ويمكن أن يؤدي التأخير بشكل مباشر إلى انخفاض المشاركة. عند بناء تطبيقات أكثر تعقيدًا تتضمن استخدام الأدوات أو الأنظمة الوكيلة، تصبح السرعة والتكلفة أكثر أهمية، ويمكن أن تصبح العامل المقيد لقدرة النظام الإجمالية. يمكن أن يتراكم الوقت الذي تستغرقه الطلبات المتسلسلة إلى LLMs بسرعة لكل طلب مستخدم مما يزيد من التكلفة.
هذا هو السبب في التحليل الاصطناعي (@ArtificialAnlys) طورت لوحة صدارة لتقييم السعر والسرعة والجودة عبر أكثر من 100 نقطة نهاية LLM API بدون خادم، وهي متاحة الآن لـ Hugging Face.
العثور على المتصدرين هنا!
لوحة المتصدرين للأداء LLM
يهدف LLM Performance Leaderboard إلى توفير مقاييس شاملة لمساعدة مهندسي الذكاء الاصطناعي على اتخاذ القرارات بشأن مزودي LLM (المفتوحين والمملوكين) وواجهة برمجة التطبيقات (API) لاستخدامهم في التطبيقات التي تدعم الذكاء الاصطناعي.
عند اتخاذ القرارات بشأن تقنيات الذكاء الاصطناعي التي سيتم استخدامها، يحتاج المهندسون إلى مراعاة الجودة والسعر والسرعة (زمن الوصول والإنتاجية). تجمع LLM Performance Leaderboard الثلاثة معًا لتمكين اتخاذ القرار في مكان واحد عبر النماذج الخاصة والمفتوحة.
المصدر: LLM Performance Leaderboard
التغطية المترية
المقاييس المبلغ عنها هي:
- جودة: مؤشر مبسط لمقارنة جودة النموذج ودقته، ويتم حسابه بناءً على مقاييس مثل MMLU، وMT-Bench، ونتائج HumanEval، كما أفاد مؤلفو النموذج، وتصنيف Chatbot Arena.
- نافذة السياق: الحد الأقصى لعدد الرموز المميزة التي يمكن لـ LLM العمل بها في أي وقت (بما في ذلك رموز الإدخال والإخراج).
- التسعير: الأسعار التي يتقاضاها المزود للاستعلام عن النموذج للاستدلال. نقوم بالإبلاغ عن تسعير الإدخال/الإخراج لكل رمز مميز، بالإضافة إلى التسعير “المختلط” لمقارنة مقدمي خدمات الاستضافة بمقياس واحد. نحن نمزج تسعير المدخلات والمخرجات بنسبة 3:1 (أي افتراض أن طول المدخلات أطول بثلاث مرات من المخرجات).
- الإنتاجية: مدى سرعة قيام نقطة النهاية بإخراج الرموز المميزة أثناء الاستدلال، ويتم قياسها بالرموز المميزة في الثانية (غالبًا ما يشار إليها باسم الرموز المميزة/الرموز المميزة أو “TPS”). نقوم بالإبلاغ عن القيم المتوسطة، P5، P25، P75 وP95 التي تم قياسها خلال الـ 14 يومًا السابقة.
- كمون: المدة التي تستغرقها نقطة النهاية للاستجابة بعد إرسال الطلب، والمعروفة باسم Time to First Token (“TTFT”) ويتم قياسها بالثواني. نقوم بالإبلاغ عن القيم المتوسطة، P5، P25، P75 وP95 التي تم قياسها خلال الـ 14 يومًا السابقة.
لمزيد من التعريفات، راجع صفحة المنهجية الكاملة لدينا.
أعباء العمل الاختبارية
تسمح لوحة المتصدرين باستكشاف الأداء في ظل العديد من أعباء العمل المختلفة (6 مجموعات في المجموع):
- متفاوتة طول الفوري: ~100 رمز، ~1 ألف رمز، ~10 آلاف رمز.
- جري استعلامات موازية: استعلام واحد، 10 استعلامات متوازية.
المنهجية
نحن نختبر كل نقطة نهاية لواجهة برمجة التطبيقات (API) على لوحة المتصدرين 8 مرات يوميًا، وتمثل أرقام لوحة المتصدرين القياس المتوسط لآخر 14 يومًا. لدينا أيضًا تقسيمات مئوية ضمن علامات التبويب المطوية.
يتم حاليًا جمع مقاييس الجودة على أساس كل نموذج وتعرض تقارير النتائج بواسطة منشئي النماذج، ولكن شاهد هذه المساحة عندما نبدأ في مشاركة النتائج من تقييمات الجودة المستقلة لدينا عبر كل نقطة نهاية.
لمزيد من التعريفات، راجع صفحة المنهجية الكاملة لدينا.
أبرز الأحداث (مايو 2024، راجع قائمة المتصدرين لمعرفة الأحدث)
- لقد انفجر سوق نماذج اللغة من حيث التعقيد خلال العام الماضي. تشمل عمليات الإطلاق التي هزت السوق خلال الشهرين الماضيين فقط نماذج خاصة مثل سلسلة Claude 3 من Anthropic ونماذج مفتوحة مثل DBRX من Databricks، وCohere’s Command R Plus، وGemma من Google، وPhi-3 من Microsoft، وMistral’s Mixtral 8x22B، وMeta’s Llama 3.
- يختلف السعر والسرعة بشكل كبير بين النماذج ومقدمي الخدمات. من Claude 3 Opus إلى Llama 3 8B، هناك فرق أسعار يصل إلى 300 ضعف – وهذا أكثر من ضعفين!
- قام موفرو واجهة برمجة التطبيقات (API) بزيادة سرعة إطلاق النماذج. وفي غضون 48 ساعة، كان 7 مزودين يعرضون نماذج Llama 3. التحدث عن الطلب على النماذج الجديدة مفتوحة المصدر والديناميكيات التنافسية بين موفري واجهة برمجة التطبيقات.
- النماذج الرئيسية التي يجب تسليط الضوء عليها عبر قطاعات الجودة:
- جودة عالية وسعر أعلى عادةً وأبطأ: GPT-4 Turbo وClaude 3 Opus
- جودة وسعر وسرعة معتدلة: Llama 3 70B، Mixtral 8x22B، Command R+، Gemini 1.5 Pro، DBRX
- جودة أقل، ولكن مع سرعة أكبر وأسعار أقل متاحة: Llama 3 8B، Claude 3 Haiku، Mixtral 8x7B

يُظهر مخطط الجودة مقابل الإنتاجية (الرموز/الرموز) مجموعة من الخيارات ذات خصائص الجودة والأداء المختلفة.
المصدر: Artificialanalys.ai/models
مثال حالة الاستخدام: يمكن أن تكون السرعة والسعر بنفس أهمية الجودة
في بعض الحالات، يمكن أن تؤدي أنماط التصميم التي تتضمن طلبات متعددة مع نماذج أسرع وأرخص إلى تكلفة أقل فحسب، بل إلى تحسين جودة النظام بشكل عام مقارنة باستخدام نموذج واحد أكبر.
على سبيل المثال، فكر في برنامج chatbot الذي يحتاج إلى تصفح الويب للعثور على المعلومات ذات الصلة من المقالات الإخبارية الحديثة. يتمثل أحد الأساليب في استخدام نموذج كبير وعالي الجودة مثل GPT-4 Turbo لإجراء بحث ثم قراءة ومعالجة الجزء الأكبر من المقالات. وهناك طريقة أخرى تتمثل في استخدام نموذج أصغر وأسرع مثل Llama 3 8B لقراءة واستخراج النقاط البارزة من عشرات صفحات الويب بالتوازي، ثم استخدام GPT-4 Turbo لتقييم وتلخيص النتائج الأكثر صلة. سيكون النهج الثاني أكثر فعالية من حيث التكلفة، حتى بعد حساب قراءة محتوى أكبر بمقدار 10 أضعاف، وقد يؤدي إلى نتائج ذات جودة أعلى.
تواصل معنا
يرجى متابعتنا على تغريد و LinkedIn للحصول على التحديثات. نحن متواجدون عبر الرسائل على أي منهما، وكذلك على موقعنا الإلكتروني وعبر البريد الإلكتروني.