كمون

قد يكون نشر نماذج اللغات الكبيرة (LLMs) ونماذج الذكاء الاصطناعي التوليدية الأخرى أمرًا صعبًا نظرًا لمتطلباتها الحسابية واحتياجات زمن الاستجابة. لتقديم توصيات مفيدة للشركات التي تتطلع إلى نشر Llama 2 على Amazon SageMaker باستخدام Hugging Face LLM Inference Container، أنشأنا معيارًا شاملاً لتحليل أكثر من 60 تكوين نشر مختلف لـ Llama 2.

في هذا المعيار، قمنا بتقييم أحجام مختلفة من Llama 2 على مجموعة من أنواع مثيلات Amazon EC2 ذات مستويات تحميل مختلفة. كان هدفنا هو قياس زمن الاستجابة (مللي ثانية لكل رمز مميز) والإنتاجية (الرموز المميزة في الثانية) للعثور على استراتيجيات النشر المثالية لثلاث حالات استخدام شائعة:

  • النشر الأكثر فعالية من حيث التكلفة: للمستخدمين الذين يبحثون عن أداء جيد بتكلفة منخفضة
  • أفضل نشر لزمن الاستجابة: تقليل زمن الوصول للخدمات في الوقت الفعلي
  • أفضل نشر للإنتاجية: زيادة الرموز المميزة التي تتم معالجتها في الثانية إلى الحد الأقصى

للحفاظ على هذا المعيار العادل والشفاف وقابل للتكرار، فإننا نشارك جميع الأصول والتعليمات البرمجية والبيانات التي استخدمناها وجمعناها:

نأمل في تمكين العملاء من استخدام LLMs وLlama 2 بكفاءة وعلى النحو الأمثل لحالة الاستخدام الخاصة بهم. قبل أن ندخل في المعيار والبيانات، دعونا نلقي نظرة على التقنيات والأساليب التي استخدمناها.

ما هي حاوية الاستدلال Hugging Face LLM؟

Hugging Face LLM DLC عبارة عن حاوية استدلالية مصممة خصيصًا لنشر LLMs بسهولة في بيئة آمنة ومُدارة. يتم تشغيل المحتوى القابل للتنزيل (DLC) بواسطة Text Generation Inference (TGI)، وهو حل مفتوح المصدر مصمم خصيصًا لنشر وخدمة LLMs. يتيح TGI إنشاء نص عالي الأداء باستخدام Tensor Parallelism والدفعات الديناميكية لأكثر برامج LLM مفتوحة المصدر شيوعًا، بما في ذلك StarCoder وBLOOM وGPT-NeoX وFalcon وLlama وT5. تستخدم VMware وIBM وGrammarly وOpen-Assistant وUber وScale AI وغيرها الكثير استدلال إنشاء النص.

ما هو اللاما 2؟

Llama 2 هي عائلة من الحاصلين على ماجستير إدارة الأعمال من Meta، تم تدريبهم على 2 تريليون رمز. يأتي Llama 2 بثلاثة أحجام – معلمات 7B و13B و70B – ويقدم تحسينات رئيسية مثل طول السياق الأطول والترخيص التجاري وقدرات الدردشة المحسنة من خلال التعلم المعزز مقارنةً بـ Llama (1). إذا كنت تريد معرفة المزيد عن Llama 2، فراجع منشور المدونة هذا.

ما هو GPTQ؟

GPTQ هي طريقة تكميمية بعد التدريب لضغط LLMs، مثل GPT. يقوم GPTQ بضغط نماذج GPT (وحدة فك التشفير) عن طريق تقليل عدد البتات اللازمة لتخزين كل وزن في النموذج، من 32 بت إلى 3-4 بت فقط. وهذا يعني أن النموذج يستهلك ذاكرة أقل بكثير ويمكن تشغيله على أجهزة أقل، على سبيل المثال وحدة معالجة الرسومات المفردة لنماذج 13B Llama2. يقوم GPTQ بتحليل كل طبقة من النموذج بشكل منفصل وتقريب الأوزان للحفاظ على الدقة الإجمالية. إذا كنت تريد معرفة المزيد وكيفية استخدامه، فراجع تحسين LLMs المفتوحة باستخدام GPTQ وHugging Face Optimum.

المعيار

لقياس أداء Llama 2 في العالم الحقيقي، قمنا باختبار 3 أحجام نماذج (معلمات 7B و13B و70B) على أربعة أنواع مختلفة من المثيلات مع أربعة مستويات تحميل مختلفة، مما أدى إلى 60 تكوينًا مختلفًا:

  • النماذج: قمنا بتقييم جميع أحجام النماذج المتوفرة حاليًا، بما في ذلك 7B و13B و70B.
  • الطلبات المتزامنة: قمنا باختبار التكوينات باستخدام 1 و5 و10 و20 طلبًا متزامنًا لتحديد الأداء في سيناريوهات الاستخدام المختلفة.
  • أنواع المثيلات: قمنا بتقييم مثيلات GPU المختلفة، بما في ذلك g5.2xlarge، وg5.12xlarge، وg5.48xlarge المدعومة بوحدات معالجة الرسومات NVIDIA A10G، وp4d.24xlarge المدعومة بوحدة معالجة الرسومات NVIDIA A100 بسعة 40 جيجابايت.
  • التكميم: قمنا بمقارنة الأداء مع وبدون التكميم. استخدمنا GPTQ 4 بت كتقنية تكميم.

كمقاييس، استخدمنا الإنتاجية ووقت الاستجابة المحددين على النحو التالي:

  • الإنتاجية (الرموز المميزة/ثانية): عدد الرموز المميزة التي يتم إنشاؤها في الثانية.
  • الكمون (ملي ثانية/الرمز المميز): الوقت المستغرق لإنشاء رمز مميز واحد

استخدمنا تلك لتقييم أداء اللاما عبر الإعدادات المختلفة لفهم الفوائد والمقايضات. إذا كنت تريد تشغيل المعيار بنفسك، فقد أنشأنا مستودع Github.

يمكنك العثور على البيانات الكاملة للمعيار في معيار Amazon SageMaker: ورقة TGI 1.0.3 Llama 2. البيانات الأولية متاحة على جيثب.

إذا كنت مهتمًا بجميع التفاصيل، فنوصيك بالتعمق في البيانات الأولية المقدمة.

التوصيات والرؤى

استنادًا إلى المعيار المعياري، نقدم توصيات محددة للنشر الأمثل لـ LLM اعتمادًا على أولوياتك بين التكلفة والإنتاجية ووقت الاستجابة لجميع أحجام نماذج Llama 2.

ملاحظة: تعتمد التوصيات على التكوين الذي اختبرناه. وفي المستقبل، قد تكون البيئات أو عروض الأجهزة الأخرى، مثل Inferentia2، أكثر فعالية من حيث التكلفة.

النشر الأكثر فعالية من حيث التكلفة

يركز التكوين الأكثر فعالية من حيث التكلفة على التوازن الصحيح بين الأداء (زمن الوصول والإنتاجية) والتكلفة. الهدف هو تعظيم الناتج لكل دولار يتم إنفاقه. لقد نظرنا إلى الأداء خلال 5 طلبات متزامنة. يمكننا أن نرى أن GPTQ تقدم أفضل فعالية من حيث التكلفة، مما يسمح للعملاء بنشر Llama 2 13B على وحدة معالجة رسومات واحدة.

نموذج التكميم مثال الطلبات المتزامنة متوسط ​​زمن الوصول (مللي ثانية/رمز مميز). الإنتاجية (الرموز / ثانية) التكلفة عند الطلب ($/ساعة) في غرب الولايات المتحدة-2 الوقت اللازم لإنشاء 1 مليون رمز (بالدقائق) تكلفة إنشاء مليون رمز ($)
اللاما 2 7 ب GPTQ g5.2xlarge 5 34.245736 120.0941633 1.52 دولار 138.78 3.50 دولار
اللاما 2 13 ب GPTQ g5.2xlarge 5 56.237484 71.70560104 1.52 دولار 232.43 5.87 دولار
اللاما 2 70 ب GPTQ ml.g5.12xlarge 5 138.347928 33.33372399 7.09 دولار 499.99 59.08 دولارًا

أفضل نشر الإنتاجية

يعمل تكوين أفضل إنتاجية على زيادة عدد الرموز المميزة التي يتم إنشاؤها في الثانية. قد يأتي هذا مع بعض الانخفاض في زمن الوصول الإجمالي نظرًا لأنك تقوم بمعالجة المزيد من الرموز المميزة في وقت واحد. لقد نظرنا إلى أعلى أداء للرموز المميزة في الثانية خلال عشرين طلبًا متزامنًا، مع بعض الاحترام لتكلفة المثيل. أعلى إنتاجية كانت لـ Llama 2 13B على مثيل ml.p4d.24xlarge بـ 688 رمزًا مميزًا/ثانية.

نموذج التكميم مثال الطلبات المتزامنة متوسط ​​زمن الوصول (مللي ثانية/رمز مميز). الإنتاجية (الرموز / الثانية) التكلفة عند الطلب ($/ساعة) في غرب الولايات المتحدة-2 الوقت اللازم لإنشاء 1 مليون رمز (بالدقائق) تكلفة إنشاء مليون رمز ($)
اللاما 2 7 ب لا أحد ml.g5.12xlarge 20 43.99524 449.9423027 7.09 دولار 33.59 3.97 دولار
اللاما 2 13 ب لا أحد ml.p4d.12xlarge 20 67.4027465 668.0204881 37.69 دولارًا 24.95 15.67 دولارًا
اللاما 2 70 ب لا أحد ml.p4d.24xlarge 20 59.798591 321.5369158 37.69 دولارًا 51.83 32.56 دولارًا

أفضل نشر الكمون

يعمل تكوين “أفضل زمن استجابة” على تقليل الوقت المستغرق لإنشاء رمز مميز واحد. يعد زمن الوصول المنخفض أمرًا مهمًا لحالات الاستخدام في الوقت الفعلي وتوفير تجربة جيدة للعميل، على سبيل المثال تطبيقات الدردشة. لقد نظرنا إلى أدنى متوسط ​​للميلي ثانية لكل رمز مميز خلال طلب واحد متزامن. كان أقل زمن استجابة إجماليًا لـ Llama 2 7B في مثيل ml.g5.12xlarge بمعدل 16.8 مللي ثانية/الرمز المميز.

نموذج التكميم مثال الطلبات المتزامنة متوسط ​​زمن الوصول (مللي ثانية/رمز مميز). الإنتاجية الشاملة (الرموز / الثانية) التكلفة عند الطلب ($/ساعة) في غرب الولايات المتحدة-2 الوقت اللازم لإنشاء 1 مليون رمز (بالدقائق) تكلفة إنشاء مليون رمز ($)
اللاما 2 7 ب لا أحد ml.g5.12xlarge 1 16.812526 61.45733054 7.09 دولار 271.19 32.05 دولارًا
اللاما 2 13 ب لا أحد ml.g5.12xlarge 1 21.002715 47.15736567 7.09 دولار 353.43 41.76 دولارًا
اللاما 2 70 ب لا أحد ml.p4d.24xlarge 1 41.348543 24.5142928 37.69 دولارًا 679.88 427.05 دولارًا

الاستنتاجات

في هذا المعيار، اختبرنا 60 تكوينًا لـ Llama 2 على Amazon SageMaker. بالنسبة لعمليات النشر الفعالة من حيث التكلفة، وجدنا أن 13B Llama 2 مع GPTQ على g5.2xlarge توفر 71 رمزًا مميزًا/ثانية بتكلفة تبلغ 1.55 دولارًا في الساعة. للحصول على الحد الأقصى من الإنتاجية، وصلت 13B Llama 2 إلى 296 رمزًا مميزًا في الثانية على ml.g5.12xlarge بسعر 2.21 دولارًا أمريكيًا لكل مليون رمز مميز. وللحصول على الحد الأدنى من زمن الوصول، حققت 7B Llama 2 16 مللي ثانية لكل رمز مميز على ml.g5.12xlarge.

نأمل أن يساعد هذا المعيار الشركات على نشر Llama 2 على النحو الأمثل بناءً على احتياجاتها. إذا كنت تريد البدء في نشر Llama 2 على Amazon SageMaker، فراجع تقديم Hugging Face LLM Inference Container لـ Amazon SageMaker ونشر Llama 2 7B/13B/70B على منشورات مدونة Amazon SageMaker.


شكرا للقراءة! إذا كان لديك أي أسئلة، فلا تتردد في الاتصال بي على تغريد أو لينكدين.



شاركها.
اترك تعليقاً