![]()
AWS Inferentia2 هي أحدث شريحة للتعلم الآلي من AWS متاحة من خلال مثيلات Amazon EC2 Inf2 على Amazon Web Services. تم تصميم مثيلات Inf2 من الألف إلى الياء لأحمال عمل الذكاء الاصطناعي، وتوفر أداءً رائعًا وتكلفة/أداء لأحمال عمل الإنتاج.
لقد عملنا لأكثر من عام مع فرق المنتجات والهندسة في AWS لجعل الأداء والفعالية من حيث التكلفة لشرائح AWS Trainium وInferentia متاحة لمستخدمي Hugging Face. مكتبتنا مفتوحة المصدر optimum-neuron يجعل من السهل تدريب ونشر نماذج Hugging Face على هذه المسرعات. يمكنك قراءة المزيد عن عملنا في تسريع المحولات ونماذج اللغات الكبيرة واستدلال إنشاء النص (TGI).
واليوم، نجعل قوة Inferentia2 متاحة بشكل مباشر وعلى نطاق واسع لمستخدمي Hugging Face Hub.
تمكين أكثر من 100000 نموذج على AWS Inferentia2 باستخدام Amazon SageMaker
منذ بضعة أشهر، قدمنا طريقة جديدة لنشر نماذج اللغات الكبيرة (LLMs) على SageMaker، مع خيار Inferentia/Trainium الجديد للنماذج المدعومة، مثل Meta Llama 3. يمكنك نشر نموذج Llama3 على مثيلات Inferentia2 على SageMaker لخدمة الاستدلال على نطاق واسع والاستفادة من مجموعة SageMaker الكاملة من الميزات المُدارة بالكامل لبناء النماذج وضبطها الدقيق وعمليات MLOps والحوكمة.

واليوم، نعمل على توسيع نطاق الدعم لتجربة النشر هذه ليشمل أكثر من 100000 نموذج عام متاح على Hugging Face، بما في ذلك 14 بنية نموذجية جديدة (albert,bert,camembert,convbert,deberta,deberta-v2,distilbert,electra,roberta,mobilebert,mpnet,vit,xlm,xlm-roberta)، و6 مهام جديدة للتعلم الآلي (text-classification,text-generation,token-classification,fill-mask,question-answering,feature-extraction).
باتباع مقتطفات التعليمات البرمجية البسيطة هذه، سيتمكن عملاء AWS من نشر النماذج بسهولة على مثيلات Inferentia2 في Amazon SageMaker.
تقدم Hugging Face Inference Endpoints دعمًا لـ AWS Inferentia2
الخيار الأسهل لنشر النماذج من Hub هو Hugging Face Inference Endpoints. اليوم، يسعدنا أن نقدم مثيلات Inferentia 2 الجديدة لنقاط النهاية لـ Hugging Face Inference Endpoints. والآن، عندما تجد نموذجًا يثير اهتمامك في Hugging Face، يمكنك نشره ببضع نقرات فقط على Inferentia2. كل ما عليك فعله هو تحديد النموذج الذي تريد نشره، وتحديد خيار مثيل Inf2 الجديد ضمن تكوين مثيل Amazon Web Services، وستكون جاهزًا للسباق.
بالنسبة للطرز المدعومة مثل Llama 3، يمكنك تحديد نكهتين:
- Inf2 صغير، مزود بنواتين وذاكرة سعة 32 جيجابايت (0.75 دولار في الساعة) مثالي لـ Llama 3 8B
- Inf2-xlarge، مع 24 مركزًا وذاكرة سعة 384 جيجابايت (12 دولارًا في الساعة) مثالي لـ Llama 3 70B
تتم محاسبة نقاط نهاية استدلال الوجه المعانقة بالثانية من السعة المستخدمة، مع زيادة التكلفة من خلال القياس التلقائي للنسخ المتماثلة، وانخفاضها إلى الصفر مع النطاق إلى الصفر – كلاهما آلي وممكّن بإعدادات سهلة الاستخدام.

تستخدم نقاط نهاية الاستدلال استدلال إنشاء النص لـ Neuron (TGI) لتشغيل Llama 3 على AWS Inferentia. TGI هو حل مصمم خصيصًا لنشر وخدمة نماذج اللغات الكبيرة (LLMs) لأحمال عمل الإنتاج على نطاق واسع، ودعم التجميع المستمر والتدفق وغير ذلك الكثير. بالإضافة إلى ذلك، تتوافق LLMs المنشورة مع Text Generation Inference مع OpenAI SDK messages API، لذلك إذا كان لديك بالفعل تطبيقات Gen AI مدمجة مع LLMs، فلن تحتاج إلى تغيير رمز التطبيق الخاص بك، وما عليك سوى الإشارة إلى نقطة النهاية الجديدة التي تم نشرها باستخدام Hugging Face Inference Endpoints.
بعد نشر نقطة النهاية الخاصة بك على Inferentia2، يمكنك إرسال الطلبات باستخدام الأداة المتوفرة في واجهة المستخدم أو OpenAI SDK.
ماذا بعد؟
نحن نعمل جاهدين لتوسيع نطاق النماذج الممكنة للنشر على AWS Inferentia2 باستخدام Hugging Face Inference Endpoints. بعد ذلك، نريد إضافة دعم لنماذج النشر والتضمين، حتى تتمكن من إنشاء صور وإنشاء أنظمة بحث وتوصية دلالية تستفيد من تسريع AWS Inferentia2 وسهولة استخدام Hugging Face Inference Endpoints.
بالإضافة إلى ذلك، نواصل عملنا لتحسين أداء استدلال إنشاء النص (TGI) على Neuronx، مما يضمن عمليات نشر LLM أسرع وأكثر كفاءة على AWS Inferentia 2 في مكتباتنا مفتوحة المصدر. ترقبوا هذه التحديثات بينما نواصل تعزيز قدراتنا وتحسين تجربة النشر الخاصة بك!