يسعدنا أن نعلن عن التكامل الأصلي لدعم أجهزة Intel Gaudi مباشرةً في استدلال إنشاء النص (TGI)، وهو حل العرض الجاهز للإنتاج الخاص بنا لنماذج اللغات الكبيرة (LLMs). يجلب هذا التكامل قوة مسرعات الذكاء الاصطناعي المتخصصة من Intel إلى مجموعة الاستدلالات عالية الأداء لدينا، مما يتيح المزيد من خيارات النشر لمجتمع الذكاء الاصطناعي مفتوح المصدر 🎉
✨ ما الجديد؟
لقد قمنا بدمج دعم Gaudi بالكامل في قاعدة التعليمات البرمجية الرئيسية لـ TGI في PR #3091. في السابق، قمنا بصيانة شوكة منفصلة لأجهزة Gaudi في tgi-gaudi. كان هذا مرهقًا للمستخدمين ومنعنا من دعم أحدث ميزات TGI عند الإطلاق. الآن باستخدام بنية TGI الجديدة متعددة الخلفيات، ندعم Gaudi مباشرة على TGI – لا مزيد من التلاعب في المستودع المخصص 🙌
يدعم هذا التكامل مجموعة Intel الكاملة من أجهزة Gaudi:
يمكنك أيضًا العثور على مزيد من المعلومات حول أجهزة Gaudi على صفحة منتج Gaudi من Intel
🌟 لماذا هذا مهم
توفر الواجهة الخلفية لـ Gaudi لـ TGI العديد من المزايا الرئيسية:
- تنوع الأجهزة 🔄: المزيد من الخيارات لنشر LLMs في الإنتاج بما يتجاوز وحدات معالجة الرسومات التقليدية
- كفاءة التكلفة 💰: غالبًا ما توفر أجهزة Gaudi أداءً سعريًا مقنعًا لأحمال عمل محددة
- جاهز للإنتاج ⚙️: كل قوة TGI (التجميع الديناميكي والاستجابات المتدفقة وما إلى ذلك) متاحة الآن على Gaudi
- دعم النماذج 🤖: تشغيل النماذج الشائعة مثل Llama 3.1 وMixtral وMistral والمزيد على أجهزة Gaudi
- الميزات المتقدمة 🔥: دعم الاستدلال متعدد البطاقات (التقسيم)، ونماذج لغة الرؤية، ودقة FP8
🚦 البدء مع TGI على Gaudi
أسهل طريقة لتشغيل TGI على Gaudi هي استخدام صورة Docker الرسمية الخاصة بنا. تحتاج إلى تشغيل الصورة على جهاز Gaudi. فيما يلي مثال أساسي للبدء:
model=meta-llama/Meta-Llama-3.1-8B-Instruct
volume=$PWD/data
hf_token=YOUR_HF_ACCESS_TOKEN
docker run --runtime=habana --cap-add=sys_nice --ipc=host \
-p 8080:80 \
-v $volume:/data \
-e HF_TOKEN=$hf_token \
-e HABANA_VISIBLE_DEVICES=all \
ghcr.io/huggingface/text-generation-inference:3.2.1-gaudi \
--model-id $model
بمجرد تشغيل الخادم، يمكنك إرسال طلبات الاستدلال:
curl 127.0.0.1:8080/generate
-X POST
-d '{"inputs":"What is Deep Learning?","parameters":{"max_new_tokens":32}}'
-H 'Content-Type: application/json'
للحصول على وثائق شاملة حول استخدام TGI مع Gaudi، بما في ذلك الأدلة الإرشادية والتكوينات المتقدمة، راجع وثائق الواجهة الخلفية المخصصة الجديدة لـ Gaudi.
🎉 أهم الميزات
لقد قمنا بتحسين النماذج التالية لكل من التكوينات الفردية والمتعددة البطاقات. وهذا يعني أن هذه النماذج تعمل بأسرع ما يمكن على Intel Gaudi. لقد قمنا بتحسين رمز النمذجة خصيصًا لاستهداف أجهزة Intel Gaudi، مما يضمن أننا نقدم أفضل أداء ونستفيد بشكل كامل من قدرات Gaudi:
- اللاما 3.1 (8ب و70ب)
- اللاما 3.3 (70ب)
- اللاما 3.2 الرؤية (11ب)
- ميسترال (7 ب)
- ميكسترال (8x7B)
- كود لاما (13ب)
- فالكون (180ب)
- كوين2 (72ب)
- ستاركودر و ستاركودر2
- جيما (7 ب)
- اللافا-v1.6-ميسترال-7B
- فاي-2
🏃♂️ نقدم أيضًا العديد من الميزات المتقدمة على أجهزة Gaudi، مثل تكميم FP8 بفضل Intel Neural Compressor (INC)، مما يتيح تحسينات أكبر في الأداء.
✨قريباً! نحن متحمسون لتوسيع تشكيلة نماذجنا من خلال الإضافات المتطورة بما في ذلك DeepSeek-r1/v3 وQWen-VL ونماذج أكثر قوة لتشغيل تطبيقات الذكاء الاصطناعي الخاصة بك! 🚀
💪 المشاركة
نحن ندعو المجتمع لتجربة TGI على أجهزة Gaudi وتقديم الملاحظات. الوثائق الكاملة متاحة في وثائق الواجهة الخلفية لـ TGI Gaudi. 📚 إذا كنت مهتمًا بالمساهمة، فاطلع على إرشادات المساهمة لدينا أو افتح مشكلة تتضمن تعليقاتك على GitHub. 🤝 من خلال تقديم دعم Intel Gaudi مباشرة إلى TGI، فإننا نواصل مهمتنا المتمثلة في توفير أدوات مرنة وفعالة وجاهزة للإنتاج لنشر LLMs. نحن متحمسون لرؤية ما ستبنيه بهذه الإمكانية الجديدة! 🎉