أدى ظهور الذكاء الاصطناعي التوليدي ومجالات إدارة الأعمال مثل ChatGPT إلى زيادة الاهتمام وأهمية تضمين النماذج لمجموعة متنوعة من المهام، خاصة لاسترداد الإنشاء المعزز، مثل البحث أو الدردشة مع بياناتك. تعتبر عمليات التضمين مفيدة لأنها تمثل الجمل والصور والكلمات وما إلى ذلك كتمثيلات متجهة رقمية، مما يسمح لنا بتعيين العناصر ذات الصلة لغويًا واسترجاع المعلومات المفيدة. وهذا يساعدنا على توفير السياق ذي الصلة لمطالبتنا بتحسين جودة وخصوصية التوليد.
بالمقارنة مع LLMs، فإن نماذج التضمين أصغر حجمًا وأسرع في الاستدلال. يعد هذا أمرًا مهمًا للغاية نظرًا لأنك تحتاج إلى إعادة إنشاء التضمينات الخاصة بك بعد تغيير النموذج الخاص بك أو تحسين ضبط النموذج الخاص بك. بالإضافة إلى ذلك، هل من المهم أن تكون عملية تعزيز الاسترجاع بأكملها سريعة قدر الإمكان لتوفير تجربة مستخدم جيدة.
في منشور المدونة هذا، سنوضح لك كيفية نشر نماذج التضمين مفتوحة المصدر لنقاط نهاية استدلال الوجه باستخدام Text Embedding Inference، وهو حل SaaS المُدار لدينا والذي يجعل من السهل نشر النماذج. بالإضافة إلى ذلك، سنعلمك كيفية تشغيل طلبات الدفعات على نطاق واسع.
- ما هو معانقة نقاط النهاية استنتاج الوجه
- ما هو الاستدلال تضمين النص
- نشر نموذج التضمين كنقطة نهاية للاستدلال
- إرسال طلب إلى نقطة النهاية وإنشاء عمليات التضمين
قبل أن نبدأ، دعونا نقوم بتحديث معرفتنا حول نقاط نهاية الاستدلال.
1. ما هي نقاط نهاية استنتاج الوجه المعانقة؟
توفر Hugging Face Inference Endpoints طريقة سهلة وآمنة لنشر نماذج التعلم الآلي لاستخدامها في الإنتاج. تعمل نقاط النهاية الاستدلالية على تمكين المطورين وعلماء البيانات من إنشاء تطبيقات الذكاء الاصطناعي التوليدي دون إدارة البنية التحتية: مما يؤدي إلى تبسيط عملية النشر ببضع نقرات، بما في ذلك التعامل مع كميات كبيرة من الطلبات من خلال التوسع التلقائي، وتقليل تكاليف البنية التحتية من خلال التوسع إلى الصفر، وتوفير الأمان المتقدم.
وفيما يلي بعض من أهم الميزات:
- النشر السهل: انشر النماذج كواجهات برمجة تطبيقات جاهزة للإنتاج ببضع نقرات فقط، مما يلغي الحاجة إلى التعامل مع البنية التحتية أو عمليات MLOs.
- كفاءة التكلفة: الاستفادة من النطاق التلقائي إلى القدرة الصفرية، مما يقلل التكاليف عن طريق تقليص البنية التحتية عندما لا تكون نقطة النهاية قيد الاستخدام، مع الدفع على أساس وقت تشغيل نقطة النهاية، مما يضمن فعالية التكلفة.
- أمان المؤسسة: انشر النماذج في نقاط نهاية آمنة غير متصلة بالإنترنت ولا يمكن الوصول إليها إلا من خلال اتصالات VPC المباشرة، المدعومة بشهادة SOC2 Type 2، وتقديم اتفاقيات معالجة البيانات BAA وGDPR لتحسين أمان البيانات والامتثال.
- تحسين LLM: مُحسّن لـ LLMs، مما يتيح إنتاجية عالية مع Paged Attention (الانتباه إلى صفحات) وزمن وصول منخفض من خلال كود المحولات المخصص وقوة Flash Attention بواسطة استدلال إنشاء النص
- دعم شامل للمهام: دعم خارج الصندوق لمهام ونماذج المحولات ومحولات الجملة والناشرين، والتخصيص السهل لتمكين المهام المتقدمة مثل مذكرات المتحدث أو أي مهمة ومكتبة للتعلم الآلي.
يمكنك البدء باستخدام Inference Endpoints على: https://ui.endpoints.huggingface.co/
2. ما هو استنتاج تضمينات النص؟
يعد استدلال تضمينات النص (TEI) حلاً مصممًا لهذا الغرض لنشر نماذج تضمينات النص مفتوحة المصدر وتقديمها. تم تصميم TEI لاستخراج عالي الأداء يدعم النماذج الأكثر شيوعًا. تدعم TEI جميع النماذج العشرة الأولى من لوحة المتصدرين لمؤشر Massive Text Embedding Benchmark (MTEB)، بما في ذلك FlagEmbedding وEmber وGTE وE5. تطبق TEI حاليًا ميزات تحسين الأداء التالية:
- لا توجد خطوة لتجميع الرسم البياني النموذجي
- صور عامل إرساء صغيرة وأوقات تشغيل سريعة. استعد للاستخدام بدون خادم حقيقي!
- التجميع الديناميكي القائم على الرمز المميز
- رمز المحولات الأمثل للاستدلال باستخدام Flash Attention وCandle وcuBLASlt
- تحميل وزن الأمانات
- الإنتاج جاهز (التتبع الموزع باستخدام قياسات Open Telemetry وPrometheus)
وقد أتاحت هذه الميزة أداءً رائدًا في الصناعة فيما يتعلق بالإنتاجية والتكلفة. في اختبار معياري لـ BAAI/bge-base-en-v1.5 على Nvidia A10G Inference Endpoint بطول تسلسل يبلغ 512 رمزًا مميزًا وحجم دفعة يبلغ 32، حققنا إنتاجية تزيد عن 450 طلبًا/ثانية مما أدى إلى تكلفة قدرها 0.00156 دولار / مليون رمز مميز أو 0.00000156 دولار / 1 ألف رمز مميز. وهذا أرخص بـ 64 مرة من OpenAI Embeddings (0.0001 دولار / 1 ألف رمز).

3. نشر نموذج التضمين كنقطة نهاية للاستدلال
للبدء، يجب عليك تسجيل الدخول باستخدام حساب مستخدم أو مؤسسة باستخدام طريقة دفع مسجلة (يمكنك إضافة واحدة هنا)، ثم الوصول إلى Inference Endpoints على https://ui.endpoints.huggingface.co
ثم انقر على “نقطة النهاية الجديدة”. حدد المستودع والسحابة والمنطقة، واضبط إعدادات المثيل والأمان، ثم قم بالنشر في حالتنا BAAI/bge-base-en-v1.5.

تقترح نقاط نهاية الاستدلال نوع مثيل بناءً على حجم النموذج، والذي يجب أن يكون كبيرًا بما يكفي لتشغيل النموذج. هنا Intel Ice Lake 2 vCPU. للحصول على أداء المعيار الذي قمنا بتشغيله، قم بتغيير المثيل إلى 1x Nvidia A10G.
ملاحظة: إذا تعذر تحديد نوع المثيل، فستحتاج إلى الاتصال بنا وطلب حصة المثيل.

يمكنك بعد ذلك نشر النموذج الخاص بك بالنقر فوق “إنشاء نقطة نهاية”. وبعد 1-3 دقائق، يجب أن تكون نقطة النهاية متصلة بالإنترنت ومتاحة لخدمة الطلبات.
4. أرسل طلبًا إلى نقطة النهاية وقم بإنشاء عمليات التضمين
توفر النظرة العامة على نقطة النهاية إمكانية الوصول إلى أداة الاستدلال، والتي يمكن استخدامها لإرسال الطلبات يدويًا. يتيح لك ذلك اختبار نقطة النهاية الخاصة بك بسرعة باستخدام مدخلات مختلفة ومشاركتها مع أعضاء الفريق.

ملاحظة: لا يقوم TEI حاليًا باقتطاع الإدخال تلقائيًا. يمكنك تمكين هذا عن طريق الإعداد truncate: true في طلبك.
بالإضافة إلى عنصر واجهة المستخدم، توفر النظرة العامة مقتطفًا برمجيًا لـ cURL وPython وJavascript، والذي يمكنك استخدامه لإرسال طلب إلى النموذج. يوضح لك مقتطف الكود كيفية إرسال طلب واحد، ولكن TEI يدعم أيضًا الطلبات المجمعة، مما يسمح لك بإرسال مستندات متعددة في نفس الوقت لزيادة الاستفادة من نقطة النهاية الخاصة بك. فيما يلي مثال على كيفية إرسال طلب دفعة مع ضبط الاقتطاع على “صحيح”.
import requests
API_URL = "https://l2skjfwp9punv393.us-east-1.aws.endpoints.huggingface.cloud"
headers = {
"Authorization": "Bearer YOUR TOKEN",
"Content-Type": "application/json"
}
def query(payload):
response = requests.post(API_URL, headers=headers, json=payload)
return response.json()
output = query({
"inputs": ["sentence 1", "sentence 2", "sentence 3"],
"truncate": True
})
خاتمة
يتيح TEI on Hugging Face Inference Endpoints النشر السريع والفعال من حيث التكلفة لنماذج التضمين الحديثة. بفضل الإنتاجية الرائدة في الصناعة والتي تزيد عن 450 طلبًا في الثانية وتكاليف منخفضة تصل إلى 0.00000156 دولارًا أمريكيًا / 1 ألف رمز مميز، توفر Inference Endpoints توفيرًا في التكلفة يصل إلى 64 ضعفًا مقارنة بـ OpenAI Embeddings.
بالنسبة للمطورين والشركات الذين يستفيدون من تضمينات النص لتمكين البحث الدلالي وروبوتات الدردشة والتوصيات والمزيد، تعمل Hugging Face Inference Endpoints على التخلص من أعباء البنية التحتية وتوفير إنتاجية عالية بأقل تكلفة لتبسيط العملية من البحث إلى الإنتاج.
شكرا للقراءة! إذا كان لديك أي أسئلة، فلا تتردد في الاتصال بي على تغريد أو لينكدين.