الصورة الرمزية جيف بودير

تحديث: تم إيقاف هذه الخدمة ولم تعد متوفرة اعتبارًا من 10 أبريل 2025. للحصول على بديل، يجب عليك التفكير في موفري الاستدلال

اليوم، يسعدنا أن نعلن عن إطلاق تعانق الوجه NVIDIA NIM API (بدون خادم)، خدمة جديدة على Hugging Face Hub، متاحة لمؤسسات Enterprise Hub. تسهل هذه الخدمة الجديدة استخدام النماذج المفتوحة مع منصة الحوسبة المسرَّعة، وهي منصة الحوسبة المسرَّعة NVIDIA DGX Cloud لخدمة الاستدلال. لقد قمنا ببناء هذا الحل بحيث يمكن لمستخدمي Enterprise Hub الوصول بسهولة إلى أحدث تقنيات NVIDIA AI بطريقة بدون خادم لتشغيل الاستدلال على نماذج الذكاء الاصطناعي التوليدية الشهيرة بما في ذلك Llama وMistral، باستخدام واجهات برمجة التطبيقات القياسية وبضعة أسطر من التعليمات البرمجية داخل Hugging Face Hub.

الاستدلال بدون خادم مع الوجه المعانق وNVIDIA NIM

الاستدلال بدون خادم مدعوم من NVIDIA NIM

تعتمد هذه التجربة الجديدة على تعاوننا مع NVIDIA لتبسيط الوصول واستخدام نماذج الذكاء الاصطناعي التوليدية المفتوحة على حوسبة NVIDIA المتسارعة. أحد التحديات الرئيسية التي يواجهها المطورون والمؤسسات هو التكلفة الأولية للبنية التحتية وتعقيد تحسين أعباء عمل الاستدلال لـ LLM. من خلال Hugging Face NVIDIA NIM API (بدون خادم)، نقدم حلاً سهلاً لهذه التحديات، مما يوفر وصولاً فوريًا إلى أحدث نماذج الذكاء الاصطناعي التوليدية المفتوحة والمحسّنة للبنية التحتية لـ NVIDIA مع واجهة برمجة تطبيقات بسيطة لتشغيل الاستدلال. يضمن نموذج تسعير الدفع أولاً بأول أنك تدفع فقط مقابل وقت الطلب الذي تستخدمه، مما يجعله خيارًا اقتصاديًا للشركات بجميع أحجامها.

NVIDIA NIM API (بدون خادم) يكمل التدريب على DGX Cloud، وهي خدمة تدريب على الذكاء الاصطناعي متاحة بالفعل على Hugging Face.

كيف يعمل

لم يكن تشغيل الاستدلال بدون خادم باستخدام نماذج Hugging Face أسهل من أي وقت مضى. فيما يلي دليل خطوة بخطوة للبدء:

ملاحظة: تحتاج إلى الوصول إلى مؤسسة بها اشتراك Hugging Face Enterprise Hub لتشغيل الاستدلال.

قبل البدء، تأكد من استيفاء المتطلبات التالية:

  1. أنت عضو في مؤسسة Enterprise Hub.
  2. لقد قمت بإنشاء رمز مميز لمؤسستك. اتبع الخطوات أدناه لإنشاء الرمز المميز الخاص بك.

قم بإنشاء رمز مميز

تسمح الرموز المميزة الدقيقة للمستخدمين بإنشاء رموز مميزة بأذونات محددة للتحكم الدقيق في الوصول إلى الموارد ومساحات الأسماء. أولاً، انتقل إلى Hugging Face Access Tokens وانقر على “إنشاء رمز جديد” وحدد “دقيق”.

إنشاء رمز مميز

أدخل “اسم الرمز المميز” وحدد مؤسسة مؤسستك في “أذونات المؤسسة” كنطاق ثم انقر فوق “إنشاء رمز مميز”. لا تحتاج إلى تحديد أي نطاقات إضافية.

رمز النطاق

الآن، تأكد من حفظ قيمة الرمز المميز هذه لمصادقة طلباتك لاحقًا.


ابحث عن NIM الخاص بك

يمكنك العثور على “NVIDIA NIM API (بدون خادم)” في صفحة النموذج لنماذج الذكاء الاصطناعي التوليدية المدعومة. يمكنك العثور على جميع الطرز المدعومة في مجموعة NVIDIA NIM وفي قسم التسعير.

سوف نستخدم meta-llama/Meta-Llama-3-8B-Instruct. انتقل إلى بطاقة النموذج meta-llama/Meta-Llama-3-8B-Instruct وافتح قائمة “نشر”، وحدد “NVIDIA NIM API (بدون خادم)” – سيؤدي هذا إلى فتح واجهة بمقتطفات التعليمات البرمجية التي تم إنشاؤها مسبقًا لـ Python أو Javascript أو Curl.

الاستدلال مشروط


أرسل طلباتك

تم توحيد NVIDIA NIM API (بدون خادم) على OpenAI API. هذا يسمح لك باستخدام openai' sdk للاستدلال. استبدل YOUR_FINE_GRAINED_TOKEN_HERE باستخدام رمزك المميز وستكون جاهزًا لتشغيل الاستدلال.

from openai import OpenAI

client = OpenAI(
    base_url="https://huggingface.co/api/integrations/dgx/v1",
    api_key="YOUR_FINE_GRAINED_TOKEN_HERE"
)

chat_completion = client.chat.completions.create(
    model="meta-llama/Meta-Llama-3-8B-Instruct",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Count to 500"}
    ],
    stream=True,
    max_tokens=1024
)


for message in chat_completion:
    print(message.choices[0].delta.content, end='')

تهاني! 🎉 يمكنك الآن البدء في إنشاء تطبيقات الذكاء الاصطناعي التوليدية الخاصة بك باستخدام النماذج المفتوحة. 🔥

تدعم NVIDIA NIM API (بدون خادم) حاليًا فقط chat.completions.create و models.list واجهة برمجة التطبيقات. نحن نعمل على توسيع هذا مع إضافة المزيد من النماذج. ال models.list يمكن استخدامها للتحقق من النماذج المتوفرة حاليًا للاستدلال.

models = client.models.list()
for m in models.data:
    print(m.id)

النماذج المدعومة والأسعار

تتم محاسبة استخدام Hugging Face NVIDIA NIM API (بدون خادم) بناءً على وقت الحوسبة المستغرق لكل طلب. نحن نستخدم حصريًا وحدات معالجة الرسومات NVIDIA H100 Tensor Core، والتي يبلغ سعرها 8.25 دولارًا للساعة. لتسهيل فهم هذا الأمر بالنسبة للتسعير حسب الطلب، يمكننا تحويله إلى تسعير لكل ثانية.

8.25 USD في الساعة = 0.0023 USD في الثانية (تقريبًا إلى 4 منازل عشرية)

ستعتمد التكلفة الإجمالية للطلب على حجم النموذج وعدد وحدات معالجة الرسومات المطلوبة والوقت المستغرق لمعالجة الطلب. فيما يلي تفاصيل عروض النماذج الحالية لدينا، ومتطلبات وحدة معالجة الرسومات الخاصة بها، وأوقات الاستجابة النموذجية، والتكلفة المقدرة لكل طلب:

معرف النموذج عدد وحدات معالجة الرسومات NVIDIA H100 وقت الاستجابة النموذجي (500 رمز إدخال، 100 رمز إخراج) التكلفة المقدرة لكل طلب
meta-llama/Meta-Llama-3-8B-Instruct 1 1 ثانية 0.0023 دولار
meta-llama/Meta-Llama-3-70B-Instruct 4 2 ثانية 0.0184 دولار
meta-llama/Meta-Llama-3.1-405B-Instruct-FP8 8 5 ثواني 0.0917 دولار

تتراكم رسوم الاستخدام على دورة الفوترة الشهرية الحالية لمؤسسات Enterprise Hub الخاصة بك. يمكنك التحقق من استخدامك الحالي والسابق في أي وقت من خلال إعدادات الفوترة الخاصة بمؤسسة Enterprise Hub الخاصة بك.

النماذج المدعومة

تسريع استدلال الذكاء الاصطناعي باستخدام NVIDIA TensorRT-LLM

نحن متحمسون لمواصلة تعاوننا مع NVIDIA لدفع حدود أداء استدلال الذكاء الاصطناعي وإمكانية الوصول إليه. التركيز الرئيسي لجهودنا المستمرة هو دمج مكتبة NVIDIA TensorRT-LLM في إطار عمل Hugging Face’s Text Generation Inference (TGI).

سنشارك المزيد من التفاصيل والمعايير وأفضل الممارسات لاستخدام TGI مع NVIDIA TensorRT-LLM في المستقبل القريب. ترقبوا المزيد من التطورات المثيرة بينما نواصل توسيع تعاوننا مع NVIDIA وتقديم إمكانات الذكاء الاصطناعي الأكثر قوة للمطورين والمؤسسات في جميع أنحاء العالم!

شاركها.
اترك تعليقاً