الصورة الرمزية شون سميث


راية

لقد منحنا كلود القدرة على تحسين نماذج اللغة باستخدام أداة جديدة تسمى Hugging Face Skills. ليس فقط كتابة البرامج النصية للتدريب، ولكن إرسال المهام فعليًا إلى وحدات معالجة الرسومات السحابية، ومراقبة التقدم، ودفع النماذج النهائية إلى Hugging Face Hub. يوضح لك هذا البرنامج التعليمي كيفية عمله وكيفية استخدامه بنفسك.

يستطيع كلود كود استخدام “المهارات” – التعليمات المعبأة والنصوص والمعرفة بالمجال – لإنجاز المهام المتخصصة. ال hf-llm-trainer تعلم المهارة كلود كل ما يحتاج لمعرفته حول التدريب: أي وحدة معالجة رسومات تختارها لحجم النموذج الخاص بك، وكيفية تكوين مصادقة Hub، ومتى يتم استخدام LoRA مقابل الضبط الدقيق الكامل، وكيفية التعامل مع العشرات من القرارات الأخرى التي تدخل في عملية تدريب ناجحة.

باستخدام هذه المهارة، يمكنك إخبار كلود بأشياء مثل:

Fine-tune Qwen3-0.6B on the dataset open-r1/codeforces-cots

وكلود سوف:

  1. التحقق من صحة تنسيق مجموعة البيانات الخاصة بك
  2. حدد الأجهزة المناسبة (t4-small لطراز 0.6B)
  3. استخدام وتحديث البرنامج النصي للتدريب مع مراقبة Trackio
  4. أرسل الوظيفة إلى Hugging Face Jobs
  5. قم بالإبلاغ عن معرف الوظيفة والتكلفة المقدرة
  6. تحقق من التقدم عندما تسأل
  7. تساعدك على تصحيح الأخطاء إذا حدث خطأ ما

يتدرب النموذج على وحدات معالجة الرسوميات Hugging Face أثناء قيامك بأشياء أخرى. عند الانتهاء، يظهر النموذج الذي تم ضبطه بدقة على Hub، ويكون جاهزًا للاستخدام.

هذه ليست لعبة تجريبية. تدعم المهارة نفس أساليب التدريب المستخدمة في الإنتاج: الضبط الدقيق الخاضع للإشراف، وتحسين التفضيلات المباشرة، والتعلم المعزز بمكافآت يمكن التحقق منها. يمكنك تدريب النماذج من 0.5B إلى 70B من المعلمات، وتحويلها إلى GGUF للنشر المحلي، وتشغيل خطوط أنابيب متعددة المراحل تجمع بين تقنيات مختلفة.

الإعداد والتثبيت

قبل البدء، سوف تحتاج إلى:

مهارات معانقة الوجه متوافقة مع Claude Code وCodex وGemini CLI. مع عمليات التكامل على الطريق لـ Cursor وWindsurf وContinue.

كلود كود

  1. قم بتسجيل المستودع كمكون إضافي للسوق:
/plugin marketplace add huggingface/skills
  1. لتثبيت مهارة، قم بتشغيل:
/plugin install <skill-folder>@huggingface-skills

على سبيل المثال:

/plugin install hf-llm-trainer@huggingface-skills

الدستور الغذائي

  1. سوف تحدد هيئة الدستور الغذائي المهارات عبر AGENTS.md ملف. يمكنك التحقق من تحميل التعليمات بما يلي:
codex --ask-for-approval never "Summarize the current instructions."
  1. لمزيد من التفاصيل، راجع دليل Codex AGENTS.

الجوزاء CLI

  1. يتضمن هذا الريبو gemini-extension.json للتكامل مع Gemini CLI.

  2. التثبيت محليا:

gemini extensions install . --consent

أو استخدم عنوان URL لـ GitHub:

gemini extensions install https://github.com/huggingface/skills.git --consent
  1. راجع مستندات ملحقات Gemini CLI لمزيد من المساعدة.

تواصل مع معانقة الوجه

يجب عليك المصادقة على حساب Hugging Face الخاص بك باستخدام رمز الوصول للكتابة حتى تتمكن المهمة من إنشاء نموذج الريبو.

قم بإعداد الرمز المميز الخاص بك:

hf auth login

export HF_TOKEN=hf_your_write_access_token_here

قم بتكوين Hugging Face MCP Server لاستخدام رمز الكتابة الخاص بك عن طريق إرساله إما في ملف HF_TOKEN أو Authorization: Bearer رؤوس HTTP.

لكلود كود: claude mcp add --transport http hf-skills https://huggingface.co/mcp?bouquet=skills --header "Authorization: Bearer $HF_TOKEN"

تشغيل التدريب الأول الخاص بك

دعونا نسير عبر مثال كامل. سنقوم بضبط نموذج صغير لرؤية سير العمل بالكامل، ثم استكشاف المزيد من الإمكانات المتقدمة.

إرشاد وكيل الترميز لضبط

ابدأ بتعليمات بسيطة وواضحة لضبط نموذج معين

Fine-tune Qwen3-0.6B on the open-r1/codeforces-cots dataset for instruction following. 

يقوم وكيل الترميز بتحليل طلبك وإعداد تكوين التدريب. بالنسبة لنموذج 0.6B في مجموعة بيانات تجريبية، فإنه يقوم بالاختيار t4-small—وحدة معالجة رسومات كافية لحجم هذا الطراز وأرخص خيار متاح.

ال open-r1/codeforces-cots مجموعة البيانات هي مجموعة بيانات لمشاكل وحلول Codeforces. إنها مجموعة بيانات جيدة لتعليمات ضبط النموذج لحل مشكلات الترميز الصعبة.

وهذا ينطبق على نماذج لغة الرؤية أيضًا! يمكنك ببساطة تشغيل “Fine-tune Qwen/Qwen3-VL-2B-Instruct on llava-instruct-mix”

المراجعة قبل التقديم

قبل أن يرسل وكيل الترميز أي شيء، سترى التكوين:

I'll fine-tune Qwen/Qwen3-0.6B on open-r1/codeforces-cots using SFT.

Configuration:
- Hardware: t4-small (~$0.75/hour)
- Estimated time: ~20 minutes
- Estimated cost: ~$0.30
- Output: username/qwen-codeforces-cots-sft

The model will be pushed to Hub automatically. Should I submit?

هذه هي فرصتك لتعديل أي شيء. قم بتغيير اسم مستودع الإخراج، أو اختر أجهزة مختلفة، أو اطلب من Claude تعديل معلمات التدريب. بمجرد الموافقة، يقوم الوكيل بإرسال الوظيفة.

على سبيل المثال، يمكنك أن تطلب من الوكيل تجربة التشغيل التجريبي:

Do a quick test run on 100 examples.

تتبع التقدم

بعد التقديم تحصل على تفاصيل الوظيفة:

✅ Job submitted successfully!

Job ID: abc123xyz
Monitor: https://huggingface.co/jobs/username/abc123xyz

Expected time: ~20 minutes
Estimated cost: ~$0.30

View real-time metrics at: https://huggingface.co/spaces/username/trackio

مثال على لوحة معلومات Trackio لاختبار الاجتياح

تتضمن المهارة تكامل Trackio، حتى تتمكن من مشاهدة انخفاض فقدان التدريب في الوقت الفعلي. تعمل المهام بشكل غير متزامن حتى تتمكن من إغلاق جهازك والعودة لاحقًا. عندما تريد التحديث:

How's my training job doing?

ثم يقوم الوكيل بإحضار السجلات وتلخيص التقدم.

استخدم النموذج الخاص بك

عند اكتمال التدريب، يكون النموذج الخاص بك موجودًا على المركز:

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("username/qwen-codeforces-cots-sft")
tokenizer = AutoTokenizer.from_pretrained("username/qwen-codeforces-cots-sft")

هذه هي الحلقة الكاملة. لقد وصفت ما تريده باللغة الإنجليزية البسيطة، وتعامل الوكيل مع اختيار وحدة معالجة الرسومات، وإنشاء البرنامج النصي، وتقديم المهمة، والمصادقة، والمثابرة. كل هذا يكلف حوالي ثلاثين سنتًا.

طرق التدريب

تدعم المهارة ثلاثة أساليب تدريبية. إن فهم متى تستخدم كل واحدة منها يساعدك على الحصول على نتائج أفضل.

الضبط الدقيق الخاضع للإشراف (SFT)

SFT هو المكان الذي تبدأ فيه معظم المشاريع. أنت تقدم بيانات توضيحية – أمثلة على المدخلات والمخرجات المطلوبة – ويقوم التدريب بضبط النموذج ليتناسب مع تلك الأنماط.

استخدم SFT عندما يكون لديك أمثلة عالية الجودة للسلوك الذي تريده. محادثات دعم العملاء، وأزواج إنشاء التعليمات البرمجية، والأسئلة والأجوبة الخاصة بالمجال – أي شيء يمكنك من خلاله إظهار الشكل الجيد للنموذج.

Fine-tune Qwen3-0.6B on my-org/support-conversations for 3 epochs.

يتحقق الوكيل من صحة مجموعة البيانات، ويختار الأجهزة (a10g-large مع LoRA لنموذج 7B)، ويقوم بتكوين التدريب باستخدام نقاط التفتيش والمراقبة.

بالنسبة للنماذج الأكبر من معلمات 3B، يستخدم الوكيل تلقائيًا LoRA (التكيف منخفض الرتبة) لتقليل متطلبات الذاكرة. وهذا يجعل تدريب نماذج 7B أو 13B ممكنًا على وحدات معالجة الرسومات الفردية مع الحفاظ على معظم جودة الضبط الدقيق الكامل.

تحسين التفضيل المباشر (DPO)

يتدرب DPO على أزواج التفضيلات، وهي الاستجابات التي يتم فيها “اختيار” أحدهما و”رفض” الآخر. يؤدي هذا إلى محاذاة مخرجات النموذج مع التفضيلات البشرية، عادةً بعد مرحلة SFT الأولية.

استخدم DPO عندما يكون لديك تعليقات توضيحية تفضيلية من أدوات التصنيف البشرية أو المقارنات الآلية. يقوم DPO بتحسين الاستجابة المفضلة مباشرة دون الحاجة إلى نموذج مكافأة منفصل.

Run DPO on my-org/preference-data to align the SFT model I just trained.
The dataset has 'chosen' and 'rejected' columns.

DPO حساس لتنسيق مجموعة البيانات. يتطلب أعمدة مسماة بالضبط chosen و rejected، أو أ prompt العمود مع الإدخال. يتحقق الوكيل من صحة ذلك أولاً ويوضح لك كيفية تعيين الأعمدة إذا كانت مجموعة البيانات الخاصة بك تستخدم أسماء مختلفة.

يمكنك تشغيل DPO باستخدام المهارات في نماذج لغة الرؤية أيضًا! جربه باستخدام openbmb/RLAIF-V-Dataset. سيطبق كلود تعديلات طفيفة لكنه سينجح في التدريب.

تحسين السياسة النسبية للمجموعة (GRPO)

GRPO هي مهمة تعلم معززة أثبتت فعاليتها في المهام التي يمكن التحقق منها مثل حل المشكلات الرياضية أو كتابة التعليمات البرمجية أو أي مهمة ذات معيار نجاح برمجي.

Train a math reasoning model using GRPO on the openai/gsm8k dataset based on Qwen3-0.6B.

يقوم النموذج بإنشاء استجابات، ويتلقى مكافآت بناءً على صحته، ويتعلم من النتائج. هذا أكثر تعقيدًا من SFT أو DPO، لكن التكوين مشابه.

الأجهزة والتكلفة

يختار الوكيل الأجهزة بناءً على حجم الطراز الخاص بك، ولكن فهم المفاضلات يساعدك على اتخاذ قرارات أفضل.

حجم النموذج لرسم خرائط GPU

ل نماذج صغيرة تحت معلمات 1B, t4-small يعمل بشكل جيد. تتدرب هذه النماذج بسرعة — توقع الحصول على 1-2 دولار للتشغيل الكامل. هذا مثالي للتشغيل التعليمي أو التجريبي.

ل النماذج الصغيرة (1-3ب)، تصعيد ل t4-medium أو a10g-small. يستغرق التدريب بضع ساعات ويكلف 5-15 دولارًا.

ل النماذج المتوسطة (3-7ب)، تحتاج a10g-large أو a100-large مع لورا. الضبط الدقيق الكامل لا يناسبك، لكن LoRA تجعلها قابلة للتدريب بشكل كبير. ميزانية 15-40 دولارًا للإنتاج.

ل نماذج كبيرة (7B+)، وظيفة مهارات التردد العالي هذه ليست مناسبة.

التجريبي مقابل الإنتاج

عند اختبار سير العمل، ابدأ صغيرًا:

Do a quick test run to SFT Qwen-0.6B with 100 examples of my-org/support-conversations.

يقوم وكيل الترميز بتكوين الحد الأدنى من التدريب، وهو ما يكفي للتحقق من عمل خط الأنابيب الخاص بك دون تكلفة حقيقية.

بالنسبة للإنتاج، كن صريحًا:

SFT Qwen-0.6B for production on the full my-org/support-conversations.
Checkpoints every 500 steps, 3 epochs, cosine learning rate.

قم دائمًا بتشغيل العرض التوضيحي قبل الالتزام بمهمة إنتاج تستغرق عدة ساعات. العرض التوضيحي بقيمة 0.50 دولار الذي اكتشف خطأ في التنسيق يوفر عملية تشغيل فاشلة بقيمة 30 دولارًا.

التحقق من صحة مجموعة البيانات

يعد تنسيق مجموعة البيانات هو المصدر الأكثر شيوعًا لفشل التدريب. يمكن للوكيل التحقق من صحة مجموعات البيانات قبل قضاء وقت GPU.

Check if my-org/conversation-data works for SFT training.

يجري الوكيل فحصًا سريعًا على وحدة المعالجة المركزية (أجزاء من بنس واحد) ويبلغ:

Dataset validation for my-org/conversation-data:

SFT: ✓ READY
  Found 'messages' column with conversation format

DPO: ✗ INCOMPATIBLE
  Missing 'chosen' and 'rejected' columns

إذا كانت مجموعة البيانات الخاصة بك بحاجة إلى تحويل، فيمكن للوكيل أن يوضح لك كيفية القيام بذلك:

My DPO dataset uses 'good_response' and 'bad_response' instead
of 'chosen' and 'rejected'. How do I fix this?

يوفر الوكيل رمز التعيين ويمكنه دمجه مباشرة في البرنامج النصي للتدريب الخاص بك.

التدريب على المراقبة

تساعدك المراقبة في الوقت الفعلي على اكتشاف المشكلات مبكرًا. تقوم المهارة بتكوين Trackio بشكل افتراضي – بعد إرسال الوظيفة، يمكنك مشاهدة المقاييس على:

https://huggingface.co/spaces/username/trackio

يوضح هذا فقدان التدريب ومعدل التعلم ومقاييس التحقق من الصحة. يُظهر التشغيل الصحي انخفاضًا مطردًا في الخسارة.

اسأل الوكيل عن الحالة في أي وقت:

What's the status of my training job?
Job abc123xyz is running (45 minutes elapsed)

Current step: 850/1200
Training loss: 1.23 (↓ from 2.41 at start)
Learning rate: 1.2e-5

Estimated completion: ~20 minutes

إذا حدث خطأ ما، فإن الوكيل يساعد في التشخيص. نفاد الذاكرة؟ يقترح الوكيل تقليل حجم الدفعة أو ترقية الأجهزة. خطأ في مجموعة البيانات؟ يحدد الوكيل عدم التطابق. نفذ الوقت؟ يوصي الوكيل بمدة أطول أو إعدادات تدريب أسرع.

التحويل إلى GGUF

بعد التدريب، قد ترغب في تشغيل النموذج الخاص بك محليًا. يعمل تنسيق GGUF مع llama.cpp والأدوات التابعة مثل LM Studio وOllama وما إلى ذلك.

Convert my fine-tuned model to GGUF with Q4_K_M quantization.
Push to username/my-model-gguf.

يرسل الوكيل مهمة تحويل تدمج محولات LoRA، وتتحول إلى GGUF، وتطبق التكميم، وتدفع إلى Hub.

ثم استخدمه محليًا:

llama-server -hf <username>/<model-name>:<quantization>


llama-server -hf unsloth/Qwen3-1.7B-GGUF:Q4_K_M

ما هو التالي

لقد أظهرنا أن وكلاء البرمجة مثل Claude Code، أو Codex، أو Gemini CLI يمكنهم التعامل مع دورة الحياة الكاملة للضبط الدقيق للنموذج: التحقق من صحة البيانات، واختيار الأجهزة، وإنشاء البرامج النصية، وإرسال المهام، ومراقبة التقدم، وتحويل المخرجات. وهذا يحول ما كان في السابق مهارة متخصصة إلى شيء يمكنك القيام به من خلال المحادثة.

بعض الأشياء التي يمكنك تجربتها:

  • قم بضبط النموذج على مجموعة البيانات الخاصة بك
  • أنشئ نموذجًا محاذيًا للتفضيلات باستخدام SFT → DPO
  • تدريب نموذج الاستدلال باستخدام GRPO في الرياضيات أو الكود
  • تحويل نموذج إلى GGUF وتشغيله باستخدام Ollama

المهارة مفتوحة المصدر. يمكنك توسيعه، أو تخصيصه لسير العمل الخاص بك، أو استخدامه كنقطة بداية لسيناريوهات التدريب الأخرى.


موارد

شاركها.
اترك تعليقاً