يسعدنا اليوم أن نعلن عن SafeCoder – وهو حل مساعد للتعليمات البرمجية مصمم للمؤسسات.
الهدف من SafeCoder هو إطلاق العنان لإنتاجية تطوير البرمجيات للمؤسسة، من خلال مبرمج مزدوج متوافق تمامًا ومستضاف ذاتيًا. في الحديث التسويقي: “مساعد الطيار الخاص بك على GitHub”.
قبل أن نتعمق أكثر، إليك ما تحتاج إلى معرفته:
- إن SafeCoder ليس نموذجًا، ولكنه حل تجاري متكامل وشامل
- تم تصميم SafeCoder مع مراعاة الأمان والخصوصية كمبادئ أساسية – لا يغادر الكود VPC أبدًا أثناء التدريب أو الاستدلال
- تم تصميم SafeCoder للاستضافة الذاتية من قبل العميل على البنية التحتية الخاصة به
- تم تصميم SafeCoder للعملاء لامتلاك نموذج لغة كبير الحجم خاص بهم

لماذا SafeCoder؟
توفر حلول مساعد التعليمات البرمجية المبنية على LLMs، مثل GitHub Copilot، تعزيزات قوية في الإنتاجية. بالنسبة للمؤسسة، تعمل القدرة على ضبط Code LLMs على قاعدة كود الشركة لإنشاء Code LLMs الخاصة على تحسين الموثوقية وأهمية عمليات الإكمال لإنشاء مستوى آخر من تعزيز الإنتاجية. على سبيل المثال، يُبلغ مساعد رمز LLM الداخلي في Google عن معدل قبول إكمال يتراوح بين 25-34% من خلال تدريبه على قاعدة تعليمات برمجية داخلية.
ومع ذلك، فإن الاعتماد على Code LLMs مغلق المصدر لإنشاء مساعدين داخليين للتعليمات البرمجية يعرض الشركات لمشكلات الامتثال والأمن. أولاً أثناء التدريب، نظرًا لأن ضبط Code LLM مغلق المصدر على قاعدة تعليمات برمجية داخلية يتطلب تعريض قاعدة التعليمات البرمجية هذه لطرف ثالث. وبعد ذلك أثناء الاستدلال، حيث من المحتمل أن يقوم طلاب Code LLM المضبوطين بدقة “بتسريب” التعليمات البرمجية من مجموعة بيانات التدريب الخاصة بهم أثناء الاستدلال. لتلبية متطلبات الامتثال، تحتاج المؤسسات إلى نشر Code LLMs المضبوطة بدقة داخل البنية التحتية الخاصة بها – وهو أمر غير ممكن مع LLMs مغلقة المصدر.
مع SafeCoder، ستساعد Hugging Face العملاء على بناء Code LLMs الخاصة بهم، وضبطها بدقة على قاعدة التعليمات البرمجية الخاصة بهم، باستخدام أحدث النماذج والمكتبات المفتوحة، دون مشاركة التعليمات البرمجية الخاصة بهم مع Hugging Face أو أي طرف ثالث آخر. مع SafeCoder، تقدم Hugging Face حل استدلال Code LLM مُسرّع بالأجهزة، ليتم نشره من قبل العميل مباشرة داخل البنية التحتية الآمنة للعميل، دون مغادرة إدخالات التعليمات البرمجية وإكمالها لبيئة تكنولوجيا المعلومات الآمنة الخاصة بهم.
من StarCoder إلى SafeCoder
في قلب حل SafeCoder توجد عائلة StarCoder من Code LLMs، التي أنشأها مشروع BigCode، وهو عبارة عن تعاون بين Hugging Face وServiceNow ومجتمع المصادر المفتوحة.
توفر نماذج StarCoder خصائص فريدة مناسبة بشكل مثالي لحلول الاستضافة الذاتية للمؤسسات:
- أحدث نتائج إكمال الكود – راجع المعايير في الورقة ولوحة المتصدرين لتقييم الكود متعدد اللغات
- مصمم لأداء الاستدلال: نموذج معلمات 15B مع تحسينات في التعليمات البرمجية، وانتباه متعدد الاستعلامات لتقليل أثر الذاكرة، وانتباه Flash للتوسع إلى سياق 8,192 رمزًا مميزًا.
- تم التدريب على Stack، وهي مجموعة بيانات تعليمات برمجية مفتوحة المصدر ومصدرها أخلاقيًا تحتوي فقط على تعليمات برمجية مرخصة مسموح بها تجاريًا، مع آلية إلغاء الاشتراك للمطور منذ البداية، ويتم تنقيحها من خلال جهود إزالة معلومات تحديد الهوية الشخصية (PII) المكثفة وإلغاء البيانات المكررة.
ملحوظة: على الرغم من أن StarCoder هو مصدر الإلهام والنموذج الذي يدعم الإصدار الأولي من SafeCoder، إلا أن إحدى الفوائد المهمة لبناء حل LLM على نماذج مفتوحة المصدر هي أنه يمكنه التكيف مع أحدث وأكبر النماذج مفتوحة المصدر المتاحة. في المستقبل، قد تقدم SafeCoder نماذج أخرى مفتوحة المصدر مسموح بها تجاريًا ومبنية على مجموعات بيانات شفافة من مصادر أخلاقية باعتبارها LLM الأساسية المتاحة للضبط الدقيق.
الخصوصية والأمن كمبدأ أساسي
بالنسبة لأي شركة، تعد قاعدة التعليمات البرمجية الداخلية من أهم حقوق الملكية الفكرية وأكثرها قيمة. أحد المبادئ الأساسية لـ SafeCoder هو أن قاعدة التعليمات البرمجية الداخلية للعميل لن تكون متاحة أبدًا لأي طرف ثالث (بما في ذلك Hugging Face) أثناء التدريب أو الاستدلال.
في مرحلة الإعداد الأولية لـ SafeCoder، يوفر فريق Hugging Face الحاويات والبرامج النصية والأمثلة للعمل جنبًا إلى جنب مع العميل لتحديد واستخراج وإعداد وتكرار وإلغاء تحديد بيانات قاعدة التعليمات البرمجية الداخلية في مجموعة بيانات تدريب لاستخدامها في حاوية تدريب مقدمة من Hugging Face تم تكوينها وفقًا للبنية التحتية للأجهزة المتاحة للعميل.
في مرحلة نشر SafeCoder، ينشر العميل الحاويات التي توفرها Hugging Face على البنية التحتية الخاصة به لكشف نقاط النهاية الداخلية الخاصة داخل VPC الخاص به. يتم تكوين هذه الحاويات وفقًا لتكوين الأجهزة الدقيق المتاح للعميل، بما في ذلك وحدات معالجة الرسومات NVIDIA أو وحدات معالجة الرسومات AMD Instinct أو وحدات المعالجة المركزية Intel Xeon أو مسرعات AWS Inferentia2 أو Habana Gaudi.
الامتثال كمبدأ أساسي
نظرًا لأن الإطار التنظيمي حول نماذج التعلم الآلي ومجموعات البيانات لا يزال قيد الكتابة في جميع أنحاء العالم، تحتاج الشركات العالمية إلى التأكد من أن الحلول التي تستخدمها تقلل من المخاطر القانونية.
تعد مصادر البيانات وإدارة البيانات وإدارة البيانات المحمية بحقوق الطبع والنشر مجرد عدد قليل من أهم مجالات الامتثال التي يجب مراعاتها. قامت BigScience، وهي الابن الأكبر والمصدر الملهم لـ BigCode، بمعالجة هذه المجالات في مجموعات عمل قبل أن يتم الاعتراف بها على نطاق واسع من خلال مسودة قانون الاتحاد الأوروبي للذكاء الاصطناعي، ونتيجة لذلك تم تصنيفها على أنها الأكثر امتثالًا بين موفري النماذج التأسيسية في دراسة جامعة ستانفورد CRFM.
توسعت BigCode في هذا العمل من خلال تنفيذ تقنيات جديدة لمجال التعليمات البرمجية وبناء The Stack مع الامتثال كمبدأ أساسي، مثل تصفية التراخيص المسموح بها تجاريًا، وآليات الموافقة (يمكن للمطورين بسهولة معرفة ما إذا كان الكود الخاص بهم موجودًا وطلب إلغاء الاشتراك في مجموعة البيانات)، والوثائق والأدوات الشاملة لفحص البيانات المصدر، وتحسينات مجموعة البيانات (مثل إلغاء البيانات المكررة وإزالة معلومات تحديد الهوية الشخصية).
تُترجم كل هذه الجهود إلى تقليل المخاطر القانونية لمستخدمي نماذج StarCoder وعملاء SafeCoder. وبالنسبة لمستخدمي SafeCoder، تُترجم هذه الجهود إلى ميزات امتثال: عندما يحصل مطورو البرامج على إكمال التعليمات البرمجية، يتم التحقق من هذه الاقتراحات مقابل The Stack، حتى يعرف المستخدمون ما إذا كانت التعليمات البرمجية المقترحة تتطابق مع التعليمات البرمجية الموجودة في مجموعة البيانات المصدر، وما هو الترخيص. يمكن للعملاء تحديد التراخيص المفضلة وإظهار تلك التفضيلات لمستخدميهم.
كيف يعمل؟
يعد SafeCoder حلاً تجاريًا كاملاً، بما في ذلك الخدمة والبرامج والدعم.
تدريب نموذج SafeCoder الخاص بك
تم تدريب StarCoder على أكثر من 80 لغة برمجة ويقدم أداءً متطورًا وفق معايير متعددة. لتقديم اقتراحات تعليمات برمجية أفضل خصيصًا لعملاء SafeCoder، نبدأ المشاركة بمرحلة تدريب اختيارية، حيث يعمل فريق Hugging Face مباشرة مع فريق العملاء لإرشادهم خلال خطوات إعداد وبناء مجموعة بيانات تعليمات برمجية للتدريب، وإنشاء نموذج إنشاء التعليمات البرمجية الخاص بهم من خلال الضبط الدقيق، دون تعريض قاعدة التعليمات البرمجية الخاصة بهم لأطراف ثالثة أو الإنترنت.
والنتيجة النهائية هي نموذج يتم تكييفه مع لغات التعليمات البرمجية والمعايير والممارسات الخاصة بالعميل. من خلال هذه العملية، يتعلم عملاء SafeCoder العملية ويبنون مسارًا لإنشاء نماذجهم الخاصة وتحديثها، مما يضمن عدم تقييد البائع، والحفاظ على التحكم في قدرات الذكاء الاصطناعي الخاصة بهم.
نشر SafeCoder
أثناء مرحلة الإعداد، يقوم عملاء SafeCoder وHugging Face بتصميم وتوفير البنية التحتية المثالية لدعم التزامن المطلوب لتقديم تجربة رائعة للمطورين. تقوم Hugging Face بعد ذلك ببناء حاويات استدلال SafeCoder التي يتم تسريعها بواسطة الأجهزة وتحسينها من أجل الإنتاجية، ليتم نشرها من قبل العميل على البنية التحتية الخاصة به.
يدعم استنتاج SafeCoder العديد من الأجهزة لمنح العملاء مجموعة واسعة من الخيارات: وحدات معالجة الرسومات NVIDIA Ampere، ووحدات معالجة الرسومات AMD Instinct، وHabana Gaudi2، وAWS Inferentia 2، ووحدات المعالجة المركزية Intel Xeon Sapphire Rapids والمزيد.
باستخدام SafeCoder
بمجرد نشر SafeCoder وتفعيل نقاط النهاية الخاصة به داخل VPC للعميل، يمكن للمطورين تثبيت مكونات SafeCoder IDE الإضافية المتوافقة للحصول على اقتراحات التعليمات البرمجية أثناء عملهم. واليوم، يدعم SafeCoder بيئات التطوير المتكاملة (IDEs) الشائعة، بما في ذلك VSCode وIntelliJ، بالإضافة إلى المزيد من المكونات الإضافية القادمة من شركائنا.
كيف يمكنني الحصول على SafeCoder؟
اليوم، نعلن عن SafeCoder بالتعاون مع VMware في مؤتمر VMware Explore ونجعل SafeCoder متاحًا لعملاء مؤسسة VMware. يساعد العمل مع VMware على ضمان نجاح نشر SafeCoder على البنية التحتية السحابية لـ VMware Cloud الخاصة بالعملاء – أيًا كان سيناريو البنية التحتية السحابية أو المحلية أو المختلطة الذي يفضله العميل. بالإضافة إلى استخدام SafeCoder، قامت VMware بنشر بنية مرجعية تحتوي على نماذج تعليمات برمجية لتمكين تحقيق أسرع وقت ممكن للوصول إلى القيمة عند نشر وتشغيل SafeCoder على البنية التحتية لـ VMware. تسهل البنية المرجعية الخاصة للذكاء الاصطناعي من VMware على المؤسسات الاستفادة بسرعة من المشاريع الشائعة مفتوحة المصدر مثل ray وkubeflow لنشر خدمات الذكاء الاصطناعي المجاورة لمجموعات البيانات الخاصة بها، مع العمل مع Hugging Face لضمان احتفاظ المؤسسات بالمرونة للاستفادة من أحدث وأكبر النماذج مفتوحة المصدر. وهذا كله بدون مقايضات في التكلفة الإجمالية للملكية أو الأداء.
يقول كريس وولف، نائب رئيس VMware AI Labs: “إن تعاوننا مع Hugging Face about SafeCoder يتوافق تمامًا مع هدف VMware المتمثل في تمكين العملاء من اختيار الحلول مع الحفاظ على الخصوصية والتحكم في بيانات أعمالهم. في الواقع، نحن نقوم بتشغيل SafeCoder داخليًا منذ أشهر وشهدنا نتائج ممتازة. والأفضل من ذلك كله، أن تعاوننا مع Hugging Face بدأ للتو، وأنا متحمس لتوصيل حلنا إلى مئات الآلاف من العملاء حول العالم”. تعرف على المزيد حول التمييز بين الذكاء الاصطناعي الخاص وبرنامج VMware في هذا المجال الناشئ هنا.
إذا كنت مهتمًا بـ SafeCoder لشركتك، فيرجى الاتصال بنا هنا – وسيتصل بك فريقنا لمناقشة متطلباتك!