هل تجد صعوبة في معرفة ما إذا كان النص مكتوبًا بواسطة إنسان أم تم إنشاؤه بواسطة الذكاء الاصطناعي؟ تعد القدرة على تحديد المحتوى الناتج عن الذكاء الاصطناعي أمرًا ضروريًا لتعزيز الثقة في المعلومات، والمساعدة في معالجة مشكلات مثل الإسناد الخاطئ والمعلومات الخاطئة. اليوم، يسعد Google DeepMind وHugging Face إطلاق SynthID Text في Transformers v4.46.0، والذي سيتم إصداره لاحقًا اليوم. تتيح لك هذه التقنية تطبيق العلامات المائية على النص الذي تم إنشاؤه بواسطة الذكاء الاصطناعي باستخدام معالج السجلات لمهام الإنشاء، واكتشاف تلك العلامات المائية باستخدام المصنف.

تحقق من ورقة نص SynthID في طبيعة للحصول على التفاصيل الفنية الكاملة لهذه الخوارزمية، ومجموعة أدوات GenAI المسؤولة من Google لمزيد من المعلومات حول كيفية تطبيق نص SynthID في منتجاتك.

كيف يعمل

الهدف الأساسي من SynthID Text هو تشفير علامة مائية في نص تم إنشاؤه بواسطة الذكاء الاصطناعي بطريقة تساعدك على تحديد ما إذا كان النص قد تم إنشاؤه من LLM الخاص بك دون التأثير على كيفية عمل LLM الأساسي أو التأثير سلبًا على جودة التوليد. قام Google DeepMind بتطوير تقنية العلامة المائية التي تستخدم وظيفة شبه عشوائية، تسمى وظيفة g، لزيادة عملية إنشاء أي ماجستير في القانون بحيث تكون العلامة المائية غير محسوسة للبشر ولكنها مرئية لنموذج مدرب. لقد تم تنفيذ ذلك كأداة مساعدة للإنشاء متوافقة مع أي LLM دون تعديل باستخدام
model.generate() واجهة برمجة التطبيقات (API)، إلى جانب مثال شامل لكيفية تدريب أجهزة الكشف على التعرف على النص الذي يحمل علامة مائية. تحقق من الورقة البحثية التي تحتوي على تفاصيل أكثر اكتمالاً حول خوارزمية SynthID Text.

تكوين علامة مائية

يتم تكوين العلامات المائية باستخدام فئة البيانات التي تحدد معلمات ز-الوظيفة وكيفية تطبيقها في عملية أخذ عينات البطولة. يجب أن يكون لكل نموذج تستخدمه تكوين العلامة المائية الخاص به يجب أن يتم تخزينها بشكل آمن وخاص، وإلا فقد يكون من الممكن نسخ العلامة المائية الخاصة بك بواسطة الآخرين.

يجب عليك تحديد معلمتين في كل تكوين للعلامة المائية:

  • ال keys المعلمة هي قائمة الأعداد الصحيحة التي يتم استخدامها لحساب ز-درجات الوظيفة عبر مفردات النموذج. يوصى باستخدام 20 إلى 30 رقمًا فريدًا تم إنشاؤه عشوائيًا لتحقيق التوازن بين قابلية الاكتشاف وجودة التوليد.

  • ال ngram_len يتم استخدام المعلمة لتحقيق التوازن بين المتانة وقابلية الاكتشاف؛ كلما كانت القيمة أكبر، أصبحت العلامة المائية أكثر قابلية للاكتشاف، على حساب كونها أكثر عرضة للتغييرات. القيمة الافتراضية الجيدة هي 5، ولكن يجب أن تكون 2 على الأقل.

يمكنك أيضًا تكوين العلامة المائية بناءً على احتياجات الأداء الخاصة بك. انظر
SynthIDTextWatermarkingConfig فئة لمزيد من المعلومات.

تتضمن ورقة البحث تحليلات إضافية لكيفية تأثير قيم التكوين المحددة على أداء العلامة المائية.

تطبيق علامة مائية

يعد تطبيق العلامة المائية تغييرًا مباشرًا لمكالمات الجيل الحالية. بمجرد تحديد التكوين الخاص بك، قم بتمرير a
SynthIDTextWatermarkingConfig كائن مثل watermarking_config= المعلمة ل model.generate() وسيحمل كل النص الذي تم إنشاؤه العلامة المائية. تحقق من SynthID Text Space للحصول على مثال تفاعلي لتطبيق العلامة المائية، ومعرفة ما إذا كان يمكنك معرفة ذلك.

from transformers import (
    AutoModelForCausalLM,
    AutoTokenizer,
    SynthIDTextWatermarkingConfig,
)


tokenizer = AutoTokenizer.from_pretrained('repo/id')
model = AutoModelForCausalLM.from_pretrained('repo/id')


watermarking_config = SynthIDTextWatermarkingConfig(
    keys=[654, 400, 836, 123, 340, 443, 597, 160, 57, ...],
    ngram_len=5,
)


tokenized_prompts = tokenizer(["your prompts here"])
output_sequences = model.generate(
    **tokenized_prompts,
    watermarking_config=watermarking_config,
    do_sample=True,
)
watermarked_text = tokenizer.batch_decode(output_sequences)

كشف العلامة المائية

تم تصميم العلامات المائية بحيث يمكن اكتشافها بواسطة مصنف مدرب ولكنها غير محسوسة للبشر. يحتاج كل تكوين للعلامة المائية تستخدمه مع نماذجك إلى وجود كاشف مدرب للتعرف على العلامة.

عملية التدريب الأساسية للكاشف هي:

  • اتخاذ قرار بشأن تكوين العلامة المائية.
  • قم بتجميع مجموعة تدريب الكاشف مقسمة بين علامة مائية أو لا تحمل علامة مائية، والتدريب أو الاختبار، نوصي بما لا يقل عن 10 آلاف مثال.
  • قم بإنشاء مخرجات بدون علامات مائية باستخدام النموذج الخاص بك.
  • قم بإنشاء مخرجات ذات علامة مائية باستخدام النموذج الخاص بك.
  • تدريب مصنف كشف العلامة المائية الخاص بك.
  • قم بإنتاج النموذج الخاص بك باستخدام تكوين العلامة المائية والكاشف المرتبط بها.

يتم توفير فئة كاشف بايزي في المحولات، إلى جانب مثال شامل لكيفية تدريب الكاشف للتعرف على النص الذي يحمل علامة مائية باستخدام تكوين محدد للعلامة المائية. يمكن أيضًا للنماذج التي تستخدم نفس الرمز المميز مشاركة تكوين العلامة المائية والكاشف، وبالتالي مشاركة علامة مائية مشتركة، طالما أن مجموعة تدريب الكاشف تتضمن أمثلة من جميع النماذج التي تشترك في العلامة المائية.

يمكن تحميل هذا الكاشف المدرّب على مركز HF خاص لتسهيل الوصول إليه عبر مؤسستك. تحتوي مجموعة أدوات GenAI المسؤولة من Google على المزيد حول كيفية إنتاج نص SynthID في منتجاتك.

القيود

تعتبر العلامات المائية النصية SynthID قوية بالنسبة لبعض التحويلات، مثل اقتصاص أجزاء من النص، أو تعديل بضع كلمات، أو إعادة صياغة بسيطة، ولكن هذه الطريقة لها قيود.

  • يعد تطبيق العلامة المائية أقل فعالية في الاستجابات الواقعية، حيث توجد فرصة أقل لزيادة الإنشاء دون تقليل الدقة.
  • يمكن تقليل درجات ثقة الكاشف بشكل كبير عند إعادة كتابة النص الذي تم إنشاؤه بواسطة الذكاء الاصطناعي بشكل كامل، أو ترجمته إلى لغة أخرى.

لم يتم إنشاء نص SynthID لمنع الخصوم المتحمسين بشكل مباشر من التسبب في الأذى. ومع ذلك، قد يزيد ذلك من صعوبة استخدام المحتوى الناتج عن الذكاء الاصطناعي لأغراض ضارة، ويمكن دمجه مع أساليب أخرى لتوفير تغطية أفضل عبر أنواع المحتوى والأنظمة الأساسية.

شكر وتقدير

يود المؤلفون أن يشكروا روبرت ستانفورث وتاتيانا ماتيجوفيكوفا على مساهماتهم في هذا العمل.

شاركها.
اترك تعليقاً