هذا الصيف، أصدرت SandboxAQ الإصدار مستودع IC50 المعزز هيكلياً (ساير), أكبر مجموعة بيانات من هياكل البروتين ليجند ثلاثية الأبعاد المقترنة بملصقات IC₅₀ المقاسة تجريبيًا، والتي تربط بشكل مباشر التركيب الجزيئي بفعالية الدواء والتغلب على الندرة الطويلة الأمد في بيانات التدريب. مجموعة البيانات هذه متاحة الآن على Hugging Face، ولأول مرة، أصبح لدى الباحثين إمكانية الوصول المفتوح إلى أكثر من 5 ملايين هياكل ثلاثية الأبعاد من بروتين ليجند عالية الدقة تم إنشاؤها بواسطة الذكاء الاصطناعي، كل منها مقترن ببيانات فعالية الربط التجريبية التي تم التحقق من صحتها.
SAIR هي مجموعة بيانات مفتوحة المصدر وهو متاح للجمهور مجانًا بموجب ترخيص CC BY 4.0 المسموح به، مما يجعله قابلاً للتنفيذ على الفور بالنسبة لخطوط أنابيب البحث والتطوير التجارية وغير التجارية. أكثر من مجرد مجموعة بيانات، SAIR هي الأصول الاستراتيجية الذي يسد فجوة البيانات طويلة الأمد في تصميم الأدوية التي تعمل بالذكاء الاصطناعي. إنه يمكّن قادة الأدوية والتكنولوجيا الحيوية والتكنولوجيا الحيوية من تسريع البحث والتطوير وتوسيع الآفاق المستهدفة وتعزيز نماذج الذكاء الاصطناعي – نقل المزيد من تصميم الأدوية المكلفة والطويلة وتحسينها من المختبر الرطب إلى في السيليكو. وهذا يعني جداول زمنية أقصر للوصول إلى القيادة، وتحسين كفاءة العملاء المحتملين، وعدد أقل من المشاريع المسدودة، ومسار أكثر قابلية للتنبؤ من الفكرة الأولية إلى المرشح السريري.
يتمتع الذكاء الاصطناعي والتصميم بمساعدة الكمبيوتر بإمكانات كبيرة في تسريع عملية تطوير أدوية جديدة بشكل كبير. لعقود من الزمن، حلم العلماء بالذكاء الاصطناعي القادر على تحديد أو تصميم مركب قوي وغير سام وفعال من خلال وصف سريع لمسار المرض، مما يؤدي عمليا إلى ضغط سنوات من البحث والتطوير في مجال الأدوية في بضع دقائق على جهاز الكمبيوتر. ومع ذلك، فإن هذه الرؤية تصطدم بقدرة الذكاء الاصطناعي على التنبؤ بخصائص الدواء المهمة مثل الفعالية والسمية وما إلى ذلك، بناءً على بنيته الجزيئية فقط.
علاوة على ذلك، غالبًا ما يتم إبطاء الاكتشاف التقليدي المعتمد على البنية في وقت مبكر من خلال تحديد الهياكل ثلاثية الأبعاد الموثوقة. يحدد التركيب الجزيئي ثلاثي الأبعاد وظيفة الجزيء وديناميكياته وتفاعلاته، وهو أمر مهم بشكل خاص عندما يُتوقع من مرشح الدواء المحتمل أن يرتبط بهدف بروتين بشري.
تتطلب الطرق التجريبية، مثل علم البلورات بالأشعة السينية والتصوير بالتبريد، وقتًا واستثمارات واسعة النطاق، ولا تزال العديد من الأهداف المرضية الواعدة تفتقر إلى المعلومات الهيكلية التي تم التحقق من صحتها تجريبيًا. ساعدت عمليات المحاكاة الحاسوبية في تقليل حاجز الحصول على الهياكل ثلاثية الأبعاد والتنبؤ بتقارب الارتباط. ومع ذلك، فإن الأجيال السابقة من الخوارزميات الخاصة بطي البروتين والالتحام به (مثل AlphaFold وVina على التوالي) تتنبأ فقط بلقطات ثابتة للجزيئات والبروتينات (والتي، في الواقع، ديناميكية بطبيعتها ومتغيرة الشكل).
SAIR يحل هذا القيد عن طريق التجميع 1 مليون زوج فريد من البروتين والليكاند المطوي حسابيًا، العائد في نهاية المطاف 5.24 مليون مجمعات ثلاثية الأبعاد متميزة (خمسة هياكل مختلفة مطوية لكل زوج). يتم إقران كل بنية بقياس IC₅₀ منسق من ChEMBL أو BindingDB، مما يوفر لأول مرة رابطًا قابلاً للتطوير بين الهياكل ثلاثية الأبعاد عالية الجودة وفعالية الدواء، وسد فجوة البيانات التاريخية التي أعاقت الاكتشاف المعتمد على الذكاء الاصطناعي. وقد تبين أن نماذج التقارب ذات التعلم العميق، مثل بولتز-2، التي تم تدريبها على بيانات مماثلة، تحقق سرعة تصل إلى 1000 مرة مقارنة بالنهج التقليدي القائم على المبدأ الأول.
كان إنشاء SAIR إنجازًا كبيرًا في مجال حوسبة الذكاء الاصطناعي عالية الأداء. استغرق الأمر أكثر من 130,000 ساعة وحدة معالجة رسومات لحساب مجموعة بيانات SAIR باستخدام Boltz1، وهو نموذج ذكاء اصطناعي قابل للطي، على مجموعة مكونة من 760 معالج NVIDIA H100، مع الاستفادة من NVIDIA DGX Cloud من خلال Google Cloud Platform.
إن التقاط مقاييس العقدة والمشغل والمجدول ووحدة معالجة الرسومات عالية الدقة، بالإضافة إلى التعاون الوثيق في كل من البنية التحتية وتحسين عبء العمل، ساعد فرق الهندسة NVIDIA AI Accelerator وSandboxAQ على تحديد الاختناقات وتحسين التكوينات لتحقيق أعلى إنتاجية لأحمال العمل.
وبالتالي، تمكن الفريقان من تحقيق استخدام حسابي لوحدة معالجة الرسومات بنسبة تزيد عن 95% لإنشاء مجموعة بيانات SAIR. وقد مكننا ذلك من إنشاء SAIR في ثلاثة أسابيع – على عكس التقدير الأصلي لمدة ثلاثة أشهر (أكثر من 4X سرعة) – وأدى إلى سير عمل حسابي محسّن للغاية ومعتمد على وحدة معالجة الرسومات والذي يتكامل بسلاسة مع بيئات الحوسبة المؤسسية المتطورة اليوم.
إن توليد مثل هذا الحجم الهائل من البيانات ليس سوى نصف القصة. ولا تقل أهمية عن ذلك الثقة في جودتها، وهذا هو السبب وراء خضوع كل عقدة متوقعة للتحقق الصارم من صحتها بوزبوسترز، أداة مفتوحة المصدر متوافقة مع معايير الصناعة لقياس الذكاء الاصطناعي المرتبط بالبنية في اكتشاف الأدوية. تتحقق هذه الأداة من السلامة الكيميائية والمعقولية المادية.
وكانت النتيجة النهائية 97 بالمئة من هياكل SAIR اجتازت جميع الفحوصات. بالإضافة إلى التحقق من صحة PoseBusters، قمنا بقياس طرق التنبؤ بالتقارب الرائدة، مثل وظائف التسجيل التجريبية، وشبكات CNN ثلاثية الأبعاد، والشبكات العصبية الرسومية، عبر الهياكل الاصطناعية لـ SAIR وقيم IC₅₀ التجريبية. النتائج التفصيلية لهذه الدراسات متاحة في مخطوطتنا العلمية على موقع bioRxiv.
تعد بيانات SAIR أساسًا موثوقًا لقياس النماذج الجديدة بالإضافة إلى النمذجة والفحص والتصميم.
يتمثل التحدي المستمر في اكتشاف الأدوية في “البروتين المظلم”، أو البروتينات المرتبطة بالأمراض والتي لا توجد لها هياكل تجريبية. يسلط SAIR الضوء على هذه المناطق المجهولة من خلال توفير مجمعات موثوقة ومتنبأ بها بواسطة الذكاء الاصطناعي حيثما تكون البيانات التجريبية نادرة. على سبيل المثال، أكثر من 40% من البروتينات الموجودة في مجموعة بيانات SAIR ليس لها هياكل متاحة في بنك بيانات البروتين (PDB) على الإطلاق، مع أو بدون رابطة. تعالج SAIR أحد أكبر التحديات في نماذج الذكاء الاصطناعي الحالية، وهو انخفاض قابلية التعميم بسبب ندرة البيانات. باستخدام SAIR، يمكن للعلماء الآن استكشاف الأهداف التي كانت تعتبر في السابق غير قابلة للعلاج، مسلحين بفرضيات هيكلية لتوجيه الفحص الافتراضي وتحسين القيادة باستخدام تنبؤات نموذجية جديرة بالثقة.
علاوة على ذلك، يكشف نطاق الأهداف المشتركة لـ SAIR عن أنماط علم الأدوية المتعددة ويوضح كيفية تفاعل جزيء واحد مع بروتينات متعددة. من خلال الاستفادة من هذا النسيج الغني من التفاعلات، يمكنك تدريب نماذج الذكاء الاصطناعي للتنبؤ بالتأثيرات غير المستهدفة أو تحديد فرص جديدة لإعادة الاستخدام، وتزويد مؤسستك بفهم أعمق للملفات التعريفية المركبة قبل بدء أي عمل معملي.
الوصول إلى SAIR
SAIR متاح مجانًا على Hugging Face. فيما يلي دليل سريع لسحب SAIR من Hugging Face، وإلقاء نظرة خاطفة على الجدول الرئيسي، و(اختياريًا) تنزيل بعض أرشيفات البنية.
1. تثبيت الأساسيات
نستخدم Hub لجلب الملفات والباندا + pyarrow لقراءة الباركيه.
pip install huggingface_hub pandas pyarrow
2. المصادقة
المصادقة على معانقة الوجه:
import huggingface_hub
huggingface_hub.login(token="your_auth_token")
3. قم بتحميل الجدول الرئيسي (sair.parquet)
يؤدي هذا إلى التقاط الملف من Hub وتحميله في DataFrame.
from huggingface_hub import hf_hub_download
import pandas as pd
parquet_path = hf_hub_download(
repo_id="SandboxAQ/SAIR",
filename="sair.parquet",
repo_type="dataset"
)
df = pd.read_parquet(parquet_path)
df.head()
4. (اختياري) قم بإدراج أرشيفات البنية المتاحة
يتم شحن ملفات البنية بأكبر عدد ممكن .tar.gz المحفوظات تحت structures_compressed/. قم بإدراجها واختيار ما تحتاجه.
from huggingface_hub import list_repo_files
files = [f.split("https://huggingface.co/")[-1] for f in list_repo_files("SandboxAQ/SAIR", repo_type="dataset")
if f.startswith("structures_compressed/") and f.endswith(".tar.gz")]
files[:5]
5. (اختياري) تنزيل الهياكل واستخراجها
يمكن أن يكون حجم كل أرشيف كبيرًا (≈10 جيجابايت). قم بتنزيل ما تحتاجه فقط واستخرجه محليًا.
import os, tarfile
from huggingface_hub import hf_hub_download
dest = "sair_structures"
os.makedirs(dest, exist_ok=True)
to_get = [
"sair_structures_1006049_to_1016517.tar.gz",
"sair_structures_100623_to_111511.tar.gz",
]
for name in to_get:
tar_path = hf_hub_download(
repo_id="SandboxAQ/SAIR",
filename=f"structures_compressed/{name}",
repo_type="dataset",
local_dir=dest,
local_dir_use_symlinks=False,
)
with tarfile.open(tar_path, "r:gz") as tar:
tar.extractall(dest)
os.remove(tar_path)
تتوفر نسخة كاملة من هذا البرنامج النصي، بما في ذلك التسجيل والتحقق الأكثر قوة، في ملف README لراحتك. لمزيد من التفاصيل، قم بزيارة الصفحة الرئيسية لـ SAIR، أو اقرأ مخطوطتنا على bioRxiv، أو شاهد ندوتنا عبر الإنترنت المشتركة مع NVIDIA لمدة 25 دقيقة، حيث نعرض SAIR ونشرح كيفية تنظيم البيانات داخلها. تتوفر وثائق شاملة وبرامج تعليمية وأمثلة للمعايير لتسهيل استخدامها وتسريع اعتمادها داخليًا.
إن مستقبل اكتشاف الأدوية يعتمد على البيانات، ويسرعه الذكاء الاصطناعي، ويرتكز على رؤى هيكلية عالية الجودة وقابلة للتطوير. على الرغم من أننا لا نمتلك حتى الآن ذكاءً اصطناعيًا يمكنه تصميم علاجات دوائية فعالة بمجرد توجيهها، فإن SAIR يجعل الباحثين أقرب إلى هذا الهدف من خلال البيانات والرؤى الجديدة التي يمكن أن تقلل سنوات حتى من خطوط أنابيب البحث والتطوير المسرعة بالذكاء الاصطناعي.
لا يمكننا الانتظار لرؤية ما سيبنيه الباحثون باستخدام SAIR، وخبراء SandboxAQ موجودون هنا لدعمهم طوال عملية الاكتشاف.
أسئلة؟
اتصل بالمؤلفين أو انشر على صفحة مناقشة مجموعة بيانات SAIR.
المؤلفون: أرمان زريبافيان، جورجيا تشانينج، زين بيكويث، ورودي بليش