SAIR არის ღია კოდის მონაცემთა ნაკრები და საჯაროდ უფასოდ ხელმისაწვდომია შემწყნარებლური CC BY 4.0 ლიცენზიით, რაც მას მყისიერად გამოსაყენებელს ხდის კომერციული და არაკომერციული კვლევა-განვითარების (R&D) მიმართულებებისთვის. ის, უფრო მეტი ვიდრე უბრალოდ მონაცემთა ნაკრები, SAIR არის სტრატეგიული აქტივი, რომელიც ავსებს დიდი ხნის არსებულ მონაცემთა ხარვეზს ხელოვნური ინტელექტის (AI) მეშვეობით წამლების დიზაინში. ის აძლევს საშუალებას ფარმაცევტულ, ბიოტექნოლოგიურ და ტექ-ბიო ლიდერებს, დააჩქარონ კვლევა-განვითარება, გააფართოონ სამიზნე ჰორიზონტები და გააძლიერონ AI მოდელები – გადაიტანონ წამლების ძვირადღირებული, ხანგრძლივი დიზაინისა და ოპტიმიზაციის პროცესის დიდი ნაწილი სველი ლაბორატორიიდან ინ სილიკო (კომპიუტერულ მოდელირებაზე) გარემოში. ეს ნიშნავს ჰიტ-ლიდამდე დროის შემცირებას, ლიდ-ოპტიმიზაციის გაუმჯობესებას, ნაკლებ ჩიხურ პროექტებს და უფრო პროგნოზირებად გზას საწყისი იდეიდან კლინიკურ კანდიდატამდე. AI-სა და კომპიუტერული დიზაინის მეთოდებს (CAD) დიდი პოტენციალი აქვთ ახალი წამლების შემუშავების დრამატულად დასაჩქარებლად. ათწლეულების განმავლობაში მეცნიერები ოცნებობდნენ ხელოვნურ ინტელექტზე, რომელსაც შეეძლო დაავადების მექანიზმის აღწერის საფუძველზე ძლიერი, არატოქსიკური და ეფექტური ნაერთის იდენტიფიცირება ან დიზაინი, პრაქტიკულად წლების კვლევა-განვითარების შეკუმშვა რამდენიმე წუთში კომპიუტერზე. თუმცა, ეს ხედვა შეზღუდულია AI-ის უნარით, იწინასწარმეტყველოს წამლის კრიტიკული თვისებები, როგორიცაა პოტენცია, ტოქსიკურობა და ა.შ., მხოლოდ მისი მოლეკულური სტრუქტურის საფუძველზე. გარდა ამისა, სტრუქტურაზე დაფუძნებული ტრადიციული აღმოჩენა ხშირად ნელდება საიმედო 3D სტრუქტურების განსაზღვრის ადრეულ ეტაპზე. მოლეკულის სამგანზომილებიანი სტრუქტურა განსაზღვრავს მის ფუნქციონალობას, დინამიკას და ურთიერთქმედებებს, რაც განსაკუთრებით მნიშვნელოვანია, როდესაც პოტენციური წამლის კანდიდატი უნდა დაუკავშირდეს ადამიანის ცილის სამიზნეს. ექსპერიმენტული მეთოდები, როგორიცაა რენტგენული კრისტალოგრაფია და კრიო-EM, მოითხოვს დიდ დროსა და ინვესტიციებს, და ბევრ პერსპექტიულ დაავადების სამიზნეს ჯერ კიდევ აკლია ექსპერიმენტულად ვალიდირებული სტრუქტურული ინფორმაცია. კომპიუტერულმა სიმულაციებმა ხელი შეუწყო 3D სტრუქტურების მოპოვებისა და შეკავშირების აფინურობის პროგნოზირების ბარიერის შემცირებას. თუმცა, ცილის ფოლდინგისა და დოკინგის ადრინდელი თაობის ალგორითმები (როგორიცაა AlphaFold და Vina შესაბამისად) მხოლოდ მოლეკულებისა და ცილების სტატიკურ კადრებს პროგნოზირებდნენ (რომლებიც რეალურად, თავისთავად დინამიური და ფორმის შემცვლელნი არიან). SAIR წყვეტს ამ შეზღუდვას 1 მილიონზე მეტი უნიკალური კომპიუტერულად კო-ფოლდირებული ცილა-ლიგანდის წყვილის კომპილაციით, რაც საბოლოოდ იძლევა 5.24 მილიონ განსხვავებულ 3D კომპლექსს (ხუთი განსხვავებული კო-ფოლდირებული სტრუქტურა თითო წყვილზე). თითოეული სტრუქტურა დაწყვილებულია კურირებულ IC₅₀ გაზომვასთან ChEMBL-დან ან BindingDB-დან, რაც პირველად უზრუნველყოფს მასშტაბირებად კავშირს მაღალი ხარისხის 3D სტრუქტურებსა და წამლის პოტენციას შორის, და ავსებს ისტორიულ მონაცემთა ხარვეზს, რომელიც ხელს უშლიდა AI-ზე დაფუძნებულ აღმოჩენებს. ღრმად ნასწავლმა აფინურობის მოდელებმა, როგორიცაა Boltz-2, მსგავს მონაცემებზე გაწვრთნილი, აჩვენა 1000-ჯერ გაზრდილი სიჩქარე ტრადიციულ, პირველი პრინციპების მიდგომასთან შედარებით. SAIR-ის შექმნა მაღალი წარმადობის AI გამოთვლის მნიშვნელოვანი მიღწევა იყო. SAIR მონაცემთა ნაკრების გამოსათვლელად Boltz1-ის, კო-ფოლდინგის AI მოდელის გამოყენებით 760 NVIDIA H100 პროცესორის კლასტერზე, NVIDIA DGX Cloud-ის მეშვეობით Google Cloud Platform-ზე, დასჭირდა 130 000 GPU საათზე მეტი. მაღალდეტალური კვანძის, ოპერატორის, გრაფიკისა და GPU მეტრიკების აღებამ, ისევე როგორც მჭიდრო თანამშრომლობამ ინფრასტრუქტურის და დატვირთვის ოპტიმიზაციაზე, დაეხმარა NVIDIA AI Accelerator-ისა და SandboxAQ-ის საინჟინრო გუნდებს, გამოევლინათ შეფერხებები და ოპტიმიზაცია მოეხდინათ კონფიგურაციებისთვის, რათა მიეღწიათ დატვირთვის უმაღლესი გამტარუნარიანობისთვის. შედეგად, ორმა გუნდმა შეძლო >95% GPU გამოთვლითი რესურსის გამოყენების მიღწევა SAIR მონაცემთა ნაკრების გენერირებისთვის. ამან საშუალება მოგვცა შეგვექმნა SAIR სამ კვირაში – თავდაპირველი სამთვიანი შეფასებისგან განსხვავებით (4-ჯერ მეტი სიჩქარე) – და გამოიწვია მაღალოპტიმიზებული, GPU-სთვის მშობლიური გამოთვლითი სამუშაო ნაკადი, რომელიც შეუფერხებლად ინტეგრირდება დღევანდელ უახლეს საწარმოო გამოთვლით გარემოში. ასეთი მასიური მონაცემების გენერირება მხოლოდ ნახევარი ამბავია. თანაბრად მნიშვნელოვანია მისი ხარისხისადმი ნდობა, რის გამოც ყველა პროგნოზირებულმა კომპლექსმა გაიარა მკაცრი ვალიდაცია PoseBusters-ით, ინდუსტრიული სტანდარტის, ღია კოდის ხელსაწყოთი, რომელიც გამოიყენება სტრუქტურასთან დაკავშირებული AI-ის ბენჩმარკინგისთვის წამლების აღმოჩენაში. ეს ინსტრუმენტი ამოწმებს ქიმიურ სიჯანსაღესა და ფიზიკურ დასაბუთებულობას. საბოლოო შედეგი იყო ის, რომ SAIR-ის სტრუქტურების 97 პროცენტმა გაიარა ყველა შემოწმება. PoseBusters-ის ვალიდაციის გარდა, ჩვენ შევაფასეთ აფინურობის პროგნოზირების წამყვანი მეთოდები, როგორიცაა ემპირიული ქულების ფუნქციები, 3D CNN და გრაფული ნერვული ქსელები, SAIR-ის სინთეზურ სტრუქტურებსა და ექსპერიმენტულ IC₅₀ მნიშვნელობებზე. ამ კვლევების დეტალური შედეგები ხელმისაწვდომია ჩვენს სამეცნიერო ხელნაწერში bioRxiv-ზე. SAIR მონაცემები საიმედო საფუძველია ახალი მოდელების ბენჩმარკინგისთვის, ისევე როგორც შემდგომი მოდელირების, სკრინინგისა და დიზაინისთვის. წამლების აღმოჩენაში მუდმივი გამოწვევაა „ბნელი პროტეომი“, ანუ დაავადებასთან დაკავშირებული ცილები, რომელთა ექსპერიმენტული სტრუქტურები უბრალოდ არ არსებობს. SAIR ანათებს ამ გამოუკვლეველ რეგიონებს სანდო, AI-ით პროგნოზირებული კომპლექსების მიწოდებით იქ, სადაც ექსპერიმენტული მონაცემები მწირია. მაგალითად, SAIR მონაცემთა ნაკრებში ცილების 40 პროცენტზე მეტს არ აქვს ხელმისაწვდომი სტრუქტურები ცილის მონაცემთა ბაზაში (PDB) საერთოდ, მიუხედავად იმისა…