AI-ის როლი გენის გაჩუმების პროგნოზირებაში: ვირტუალური უჯრედის გამოწვევა
თანამედროვე კვლევები მიზნად ისახავს ხელოვნური ინტელექტის (AI) მოდელის შექმნას, რომელიც CRISPR-ის გამოყენებით გენის გაჩუმების უჯრედზე ზემოქმედებას იწინასწარმეტყველებს. „ვირტუალური უჯრედის გამოწვევა“ ცდილობს გადალახოს ფიზიკური ექსპერიმენტების სირთულეები და მაღალი ღირებულება, რაც საშუალებას მისცემს ათასობით წამლის კანდიდატის ტესტირებას ვირტუალურ გარემოში. Arc-ის მიერ შეგროვებული 300 ათასი ერთუჯრედოვანი რნმ-ის სექვენირების პროფილის მონაცემთა ნაკრები გამოიყენება ნერვული ქსელების სავარჯიშოდ. სტატია ას
მიზანია შეიქმნას მოდელი, რომელიც CRISPR-ის გამოყენებით გენის გაჩუმების უჯრედზე ზემოქმედებას იწინასწარმეტყველებს. „ატომების სამყაროში“ მუშაობა ძვირი, შრომატევადი და შეცდომის მაღალი რისკის შემცველია. რა მოხდება, თუკი შეგვეძლება ათასობით წამლის კანდიდატის ტესტირება პეტრის ჭურჭლის შეხების გარეშე?
სწორედ ეს არის „ვირტუალური უჯრედის გამოწვევის“ მიზანი — შეიქმნას მოდელი (სავარაუდოდ, ნერვული ქსელი), რომელსაც ზუსტად შეუძლია იმის სიმულაცია, თუ რა ხდება უჯრედში, როდესაც რაიმე პარამეტრს ვცვლით. იმის გათვალისწინებით, რომ უკუკავშირის მარყუჟის გამკაცრება ხშირად პროგრესის დაჩქარების საუკეთესო გზაა, ასეთი მოდელის ზუსტად შექმნას მნიშვნელოვანი გავლენა ექნებოდა. ამ ნერვული ქსელის წვრთნისთვის მონაცემები დაგვჭირდება. გამოწვევისთვის Arc-მა შეაგროვა დაახლოებით 300 ათასი ერთუჯრედოვანი რნმ-ის სექვენირების პროფილის მონაცემთა ნაკრები. სანამ გავაგრძელებთ, შესაძლოა, ღირდეს ცენტრალური დოგმის განხილვა. ეს სტატია სწორედ ამ ბიოლოგიურ საფუძველს დაეყრდნობა, რათა მოგაწოდოთ გამოწვევისთვის საჭირო მინიმალური ცოდნა. სავარჯიშო ნაკრები შედგება მეჩხერი მატრიცისა და მასთან დაკავშირებული მეტამონაცემებისგან. უფრო კონკრეტულად, გვაქვს 220 ათასი უჯრედი და თითოეული უჯრედისთვის გვაქვს ტრანსკრიპტომი. ეს ტრანსკრიპტომი არის მეჩხერი რიგის ვექტორი, სადაც თითოეული ჩანაწერი არის რნმ-ის მოლეკულების (ტრანსკრიპტების) ნედლი რაოდენობა, რომელსაც შესაბამისი გენი (ჩვენი სვეტი) აკოდირებს. 220 ათასი უჯრედიდან დაახლოებით 38 ათასი შეუცვლელია, რაც ნიშნავს, რომ CRISPR-ის გამოყენებით გენი არ გაჩუმებულა. ეს საკონტროლო უჯრედები გადამწყვეტია, რასაც მალე ვნახავთ. მონაცემთა ნაკრების უკეთ გასაგებად, ავირჩიოთ გენი, TMSB4X (ყველაზე ხშირად გაჩუმებული გენი მონაცემთა ნაკრებში) და შევადაროთ რნმ-ის მოლეკულების რაოდენობა, რომელიც აღმოჩენილია საკონტროლო და შეცვლილ უჯრედებში.
ვხედავთ, რომ TMSB4X გაჩუმებულ უჯრედს მნიშვნელოვნად შემცირებული ტრანსკრიპტების რაოდენობა აქვს საკონტროლო უჯრედებთან შედარებით. ყველაზე დაკვირვებულებს შესაძლოა აინტერესებდეთ, რატომ არ იზომება რნმ-ის მოლეკულების რაოდენობა გენის გაჩუმებამდე და გაჩუმების შემდეგ — საერთოდ რატომ გვჭირდება საკონტროლო უჯრედები? სამწუხაროდ, ტრანსკრიპტომის წაკითხვა უჯრედს ანადგურებს, რაც დამკვირვებლის ეფექტის პრობლემას მოგვაგონებს. უჯრედის მდგომარეობის გაზომვის შეუძლებლობა გაჩუმებამდე და გაჩუმების შემდეგ მრავალ პრობლემას ქმნის, რადგან იძულებულნი ვართ, საბაზისო (იგივე საკონტროლო, შეუცვლელი) უჯრედების პოპულაცია საცნობარო წერტილად გამოვიყენოთ. საკონტროლო და შეცვლილი უჯრედები სრულად ერთგვაროვანი არ არის დაბრკოლებამდეც კი. ეს ნიშნავს, რომ ახლა ჩვენი ნამდვილი სიგნალი, ანუ დაბრკოლება, უნდა გამოვყოთ ჰეტეროგენულობით გამოწვეული ხმაურისგან. უფრო ფორმალურად, შეცვლილ უჯრედებში გენის გამოხატულება შეგვიძლია შემდეგნაირად წარმოვიდგინოთ: X^p∼T^p(Dbasal)+H(Dbasal)+ε,ε∼Pε.
„ვირტუალური უჯრედის გამოწვევამდე“ Arc-მა გამოუშვა STATE, მათი მცდელობა გამოწვევის გადასაჭრელად ტრანსფორმატორზე დაფუძნებული წყვილი მოდელის გამოყენებით. ეს მყარ ამოსავალ წერტილს წარმოადგენს მონაწილეებისთვის, ამიტომ მას დეტალურად განვიხილავთ. STATE შედგება ორი მოდელისგან: მდგომარეობის გარდამავალი მოდელი (ST) და მდგომარეობის ჩანერგვის მოდელი (SE). SE შექმნილია უჯრედების მდიდარი სემანტიკური ჩანერგვების შესაქმნელად, უჯრედის ტიპებს შორის განზოგადების გასაუმჯობესებლად. ST არის „უჯრედის სიმულატორი“, რომელიც იღებს ან საკონტროლო უჯრედის ტრანსკრიპტომს, ან SE-ის მიერ წარმოებულ უჯრედის ჩანერგვას, ინტერესის დაბრკოლების წარმომდგენ ერთ-ერთი ცხელი კოდირების ვექტორთან ერთად და გამოაქვს შეცვლილი ტრანსკრიპტომი.
მდგომარეობის გარდამავალი მოდელი შედარებით მარტივი ტრანსფორმატორია Llama არქიტექტურით, რომელიც მუშაობს შემდეგზე: კოვარიანტულად შეხამებული საკონტროლო უჯრედების ნაკრების გამოყენება შეწყვილებული სამიზნე უჯრედებით მოდელს დაეხმარება ჩვენი განზრახული დაბრკოლების რეალური ეფექტის გარჩევაში. როგორც საკონტროლო ნაკრების ტენსორი, ასევე დაბრკოლების ტენსორი გადადის დამოუკიდებელ ენკოდერებში, რომლებიც უბრალოდ 4-შრიანი MLPs-ია GELU აქტივაციით. თუ გენის ექსპრესიის სივრცეში მუშაობენ (ანუ სრულ ტრანსკრიპტომს აწარმოებენ), გამოსავალს გადასცემენ ნასწავლ დეკოდერს. ST წვრთნილია მაქსიმალური საშუალო სხვაობის (Maximum Mean Discrepancy) გამოყენებით. მარტივად რომ ვთქვათ, მოდელი სწავლობს ორი ალბათური განაწილების შორის სხვაობის მინიმიზაციას.
მდგომარეობის ჩანერგვის მოდელი არის BERT-ის მსგავსი ავტოენკოდერი. ამის უფრო ღრმად გასაგებად, ჯერ ცოტა გადავუხვევთ მეტი ბიოლოგიური საფუძვლებისთვის. გენი შედგება ეგზონებისგან (ცილის მაკოდირებელი სექციები) და ინტრონებისგან (არაცილის მაკოდირებელი სექციები). დნმ ჯერ ტრანსკრიბირდება წინამორბედ რნმ-ად, როგორც ზემოთ არის ნაჩვენები. უჯრედი შემდეგ ასრულებს ალტერნატიულ სპლაისინგს. ეს ძირითადად ნიშნავს „ეგზონების არჩევას და შერჩევას“, ყველა ინტრონის ამოჭრას. გენი შეგიძლიათ წარმოიდგინოთ, როგორც IKEA-ს ინსტრუქცია მაგიდის ასაწყობად. ასევე, შეიძლება აეწყოს 3-ფეხიანი მაგიდა, ან შესაძლოა უცნაური წიგნის თარო, გარკვეული ძალისხმევით, თუ ზოგიერთ ნაწილს გამოტოვებთ. ეს განსხვავებული ობიექტები ცილის იზოფორმების ანალოგებია, ცილების, რომლებიც იმავე გენის მიერ არის კოდირებული. ამ ძირითადი გაგებით, შეგვიძლია გადავიდეთ იმაზე, თუ როგორ მუშაობს SE მოდელი. გვახსოვდეს, რომ SE-სთვის ჩვენი მთავარი მიზანია მნიშვნელოვანი უჯრედის ჩანერგვების შექმნა. ამისათვის, ჯერ უნდა შევქმნათ მნიშვნელოვანი გენის ჩანერგვები.
თეგები:
#ხელოვნური ინტელექტი
#ბიოლოგია
#crispr
#გენეტიკა
#ნერვული ქსელი
#ვირტუალური უჯრედი
#რნმ სექვენირება
#state მოდელი
წყარო: huggingface.co
AI-ით გადამუშავებული