ხელოვნური ინტელექტი უჯრედის მოდელირებაში: გენის გაჩუმების ეფექტის პროგნოზირება CRISPR-ით
„ვირტუალური უჯრედის გამოწვევა“ მიზნად ისახავს ისეთი ხელოვნური ინტელექტის მოდელის შექმნას, რომელიც შეძლებს CRISPR-ის გამოყენებით გენის გაჩუმების შედეგად უჯრედზე მიღებული ეფექტების პროგნოზირებას, ფიზიკური, ძვირადღღირებული ექსპერიმენტების საჭიროების გარეშე. გამოწვევისთვის Arc-მა შეაგროვა 300 ათასი ერთუჯრედოვანი რნმ სეკვენირების პროფილის მონაცემთა ნაკრები. ამ პროცესში მნიშვნელოვანი სირთულეებია უჯრედის მდგომარეობის გაზომვის შეუძლებლობა ცვლილებამდე და მის შემდეგ, რაც მოითხოვს საკონტროლო უჯრედების გამო
მიზანია ისეთი მოდელის გაწვრთნა, რომელიც იწინასწარმეტყველებს CRISPR-ის გამოყენებით გენის „გაჩუმების“ (დადუმების) ეფექტს უჯრედზე. ატომების სამყაროში მუშაობა ძვირი, შრომატევადი და შეცდომებისადმი მიდრეკილია. რა მოხდება, თუ ათასობით წამლის კანდიდატის ტესტირებას შევძლებთ პეტრის ჯამზე შეხების გარეშე?
ეს არის ვირტუალური უჯრედის გამოწვევის მთავარი მიზანი — მოდელი (სავარაუდოდ ნერვული ქსელი), რომელსაც შეუძლია ზუსტად მოახდინოს იმის სიმულაცია, თუ რა ხდება უჯრედში, როდესაც რაიმე პარამეტრს ვცვლით. იმის გათვალისწინებით, რომ უკუკავშირის მარყუჟის გამკაცრება ხშირად პროგრესის დაჩქარების საუკეთესო გზაა, მოდელი, რომელსაც ამის ზუსტად გაკეთება შეუძლია, მნიშვნელოვან გავლენას მოახდენს. ამ ნერვული ქსელის გასაწვრთნელად, მონაცემები დაგვჭირდება. გამოწვევისთვის, Arc-მა შეაგროვა ~300 ათასი ერთუჯრედოვანი რნმ სეკვენირების პროფილის მონაცემთა ნაკრები. შესაძლოა, ღირდეს ცენტრალური დოგმის განხილვა, სანამ გავაგრძელებთ. ეს სტატია დაეფუძნება ამას, რათა უზრუნველყოს გამოწვევისთვის საჭირო მინიმალური ბიოლოგიური ცოდნა.
საწვრთნელი ნაკრები შედგება მეჩხერი მატრიცისა და მასთან დაკავშირებული მეტამონაცემებისგან. უფრო კონკრეტულად, გვაქვს 220 ათასი უჯრედი და თითოეული უჯრედისთვის გვაქვს ტრანსკრიპტომი. ეს ტრანსკრიპტომი არის მეჩხერი მწკრივი ვექტორი, სადაც თითოეული ჩანაწერი არის რნმ-ის მოლეკულების (ტრანსკრიპტების) ნედლი რაოდენობა, რომელსაც შესაბამისი გენი (ჩვენი სვეტი) აკოდირებს. 220 ათასი უჯრედიდან, ~38 ათასი არის დაუზიანებელი, რაც ნიშნავს, რომ CRISPR-ის გამოყენებით არცერთი გენი არ არის გაჩუმებული. ეს საკონტროლო უჯრედები გადამწყვეტია, რასაც მალე ვნახავთ.
მონაცემთა ნაკრების უკეთ გასაგებად, ავირჩიოთ გენი, TMSB4X (მონაცემთა ნაკრებში ყველაზე ხშირად „გაჩუმებული“ გენი) და შევადაროთ რნმ-ის მოლეკულების რაოდენობა, რომელიც აღმოჩენილია საკონტროლო უჯრედსა და დარღვეულ უჯრედში.
ჩანს, რომ TMSB4X-ის გაჩუმების მქონე უჯრედს აქვს მნიშვნელოვნად შემცირებული ტრანსკრიპტების რაოდენობა საკონტროლო უჯრედებთან შედარებით. გამჭრიახებს შორის ზოგიერთი შეიძლება კითხულობდეს, რატომ არ ვზომავთ რნმ-ის მოლეკულების რაოდენობას გენის გაჩუმებამდე და გაჩუმების შემდეგ — რატომ გვჭირდება საერთოდ საკონტროლო უჯრედები? სამწუხაროდ, ტრანსკრიპტომის წაკითხვა ანადგურებს უჯრედს, რაც დამკვირვებლის ეფექტის მსგავსი პრობლემაა. უჯრედის მდგომარეობის გაზომვის შეუძლებლობა ცვლილებამდე და ცვლილების შემდეგ ბევრ პრობლემას ქმნის, რადგან იძულებულნი ვართ გამოვიყენოთ ბაზალური (ანუ, საკონტროლო, დაუზიანებელი) უჯრედების პოპულაცია საცნობარო წერტილად. საკონტროლო და დარღვეული უჯრედები არ არის მთლიანად ერთგვაროვანი დარღვევამდეც კი. ეს ნიშნავს, რომ ახლა უნდა გამოვყოთ ჩვენი ნამდვილი სიგნალი, დარღვევა, ჰეტეროგენურობით გამოწვეული ხმაურისგან.
ვირტუალური უჯრედის გამოწვევამდე, Arc-მა გამოუშვა STATE, მათი საკუთარი მცდელობა გამოწვევის გადასაჭრელად ტრანსფორმერზე დაფუძნებული მოდელების წყვილის გამოყენებით. ეს წარმოადგენს ძლიერ ამოსავალ წერტილს მონაწილეებისთვის, ამიტომ დეტალურად განვიხილავთ მას. STATE შედგება ორი მოდელისგან: მდგომარეობის ტრანზიციის მოდელი (ST) და მდგომარეობის ჩაშენების მოდელი (SE). SE შექმნილია უჯრედების მდიდარი სემანტიკური ჩაშენების შესაქმნელად უჯრედის ტიპებს შორის განზოგადების გასაუმჯობესებლად. ST არის „უჯრედის სიმულატორი“, რომელიც იღებს ან საკონტროლო უჯრედის ტრანსკრიპტომს, ან SE-ს მიერ წარმოებულ უჯრედის ჩაშენებას, ინტერესის დარღვევის წარმომდგენ ერთ-ჰოთ კოდირებულ ვექტორთან ერთად, და გამოსცემს დარღვეულ ტრანსკრიპტომს.
მდგომარეობის ტრანზიციის მოდელი შედარებით მარტივი ტრანსფორმერია Llama-ს არქიტექტურით, რომელიც მუშაობს შემდეგნაირად: კოვარიატებით შესაბამისი საკონტროლო უჯრედების ნაკრების გამოყენება დაწყვილებული სამიზნე უჯრედებით უნდა დაეხმაროს მოდელს ჩვენი განზრახული დარღვევის რეალური ეფექტის გარჩევაში. როგორც საკონტროლო ნაკრების ტენზორი, ასევე დარღვევის ტენზორი გადაეცემა დამოუკიდებელ ენკოდერებს, რომლებიც უბრალოდ 4-ფენიანი MLP-ებია GELU გააქტივაციებით. თუ პირდაპირ გენის ექსპრესიის სივრცეში მუშაობენ (ანუ, სრული ტრანსკრიპტომის წარმოქმნით), ისინი გამოსავალს გადასცემენ ნასწავლ დეკოდერს. ST გაწვრთნილია მაქსიმალური საშუალო სხვაობის (Maximum Mean Discrepancy) გამოყენებით. მარტივად რომ ვთქვათ, მოდელი სწავლობს შეამციროს განსხვავება ორ ალბათურ განაწილებას შორის.
მდგომარეობის ჩაშენების მოდელი არის BERT-ის მსგავსი ავტოენკოდერი. ამის უფრო ღრმად გასაგებად, ჯერ ცოტა ხნით უნდა გადავუხვიოთ გზას და განვიხილოთ მეტი ბიოლოგიური საფუძვლები.
გენი შედგება ეგზონებისგან (ცილის მაკოდირებელი სექციები) და ინტრონებისგან (არაცილის მაკოდირებელი სექციები). დნმ ჯერ ტრანსკრიბირდება პრე-რნმ-ად, როგორც ზემოთ ნაჩვენებია. შემდეგ უჯრედი ასრულებს ალტერნატიულ სპლაისინგს. ეს ძირითადად „ეგზონების შერჩევაა“, ყველა ინტრონის ამოჭრა. გენზე შეიძლება იფიქროთ, როგორც IKEA-ს მაგიდის ასაწყობ ინსტრუქციაზე. ასევე შეიძლება ააგოთ სამფეხა მაგიდა, ან შესაძლოა უცნაური თარო გარკვეული ძალისხმევით, ზოგიერთი ნაწილის გამოტოვებით. ეს სხვადასხვა ობიექტები ანალოგიურია ცილის იზოფორმებისა, ერთი და იგივე გენის მიერ კოდირებული ცილებისა. ამ ძირითადი გაგებით, შეგვიძლია გადავიდეთ იმაზე, თუ როგორ მუშაობს SE მოდელი. გვახსოვდეს, რომ SE-ს მთავარი მიზანია უჯრედების აზრიანი ჩაშენების შექმნა. ამის გასაკეთებლად, ჯერ აზრიანი გენის ჩაშენებები უნდა შევქმნათ.
თეგები:
#ხელოვნური ინტელექტი
#ნერვული ქსელები
#ტრანსფორმერული მოდელები
#ბიოინფორმატიკა
#crispr
#ვირტუალური უჯრედი
#state მოდელი
#გენის გაჩუმება
#რნმ სეკვენირება
#უჯრედის სიმულაცია
წყარო: huggingface.co
AI-ით გადამუშავებული