პროტეინების დასამუშავებლად გამოყენებული მოდელები დიდწილად შთაგონებულია დიდი ენობრივი მოდელებით, როგორიცაა BERT და GPT. იმის გასაგებად, თუ როგორ მუშაობს ეს მოდელები, დროში დავბრუნდეთ დაახლოებით 2016 წელს, მათ არსებობამდე. დონალდ ტრამპი ჯერ არ იყო არჩეული, ბრექსიტი ჯერ არ მომხდარა და ღრმა სწავლა (DL) არის ცხელი ახალი ტექნიკა, რომელიც ყოველდღიურად ახალ რეკორდებს ამყარებს. DL-ის წარმატების გასაღები არის ის, რომ ის იყენებს ხელოვნურ ნერვულ ქსელებს მონაცემებში რთული შაბლონების შესასწავლად. თუმცა, DL-ს ერთი კრიტიკული პრობლემა აქვს – მას სჭირდება ბევრი მონაცემი კარგად მუშაობისთვის, და ბევრ ამოცანაში ეს მონაცემები უბრალოდ არ არის ხელმისაწვდომი. ვთქვათ, გსურთ გაწვრთნათ DL მოდელი, რათა მიიღოს წინადადება ინგლისურად, როგორც შეყვანა, და გადაწყვიტოს, არის თუ არა ის გრამატიკულად სწორი. თქვენ აგროვებთ სასწავლო მონაცემებს, და ის ასე გამოიყურება: [გრამატიკულად სწორი წინადადებები; გრამატიკულად არასწორი წინადადებები]. თეორიულად, ეს ამოცანა სრულიად შესაძლებელი იყო იმ დროს – თუ ამგვარ სასწავლო მონაცემებს DL მოდელში შეიტანდით, მას შეეძლო ესწავლა, თუ როგორ ევარაუდა ახალი წინადადებები გრამატიკულად სწორი იყო თუ არა. პრაქტიკაში, ეს არც ისე კარგად მუშაობდა, რადგან 2016 წელს ადამიანების უმეტესობა შემთხვევით ახდენდა ახალი მოდელის ინიციალიზაციას თითოეული ამოცანისთვის, რომელზეც სურდათ მათი გაწვრთნა. ეს ნიშნავდა, რომ მოდელებს უნდა ესწავლათ ყველაფერი, რაც მათ სჭირდებოდათ, მხოლოდ სასწავლო მონაცემებში მოცემული მაგალითებიდან! იმის გასაგებად, თუ რამდენად რთულია ეს, წარმოიდგინეთ, რომ თქვენ ხართ მანქანური სწავლის მოდელი და მე გაწვდით სასწავლო მონაცემებს ამოცანისთვის, რომლის სწავლაც მინდა. აქ არის: მე ავირჩიე ენა, რომელიც იმედია არასდროს გინახავთ, ამიტომ ვვარაუდობ, რომ არც ისე დარწმუნებულად გრძნობთ თავს, რომ ეს ამოცანა ისწავლეთ. შესაძლოა, ასობით ან ათასობით მაგალითის შემდეგ დაიწყოთ განმეორებადი სიტყვების ან შაბლონების შემჩნევა შეყვანებში, და შესაძლოა შეძლოთ გამოცნობების გაკეთება, რომლებიც შემთხვევითობაზე უკეთესი იქნებოდა, მაგრამ ამის მიუხედავად, ახალი სიტყვა ან უჩვეულო ფრაზა ნამდვილად შეგეშლიდათ ხელს და არასწორად გამოიცნობდით. შემთხვევითი არ არის, რომ DL მოდელებიც დაახლოებით ასეთი სიზუსტით მუშაობდნენ მაშინ! ახლა სცადეთ იგივე ამოცანა, მაგრამ ინგლისურად: ახლა ადვილია - ამოცანა მხოლოდ იმის პროგნოზირებაა, არის თუ არა ფილმის მიმოხილვა პოზიტიური (1) თუ ნეგატიური (0). მხოლოდ ორი პოზიტიური და ორი ნეგატიური მაგალითით, ალბათ, შეძლებდით ამ ამოცანის შესრულებას თითქმის 100%-იანი სიზუსტით, რადგან უკვე გაქვთ ინგლისური ლექსიკისა და გრამატიკის, ისევე როგორც ფილმებისა და ემოციური გამოხატვის კულტურული კონტექსტის ვრცელი წინასწარი ცოდნა. ამ ცოდნის გარეშე, სიტუაცია უფრო პირველი ამოცანის მსგავსია – დაგჭირდებათ უზარმაზარი რაოდენობის მაგალითების წაკითხვა, სანამ შეყვანებში ზედაპირულ შაბლონებსაც კი შეამჩნევთ, და მაშინაც კი, თუ ასობით ათასი მაგალითის შესასწავლად დროს დახარჯავდით, თქვენი გამოცნობები მაინც ბევრად ნაკლებად ზუსტი იქნებოდა, ვიდრე ოთხი მაგალითის შემდეგ ინგლისური ენის ამოცანაში. მანქანურ სწავლაში, ცოდნის ახალ ამოცანაზე გადატანის ამ კონცეფციას „ტრანსფერულ სწავლას“ ვუწოდებთ. ამგვარი ტრანსფერული სწავლის DL-სთვის ამუშავება 2016 წლისთვის სფეროს მთავარი მიზანი იყო. სიტყვების წინასწარ გაწვრთნილი ვექტორები (რაც ძალიან საინტერესოა, მაგრამ ამ ბლოგპოსტის ფარგლებს სცდება!) არსებობდა 2016 წლისთვის და საშუალებას აძლევდა გარკვეული ცოდნის გადატანას ახალ მოდელებზე, მაგრამ ეს ცოდნის გადაცემა მაინც შედარებით ზედაპირული იყო და მოდელებს კარგად მუშაობისთვის კვლავ სჭირდებოდათ დიდი რაოდენობით სასწავლო მონაცემები. სიტუაცია გაგრძელდა 2018 წლამდე, როდესაც გამოქვეყნდა ორი უზარმაზარი ნაშრომი, რომელმაც წარმოადგინა ULMFiT და მოგვიანებით BERT მოდელები. ეს იყო პირველი ნაშრომები, რომლებმაც ბუნებრივი ენის ტრანსფერული სწავლა მართლაც კარგად ამუშავეს, და კერძოდ BERT-მა აღნიშნა წინასწარ გაწვრთნილი დიდი ენობრივი მოდელების ეპოქის დასაწყისი. ხრიკი, რომელიც ორივე ნაშრომს ჰქონდა, ის იყო, რომ მათ გამოიყენეს ღრმა სწავლის ხელოვნური ნერვული ქსელების შიდა სტრუქტურა – მათ დიდი ხნის განმავლობაში ავარჯიშეს ნერვული ქსელი ტექსტურ ამოცანაზე, სადაც სასწავლო მონაცემები ძალიან უხვადა იყო, შემდეგ კი უბრალოდ დააკოპირეს მთელი ნერვული ქსელი ახალ ამოცანაზე, შეცვალეს მხოლოდ რამდენიმე ნეირონი, რომელიც შეესაბამებოდა ქსელის გამოსავალს. ეს ფიგურა ULMFiT-ის ნაშრომიდან გვიჩვენებს შესრულების უზარმაზარ გაუმჯობესებას ტრანსფერული სწავლის გამოყენების შედეგად, მოდელის ნულიდან გაწვრთნასთან შედარებით, სამ ცალკეულ ამოცანაზე. ბევრ შემთხვევაში, ტრანსფერული სწავლის გამოყენება იძლევა ისეთ შესრულებას, რომელიც 100-ჯერ მეტ სასწავლო მონაცემთან ტოლფასია. და არ დაგავიწყდეთ, რომ ეს 2018 წელს გამოქვეყნდა – თანამედროვე დიდი ენობრივი მოდელები კიდევ უკეთესად მუშაობენ! ეს იმიტომ მუშაობს, რომ ნებისმიერი არატრივიალური ამოცანის ამოხსნის პროცესში, ნერვული ქსელები სწავლობენ შეყვანის მონაცემების უამრავ სტრუქტურას – ვიზუალური ქსელები, ნედლი პიქსელების მიღებისას, სწავლობენ ხაზების, მრუდების და კიდეების იდენტიფიცირებას; ტექსტური ქსელები, ნედლი ტექსტის მიღებისას, სწავლობენ გრამატიკული სტრუქტურის დეტალებს. ეს ინფორმაცია არ არის ამოცანისთვის სპეციფიკური – ტრანსფერული სწავლის მუშაობის მთავარი მიზეზი ის არის, რომ ის, რაც ამოცანის ამოსახსნელად გჭირდებათ, ხშირად არ არის ამ ამოცანისთვის სპეციფიკური! ფილმის მიმოხილვების კლასიფიკაციისთვის არ გჭირდებოდათ ბევრი რამ იცოდეთ ფილმის მიმოხილვების შესახებ, მაგრამ გჭირდებოდათ ინგლისური ენისა და კულტურული კონტექსტის ვრცელი ცოდნა. ამოცანის არჩევით, სადაც სასწავლო მონაცემები უხვადაა, შეგვიძლია მივიღოთ ნერვული ქსელი, რომელიც სწავლობს ბევრ ასეთ ზოგად სტრუქტურას და შემდეგ გადავიტანოთ ეს ცოდნა ახალ ამოცანაზე.