BERT-ისა და GPT2-ის მსგავსად, მასიურმა, წინასწარ გაწვრთნილმა ენკოდერ-დეკოდერ მოდელებმა აჩვენეს შესრულების მნიშვნელოვანი გაუმჯობესება სხვადასხვა თანმიმდევრობა-თანმიმდევრობაზე ამოცანებში (Lewis et al. (2019), Raffel et al. (2019)). თუმცა, ენკოდერ-დეკოდერ მოდელების წინასწარ წვრთნასთან დაკავშირებული უზარმაზარი გამოთვლითი ხარჯების გამო, ასეთი მოდელების განვითარება ძირითადად შეზღუდულია დიდი კომპანიებითა და ინსტიტუტებით. ნაშრომში „Leveraging Pre-trained Checkpoints for Sequence Generation Tasks“ (2020), სასჩა როტე, შაში ნარაიანი და ალიაქსეი სევერინი ახდენენ ენკოდერ-დეკოდერ მოდელის ინიციალიზაციას წინასწარ გაწვრთნილი მხოლოდ ენკოდერის და/ან დეკოდერის საკონტროლო წერტილების (მაგალითად, BERT, GPT2) გამოყენებით, რათა თავიდან აიცილონ ძვირადღირებული წინასწარი წვრთნა. ავტორები აჩვენებენ, რომ ასეთი „თბილი სტარტით“ დაწყებული ენკოდერ-დეკოდერ მოდელები კონკურენტულ შედეგებს იძლევა მსხვილ, წინასწარ გაწვრთნილ ენკოდერ-დეკოდერ მოდელებთან, როგორიცაა T5 და Pegasus, მრავალ თანმიმდევრობა-თანმიმდევრობაზე ამოცანაში, წვრთნის ხარჯების გაცილებით მცირე ნაწილად. ამ ნოუთბუქში დეტალურად განვმარტავთ, თუ როგორ შეიძლება ენკოდერ-დეკოდერ მოდელების „თბილი სტარტით“ დაწყება, მოგცემთ პრაქტიკულ რჩევებს როტეს და სხვების (2020) ნაშრომზე დაყრდნობით და საბოლოოდ განვიხილავთ კოდის სრულ მაგალითს, რომელიც აჩვენებს, თუ როგორ ხდება ენკოდერ-დეკოდერ მოდელების „თბილი სტარტით“ დაწყება 🤗Transformers-ის გამოყენებით. ეს ნოუთბუქი დაყოფილია 4 ნაწილად: მკაცრად რეკომენდებულია (ალბათ აუცილებელიც კი), რომ წაიკითხოთ ეს ბლოგპოსტი ტრანსფორმერზე დაფუძნებული ენკოდერ-დეკოდერ მოდელების შესახებ. დავიწყოთ ენკოდერ-დეკოდერ მოდელების „თბილი სტარტის“ საწყისი ინფორმაციით. ბოლო დროს, წინასწარ გაწვრთნილმა ენობრივმა მოდელებმა მოახდინეს რევოლუცია ბუნებრივი ენის დამუშავების (NLP) სფეროში. პირველი წინასწარ გაწვრთნილი ენობრივი მოდელები დაფუძნებული იყო რეკურენტულ ნეირონულ ქსელებზე (RNN), როგორც ეს დაიმ და სხვებმა (2015) წარმოადგინეს. დაიმ და სხვებმა აჩვენეს, რომ RNN-ზე დაფუძნებული მოდელის წინასწარი წვრთნა არა-მარკირებულ მონაცემებზე და შემდეგ მისი დაზუსტება კონკრეტულ ამოცანაზე, უკეთეს შედეგებს იძლევა, ვიდრე შემთხვევით ინიციალიზებული მოდელის პირდაპირ ამ ამოცანაზე წვრთნა. თუმცა, მხოლოდ 2018 წელს გახდა წინასწარ გაწვრთნილი ენობრივი მოდელები ფართოდ მიღებული NLP-ში. Peters et al.-ის ELMO-მ და Howard et al.-ის ULMFit-მა პირველებმა მნიშვნელოვნად გააუმჯობესეს უახლესი შედეგები ბუნებრივი ენის გაგების (NLU) ამოცანებში. სულ რაღაც რამდენიმე თვის შემდეგ, OpenAI-მ და Google-მა გამოაქვეყნეს ტრანსფორმერზე დაფუძნებული წინასწარ გაწვრთნილი ენობრივი მოდელები, შესაბამისად, Radford et al.-ის GPT და Devlin et al.-ის BERT. ტრანსფორმერზე დაფუძნებული ენობრივი მოდელების გაუმჯობესებულმა ეფექტურობამ RNN-ებთან შედარებით, საშუალება მისცა GPT2-სა და BERT-ს, რომ წინასწარ გაწვრთნილიყვნენ არა-მარკირებული ტექსტური მონაცემების მასიურ რაოდენობაზე. წინასწარი წვრთნის შემდეგ, BERT-სა და GPT-ს ძალიან მცირე დაზუსტება დასჭირდათ, რათა NLU ამოცანების ათეულზე მეტში უახლესი შედეგები გაეუმჯობესებინათ. წინასწარ გაწვრთნილი ენობრივი მოდელების უნარი, ეფექტურად გადაეტანათ ამოცანისგან დამოუკიდებელი ცოდნა ამოცანის სპეციფიკურ ცოდნაში, NLU-სთვის დიდ კატალიზატორად იქცა. მაშინ, როდესაც ინჟინრებსა და მკვლევრებს ადრე ენობრივი მოდელის ნულიდან წვრთნა უწევდათ, ახლა მსხვილი წინასწარ გაწვრთნილი ენობრივი მოდელების საჯაროდ ხელმისაწვდომი საკონტროლო წერტილების დაზუსტება შესაძლებელია ხარჯებისა და დროის მცირე ნაწილად. ამან შეიძლება მილიონობით დოლარი დაზოგოს ინდუსტრიაში და საშუალებას იძლევა კვლევებში უფრო სწრაფი პროტოტიპირებისა და უკეთესი ბენჩმარკებისთვის. წინასწარ გაწვრთნილმა ენობრივმა მოდელებმა NLU ამოცანებში შესრულების ახალი დონე დაამკვიდრეს და სულ უფრო მეტი კვლევა ეფუძნება ასეთი წინასწარ გაწვრთნილი ენობრივი მოდელების გამოყენებას გაუმჯობესებული NLU სისტემებისთვის. თუმცა, დამოუკიდებელი BERT და GPT მოდელები ნაკლებად წარმატებული აღმოჩნდა თანმიმდევრობა-თანმიმდევრობაზე ამოცანებისთვის, მაგალითად, ტექსტის შეჯამება, მანქანური თარგმანი, წინადადების გადაფორმება და სხვა. თანმიმდევრობა-თანმიმდევრობაზე ამოცანები განისაზღვრება, როგორც შეყვანის თანმიმდევრობის X1:n ასახვა გამომავალ თანმიმდევრობაზე Y1:m, წინასწარ უცნობი გამომავალი სიგრძით m. შესაბამისად, თანმიმდევრობა-თანმიმდევრობაზე მოდელმა უნდა განსაზღვროს გამომავალი თანმიმდევრობის Y1:m პირობითი ალბათობის განაწილება შეყვანის თანმიმდევრობის X1:n გათვალისწინებით: pθmodel(Y1:m∣X1:n). ზოგადობის დაკარგვის გარეშე, n სიტყვის შეყვანის თანმიმდევრობა აქ წარმოდგენილია ვექტორული თანმიმდევრობით X1:n=x1,…,xn და m სიტყვის გამომავალი თანმიმდევრობა, როგორც Y1:m=y1,…,ym. ვნახოთ, როგორ მოერგებოდნენ BERT და GPT2 თანმიმდევრობა-თანმიმდევრობაზე ამოცანების მოდელირებას. BERT არის მხოლოდ ენკოდერის მოდელი, რომელიც შეყვანის თანმიმდევრობას X1:n ასახავს კონტექსტუალიზებულ კოდირებულ თანმიმდევრობაზე X‾1:n: fθBERT:X1:n→X‾1:n. BERT-ის კონტექსტუალიზებული კოდირებული თანმიმდევრობა X‾1:n შემდეგ შეიძლება დამუშავდეს კლასიფიკაციის ფენის მიერ NLU კლასიფიკაციის ამოცანებისთვის, როგორიცაა სენტიმენტის ანალიზი, ბუნებრივი ენის ინფერენცია და ა.შ. ამისათვის, კლასიფიკაციის ფენა, ანუ, როგორც წესი, გაერთიანების ფენა, რომელსაც მოსდევს წინ მიმავალი ფენა, ემატება როგორც საბოლოო ფენა BERT-ის თავზე, რათა ასახოს...