ვიზუალური ტრანსფორმერების (ViT) დაზუსტება Graphcore IPU-ებზე Hugging Face Optimum-ის გამოყენებით
ეს ბლოგ-პოსტი გვიჩვენებს, თუ რამდენად მარტივია წინასწარ გაწვრთნილი ტრანსფორმერული მოდელების, კერძოდ, ვიზუალური ტრანსფორმერების (ViT) დაზუსტება Graphcore Intelligence Processing Units (IPU)-ზე Hugging Face Optimum ბიბლიოთეკის გამოყენებით. სტატია მოიცავს დეტალურ სახელმძღვანელოს გულმკერდის რენტგენის მონაცემთა ნაკრების მაგალითზე, განმარტავს ViT არქიტექტურის უპირატესობებს CNN-ებთან შედარებით და ხაზს უსვამს IPU-ების როლს ამ პროცესის ოპტიმიზაციაში სხვადასხვა სფეროში, მათ შორის ჯანდაცვაში.
ეს ბლოგ-პოსტი გვიჩვენებს, თუ რამდენად მარტივია წინასწარ გაწვრთნილი ტრანსფორმერული მოდელების დაზუსტება თქვენი მონაცემთა ნაკრებისთვის Hugging Face Optimum ბიბლიოთეკის გამოყენებით Graphcore Intelligence Processing Units (IPU)-ზე. მაგალითისთვის, ჩვენ წარმოგიდგენთ ნაბიჯ-ნაბიჯ სახელმძღვანელოს და ნოუთბუქს, რომელიც იყენებს გულმკერდის რენტგენის ფართოდ გამოყენებად დიდ მონაცემთა ნაკრებს ვიზუალური ტრანსფორმერის (ViT) მოდელის გასაწვრთნელად.
2017 წელს Google AI-ის მკვლევართა ჯგუფმა გამოაქვეყნა ნაშრომი, რომელშიც წარმოდგენილი იყო ტრანსფორმერის მოდელის არქიტექტურა. ახალი თვითყურადღების (self-attention) მექანიზმით დახასიათებული ტრანსფორმერები შემოთავაზებულ იქნა, როგორც მოდელების ახალი და ეფექტური ჯგუფი ენობრივი აპლიკაციებისთვის. მართლაც, ბოლო ხუთი წლის განმავლობაში, ტრანსფორმერებმა საოცარი პოპულარობა მოიპოვეს და ამჟამად მიღებულია, როგორც დე ფაქტო სტანდარტი ბუნებრივი ენის დამუშავებისთვის (NLP). ენისთვის განკუთვნილი ტრანსფორმერები, ალბათ, ყველაზე მეტად წარმოდგენილია სწრაფად განვითარებადი GPT და BERT მოდელების ოჯახებით. ორივე მათგანი მარტივად და ეფექტურად მუშაობს Graphcore IPU-ებზე, როგორც მზარდი Hugging Face Optimum Graphcore ბიბლიოთეკის ნაწილი.
ტრანსფორმერული ენობრივი მოდელების გამოშვების ქრონოლოგია (წყარო: Hugging Face) ტრანსფორმერის მოდელის არქიტექტურის შესახებ სიღრმისეული განმარტება (NLP-ზე ფოკუსირებით) შეგიძლიათ იხილოთ Hugging Face-ის ვებგვერდზე.
მიუხედავად იმისა, რომ ტრანსფორმერებმა საწყისი წარმატება ენობრივ სფეროში მოიპოვეს, ისინი უკიდურესად მრავალმხრივია და შეიძლება გამოყენებულ იქნეს სხვა მიზნებისთვისაც, მათ შორის კომპიუტერული ხედვისთვის (CV), რასაც ამ ბლოგ-პოსტში განვიხილავთ. CV არის სფერო, სადაც კონვოლუციური ნერვული ქსელები (CNN) უდავოდ ყველაზე პოპულარული არქიტექტურაა. თუმცა, ვიზუალური ტრანსფორმერის (ViT) არქიტექტურა, რომელიც პირველად 2021 წელს Google Research-ის ნაშრომში იქნა წარმოდგენილი, წარმოადგენს გარღვევას გამოსახულების ამოცნობაში და იყენებს იმავე თვითყურადღების (self-attention) მექანიზმს, როგორც BERT და GPT, თავის მთავარ კომპონენტად.
იმ დროს, როდესაც BERT და სხვა ტრანსფორმერზე დაფუძნებული ენის დამუშავების მოდელები იღებენ წინადადებას (ანუ, სიტყვების სიას) შეტანის სახით, ViT მოდელები შეტანილ გამოსახულებას ყოფენ რამდენიმე პატარა „პატჩად“ (patches), რაც ენის დამუშავებაში ცალკეული სიტყვების ეკვივალენტურია. თითოეული პატჩი ხაზოვნად კოდირდება ტრანსფორმერის მოდელის მიერ ვექტორულ წარმოდგენად, რომელიც შეიძლება დამუშავდეს ინდივიდუალურად. გამოსახულებების პატჩებად, ანუ ვიზუალურ ტოკენებად დაყოფის ეს მიდგომა, განსხვავდება CNN-ების მიერ გამოყენებული პიქსელების მასივებისგან.
წინასწარი გაწვრთნის წყალობით, ViT მოდელი სწავლობს გამოსახულებების შიდა წარმოდგენას, რომელიც შემდეგ შეიძლება გამოყენებულ იქნეს ვიზუალური მახასიათებლების ამოსაღებად, რაც სასარგებლოა შემდგომი ამოცანებისთვის. მაგალითად, შეგიძლიათ გაწვრთნათ კლასიფიკატორი ახალ მარკირებულ გამოსახულებათა მონაცემთა ნაკრებზე, წინასწარ გაწვრთნილი ვიზუალური ენკოდერის თავზე ხაზოვანი ფენის განთავსებით. ჩვეულებრივ, ხაზოვან ფენას ათავსებენ [CLS] ტოკენის თავზე, რადგან ამ ტოკენის ბოლო ფარული მდგომარეობა შეიძლება განიხილებოდეს, როგორც მთელი გამოსახულების წარმოდგენა.
ViT მოდელის სტრუქტურის მიმოხილვა, როგორც წარმოდგენილია Google Research-ის ორიგინალურ 2021 წლის ნაშრომში. CNN-ებთან შედარებით, ViT მოდელებმა აჩვენეს ამოცნობის უფრო მაღალი სიზუსტე დაბალი გამოთვლითი ხარჯებით და გამოიყენება აპლიკაციების ფართო სპექტრში, მათ შორის გამოსახულების კლასიფიკაციის, ობიექტის ამოცნობისა და სეგმენტაციისთვის. მხოლოდ ჯანდაცვის სფეროში გამოყენების შემთხვევები მოიცავს COVID-19-ის, ბარძაყის მოტეხილობების, ემფიზემის, სარძევე ჯირკვლის კიბოსა და ალცჰეიმერის დაავადების ამოცნობასა და კლასიფიკაციას — მრავალ სხვა დაავადებასთან ერთად.
Graphcore IPU-ები განსაკუთრებით კარგად შეესაბამება ViT მოდელებს მათი გაწვრთნის პარალელიზაციის უნარის გამო, მონაცემთა მილსადენისა (data pipelining) და მოდელის პარალელიზმის კომბინაციის გამოყენებით. ამ მასიურად პარალელური პროცესის დაჩქარება შესაძლებელია IPU-ის MIMD არქიტექტურითა და მისი მასშტაბირებადი გადაწყვეტით, რომელიც IPU-Fabric-ზეა ორიენტირებული. კონვეიერული პარალელიზმის (pipeline parallelism) შემოღებით, იზრდება მონაცემთა პარალელიზმის თითოეული ინსტანციისთვის დასამუშავებელი „ბატჩის ზომა“ (batch size), უმჯობესდება ერთი IPU-ის მიერ დამუშავებული მეხსიერების არეალის წვდომის ეფექტურობა და მცირდება პარამეტრების აგრეგაციის კომუნიკაციის დრო მონაცემთა პარალელური სწავლისთვის.
წინასწარ ოპტიმიზირებული ტრანსფორმერული მოდელების მთელი რიგის დამატების წყალობით ღია კოდის Hugging Face Optimum Graphcore ბიბლიოთეკაში, წარმოუდგენლად მარტივია მაღალი ხარისხის წარმადობისა და ეფექტურობის მიღწევა IPU-ებზე ViT-ის მსგავსი მოდელების გაშვებისა და დაზუსტებისას. Hugging Face Optimum-ის მეშვეობით, Graphcore-მა გამოუშვა მზა, IPU-ზე გაწვრთნილი მოდელის საგუშაგო წერტილები (checkpoints) და კონფიგურაციის ფაილები, რათა მოდელების მაქსიმალური ეფექტურობით გაწვრთნა გამარტივდეს. ეს განსაკუთრებით სასარგებლოა, რადგან ViT მოდელები, როგორც წესი, საჭიროებენ წინასწარ გაწვრთნას დიდი რაოდენობით მონაცემებზე. ეს ინტეგრაცია საშუალებას გაძლევთ გამოიყენოთ ორიგინალური ავტორების მიერ გამოშვებული საგუშაგო წერტილები Hugging Face მოდელის ჰაბში, ასე რომ თქვენ არ მოგიწევთ მათი თავად გაწვრთნა. მომხმარებლებისთვის ნებისმიერი საჯარო მონაცემთა ნაკრების „plug and play“ შესაძლებლობის მიცემით, Optimum ამცირებს AI მოდელების განვითარების საერთო ციკლს და უზრუნველყოფს უწყვეტ ინტეგრაციას Graphcore-ის უახლეს აპარატურასთან, რაც იძლევა ღირებულების მიღების უფრო სწრაფ დროს.
ამ ბლოგ-პოსტისთვის, ჩვენ გამოვიყენებთ ImageNet-21k-ზე წინასწარ გაწვრთნილ ViT მოდელს, რომელიც ეფუძნება დოსოვიტსკის და სხვათა ნაშრომს სახელწოდებით „An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale“. მაგალითად, ჩვენ გაჩვენებთ Optimum-ის გამოყენების პროცესს ViT-ის დაზუსტებისთვის ChestX-ray1-ზე.
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#კომპიუტერული ხედვა
#hugging face
#nlp
#ტრანსფორმერი
#დაზუსტება
#ვიზუალური ტრანსფორმერი (vit)
#optimum
#graphcore
#ipu
წყარო: huggingface.co
AI-ით გადამუშავებული