Few-Shot Learning ხელოვნურ ინტელექტში: GPT-Neo და აჩქარებული დასკვნის API
სტატია განმარტავს „Few-Shot Learning“ (რამდენიმე მაგალითზე დაფუძნებული სწავლების) კონცეფციას, როგორც მანქანური სწავლების ტექნიკას, რომელიც მოდელს მცირე რაოდენობის მონაცემებით წვრთნის. განხილულია მისი გამოყენება ბუნებრივი ენის დამუშავებაში (NLP) დიდი ენობრივი მოდელების, როგორიცაა EleutherAI GPT-Neo და OpenAI GPT-3, მეშვეობით. სტატია ასევე მიმოიხილავს Hugging Face-ის აჩქარებული დასკვნის (Accelerated Inference) API-ის როლს, ამ ტექნიკის ოპტიმიზაციას, გამოწვევებს (მაგ., მოდელის მგრძნობელობა მაგალითებ
Few-Shot Learning (რამდენიმე მაგალითზე დაფუძნებული სწავლება) გულისხმობს მანქანური სწავლების მოდელისთვის ძალიან მცირე რაოდენობის საწვრთნელი მონაცემების მიწოდებას, რათა მან თავისი პროგნოზები გააკეთოს, მაგალითად, დასკვნის გაკეთების დროს მხოლოდ რამდენიმე მაგალითის საფუძველზე. ეს განსხვავდება სტანდარტული დაზუსტების (fine-tuning) ტექნიკისგან, რომელიც წინასწარ გაწვრთნილი მოდელისთვის შედარებით დიდი რაოდენობის საწვრთნელ მონაცემებს მოითხოვს, რათა მოდელი ზუსტად მოერგოს სასურველ ამოცანას.
ეს ტექნიკა ძირითადად კომპიუტერულ ხედვაში გამოიყენებოდა, თუმცა უახლესი ენობრივი მოდელების, როგორიცაა EleutherAI GPT-Neo და OpenAI GPT-3, მეშვეობით, მისი გამოყენება უკვე შესაძლებელია ბუნებრივი ენის დამუშავებაში (NLP).
NLP-ში, Few-Shot Learning გამოიყენება დიდ ენობრივ მოდელებთან, რომლებმაც ისწავლეს მრავალი ამოცანის იმპლიციტურად შესრულება ტექსტური მონაცემთა დიდ ნაკრებებზე წინასწარი გაწვრთნისას. ეს საშუალებას აძლევს მოდელს განაზოგადოს, ანუ გაიგოს დაკავშირებული, მაგრამ მანამდე უცნობი ამოცანები, მხოლოდ რამდენიმე მაგალითის საფუძველზე. Few-Shot NLP-ის მაგალითები სამი ძირითადი კომპონენტისგან შედგება. (წყარო: Language Models are Few-Shot Learners)
ამ „რამდენიმე მაგალითზე დაფუძნებული“ (few-shot) ნიმუშების შექმნა საკმაოდ რთულია, ვინაიდან თქვენ უნდა ჩამოაყალიბოთ „ამოცანა“, რომლის შესრულებაც გსურთ მოდელისგან. გავრცელებული პრობლემაა ის, რომ მოდელები, განსაკუთრებით მცირე ზომის, ძალიან მგრძნობიარენი არიან მაგალითების დაწერის სტილის მიმართ. Few-Shot Learning-ის წარმოებაში ოპტიმიზაციის ერთ-ერთი მიდგომაა ამოცანისთვის საერთო წარმოდგენის სწავლა და შემდეგ ამ წარმოდგენაზე დაყრდნობით ამოცანის სპეციფიკური კლასიფიკატორების გაწვრთნა. OpenAI-მ GPT-3-ის შესახებ მოხსენებაში აჩვენა, რომ Few-Shot მოთხოვნის (prompting) შესაძლებლობა უმჯობესდება ენობრივი მოდელის პარამეტრების რაოდენობის ზრდასთან ერთად. (წყარო: Language Models are Few-Shot Learners)
მოდით, ახლა გადავხედოთ, როგორ შეიძლება GPT-Neo-სა და 🤗 აჩქარებული დასკვნის (Accelerated Inference) API-ის გამოყენება საკუთარი Few-Shot Learning პროგნოზების შესაქმნელად! GPT-Neo არის EleutherAI-ის ტრანსფორმერებზე დაფუძნებული ენობრივი მოდელების ოჯახი, რომელიც GPT არქიტექტურას ეფუძნება. EleutherAI-ის მთავარი მიზანია, გაწვრთნას GPT-3-ის ზომის ეკვივალენტური მოდელი და გახადოს ის საჯაროდ ხელმისაწვდომი ღია ლიცენზიით. ამჟამად ხელმისაწვდომი GPT-Neo-ს ყველა საკონტროლო წერტილი გაწვრთნილია Pile მონაცემთა ნაკრებით, რომელიც არის დიდი ტექსტური კორპუსი და დეტალურად არის დოკუმენტირებული (Gao et al., 2021). ამდენად, მოსალოდნელია, რომ ის უკეთ იმუშავებს ტექსტზე, რომელიც ემთხვევა მისი საწვრთნელი ტექსტის განაწილებას; გირჩევთ, გაითვალისწინოთ ეს თქვენი მაგალითების დიზაინისას.
აჩქარებული დასკვნის (Accelerated Inference) API არის ჩვენი ჰოსტინგის სერვისი, რომელიც საშუალებას გაძლევთ შეასრულოთ დასკვნა (inference) 10 000-ზე მეტ საჯაროდ ხელმისაწვდომ მოდელზე 🤗 Model Hub-ზე, ან თქვენს საკუთარ კერძო მოდელებზე, მარტივი API გამოძახებების მეშვეობით. API მოიცავს აჩქარებას CPU-სა და GPU-ზე, რაც 100-ჯერად დაჩქარებას იძლევა ტრანსფორმერების სტანდარტულ (out-of-the-box) განლაგებასთან შედარებით. Few-Shot Learning პროგნოზების GPT-Neo-სთან ინტეგრირებისთვის თქვენს აპლიკაციებში, შეგიძლიათ გამოიყენოთ 🤗 აჩქარებული დასკვნის API ქვემოთ მოცემული კოდის ფრაგმენტით. თქვენი API ტოკენი შეგიძლიათ იპოვოთ აქ, ხოლო თუ არ გაქვთ ანგარიში, შეგიძლიათ დაიწყოთ აქ.
წარმოგიდგენთ რამდენიმე პრაქტიკულ რჩევას, რომელიც დაგეხმარებათ GPT-Neo-სა და 🤗 აჩქარებული დასკვნის API-ის გამოყენების დაწყებაში. ვინაიდან GPT-Neo (2.7B) დაახლოებით 60-ჯერ მცირეა GPT-3-ზე (175B), ის არ აზოგადებს ისე კარგად zero-shot ამოცანებზე და კარგი შედეგების მისაღწევად 3-4 მაგალითი სჭირდება. როდესაც მეტ მაგალითს მიაწოდებთ, GPT-Neo უკეთ იგებს ამოცანას და ითვალისწინებს end_sequence პარამეტრს, რაც საშუალებას გვაძლევს საკმაოდ კარგად ვაკონტროლოთ გენერირებული ტექსტი.
ჰიპერპარამეტრები, როგორიცაა ბოლო მიმდევრობა (End Sequence), ტოკენის სიგრძე (Token Length) და ტემპერატურა (Temperature), შეიძლება გამოყენებულ იქნას მოდელის მიერ ტექსტის გენერირების გასაკონტროლებლად, რაც თქვენს სასარგებლოდ შეგიძლიათ გამოიყენოთ სასურველი ამოცანის ამოსახსნელად. ტემპერატურა აკონტროლებს თქვენი გენერირებული ტექსტის შემთხვევითობას: დაბალი ტემპერატურა იწვევს ნაკლებად შემთხვევით გენერირებას, ხოლო მაღალი ტემპერატურა – უფრო შემთხვევით გენერირებას. მოცემულ მაგალითში ხედავთ, რამდენად მნიშვნელოვანია ჰიპერპარამეტრების სწორად განსაზღვრა. ამან შეიძლება გადამწყვეტი როლი ითამაშოს ამოცანის წარმატებით გადაწყვეტაში ან სრულ კრახში. Few-Shot Learning მძლავრი ტექნიკაა, მაგრამ მას ასევე აქვს უნიკალური ხარვეზები, რომლებიც გასათვალისწინებელია გამოყენების შემთხვევების შემუშავებისას.
ამის საილუსტრაციოდ, განვიხილოთ ვიჯეტში მოცემული სენტიმენტების ანალიზის ნაგულისხმევი პარამეტრი. სენტიმენტების კლასიფიკაციის სამი მაგალითის ნახვის შემდეგ, მოდელი შემდეგ პროგნოზებს აკეთებს 5-დან 4 შემთხვევაში, ტემპერატურის 0.1-ზე დაყენებით: ტვიტი: „მე ვარ შეზღუდული შესაძლებლობის მქონე ბედნიერი ადამიანი.“ სენტიმენტი: უარყოფითი. რა შეიძლება არასწორად წავიდეს? წარმოიდგინეთ, რომ თქვენ იყენებთ სენტიმენტების ანალიზს ონლაინ სავაჭრო ვებსაიტზე პროდუქტის მიმოხილვების აგრეგირებისთვის: შესაძლო შედეგი შეიძლება იყოს ის, რომ შეზღუდული შესაძლებლობის მქონე ადამიანებისთვის სასარგებლო ნივთები ავტომატურად დაქვეითდებოდა რეიტინგში – ეს არის ავტომატური დისკრიმინაციის ფორმა.
ამ კონკრეტულ საკითხზე მეტი ინფორმაციისთვის, გირჩევთ გაეცნოთ ACL 2020 წლის ნაშრომს „სოციალური მიკერძოებები NLP მოდელებში, როგორც ბარიერები შეზღუდული შესაძლებლობის მქონე პირებისთვის“. ვინაიდან Few-Shot Learning უფრო პირდაპირ ეყრდნობა წინასწარი გაწვრთნისას მიღებულ ინფორმაციასა და ასოციაციებს, ის უფრო მგრძნობიარეა ამ ტიპის შეცდომების მიმართ. როგორ მინიმუმამდე დავიყვანოთ ზიანის რისკი? წარმოგიდგენთ რამდენიმე პრაქტიკულ რეკომენდაციას. ყველაზე მეტად თავიდან უნდა იქნას აცილებული მოდელის გამოყენება მომხმარებლისთვის ან მომხმარებლის შესახებ გადაწყვეტილებების ავტომატურად მისაღებად, შესაძლებლობის გარეშე...
თეგები:
#ai
#ხელოვნური ინტელექტი
#ეთიკა
#მანქანური სწავლება
#მიკერძოება
#hugging face
#ენობრივი მოდელები
#nlp
#ინფერენსი
#few-shot learning
#gpt-neo
#gpt-3
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი