ნულოვანი ცდის შეფასება პოპულარული მეთოდია მკვლევრებისთვის, რათა შეაფასონ დიდი ენობრივი მოდელების (დემ) მუშაობა, რადგან დადგინდა, რომ ისინი სწავლის პროცესში იძენენ შესაძლებლობებს ეტიკეტირებული მაგალითების პირდაპირი ჩვენების გარეშე. „უკუ მასშტაბირების პრიზი“ (Inverse Scaling Prize) წარმოადგენს საზოგადოების ბოლო დროს განხორციელებული ძალისხმევის მაგალითს, რომელიც მიზნად ისახავს ფართომასშტაბიანი ნულოვანი ცდის შეფასების ჩატარებას მოდელების ზომისა და ოჯახების მიხედვით, რათა აღმოჩენილ იქნას ისეთი ამოცანები, რომლებზეც უფრო დიდმა მოდელებმა შეიძლება უარესად იმუშაონ, ვიდრე მათმა მცირე ზომის ანალოგებმა. Hugging Face Hub-ზე შეფასება გეხმარებათ შეაფასოთ ნებისმიერი მოდელი Hub-ზე კოდის დაწერის გარეშე და მუშაობს AutoTrain-ის მეშვეობით. ახლა უკვე Hub-ზე არსებული ნებისმიერი მიზეზ-შედეგობრივი ენობრივი მოდელის შეფასება შესაძლებელია ნულოვანი ცდის მეთოდით. ნულოვანი ცდის შეფასება ზომავს გაწვრთნილი მოდელის მიერ სიმბოლოთა მოცემული ნაკრების გენერირების ალბათობას და არ საჭიროებს ეტიკეტირებულ სავარჯიშო მონაცემებს, რაც მკვლევრებს საშუალებას აძლევს თავიდან აიცილონ ძვირადღირებული ეტიკეტირების სამუშაოები. ამ პროექტისთვის AutoTrain-ის ინფრასტრუქტურა განვაახლეთ, რათა დიდი მოდელების შეფასება უფასოდ გახდეს შესაძლებელი 🤯! მომხმარებლებისთვის ძვირი და შრომატევადია საკუთარი კოდის დაწერა, რათა შეაფასონ დიდი მოდელები GPU-ებზე. მაგალითად, 66 მილიარდი პარამეტრის მქონე ენობრივი მოდელის მხოლოდ ჩატვირთვასა და კომპილაციას შეიძლება დასჭირდეს 35 წუთი, რაც დიდ მოდელებზე შეფასებას ხელმისაწვდომს ხდიდა მხოლოდ მათთვის, ვისაც ძვირადღირებული ინფრასტრუქტურა და ფართო ტექნიკური გამოცდილება ჰქონდა. ამ ცვლილებებით, 66-მილიარდიანი პარამეტრის მქონე მოდელის შეფასება ნულოვანი ცდის კლასიფიკაციის ამოცანაზე, 2000 წინადადების სიგრძის მაგალითით, 3.5 საათს იღებს და მისი შესრულება ნებისმიერ მსურველს შეუძლია. Hub-ზე შეფასება ამჟამად მხარს უჭერს 66 მილიარდ პარამეტრამდე მოდელების შეფასებას, ხოლო უფრო დიდი მოდელების მხარდაჭერა სამომავლოდ იგეგმება. ნულოვანი ცდის ტექსტის კლასიფიკაციის ამოცანა იღებს მონაცემთა ნაკრებს, რომელიც შეიცავს მოთხოვნებს (prompts) და შესაძლო დასრულებებს (completions). ძირეულად, დასრულებები უკავშირდება მოთხოვნას და თითოეული სიმბოლოს ლოგარითმული ალბათობები ჯამდება, შემდეგ ნორმალიზდება და შედარდება სწორ დასრულებასთან, რათა მოხდეს ამოცანის სიზუსტის ანგარიშგება. ამ ბლოგპოსტში, ჩვენ გამოვიყენებთ ნულოვანი ცდის ტექსტის კლასიფიკაციის ამოცანას სხვადასხვა OPT მოდელის შესაფასებლად WinoBias-ზე – კორეფერენციის ამოცანაზე, რომელიც ზომავს გენდერულ მიკერძოებას პროფესიებთან მიმართებაში. WinoBias ზომავს, არის თუ არა მოდელი უფრო მეტად მიდრეკილი სტერეოტიპული ნაცვალსახელის არჩევისკენ პროფესიის შემცველი წინადადების შესავსებად, და აღვნიშნავთ, რომ შედეგები მოდელის ზომასთან მიმართებაში უკუ მასშტაბირების ტენდენციას მიუთითებს. WinoBias-ის მონაცემთა ნაკრები ფორმატირებულია როგორც ნულოვანი ცდის ამოცანა, სადაც კლასიფიკაციის ვარიანტები დასრულებებია. თითოეული დასრულება განსხვავდება ნაცვალსახელით, და სამიზნე შეესაბამება პროფესიისთვის ანტი-სტერეოტიპულ დასრულებას (მაგალითად, „დეველოპერი“ სტერეოტიპულად მამაკაცების დომინირებული პროფესიაა, ამიტომ „ის ქალი“ იქნებოდა ანტი-სტერეოტიპული ნაცვალსახელი). მაგალითისთვის იხილეთ აქ: შემდეგ, Hub-ზე შეფასების ინტერფეისში text_zero_shot_classification ამოცანის გამოყენებით, შეგვიძლია ავირჩიოთ ეს ახლად ატვირთული მონაცემთა ნაკრები, შევარჩიოთ მოდელები, რომელთა შეფასებაც გვსურს და წარვადგინოთ ჩვენი შეფასების სამუშაოები! სამუშაოს დასრულების შემდეგ, ელექტრონული ფოსტით მიიღებთ შეტყობინებას, რომ ავტომატური შეფასების ბოტმა ახალი pull request-ი გახსნა მოდელის Hub-ის რეპოზიტორიუმში შედეგებით. WinoBias-ის ამოცანიდან მიღებული შედეგების დაფიქსირებით, ვხვდებით, რომ მცირე ზომის მოდელები უფრო მეტად ირჩევენ ანტი-სტერეოტიპულ ნაცვალსახელს წინადადებისთვის, ხოლო უფრო დიდი მოდელები უფრო მეტად სწავლობენ სტერეოტიპულ ასოციაციებს გენდერსა და პროფესიებს შორის ტექსტში. ეს ადასტურებს სხვა ბენჩმარკებიდან (მაგ. BIG-Bench) მიღებულ შედეგებს, რომლებიც აჩვენებს, რომ უფრო დიდი, უფრო ქმედითი მოდელები უფრო მიდრეკილნი არიან მიკერძოებისკენ გენდერის, რასის, ეთნიკური წარმომავლობისა და ეროვნების მიმართ, და წინა ნაშრომებს, რომლებიც გვიჩვენებს, რომ უფრო დიდი მოდელები უფრო მეტად გამოიმუშავებენ ტოქსიკურ ტექსტს. ღია მეცნიერებამ დიდი პროგრესი განიცადა საზოგადოების მიერ განვითარებული ისეთი ინსტრუმენტებით, როგორიცაა EleutherAI-ის ენობრივი მოდელების შეფასების ხელსაწყო (Language Model Evaluation Harness) და BIG-bench პროექტი, რაც მკვლევრებს გაუადვილებს უახლესი მოდელების ქცევის გაგებას. Hub-ზე შეფასება არის დაბალკოდიანი ინსტრუმენტი, რომელიც ამარტივებს მოდელების ნაკრების ნულოვანი ცდის შესრულების შედარებას ისეთი ღერძის გასწვრივ, როგორიცაა FLOPS ან მოდელის ზომა, ასევე კონკრეტულ კორპუსებზე გაწვრთნილი მოდელების ნაკრების შესრულების შედარებას სხვა მოდელების ნაკრებთან. ნულოვანი ცდის ტექსტის კლასიფიკაციის ამოცანა უკიდურესად მოქნილია — ნებისმიერი მონაცემთა ნაკრები, რომელიც შეიძლება გარდაიქმნას ვინოგრადის სქემად, სადაც შესადარებელი მაგალითები მხოლოდ რამდენიმე სიტყვით განსხვავდება, შეიძლება გამოყენებულ იქნას ამ ამოცანასთან ერთად და შეფასდეს მრავალ მოდელზე ერთდროულად. ჩვენი მიზანია გავამარტივოთ ახალი მონაცემთა ნაკრების ატვირთვა შეფასებისთვის და მკვლევრებს მივცეთ საშუალება ადვილად შეადარონ მრავალი მოდელი მასზე. მაგალითი კვლევითი შეკითხვა, რომელიც შეიძლება გადაწყდეს მსგავსი ხელსაწყოების გამოყენებით, არის უკუ მასშტაბირების პრობლემა: მიუხედავად იმისა, რომ დიდი მოდელები ზოგადად უფრო ქმედითია ენობრივი ამოცანების უმეტესობაში, არსებობს ამოცანები, სადაც უფრო დიდი მოდელები უარესად მუშაობენ. „უკუ მასშტაბირების პრიზი“ არის კონკურსი, რომელიც მკვლევრებს უბიძგებს შექმნან ისეთი ამოცანები, სადაც უფრო დიდი მოდელები უარესად მუშაობენ, ვიდრე მათი მცირე ზომის ანალოგები. ჩვენ მოგიწოდებთ, სცადოთ ნულოვანი ცდის შეფასება Hub-ზე.