ხელოვნური ინტელექტის პროგრესი საოცარია, იმ დონემდე, რომ ზოგიერთი ადამიანი სერიოზულად მსჯელობს, ხომ არ შეიძლება AI მოდელები ადამიანებზე უკეთესი იყვნენ გარკვეულ ამოცანებში. თუმცა, ეს პროგრესი არათანაბარი იყო: რამდენიმე ათეული წლის წინანდელ მანქანური სწავლების სპეციალისტისთვის თანამედროვე აპარატურა და ალგორითმები შეიძლება წარმოუდგენლად გამოიყურებოდეს, ისევე როგორც ჩვენს ხელთ არსებული მონაცემებისა და გამოთვლითი სიმძლავრის უზარმაზარი რაოდენობა, მაგრამ ამ მოდელების შეფასების მეთოდი დაახლოებით იგივე დარჩა. მიუხედავად ამისა, გადაჭარბებული არ იქნება იმის თქმა, რომ თანამედროვე AI შეფასების კრიზისშია. ამჟამად სწორი შეფასება მრავალი მოდელის გაზომვას გულისხმობს, ხშირად მრავალ მონაცემთა ნაკრებზე და მრავალი მეტრიკის გამოყენებით. მაგრამ ამის გაკეთება ზედმეტად მოუხერხებელია. ეს განსაკუთრებით ეხება რეპროდუცირებადობას, რადგან თვითგამოცხადებული შედეგები შესაძლოა გამოწვეული იყოს შემთხვევითი შეცდომებით, იმპლემენტაციის დახვეწილი განსხვავებებით, ან უარესი. ჩვენ გვჯერა, რომ უკეთესი შეფასება შესაძლებელია, თუ ჩვენ – საზოგადოება – დავამკვიდრებთ საუკეთესო პრაქტიკის უკეთეს ნაკრებს და ვეცდებით ბარიერების მოხსნას. ბოლო რამდენიმე თვის განმავლობაში, ჩვენ ინტენსიურად ვმუშაობდით „Evaluation on the Hub“-ზე: შეაფასეთ ნებისმიერი მოდელი ნებისმიერ მონაცემთა ნაკრებზე ნებისმიერი მეტრიკის გამოყენებით, ერთი ღილაკის დაჭერით. დასაწყებად, ჩვენ შევაფასეთ ასობით მოდელი რამდენიმე ძირითად მონაცემთა ნაკრებზე და „Hub“-ის ახალი „Pull Request“ ფუნქციის გამოყენებით, შევქმენით მრავალი PR მოდელის ბარათებზე მათი დადასტურებული შესრულების საჩვენებლად. შეფასების შედეგები პირდაპირ მოდელის ბარათის მეტამონაცემებშია კოდირებული, „Hub“-ზე არსებული ყველა მოდელისთვის ერთიანი ფორმატის დაცვით. იხილეთ „DistilBERT“-ის მოდელის ბარათი, რათა ნახოთ, როგორ გამოიყურება! „Evaluation on the Hub“ უამრავ საინტერესო გამოყენების სცენარს ხსნის. მონაცემთა მეცნიერისთვის ან ხელმძღვანელისთვის, რომელსაც სჭირდება გადაწყვიტოს, რომელი მოდელი გამოიყენოს, აკადემიკოსისთვის, რომელიც ცდილობს ნაშრომის შედეგების რეპროდუცირებას ახალ მონაცემთა ნაკრებზე, ეთიკოსისთვის, რომელსაც სურს უკეთ გაიგოს გამოყენების რისკები. თუ სამ ძირითად საწყის გამოყენების სცენარს გამოვყოფთ, ესენია: **ამოცანისთვის საუკეთესო მოდელის პოვნა** დავუშვათ, ზუსტად იცით, რა არის თქვენი ამოცანა და გსურთ იპოვოთ სწორი მოდელი ამ სამუშაოსთვის. შეგიძლიათ შეამოწმოთ თქვენი ამოცანის წარმომადგენლობითი მონაცემთა ნაკრების ლიდერბორდი, რომელიც აერთიანებს ყველა შედეგს. ეს შესანიშნავია! და რა მოხდება, თუ ის ახალი, საინტერესო მოდელი, რომლითაც დაინტერესებული ხართ, ჯერ არ არის ამ მონაცემთა ნაკრების ლიდერბორდზე? უბრალოდ გაუშვით მისი შეფასება, „Hub“-ის დატოვების გარეშე. **მოდელების შეფასება თქვენს სრულიად ახალ მონაცემთა ნაკრებზე** ახლა კი, რა მოხდება, თუ გაქვთ სრულიად ახალი მონაცემთა ნაკრები, რომელზეც გსურთ ბაზისური შეფასებების ჩატარება? შეგიძლიათ ატვირთოთ ის „Hub“-ზე და შეაფასოთ იმდენი მოდელი, რამდენიც გსურთ. კოდი არ არის საჭირო. უფრო მეტიც, შეგიძლიათ დარწმუნებული იყოთ, რომ მოდელების შეფასების მეთოდი თქვენს მონაცემთა ნაკრებზე ზუსტად იგივეა, რაც სხვა მონაცემთა ნაკრებებზე მათი შეფასებისას. **თქვენი მოდელის შეფასება ბევრ სხვა დაკავშირებულ მონაცემთა ნაკრებზე** ან დავუშვათ, გაქვთ სრულიად ახალი კითხვა-პასუხის მოდელი, გაწვრთნილი „SQuAD“-ზე? არსებობს ასობით სხვადასხვა კითხვა-პასუხის მონაცემთა ნაკრები შესაფასებლად :scream: შეგიძლიათ აირჩიოთ ის, რაც გაინტერესებთ და შეაფასოთ თქვენი მოდელი, პირდაპირ „Hub“-იდან. „Evaluation on the Hub“ შექმნილია თქვენი ცხოვრების გასამარტივებლად. მაგრამ, რა თქმა უნდა, ფონზე ბევრი რამ ხდება. რაც განსაკუთრებით მოგვწონს „Evaluation on the Hub“-ში, ეს არის ის, რომ ის იმდენად შეუფერხებლად ჯდება არსებულ Hugging Face ეკოსისტემაში, რომ თითქმის იძულებულები ვიყავით, შეგვექმნა. მომხმარებლები იწყებენ მონაცემთა ნაკრებების გვერდებიდან, საიდანაც მათ შეუძლიათ შეფასებების გაშვება ან ლიდერბორდების ნახვა. მოდელის შეფასების გაგზავნის ინტერფეისი და ლიდერბორდები ჩვეულებრივი Hugging Face Spaces-ია. შეფასების ბექენდი „AutoTrain“-ის მიერ არის გამყარებული, რომელიც „Hub“-ზე აკეთებს PR-ს მოცემული მოდელის მოდელის ბარათისთვის. როგორ გამოიყურება ეს პრაქტიკაში? მოდით განვიხილოთ მაგალითი. დავუშვათ, თქვენი საქმიანობა არის ძაღლების, მაფინებისა და შემწვარი ქათმის გარჩევა (ა.კ.ა. dogfooding!). როგორც ზემოთ მოცემული სურათი გვიჩვენებს, ამ პრობლემის გადასაჭრელად დაგჭირდებათ: საბედნიეროდ, თქვენმა მონაცემთა მეცნიერების გუნდმა ატვირთა მონაცემთა ნაკრები Hugging Face Hub-ზე და გაწვრთნა რამდენიმე განსხვავებული მოდელი. ასე რომ, ახლა თქვენ უბრალოდ უნდა აირჩიოთ საუკეთესო – მოდით გამოვიყენოთ „Evaluation on the Hub“, რათა ვნახოთ, რამდენად კარგად მუშაობენ ისინი სატესტო ნაკრებზე! დასაწყებად, გადადით „model-evaluator Space“-ზე და აირჩიეთ მონაცემთა ნაკრები, რომელზეც გსურთ მოდელების შეფასება. ძაღლისა და საკვების გამოსახულებების ჩვენი მონაცემთა ნაკრებისთვის, თქვენ იხილავთ მსგავს რამეს, როგორიცაა ქვემოთ მოცემული სურათი: ახლა, „Hub“-ზე მრავალი მონაცემთა ნაკრები შეიცავს მეტამონაცემებს, რომლებიც აკონკრეტებენ, როგორ უნდა მოხდეს შეფასების კონფიგურაცია (მაგალითისთვის იხილეთ „acronym_identification“). ეს საშუალებას გაძლევთ შეაფასოთ მოდელები ერთი დაწკაპუნებით, მაგრამ ჩვენს შემთხვევაში გაჩვენებთ, როგორ დააკონფიგურიროთ შეფასება ხელით. ღილაკზე „Advanced configuration“ დაწკაპუნებით გამოჩნდება სხვადასხვა პარამეტრი, რომელთაგანაც შეგიძლიათ აირჩიოთ: როგორც ქვემოთ მოცემულ სურათზეა ნაჩვენები, ამოცანის, მონაცემთა ნაკრებისა და გაყოფის კონფიგურაცია, რომელზეც უნდა მოხდეს შეფასება, მარტივია: შემდეგი ნაბიჯი არის იმის განსაზღვრა, თუ რომელი მონაცემთა ნაკრების სვეტები შეიცავს სურათებს და რომელი შეიცავს ლაბ