RTEB: ახალი ბენჩმარკი ხელოვნური ინტელექტის მოდელების მოძიების ხარისხის საიმედო შეფასებისთვის
ხელოვნური ინტელექტის აპლიკაციების მუშაობა, როგორიცაა RAG და რეკომენდაციის სისტემები, მნიშვნელოვნად შეზღუდულია ძიებისა და მოძიების ხარისხით. დეველოპერებისთვის პრობლემას წარმოადგენს ემბედინგის მოდელების მოძიების ხარისხის ზუსტი გაზომვა, რადგან არსებული ბენჩმარკები ხშირად აჩვენებენ „განზოგადების ხარვეზს“ და არ შეესაბამებიან რეალურ საწარმოო გამოყენების შემთხვევებს. ამ გამოწვევების გადასაჭრელად შეიქმნა RTEB – ახალი, საიმედო ბენჩმარკი, რომელიც ზომავს მოძიების სიზუსტეს. ის იყენებს ჰიბრიდულ სტრატეგიას (ღ
მრავალი ხელოვნური ინტელექტის აპლიკაციის, RAG-დან და აგენტებიდან დაწყებული რეკომენდაციის სისტემებით დამთავრებული, მუშაობა ფუნდამენტურად შეზღუდულია ძიებისა და მოძიების ხარისხით. ამგვარად, ემბედინგის მოდელების მოძიების ხარისხის ზუსტი გაზომვა დეველოპერებისთვის ხშირად მტკივნეული საკითხია. როგორ გაიგოთ რეალურად, რამდენად კარგად იმუშავებს მოდელი რეალურ პირობებში? აი, აქ ხდება ყველაფერი რთული. შეფასების ამჟამინდელი სტანდარტი ხშირად ეყრდნობა მოდელის „ნულოვანი დარტყმის“ (zero-shot) შესრულებას საჯარო ბენჩმარკებზე. თუმცა, ეს საუკეთესო შემთხვევაში, მოდელის რეალური განზოგადების შესაძლებლობების მიახლოებაა. როდესაც მოდელები განმეორებით ფასდება ერთსა და იმავე საჯარო მონაცემთა ნაკრებებზე, ჩნდება სხვაობა მათ მოხსენებულ ქულებსა და ახალ, უცნობ მონაცემებზე მათ რეალურ მუშაობას შორის.
ამ გამოწვევების გადასაჭრელად, ჩვენ შევიმუშავეთ RTEB, ბენჩმარკი, რომელიც შექმნილია მოძიების მოდელების შეფასების საიმედო სტანდარტის უზრუნველსაყოფად. მიუხედავად იმისა, რომ შეფასების ძირითადი მეთოდოლოგია და მეტრიკა (როგორიცაა NDCG@10) კარგად არის ცნობილი და გამართული, არსებული ბენჩმარკების მთლიანობას ხშირად აფერხებს შემდეგი საკითხები:
**განზოგადების ხარვეზი.** ამჟამინდელი ბენჩმარკის ეკოსისტემა უნებლიედ ხელს უწყობს „ტესტისთვის სწავლას“. როდესაც სასწავლო მონაცემთა წყაროები ემთხვევა შეფასების მონაცემთა ნაკრებებს, მოდელის ქულა შეიძლება გაიზარდოს, რაც ძირს უთხრის ბენჩმარკის მთლიანობას. ეს პრაქტიკა, მიზანმიმართული იქნება თუ არა, აშკარაა რამდენიმე მოდელის სასწავლო მონაცემთა ნაკრებებში. ეს ქმნის უკუკავშირის მარყუჟს, სადაც მოდელები ჯილდოვდებიან სატესტო მონაცემების დამახსოვრებისთვის, ნაცვლად იმისა, რომ განავითარონ ძლიერი, განზოგადებადი შესაძლებლობები. ზემოაღნიშნულის გამო, მოდელები უფრო დაბალი „ნულოვანი დარტყმის“ (zero-shot) ქულით[1] შეიძლება ძალიან კარგად მუშაობდნენ ბენჩმარკზე, ახალ პრობლემებზე განზოგადების გარეშე. ამ მიზეზით, ხშირად რეკომენდებულია მოდელები ოდნავ დაბალი ბენჩმარკის შესრულებით და უფრო მაღალი „ნულოვანი დარტყმის“ ქულით.
**შეუსაბამობა დღევანდელ ხელოვნური ინტელექტის აპლიკაციებთან.** მრავალი ბენჩმარკი ცუდად არის მისადაგებული საწარმოო გამოყენების შემთხვევებთან, რომლებსაც დღეს დეველოპერები აშენებენ. ისინი ხშირად ეყრდნობიან აკადემიურ მონაცემთა ნაკრებებს ან მოძიების ამოცანებს, რომლებიც მიღებულია QA მონაცემთა ნაკრებებიდან, რაც, მართალია, თავისთავად სასარგებლოა, მაგრამ არ იყო შექმნილი მოძიების შესაფასებლად და შეიძლება ვერ აღბეჭდოს რეალურ სამყაროში მოძიების სცენარებში არსებული განაწილების მიკერძოებები და სირთულეები. ბენჩმარკები, რომლებსაც ეს პრობლემები არ აქვთ, ხშირად ზედმეტად ვიწროა, ფოკუსირებულია ერთ დომენზე, მაგალითად, კოდის მოძიებაზე, რაც მათ უვარგისს ხდის ზოგადი დანიშნულების მოდელების შესაფასებლად.
დღეს, მოხარულნი ვართ წარმოგიდგინოთ მოძიების ემბედინგის ბენჩმარკი (RTEB). მისი მიზანია შექმნას ახალი, საიმედო, მაღალი ხარისხის ბენჩმარკი, რომელიც ზომავს ემბედინგის მოდელების მოძიების ნამდვილ სიზუსტეს. ბენჩმარკის ზედმეტი მისადაგების (overfitting) წინააღმდეგ საბრძოლველად, RTEB ახორციელებს ჰიბრიდულ სტრატეგიას, რომელიც იყენებს როგორც ღია, ასევე კერძო მონაცემთა ნაკრებებს. ეს ჰიბრიდული მიდგომა ხელს უწყობს ფართო, ძლიერი განზოგადების მქონე მოდელების განვითარებას. მოდელი, რომელსაც ექნება შესრულების მნიშვნელოვანი ვარდნა ღია და კერძო მონაცემთა ნაკრებებს შორის, მიანიშნებს ზედმეტ მისადაგებაზე, რაც მკაფიო სიგნალი იქნება საზოგადოებისთვის. ეს უკვე აშკარაა ზოგიერთი მოდელის შემთხვევაში, რომლებიც RTEB-ის კერძო მონაცემთა ნაკრებებზე შესრულების შესამჩნევ ვარდნას აჩვენებენ.
RTEB შემუშავებულია საწარმოო გამოყენების შემთხვევებზე განსაკუთრებული აქცენტით. კომპლექსური იერარქიის ნაცვლად, ის იყენებს მარტივ ჯგუფებს სიცხადისთვის. ერთი მონაცემთა ნაკრები შეიძლება მიეკუთვნებოდეს მრავალ ჯგუფს (მაგ., გერმანული სამართლის მონაცემთა ნაკრები არსებობს როგორც „სამართლის“, ასევე „გერმანულ“ ჯგუფებში). მონაცემთა ნაკრებების სრული სია შეგიძლიათ იხილოთ ქვემოთ. ჩვენ ვგეგმავთ მუდმივად განვაახლოთ როგორც ღია, ასევე დახურული ნაწილი სხვადასხვა კატეგორიის მონაცემთა ნაკრებებით და აქტიურად წავახალისოთ საზოგადოების მონაწილეობა; გთხოვთ, გახსნათ საკითხი (issue) MTEB-ის საცავში GitHub-ზე, თუ გსურთ სხვა მონაცემთა ნაკრებების შეთავაზება.
RTEB დღეს ბეტა ვერსიით გამოვა. ჩვენ გვჯერა, რომ ძლიერი ბენჩმარკის შექმნა საზოგადოების ძალისხმევაა და ვგეგმავთ RTEB-ის განვითარებას დეველოპერებისა და მკვლევრების უკუკავშირის საფუძველზე. ჩვენ გირჩევთ გაგვიზიაროთ თქვენი აზრები, შემოგვთავაზოთ ახალი მონაცემთა ნაკრებები, იპოვოთ პრობლემები არსებულ მონაცემთა ნაკრებებში და დაგვეხმაროთ ყველასთვის უფრო საიმედო სტანდარტის შექმნაში. თავისუფლად შემოგვიერთდით დისკუსიაში ან გახსენით საკითხი (issue) MTEB-ის საცავში Github-ზე.
გაუმჯობესების სფეროების გამოსაკვეთად, გვსურს გამჭვირვალედ ვისაუბროთ RTEB-ის ამჟამინდელ შეზღუდვებსა და ჩვენს სამომავლო გეგმებზე. ჩვენი მიზანია, RTEB გახდეს საზოგადოების მიერ სანდო სტანდარტი მოძიების შეფასებისთვის. RTEB-ის ლიდერთა სია დღეს ხელმისაწვდომია Hugging Face-ზე, როგორც MTEB-ის ლიდერთა სიის ახალი მოძიების განყოფილების ნაწილი. გეპატიჟებით, შეამოწმოთ ის, შეაფასოთ თქვენი მოდელები და შემოგვიერთდეთ მთელი ხელოვნური ინტელექტის საზოგადოებისთვის უკეთესი, უფრო საიმედო ბენჩმარკის შექმნაში.
[1] „ნულოვანი დარტყმის“ (Zero-shot) ქულა არის შეფასების ნაკრების ის პროპორცია, რომელზეც მოდელის მიმწოდებელმა მკაფიოდ განაცხადა, რომ გაწვრთნა მოდელი. ეს, როგორც წესი, მოიცავს მხოლოდ საწვრთნელ ნაწილს. მეტი სტატია ჩვენი ბლოგიდან. საინტერესო ფაქტი: მხოლოდ ინგლისურენოვანი მოდელები, როგორც წესი, უარეს შედეგებს აჩვენებენ დახურულ მონაცემთა ნაკრებებზე, ხოლო მრავალენოვანი მოდელები უკეთესად მუშაობენ დახურულ მონაცემთა ნაკრებებზე. ხდება თუ არა ეს იმიტომ, რომ საბაზისო MTEB ბენჩმარკი მხოლოდ ინგლისურენოვანია, ხოლო RTEB მრავალენოვანია? ბუნებრივია, რომ მრავალენოვანი მოდელი...
თეგები:
#ხელოვნური ინტელექტი
#დეველოპმენტი
#მანქანური სწავლება
#hugging face
#rag
#rteb
#ბენჩმარკი
#მოდელების შეფასება
#ემბედინგი
#მოძიება
წყარო: huggingface.co
AI-ით გადამუშავებული