🥇 ლიდერბორდი წარმოადგენს ყოვლისმომცველ ხედვას საუკეთესო ტექსტური ემბედინგის მოდელებზე, რომლებიც ხელმისაწვდომია მრავალფეროვან ამოცანებზე. 📝 თანდართული ნაშრომი გვაწვდის ინფორმაციას MTEB-ში არსებული ამოცანებისა და მონაცემთა ნაკრებების შესახებ და აანალიზებს ლიდერბორდის შედეგებს! 💻 GitHub-ის საცავი შეიცავს კოდს ნებისმიერი მოდელის ბენჩმარკინგისა და ლიდერბორდზე წარდგენისთვის. ტექსტური ემბედინგები არის ტექსტის ვექტორული წარმოდგენები, რომლებიც კოდირებს სემანტიკურ ინფორმაციას. რადგანაც მანქანებს გამოთვლების შესასრულებლად სჭირდებათ რიცხვითი მონაცემები, ტექსტური ემბედინგები მრავალი ბუნებრივი ენის დამუშავების (NLP) შემდგომი აპლიკაციის გადამწყვეტი კომპონენტია. მაგალითად, Google იყენებს ტექსტურ ემბედინგებს თავისი საძიებო სისტემის გასაძლიერებლად. ტექსტური ემბედინგები ასევე შეიძლება გამოყენებულ იქნას ტექსტის დიდ მასივებში შაბლონების მოსაძებნად კლასტერული დაჯგუფების მეშვეობით, ან ტექსტის კლასიფიკაციის მოდელებისთვის შესატან მონაცემებად, როგორც ეს ჩვენს ბოლო SetFit-ის ნაშრომშია. თუმცა, ტექსტური ემბედინგების ხარისხი დიდად არის დამოკიდებული გამოყენებულ ემბედინგის მოდელზე. MTEB შექმნილია იმისათვის, რომ დაგეხმაროთ იპოვოთ საუკეთესო ემბედინგის მოდელი მრავალფეროვანი ამოცანებისთვის! 🐋 **მასიური:** MTEB მოიცავს 56 მონაცემთა ნაკრებს 8 ამოცანაში და ამჟამად აჯამებს >2000 შედეგს ლიდერბორდზე. 🌎 **მრავალენოვანი:** MTEB შეიცავს 112-მდე სხვადასხვა ენას! ჩვენ შევაფასეთ რამდენიმე მრავალენოვანი მოდელი Bitext Mining-ის, კლასიფიკაციისა და STS-ის ამოცანებზე. 🦚 **გაფართოებადი:** იქნება ეს ახალი ამოცანები, მონაცემთა ნაკრებები, მეტრული მაჩვენებლები თუ ლიდერბორდის დამატებები, ნებისმიერი წვლილი მისასალმებელია. ეწვიეთ GitHub-ის საცავს, რათა შედეგები ლიდერბორდზე წარადგინოთ ან არსებული პრობლემები გადაჭრათ. ვიმედოვნებთ, შემოგვიერთდებით საუკეთესო ტექსტური ემბედინგის მოდელის პოვნის ამ გზაზე! MTEB-ში არსებული ამოცანებისა და მონაცემთა ნაკრებების მიმოხილვა. მრავალენოვანი მონაცემთა ნაკრებები აღნიშნულია იასამნისფერი შეფერილობით. MTEB-ის საწყისი შეფასებისთვის, ჩვენ ფოკუსირებული ვიყავით მოდელებზე, რომლებიც აცხადებდნენ ხელოვნების უახლეს მიღწევებს და პოპულარულ მოდელებზე Hub-ზე. ამან განაპირობა ტრანსფორმერების მაღალი წარმომადგენლობა. 🤖 მოდელები საშუალო ინგლისური MTEB ქულის (y) მიხედვით, სიჩქარის (x) და ემბედინგის ზომის (წრის ზომა) მიხედვით. ჩვენ დავაჯგუფეთ მოდელები შემდეგი სამი ატრიბუტის მიხედვით, რათა გაგვემარტივებინა საუკეთესო მოდელის პოვნა თქვენი ამოცანისთვის: 🏎 **მაქსიმალური სიჩქარე:** Glove-ის მსგავსი მოდელები გვთავაზობენ მაღალ სიჩქარეს, მაგრამ განიცდიან კონტექსტის აღქმის ნაკლებობას, რაც იწვევს დაბალ საშუალო MTEB ქულებს. ⚖️ **სიჩქარე და შესრულება:** ოდნავ ნელი, მაგრამ მნიშვნელოვნად ძლიერი, all-mpnet-base-v2 ან all-MiniLM-L6-v2 უზრუნველყოფს კარგ ბალანსს სიჩქარესა და შესრულებას შორის. 💪 **მაქსიმალური შესრულება:** მრავალმილიარდიანი პარამეტრის მოდელები, როგორიცაა ST5-XXL, GTR-XXL ან SGPT-5.8B-msmarco, დომინირებენ MTEB-ზე. ისინი, როგორც წესი, აწარმოებენ უფრო დიდ ემბედინგებსაც, მაგალითად SGPT-5.8B-msmarco, რომელიც წარმოქმნის 4096-განზომილებიან ემბედინგებს, რაც მეტ მეხსიერებას მოითხოვს! მოდელის შესრულება დიდად განსხვავდება ამოცანისა და მონაცემთა ნაკრების მიხედვით, ამიტომ გირჩევთ, შეამოწმოთ ლიდერბორდის სხვადასხვა ჩანართი, სანამ გადაწყვეტთ რომელი მოდელი გამოიყენოთ! MTEB ბიბლიოთეკის გამოყენებით, შეგიძლიათ შეაფასოთ ნებისმიერი მოდელი, რომელიც აწარმოებს ემბედინგებს და დაამატოთ მისი შედეგები საჯარო ლიდერბორდს. მოდით, სწრაფად განვიხილოთ მაგალითი! პირველ რიგში, დააინსტალირეთ ბიბლიოთეკა: შემდეგ, შეაფასეთ მოდელი მონაცემთა ნაკრებზე, მაგალითად, komninos word embeddings Banking77-ზე. ამან უნდა წარმოქმნას results/average_word_embeddings_komninos/Banking77Classification.json ფაილი! ახლა შეგიძლიათ წარადგინოთ შედეგები ლიდერბორდზე, Hub-ზე არსებული ნებისმიერი მოდელის README.md-ის მეტამონაცემებში დამატებით. გაუშვით ჩვენი ავტომატური სკრიპტი მეტამონაცემების გენერირებისთვის: მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის