არაბულენოვანი დიდი ენობრივი მოდელების (LLM) მზარდმა ხელმისაწვდომობამ, როგორც მონოენოვანი, ისე მრავალენოვანი მოდელების სახით, საზოგადოებას უბიძგა შეექმნა არაბული ენისთვის განკუთვნილი ლიდერბორდები. მანამდე, არაბულზე ფოკუსირებული ლიდერბორდები, როგორც წესი, შემოიფარგლებოდა ვიწრო ბენჩმარკებით, რომლებიც კონკრეტული ავტორების მიერ იყო შექმნილი, ხშირად მათი ნაშრომების დემონსტრირების მიზნით. ამ შემთხვევებში, ავტორები აწყობდნენ ლიდერბორდებს იმის საჩვენებლად, თუ როგორ ასრულებდნენ მოდელები კონკრეტულ ამოცანას ან მონაცემთა ნაკრებს. ალტერნატიულად, სხვა ლიდერბორდები მომხმარებლებს მოითხოვდნენ შეფასებების საკუთარ გამოთვლით რესურსებზე ჩატარებას და შემდეგ შედეგების შემცველი JSON ფაილის წარდგენას გამოსაქვეყნებლად. მიუხედავად იმისა, რომ ამ მიდგომებმა ხელი შეუწყო არაბული ბენჩმარკინგის მიმართ საწყისი ინტერესის გაღვივებას, მათ ასევე შექმნეს რამდენიმე გამოწვევა. ეს შეზღუდვები ხაზს უსვამს უფრო ერთიანი, ხელმისაწვდომი და გამჭვირვალე ბენჩმარკინგის პლატფორმის საჭიროებას — ისეთის, რომელიც არა მხოლოდ შესაძლებელს გახდის, არამედ წაახალისებს ნამდვილ და რეპროდუცირებად ექსპერიმენტებს მთელი არაბული NLP საზოგადოებისთვის. ამ საკითხების გადასაჭრელად, 2024 წლის მაისში, 2A2I-მ, TII-მ და HuggingFace-მა გაუშვეს Open Arabic LLM Leaderboard - OALL [1]-ის პირველი ვერსია, რომელშიც წარმოდგენილია 14 ბენჩმარკი სხვადასხვა ამოცანისთვის, მათ შორის წაკითხულის გააზრება, სენტიმენტების ანალიზი და კითხვა-პასუხის რეჟიმი. 2024 წლის სექტემბერში, SDAIA-სა და King Salman Global Academy for Arabic Language-ს შორის თანამშრომლობით, დაინერგა Balsam Index, რომელიც მოიცავს დაახლოებით 1,400 მონაცემთა ნაკრებს 50,000 კითხვით და ფარავს 67 ამოცანას, როგორიცაა გრამატიკის კორექტირება, პერიფრაზირება, მიზეზ-შედეგობრივი კლასიფიკაცია და ტექსტის გააზრება. მოგვიანებით, იმავე წლის 5 დეკემბერს, Inception-მა და MBZUAI-მ გამოაცხადეს AraGen Leaderboard-ის შექმნა, რომელიც არაბული ენისთვის განკუთვნილი პირველი გენერაციული ამოცანების ლიდერბორდია. მან დანერგა 3C3H შეფასების მეტრიკა, რომელიც იყენებს დინამიურ შეფასების ციკლებს კერძო ტესტირებით, და უზრუნველყოფს მშობლიური არაბული და კულტურულად მგრძნობიარე გენერაციული ამოცანების მონაცემთა ნაკრებს, AraGen Bench-ს, რათა შეაფასოს LLM-ები ოთხ ძირითად ამოცანაში. წლის ძლიერი დასასრულისთვის, 2024 წლის 19 დეკემბერს, Scale-ის უსაფრთხოების, შეფასებისა და შესაბამისობის ლაბორატორიამ (SEAL) გამოაქვეყნა არაბული ლიდერბორდი, როგორც მათი მრავალენოვანი ლიდერბორდების ნაწილი. ამ ლიდერბორდის საფუძვლად მყოფი ბენჩმარკი ყოველთვის კერძო რჩება, ისევე როგორც სხვა ენები მათ ლიდერბორდების ოჯახში, და ეყრდნობა ადამიანის უპირატესობის შეფასებას, იყენებს რა 1,000 არაბული მოთხოვნისგან შემდგარ მონაცემთა ნაკრებს, რომელიც შექმნილია ჩატბოტების ინტერაქციის შესაძლებლობების გასაუმჯობესებლად რთულ და კულტურულად ნიუანსირებულ საუბრებში. გაშვებიდან 7 თვეზე ნაკლებ დროში, Open Arabic LLM Leaderboard-ის პირველი ვერსია სწრაფად იქცა სასიცოცხლოდ მნიშვნელოვან პლატფორმად არაბული AI საზოგადოებისთვის, რომელმაც გასულ თვეში (2025 წლის იანვარი) 46,000-ზე მეტი ვიზიტორი და 2,000-ზე მეტი შესვლა მიიზიდა. HuggingFace-ის სივრცემ 100-ზე მეტი მოწონება და Google Scholar-ზე 8 ციტირება დაიმსახურა. საზოგადოებამ წარადგინა 700-ზე მეტი მოდელი, 1 მილიარდიდან 70 მილიარდზე მეტ პარამეტრამდე დიაპაზონში. წარდგენილი მოდელები 180-ზე მეტი უნიკალური ორგანიზაციიდან მოდის, რაც მას ერთ-ერთ ყველაზე აქტიურ LLM შეფასების ლიდერბორდად აქცევს. გაშვების დღიდან, ლიდერბორდმა მრავალი საინტერესო დისკუსია გამოიწვია სოციალურ მედიაში, HuggingFace-სა და Reddit-ზე, რის გამოც ის დღემდე ყველაზე გამორჩეული არაბული ლიდერბორდია. როგორც სურათი 1-ზეა ნაჩვენები, ლიდერბორდის საწყის ვერსიაში წარდგენილი ~700 მოდელიდან უმრავლესობა (70%-ზე მეტი) არის ჩატის და დაზუსტებული მოდელები, ხოლო წინასწარ გაწვრთნილი მოდელები მხოლოდ 11%-ს შეადგენს. მოდელის ზომის თვალსაზრისით, მოდელების 50%-ზე მეტი 7 მილიარდ პარამეტრზე მცირეა. სხვა ენების ლიდერბორდებთან შედარებით, როგორც სურათი 2-ზეა ნაჩვენები, Open Arabic LLM Leaderboard გამოირჩევა, როგორც ერთ-ერთი ყველაზე აქტიური, უშუალოდ კორეული, პოლონური და პორტუგალიური ლიდერბორდების შემდეგ, ყველა ეს ლიდერბორდი გაშვებიდან ერთ წელზე ნაკლებ დროშია. იმის გათვალისწინებით, რომ არაბული ერთ-ერთი ყველაზე გავრცელებული ენაა მსოფლიოში, თუმცა ინტერნეტში შედარებით შეზღუდული კონტენტია ხელმისაწვდომი, ეს მაჩვენებლები კიდევ უფრო დიდ მნიშვნელობას იძენს სხვა ენებთან შედარებით. საზოგადოებაში ბოლო დროს გამართულმა დისკუსიებმა, მათ შორის Open Arabic LLM Leaderboard-ის (OALL) და მსგავსი ინიციატივების კრიტიკამ, გამოავლინა არსებული ბენჩმარკინგის პრაქტიკის ძირითადი ხარვეზები [2]. ბევრმა მკვლევარმა, დეველოპერმა და ენის ენთუზიასტმა ხაზი გაუსვა არაბული ენისთვის სპეციფიკური ამოცანების უფრო პირდაპირი შეფასების, ბენჩმარკების შექმნის პროცესში გამჭვირვალობის გაზრდის და უფრო მრავალფეროვანი მონაცემთა ნაკრებების ჩართვის აუცილებლობას, რომლებიც ასახავს არაბული დიალექტების, დომენებისა და რეალური სამყაროს პროგრამების ფართო სპექტრს. ამ მოსაზრებებმა ცენტრალური როლი ითამაშა განახლებული ლიდერბორდის ფორმირებაში. არაბული ენა წარმოადგენს უნიკალურ გამოწვევებს და მახასიათებლებს, რომლებიც საჭიროებს სპეციალიზებულ შეფასებას, რაც სცდება ზოგადი NLP ამოცანების შესაძლებლობებს. ეს მოიცავს რთულ გრამატიკას, მდიდარ და კომპლექსურ მორფოლოგიას, სალაპარაკო დიალექტების მრავალფეროვნებას და კულტურულად ნიუანსირებულ უსაფრთხოებასთან დაკავშირებულ მოსაზრებებს. ლიდერბორდი, რომელიც ითვალისწინებს ამ ფაქტორებს, შეუძლია უფრო ნათელი სურათი შექმნას იმის შესახებ, თუ რამდენად კარგად მუშაობენ მოდელები რეალურ არაბულენოვან კონტექსტებში.