ჩვენი მიმდინარე ძალისხმევის ფარგლებში, სიამოვნებით გაგიზიარებთ შემდეგ განახლებებს: შემდეგი სექციები დეტალურად აღწერს თითოეულ ამ განახლებას. Arabic-Leaderboards არის ყოვლისმომცველი და ერთიანი სივრცე არაბული ენის ყველა შეფასებისა და ამოცანისთვის. ის მიზნად ისახავს იყოს ცენტრალური კერა, რომელიც მოიცავს შეფასებების ფართო სპექტრს, მოდელებისთვის სხვადასხვა მოდალობის მასშტაბით. ამჟამად, ის მოიცავს AraGen-03-25-ს და Arabic Instruction Following-ს, როგორც აქტიურ ლიდერბორდებს. ჩვენ ვგეგმავთ ამ სივრცის გაფართოებას მეტი ლიდერბორდებითა და ამოცანებით არაბული AI მოდელებისთვის სხვადასხვა მოდალობის მასშტაბით. ჩვენ ვიწვევთ დაინტერესებულ კონტრიბუტორებს, დაგვიკავშირდნენ საზოგადოების ჩანართის ან პირდაპირი ელფოსტის საშუალებით, რათა განვიხილოთ, თუ როგორ მოხდება მათი ნამუშევრების/ლიდერბორდების ინტეგრირება დამატებით ჩანართებად ამ სივრცეში. 2024 წლის დეკემბერში ჩვენ წარმოვადგინეთ AraGen ეტალონი, როგორც AraGen ლიდერბორდის საფუძველი. ამ ლიდერბორდის ერთ-ერთი ძირითადი მახასიათებელია მისი დინამიური ბუნება, სადაც შეფასების მონაცემთა ნაკრებები სამი თვის განმავლობაში კონფიდენციალური (ბრმა ტესტირება) რჩება სამართლიანი და მიუკერძოებელი შეფასებების უზრუნველსაყოფად. იგივე ფილოსოფიის ერთგულებით, ჩვენ საჯაროდ ვაქვეყნებთ AraGen-12-24 ეტალონს, მოდელის ყველა პასუხთან ერთად, შეფასებულს Claude-3.5-Sonnet-ის მიერ 3C3H მითითებების შესაბამისად. ამ ეტალონისა და მოდელის პასუხების გაზიარებით, ჩვენი მიზანია საზოგადოებას მოვუწოდოთ, განიხილოს ისინი, გამოავლინოს ნებისმიერი მოულოდნელი ქცევა, რომელიც შესაძლოა გამოგვრჩა, და დაგვეხმაროს ჩვენი შეფასების ჩარჩოს დახვეწაში. AraGen-ის ამ უახლეს გამოცემაში, ჩვენ გავაფართოვეთ მონაცემთა ნაკრები, რათა მოიცავდეს 340 კითხვისა და პასუხის წყვილს, წინა ვერსიის 279-ის ნაცვლად. განაწილება შედარებით მსგავსი რჩება: ეს განაწილება ასახავს ძირითად აქცენტს კითხვა-პასუხზე, როგორც ნებისმიერი ენობრივი მოდელის/ჩატბოტის/AI-ასისტენტის მთავარ გამოყენების შემთხვევაზე, ამასთანავე, გათვალისწინებულია სხვა შეფასების სფეროებიც, განსაკუთრებით არაბული გრამატიკისა და ორთოგრაფიის სირთულის გათვალისწინებით რთული მოთხოვნების გენერირებისას. გარდა ამისა, ჩვენ დავხვეწეთ შემფასებელი სისტემის მოთხოვნა, რათა გაუმჯობესდეს სიცხადე, თუნდაც მცირე/სუსტი შემფასებელი მოდელებისთვის. თანმიმდევრულობისა და სანდოობის შენარჩუნება ჩვენს ეტალონსა და შეფასების მილსადენში გადამწყვეტია დინამიური შეფასების ციკლების დანერგვისას. ამის უზრუნველსაყოფად, ჩვენ გავაანალიზეთ რეიტინგის ცვალებადობა ტოპ 10 მოდელს შორის სხვადასხვა მონაცემთა ნაკრების ვერსიებსა და სისტემის მოთხოვნის კონფიგურაციებში. ჩვენ გავაანალიზეთ მოდელის შესრულება ორი შეფასების სცენარის პირობებში: საერთო რეიტინგები სტაბილური იყო, საუკეთესო მოდელი (o1-2024-12-17) მუდმივად ინარჩუნებდა ლიდერობას. აღსანიშნავია, რომ დავაკვირდით რეიტინგების გაცვლას ორ Claude მოდელს შორის, რაც ხაზს უსვამს ჩვენი შეფასების მიდგომის მგრძნობელობას, განსაკუთრებით მათი თავდაპირველი ახლო ქულების გათვალისწინებით. ერთადერთი მნიშვნელოვანი ცვლილება რეიტინგებში იყო gpt-4o-2024-08-06 მოდელისთვის, რომლის შესრულება საგრძნობლად გაუმჯობესდა განახლებული მონაცემთა ნაკრებისა და მოთხოვნის მეშვეობით. ეს მოულოდნელი ნახტომი ამჟამად შესწავლის პროცესშია, როგორც ჩვენი მიმდინარე ეტალონების დიზაინის კვლევის ნაწილი. სისტემის მოთხოვნაში ცვლილებების გამო არ მომხდარა მნიშვნელოვანი ვარიაციები, რაც მიუთითებს კარგ რეპროდუცირებადობაზე, სანამ გამოიყენება იგივე შემფასებელი მოდელი (claude-3.5-sonnet). თუმცა, ვარაუდობთ პოტენციურ ვარიაციებს მცირე ან სუსტ მოდელებთან, როგორც შემფასებლებთან, სადაც მეორე სისტემის მოთხოვნის (SP2) გამოყენებამ შეიძლება გააუმჯობესოს თანმიმდევრულობა. შეჯამების სახით, o1-2024-12-17-ის ძლიერი, მუდმივად მაღალი რანგის შესრულება – რომლის საუკეთესო ქულა 82.67%-დან 70.25%-მდე შემცირდა – აგრძელებს მის სანდოობას არაბული აპლიკაციებისთვის უფრო რთული განახლებული ეტალონის პირობებში. მიუხედავად იმისა, რომ შეფასების მილსადენის ბოლოდროინდელმა განახლებებმა მცირე ცვლილებები გამოიწვია რეიტინგებში, საერთო ჩარჩო სტაბილური დარჩა, ხოლო საუკეთესო და ყველაზე დაბალი შემსრულებლები თანმიმდევრულ პოზიციებს აჩვენებდნენ. მრავალი დაფიქსირებული რეიტინგის კორექტირება სავარაუდოდ ასახავს ტიპურ შეფასების შეცდომის ზღვრებს მცირე ქულების განსხვავებების გამო. აღსანიშნავია, რომ მეორედან მეხუთე ადგილზე გასული მოდელების ქულები, რომლებიც ადრე 70-78% შორის იყო, ახლა 51-57%-ს შორისაა. ეს ხაზს უსვამს იმას, რომ AraGen მონაცემთა განახლებული ნაკრები მნიშვნელოვნად უფრო რთულ ეტალონს წარმოადგენს, რაც შეესაბამება მსჯელობის მოდელებში მიმდინარე მიღწევებს. მიუხედავად აბსოლუტური ქულების ამ ცვლილებებისა, გამამხნევებელია, რომ ლიდერბორდის პოზიციები ძირითადად თანმიმდევრული დარჩა, რაც ხაზს უსვამს შეფასების მიდგომის სიმტკიცეს მომავალში. ცხრილი 1. AraGen-03-25 (SP1) რეიტინგები, ცხრილი 2. AraGen-03-25 (SP2) რეიტინგები, ცხრილი 3. AraGen-12-24 (SP1) რეიტინგები, ცხრილი 4. AraGen-03-25 (SP2) რეიტინგები. ჩვენი დეკემბრის გამოცემის ფარგლებში, წარმოვადგინეთ 3C3H, როგორც მოდელების ჩატის შესაძლებლობების შეფასების ახალი საზომი, რომლის მიზანია LLM-ების პასუხების როგორც ფაქტობრივი სიზუსტის, ისე გამოსადეგობის შეფასება. ბოლო სამი თვის განმავლობაში, ჩვენ დავაკვირდით საინტერესო აღმოჩენებს, რომლებსაც ამ სექციაში გაგიზიარებთ. ერთ-ერთი გამოკვეთილი ტენდენციაა ის, რომ სხვადასხვა განზომილებები თითქმის იდეალურად არის კორელაციაში. უმეტეს შემთხვევაში, სწორი პასუხები ფასდება როგორც მაღალეფექტური და უვნებელი, მაშინ როდესაც მოდელების უმეტესობა ვერ ინარჩუნებს ამ კორელაციას კონცენტრირებულობის განზომილებისთვის. ეს ზოგადად ასახავს იმას, თუ როგორ ვავარჯიშებთ ამ მოდელებს დღეს, სადაც უფრო ვრცელი პასუხები ხშირად უფრო სასარგებლოდ ითვლება. ამ ტენდენციამ ცოტა ხნის წინ მიიპყრო ყურადღება