AraGen-ის ლიდერბორდი: ინოვაციური ჩარჩო დიდი ენობრივი მოდელების ყოვლისმომცველი შეფასებისთვის
AraGen-ის ლიდერბორდი წარმოადგენს ახალ, ინოვაციურ ჩარჩოს დიდი ენობრივი მოდელების (დემ) შესაფასებლად. ის გვთავაზობს 3C3H საზომს, რომელიც აფასებს მოდელის პასუხებს ექვს განზომილებაში (სისწორე, სრულყოფილება, ლაკონურობა, გამოსადეგობა, პატიოსნება და უვნებლობა) დემ-მოსამართლის პრინციპზე დაყრდნობით, ფაქტობრივი სიზუსტისა და გამოყენებადობის გათვალისწინებით. სისტემა მოიცავს დინამიურ შეფასებებს ბრმა ტესტირების ციკლებით მონაცემთა დაბინძურების თავიდან ასაცილებლად. AraGen განსაკუთრებულ აქცენტს აკეთებს არაბული ე
AraGen-ის ლიდერბორდს სამი ძირითადი წვლილი შეაქვს: **3C3H საზომი:** 3C3H საზომი აფასებს მოდელის პასუხს და ამ ჩარჩოს ცენტრალური ნაწილია. ეს არის ჰოლისტიკური მიდგომა, რომელიც აფასებს მოდელის პასუხებს მრავალი განზომილების მიხედვით – სისწორე, სრულყოფილება, ლაკონურობა, გამოსადეგობა, პატიოსნება და უვნებლობა – დემ-მოსამართლის პრინციპზე დაყრდნობით. **დინამიური შეფასებები:** AraGen-ის ლიდერბორდი ახორციელებს დინამიური შეფასების სტრატეგიას, რომელიც მოიცავს სამთვიან ბრმა ტესტირების ციკლებს. ამ ციკლების განმავლობაში, მონაცემთა ნაკრები და შეფასების კოდი კონფიდენციალური რჩება საჯაროდ გამოქვეყნებამდე ციკლის ბოლოს, რის შემდეგაც ისინი იცვლება ახალი, კერძო ბენჩმარკით. **არაბული შეფასების მონაცემთა ნაკრები:** AraGen-ის ბენჩმარკი გთავაზობთ არაბული დიდი ენობრივი მოდელების (დემ) შესაფასებლად ზედმიწევნით აგებულ შეფასების მონაცემთა ნაკრებს, რომელიც აერთიანებს მრავალ და ერთჯერად სცენარებს და ამოწმებს მოდელის შესაძლებლობებს მრავალ დომენსა და ამოცანაში. ჩვენ გვჯერა, რომ AraGen თავისი დინამიური შეფასების მიდგომით წყვეტს მონაცემთა დაბინძურების მუდმივ პრობლემებს, რითაც ინარჩუნებს ბენჩმარკის მთლიანობას. ის ასევე წარმოადგენს მასშტაბირებადი, ენისგან დამოუკიდებელი ჩარჩოს პირველ გამოყენებას დახვეწილი და სამართლიანი მოდელის შეფასებისთვის, რაც მნიშვნელოვან ძალისხმევას წარმოადგენს დემ-ის მუშაობის გასაგებად მრავალფეროვან ლინგვისტურ კონტექსტებში და ახალ სტანდარტს ამკვიდრებს მოდელების ყოვლისმომცველი ბენჩმარკინგისთვის.
დიდი ენობრივი მოდელების (დემ) შეფასება ხელოვნური ინტელექტის კვლევაში ერთ-ერთი მთავარი გამოწვევაა. მიუხედავად იმისა, რომ არსებულმა მეთოდოლოგიებმა გააუმჯობესა ჩვენი გაგება დემ-ის შესაძლებლობების შესახებ, ისინი ხშირად ვერ ახერგებენ ყოვლისმომცველად მოიცვან როგორც ფაქტობრივი სიზუსტე – მოდელის ძირითადი ცოდნის შეფასება – ისე გამოყენებადობა – მისი შესაბამისობა ადამიანის (საბოლოო მომხმარებლის) მოლოდინებთან. შეფასების ამჟამინდელი მიდგომები შეიძლება ფართოდ დაიყოს ცოდნაზე ან ფაქტობრივ სიზუსტეზე დაფუძნებულ ბენჩმარკებად და პრეფერენციებზე დაფუძნებულ ბენჩმარკებად. ავტომატური ბენჩმარკები ფოკუსირებულია ფუნდამენტური ცოდნისა და ფაქტობრივი სისწორის შეფასებაზე. მაგალითად, Hugging Face-ის Open LLM Leaderboard-ის მსგავსი ინიციატივები აფასებს მოცემული მოთხოვნის (კითხვის) არჩევანის ალბათობას და ადარებს ყველაზე სავარაუდო გამოსავალს „ოქროს სტანდარტის“ საცნობარო არჩევანს. მიუხედავად იმისა, რომ ეფექტურია ძირითადი ცოდნის შესამოწმებლად, ეს ბენჩმარკები შეზღუდულ ინფორმაციას იძლევა იმის შესახებ, თუ როგორ მუშაობენ მოდელები პრაქტიკულ, მომხმარებლისთვის განკუთვნილ კონტექსტებში, რის შედეგადაც გამოყენებადობის კრიტიკული ასპექტები გადაუჭრელი რჩება.
ამის საპირისპიროდ, პრეფერენციებზე დაფუძნებული ბენჩმარკები მიზნად ისახავს მომხმარებლის პრეფერენციებთან შესაბამისობის დადგენას. მაგალითები მოიცავს LMSYS-ის Chatbot Arena-ს და AtlaAI-ის Judge Arena-ს, რომლებიც ძირითადად ეყრდნობიან გამოსავლების სუბიექტურ შეფასებებს სტილის, ტონისა და საერთო სარგებლიანობის მიხედვით. თუმცა, ამ მიდგომებმა შეიძლება რისკის ქვეშ დააყენოს სტილისტური შესაბამისობის პრიორიტეტი ფაქტობრივ სიზუსტეზე, რამაც შესაძლოა შეფასებები სტილისტურად სასურველი, მაგრამ ნაკლებად ზუსტი პასუხებისკენ გადახაროს. გარდა ამისა, ხალხმრავალ არენებს შეუძლიათ ასახონ მათი ანოტატორების მიკერძოება, რომლებსაც შესაძლოა არ ჰქონდეთ მკაფიო ხმის მიცემის მითითებები, რაც კიდევ უფრო აისახება შეფასებების თანმიმდევრულობასა და სანდოობაზე.
ამ შეზღუდვების მოსაგვარებლად, ჩვენ ვთავაზობთ შეფასების ახალ საზომს, რომელიც მიზნად ისახავს ორივე მიდგომის გაერთიანებას, რაც ენობრივი მოდელების შესაფასებლად ყოვლისმომცველ მექანიზმს გვთავაზობს. ის აფასებს მოდელის გამოსავლის ორ ძირითად ასპექტს: ეს ხდება დემ-მოსამართლის პრინციპზე დაფუძნებული ახალი შეფასების საზომის დანერგვით (იხილეთ აქ ამ მიდგომის შესახებ დამატებითი ინფორმაციისთვის), რომელიც აფასებს მოდელის მუშაობას ექვსი განზომილების მიხედვით, რომლებიც ასახავს ფაქტობრივ სიზუსტესა და გამოყენებადობას. დაბალანსებული პერსპექტივის მიღებით, ჩვენ უზრუნველვყოფთ, რომ გამოყენებადობა არ მოდის ფაქტობრივი სიზუსტის ხარჯზე და პირიქით. AraGen-ის ლიდერბორდი აფასებს როგორც ღია, ისე საკუთრების მოდელებს, რომლებიც შეფასებულია AraGen-ის ბენჩმარკზე ახალი 3C3H საზომის გამოყენებით, რომელსაც ქვემოთ წარმოგიდგენთ. 3C3H უზრუნველყოფს ყოვლისმომცველ ჩარჩოს დიდი ენობრივი მოდელების როგორც ფაქტობრივი სიზუსტის, ისე გამოყენებადობის შესაფასებლად. არაბული ენა შეირჩა ამ ჩარჩოს პირველ აპლიკაციად, რაც შეესაბამება Inception-ის მისიას, რომ მოახდინოს ხელოვნური ინტელექტის დემოკრატიზაცია არაბული და ზოგადად გლობალური სამხრეთისთვის, ამასთან ერთად გადაჭრის რა ამ ენებისა და რეგიონებისთვის ძლიერი გენერაციული ბენჩმარკების ნაკლებობის პრობლემას. ვიმედოვნებთ, რომ ამ ნამუშევრის გაფართოებას მრავალ სხვა ენაზეც ვიხილავთ.
ლიდერბორდი დინამიურია; შეფასების მონაცემთა ნაკრები კონფიდენციალური (ბრმა ტესტირება) რჩება სამი თვის განმავლობაში, რათა უზრუნველყოფილი იყოს სამართლიანი და მიუკერძოებელი შეფასებები. ამ პერიოდის შემდეგ, მონაცემთა ნაკრები და შესაბამისი შეფასების კოდი საჯაროდ გამოქვეყნდება, რაც დაემთხვევა ახალი მონაცემთა ნაკრების დანერგვას შეფასების შემდეგი ციკლისთვის, რომელიც თავის მხრივ სამი თვის განმავლობაში კონფიდენციალური დარჩება. ეს იტერაციული პროცესი უზრუნველყოფს, რომ შეფასებები აქტუალური რჩება და მოდელები მუდმივად ტესტირდება ახალ, უცნობ მონაცემებზე. ჩვენ გვჯერა, რომ ეს დინამიური მიდგომა სასარგებლოც არის და მტკიცეც, რადგან ის ამცირებს მონაცემთა გაჟონვას, ხელს უწყობს მოდელის მუდმივ გაუმჯობესებას და ინარჩუნებს ბენჩმარკის აქტუალობას დემ-ის განვითარების სწრაფად ცვალებად ლანდშაფტში. AraGen-ის შეფასების მიმართულება მიზნად ისახავს მტკიცე, რეპროდუცირებადი და მასშტაბირებადი შეფასებების უზრუნველყოფას. პროცესი მოიცავს შემდეგ ნაბიჯებს: ჩვენი მთავარი წვლილი, 3C3H საზომი, აფასებს მოდელის მუშაობას ექვსი განზომილების მიხედვით, დემ-მოსამართლის გამოყენებით.
თეგები:
#ai
#ტექნოლოგიები
#ხელოვნური ინტელექტი
#llm
#დიდი ენობრივი მოდელები
#ლიდერბორდი
#ბენჩმარკინგი
#არაბული ენა
#შეფასება
#aragen
#3c3h
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი