Math-Verify-ის დანერგვა: ღია LLM ლიდერბორდის რეიტინგების გადაფასება უფრო სამართლიანი შედარებებისთვის
Hugging Face-ის ღია LLM ლიდერბორდმა მნიშვნელოვანი განახლება განიცადა Math-Verify ინსტრუმენტის დანერგვით. ამ ახალმა სისტემამ ხელახლა შეაფასა ყველა 3,751 წარმოდგენილი მოდელი, რამაც გამოასწორა მათემატიკური ამოცანების შეფასების კრიტიკული პრობლემები. შედეგად, ბევრი მოდელის, განსაკუთრებით Qwen-ისა და DeepSeek-ის, ქულები მნიშვნელოვნად გაუმჯობესდა, ხოლო MATH ქვეჯგუფის ტოპ 20 რეიტინგი სრულად გადალაგდა, სადაც Nvidia-ს AceMath მოდელები ახლა დომინირებენ. ეს უზრუნველყოფს მსხვილი ენობრივი მოდელების (LLM) უფრო
დღეს სიხარულით გაცნობებთ, რომ Math-Verify-ის გამოყენებით საფუძვლიანად გადავაფასეთ Open LLM ლიდერბორდზე ოდესმე წარმოდგენილი ყველა 3,751 მოდელი, რათა უზრუნველყოფილი იყოს კიდევ უფრო სამართლიანი და სანდო მოდელების შედარება! Open LLM ლიდერბორდი არის Hugging Face Hub-ზე ყველაზე ხშირად გამოყენებული ლიდერბორდი: ის ადარებს ღია დიდი ენობრივი მოდელების (LLM) მუშაობას სხვადასხვა ამოცანებში.
ერთ-ერთი ასეთი ამოცანა, სახელწოდებით MATH-Hard, კონკრეტულად მათემატიკურ პრობლემებს ეხება: ის აფასებს, თუ რამდენად კარგად წყვეტენ LLM-ები სკოლის და უნივერსიტეტის დონის მათემატიკურ ამოცანებს. ის იყენებს 1,324 უმაღლესი სირთულის (დონე 5) ამოცანას Hendrycks MATH მონაცემთა ნაკრებიდან, რომელიც მოიცავს 7 თემას (წინასწარი გამოთვლები, წინაალგებრა, ალგებრა, შუალედური ალგებრა, დათვლა/ალბათობა და რიცხვთა თეორია), 5-შოტიანი მიდგომის გამოყენებით (მოდელს ეძლევა 5 მაგალითი მოთხოვნაში, რათა აჩვენოს, როგორ უნდა უპასუხოს).
ტიპური შეკითხვა და პასუხი მოცემულია ქვემოთ. ლიდერბორდში მოდელებს მოეთხოვებოდათ პასუხების დასრულება ძალიან სპეციფიკური სტრიქონით (Minerva-Math ნაშრომის მიხედვით). შემდეგ ლიდერბორდი შეეცდებოდა მიღებული პასუხის SymPy-ის საშუალებით გაანალიზებას, რათა იგი სიმბოლურ წარმოდგენად გადაექცია (და საჭიროების შემთხვევაში გაემარტივებინა მნიშვნელობები), სანამ საბოლოოდ ოქროს სტანდარტთან შედარდებოდა.
თუმცა, მომხმარებლებმა ზემოაღნიშნულთან დაკავშირებით არაერთი პრობლემა დააფიქსირეს. პირველ რიგში, განმეორებადი პრობლემა იყო ზოგიერთი მოდელის უუნარობა, დაეცვა პასუხის მოსალოდნელი ფორმატი მაგალითებიდან: ისინი გამოსცემდნენ სხვა წინადადებებს პასუხების შესავალად. ვინაიდან ფორმატი არ იყო დაცული, პასუხები არასწორად აღინიშნებოდა, მაშინაც კი, თუ ისინი რეალურად სწორი იყო! (რაც პრობლემაა, თუ კონკრეტულად გაინტერესებთ „რამდენად კარგია მოდელი მათემატიკაში“). შემდეგი ნაბიჯი, პასუხის სიმბოლურ წარმოდგენად გადაქცევა, ასევე ქმნიდა პრობლემებს, ამჯერად SymPy-ის გაანალიზებასთან დაკავშირებით. საბოლოო ეტაპზე, ამოღებული პასუხის სამიზნე გამოსახულებასთან შედარებისას, ასევე დაფიქსირდა არაერთი პრობლემა.
ყველა ეს პრობლემა ახლა მთლიანად გამოსწორებულია ახალი Math-Verify პარსერით! ვინაიდან ეს პრობლემები გროვდებოდა, ზოგიერთმა მოდელმა ამის გამო მნიშვნელოვნად დაზარალდა, მათი მუშაობა ძლიერად იყო შეუფასებელი… ამიტომ ჩვენ წინა შემფასებელი Math-Verify-ით ჩავანაცვლეთ, რაც მხოლოდ 3 ხაზის კოდის შეცვლას ნიშნავდა! (თქვენც შეგიძლიათ სცადოთ თქვენს მათემატიკურ შეფასებებში!)
ეს, შესაბამისად, ნიშნავდა ივნისის შემდეგ წარმოდგენილი ყველა მოდელის ხელახლა შეფასებას… და სრულად შეცვალა ლიდერბორდის MATH ქვეჯგუფის ტოპ 20 მოდელი. საშუალოდ, მოდელებმა მთლიანობაში 61-ით მეტი ამოცანა გადაჭრეს, რაც 4.66 ქულით ზრდას უდრის! ყველაზე მნიშვნელოვანი გაუმჯობესება ალგებრასთან დაკავშირებულ ორ ქვეჯგუფში (ალგებრა და წინაალგებრა) დაფიქსირდა, შესაბამისად 8.27 და 6.93 ქულით ზრდით. ექსტრემალურ შემთხვევებში, ზოგიერთმა მოდელმა ამ ქვეჯგუფებში თითქმის 90 ქულით გაუმჯობესება აჩვენა.
ჩვენი აზრით, ამ ქვეჯგუფებში ყველაზე დიდი გაუმჯობესება იმიტომ მოხდა, რომ ისინი ხშირად მოიცავს პასუხებს, რომლებიც წარმოდგენილია როგორც სიმრავლეები (მრავალჯერადი ამონახსნის მქონე კითხვების გამო) და მატრიცები. Math-Verify-მ გააუმჯობესა ამ ორივე ტიპის პასუხების დამუშავება, რამაც ხელი შეუწყო ამ მნიშვნელოვან მიღწევებს.
თავდაპირველად მათემატიკური შეფასების პრობლემები Qwen მოდელების შემოწმებისას აღმოვაჩინეთ, რომლებსაც თვითშეტყობინებულ შესრულებასთან შედარებით უჩვეულოდ დაბალი ქულები ჰქონდათ. Math-Verify-ის დანერგვის შემდეგ, ამ მოდელების ქულები ორჯერ მეტად გაიზარდა, რაც მათი მუშაობის წინა სერიოზულ შეუფასებლობას მოწმობს. მაგრამ Qwen მოდელები მარტო არ არიან. კიდევ ერთი ძირითადი ოჯახი, რომელზეც ეს ცვლილება აისახა, არის DeepSeek. Math-Verify-ზე გადასვლის შემდეგ, DeepSeek მოდელებმა თითქმის სამჯერ გაზარდეს თავიანთი ქულები! ეს იმიტომ მოხდა, რომ მათი პასუხები, როგორც წესი, \boxed{} ნიშნებში იყო მოქცეული, რასაც ძველი შემფასებელი ვერ ახერხებდა ამოღებას.
როგორც დასაწყისში აღინიშნა, ტოპ 20 რეიტინგში მნიშვნელოვანი ცვლილებები მოხდა, სადაც Nvidia-ს AceMath მოდელები ახლა MATH-Hard ლიდერბორდზე დომინირებენ.
ამ ცვლილების სხვა ძირითადი ბენეფიციარები არიან Qwen-ის წარმოებულები, რომლებიც ახლა თითქმის ექსკლუზიურად ერთადერთი მოდელები არიან, რომლებიც AceMath-ის ქვემოთ არიან რეიტინგში.
ქვემოთ მოცემულია სრული ცხრილი, რომელიც ადარებს ლიდერბორდის ძველ და ახალ ტოპ 20 რეიტინგებს:
დაბოლოს, ჩვენ შევისწავლეთ, თუ როგორ განვითარდა ლიდერბორდის საერთო შედეგები. მიუხედავად იმისა, რომ პირველი ოთხი პოზიცია უცვლელი დარჩა, დანარჩენებმა მნიშვნელოვანი ცვლილებები განიცადეს. MATH ქვეჯგუფში Qwen-ის მრავალი წარმოებულის ზრდის გამო, Qwen მოდელების არსებობა ტოპ 20-ში კიდევ უფრო გაიზარდა საერთო შედეგებში.
ბევრმა სხვა მოდელმა ასევე მთლიანად გააუმჯობესა თავისი ადგილი რეიტინგში, 200 ან მეტი პოზიციით! შედეგების უფრო დეტალურად ნახვა შეგიძლიათ Open LLM ლიდერბორდზე. Math-Verify-ის დანერგვამ მნიშვნელოვნად გააუმჯობესა ჩვენი შეფასებების სიზუსტე და სამართლიანობა Open LLM ლიდერბორდზე. ამან გამოიწვია ლიდერბორდის გადალაგება, სადაც ბევრმა მოდელმა აჩვენა მნიშვნელოვანი გაუმჯობესება თავიანთ ქულებში. ჩვენ მოვუწოდებთ ყველა დეველოპერსა და მკვლევარს, მიიღონ Math-Verify საკუთარი მათემატიკური შეფასებებისთვის. ამით თქვენ უზრუნველყოფთ, რომ თქვენი მოდელები შეფასდება უფრო სანდო შედეგებით. გარდა ამისა, გიწვევთ გაეცნოთ განახლებულ რეიტინგებს.
თეგები:
#ხელოვნური ინტელექტი
#llm
#მონაცემები
#მათემატიკა
#hugging face
#ლიდერბორდი
#მოდელები
#შეფასება
#qwen
#deepseek
#math-verify
#acemath
#ალგებრა
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი