LLaMA-ს MMLU შეფასება: უთანხმოება ხელოვნური ინტელექტის მოდელების რეიტინგში
Open LLM ლიდერბორდზე LLaMA მოდელის MMLU (Massive Multitask Language Understanding) შეფასების ქულები გაცილებით დაბალი აღმოჩნდა, ვიდრე მის გამოქვეყნებულ ნაშრომში იყო მითითებული. ამან საზოგადოებაში გაკვირვება გამოიწვია. გამოძიებამ გამოავლინა MMLU შეფასების სხვადასხვა იმპლემენტაცია, მათ შორის EleutherAI Harness, ორიგინალი UC Berkeley-ის კოდი და Stanford HELM, რომლებიც განსხვავებულ შედეგებს იძლევა და მოდელების რეიტინგსაც კი ცვლის. სტატია დეტალურად განმარტავს ამ შეუსაბამობის მიზეზებს და დიდი ენობრივი
დისკუსია ლიდერბორდზე წარმოდგენილი ოთხი შეფასებიდან ერთის, კერძოდ, Massive Multitask Language Understanding-ის (შემოკლებით MMLU) ბენჩმარკის, ირგვლივ ტრიალებდა. საზოგადოება გააკვირვა იმ ფაქტმა, რომ ლიდერბორდის ამჟამინდელი ტოპ მოდელის, LLaMA-ს (🦙) MMLU შეფასების ციფრები მნიშვნელოვნად დაბალი იყო LLaMa-ს გამოქვეყნებულ ნაშრომში მითითებულ ციფრებთან შედარებით. ამიტომ გადავწყვიტეთ, ღრმად ჩავძირულიყავით ამ საკითხში, რათა გაგვეგო, რა ხდებოდა და როგორ უნდა მოგვარებულიყო პრობლემა.
ჩვენი ძიებისას, გვქონდა დისკუსიები როგორც ბრწყინვალე ხავიერ-მ-თან (@javier-m), რომელიც LLaMA-ს შეფასებებზე თანამშრომლობდა, ასევე ფალკონის გუნდის საოცარ სლიპი-ლოლო-სთან (@slippylolo). აღსანიშნავია, რომ ქვემოთ მოცემული ყველა შეცდომა, რა თქმა უნდა, ჩვენ უნდა მივაწეროთ და არა მათ! ამ მოგზაურობისას თქვენ ბევრს გაიგებთ იმის შესახებ, თუ როგორ უნდა შეაფასოთ მოდელი ერთი შეფასების საფუძველზე და რამდენად უნდა ენდოთ ონლაინ და სამეცნიერო ნაშრომებში მოცემულ ციფრებს. მზად ხართ? მაშინ შეიკარით უსაფრთხოების ღვედები, ვიწყებთ!
უპირველეს ყოვლისა, აღსანიშნავია, რომ Open LLM ლიდერბორდი რეალურად წარმოადგენს მხოლოდ "შემოხვევას" (wrapper), რომელიც აწარმოებს ღია კოდის ბენჩმარკინგის ბიბლიოთეკას Eleuther AI LM Evaluation Harness-ს. ეს უკანასკნელი შექმნილია EleutherAI-ის არაკომერციული ხელოვნური ინტელექტის კვლევითი ლაბორატორიის მიერ, რომელიც ცნობილია The Pile-ის შექმნით და GPT-J-ის, GPT-Neo-X 20B-ის და Pythia-ს წვრთნით. ეს არის გუნდი სერიოზული გამოცდილებით AI სივრცეში! ეს "შემოხვევა" შეფასებებს აწარმოებს Eleuther AI Harness-ის გამოყენებით Hugging Face-ის გამოთვლითი კლასტერის თავისუფალ ციკლებზე და შედეგებს ინახავს ჰაბზე არსებულ მონაცემთა ბაზაში, რომელიც შემდეგ ნაჩვენებია ლიდერბორდის ონლაინ სივრცეში.
LLaMA მოდელებისთვის, Eleuther AI LM Evaluation Harness-ით მიღებული MMLU ციფრები მნიშვნელოვნად განსხვავდება LLaMa-ს ნაშრომში მოხსენებული MMLU ციფრებისგან. რატომ ხდება ასე? როგორც აღმოჩნდა, LLaMA-ს გუნდმა ადაპტირება მოახდინა ონლაინ ხელმისაწვდომი სხვა კოდის იმპლემენტაციის: შეფასების კოდის, რომელიც შემოთავაზებულია ორიგინალი UC Berkeley-ის გუნდის მიერ, რომელმაც შექმნა MMLU ბენჩმარკი (ხელმისაწვდომია https://github.com/hendrycks/test-ზე) და რომელსაც აქ "ორიგინალ იმპლემენტაციას" ვუწოდებთ.
კვლევის გაღრმავებისას, ვიპოვეთ კიდევ ერთი საინტერესო იმპლემენტაცია იმავე MMLU მონაცემთა ბაზაზე შეფასებისთვის: შეფასების კოდი, რომელიც მოწოდებულია Stanford-ის CRFM-ის ძალიან ყოვლისმომცველი შეფასების ბენჩმარკში Holistic Evaluation of Language Models, რომელსაც აქ HELM იმპლემენტაციას ვუწოდებთ. როგორც EleutherAI Harness, ასევე Stanford HELM ბენჩმარკები საინტერესოა, რადგან ისინი ბევრ შეფასებას აერთიანებენ ერთიან კოდის ბაზაში (მათ შორის MMLU-ს), რითაც მოდელის მუშაობის ფართო ხედვას გვთავაზობენ. სწორედ ამიტომ Open LLM ლიდერბორდი იყენებს ასეთ „ჰოლისტიკურ“ ბენჩმარკებს, ნაცვლად იმისა, რომ თითოეული შეფასებისთვის ინდივიდუალური კოდის ბაზები გამოიყენოს.
სიტუაციის გასარკვევად, გადავწყვიტეთ, რომ იგივე MMLU შეფასების ეს სამი შესაძლო იმპლემენტაცია გაგვეშვა მოდელების ერთობლიობაზე, რათა მათი რეიტინგი ამ შედეგების მიხედვით განგვესაზღვრა: (აღსანიშნავია, რომ Harness-ის იმპლემენტაცია ცოტა ხნის წინ განახლდა - მეტი ამის შესახებ ჩვენი პოსტის ბოლოს). შედეგები გასაოცარია: სრული შეფასების ციფრები შეგიძლიათ იხილოთ პოსტის ბოლოს. ერთი და იმავე ბენჩმარკის ეს განსხვავებული იმპლემენტაციები იძლევა მკვეთრად განსხვავებულ ციფრებს და ლიდერბორდზე მოდელების რეიტინგის რიგითობასაც კი ცვლის!
შევეცადოთ გავარკვიოთ, საიდან მოდის ეს შეუსაბამობა. მაგრამ ჯერ მოკლედ განვიხილოთ, თუ როგორ შეგვიძლია ავტომატურად შევაფასოთ ქცევები თანამედროვე დიდ ენობრივ მოდელებში (LLMs). MMLU არის მრავალჯერადი არჩევანის კითხვებზე დაფუძნებული ტესტი, ამიტომ შედარებით მარტივი ბენჩმარკია (ღია კითხვებთან შედარებით), მაგრამ, როგორც დავინახავთ, ის მაინც დიდ ადგილს ტოვებს იმპლემენტაციის დეტალებისა და განსხვავებებისთვის.
ბენჩმარკი შედგება კითხვებისგან ოთხი შესაძლო პასუხით, რომელიც მოიცავს 57 ზოგადი ცოდნის დომენს, დაჯგუფებულს ფართო კატეგორიებად: „ჰუმანიტარული მეცნიერებები“, „სოციალური მეცნიერებები“, „STEM“ და ა.შ. თითოეული კითხვისთვის მხოლოდ ერთი მოცემული პასუხია სწორი. აქ მოცემულია მაგალითი: შენიშვნა: ამ მონაცემთა ნაკრების მეტის შესწავლა შეგიძლიათ მარტივად ჰაბზე არსებულ მონაცემთა ნაკრების დამთვალიერებელში.
დიდი ენობრივი მოდელები ხელოვნური ინტელექტის მოდელების ზოოპარკში შედარებით მარტივი მოდელებია. ისინი იღებენ ტექსტური სტრიქონის შეტანას (ე.წ. „პრომპტი“), რომელიც იჭრება ტოკენებად (სიტყვები, ქვესიტყვები ან სიმბოლოები, იმის მიხედვით, თუ როგორ არის აგებული მოდელი) და გადაეცემა მოდელს. ამ შეტანიდან გამომდინარე, ისინი წარმოქმნიან ალბათობის განაწილებას შემდეგი ტოკენისთვის, ყველა იმ ტოკენზე, რომელიც მათ იციან (ე.წ. მოდელის „ლექსიკონი“): ამგვარად, შეგიძლიათ გაიგოთ, რამდენად „სავარაუდოა“ ნებისმიერი ტოკენი, როგორც შეტანილი პრომპტის გაგრძელება. ამ ალბათობების გამოყენება შეგვიძლია ტოკენის ასარჩევად, მაგალითად, ყველაზე სავარაუდოს (ან შეგვიძლია შევიტანოთ მცირე ხმაური შერჩევით, რათა თავიდან ავიცილოთ „ზედმეტად მექანიკური“ პასუხები). ჩვენი არჩეული ტოკენის პრომპტზე დამატება და მისი მოდელში ხელახლა შეტანა საშუალებას გვაძლევს, წარმოქმნას კიდევ ერთი ტოკენი და ასე გაგრძელდეს, სანამ მთლიანი წინადადებები არ შეიქმნება შეტანილი პრომპტის გაგრძელებად.
ასე წარმოქმნიან პასუხებს ChatGPT ან Hugging Chat. შეჯამებისთვის, მოდელიდან ინფორმაციის მისაღებად და მისი შესაფასებლად ორი ძირითადი გზა გვაქვს: ამ ცოდნით აღჭურვილი, მოდით ჩავუღრმავდეთ MMLU-ის ჩვენს სამ იმპლემენტაციას, რათა გავარკვიოთ, რა შეტანა ეგზავნება მოდელებს, რა არის მოსალოდნელი გამომავალი სახით და როგორ ხდება ამ გამომავალი შედეგების შედარება. შევადაროთ...
თეგები:
#ხელოვნური ინტელექტი
#ენის მოდელები
#ბენჩმარკინგი
#შეფასება
#llama
#ai კვლევა
#eleutherai
#open llm leaderboard
#mmlu
#stanford helm
წყარო: huggingface.co
AI-ით გადამუშავებული