LLM-ების შეფასება: სად შეგვიძლია ვენდოთ მონაცემებს?
სტატია განიხილავს დიდი ენობრივი მოდელების (LLM) შეფასების არსებულ გამოწვევებს, განსაკუთრებით GPT-4-ზე დაფუძნებულ მეტრიკაზე დამოკიდებულებას, რაც შესაძლოა სრულად არ ასახავდეს ადამიანურ უპირატესობებს. ხაზგასმულია ადამიანურად მარკირებული მონაცემების მნიშვნელობა რეალური უპირატესობების გასაზომად და წარმოდგენილია Hugging Face Open LLM ლიდერბორდის გაფართოება. ეს გაფართოებული ლიდერბორდი აერთიანებს ავტომატიზებულ აკადემიურ ბენჩმარკებს, პროფესიონალურ ადამიანურ მარკირებას და GPT-4 შეფასებებს, რათა უზრუნველყო
ამ სფეროში ხშირია შემთხვევა, როდესაც ახალი დიდი ენობრივი მოდელი (LLM) გამოდის განცხადებით: „ჩვენი მოდელი სასურველია ChatGPT-ზე N% შემთხვევაში“, და ამ წინადადებაში გამოტოვებულია ის ფაქტი, რომ მოდელი სასურველია GPT-4-ზე დაფუძნებული შეფასების სქემის მიხედვით.
რისი ჩვენებაც ამ პუნქტებს სურთ, არის სხვა საზომის პროქსი: ადამიანური მარკირების მიერ მოწოდებული ქულები.
მოდელების გაწვრთნის პროცესმა ადამიანური უკუკავშირის საფუძველზე გამაძლიერებელი სწავლით (RLHF) გაავრცელა ინტერფეისები და მონაცემები ორი მოდელის დასრულებული ნაწილების ერთმანეთთან შესადარებლად.
ეს მონაცემები გამოიყენება RLHF პროცესში, რათა გაიწვრთნას ჯილდოს მოდელი, რომელიც პროგნოზირებს სასურველ ტექსტს, თუმცა მოდელის გამოსავლის შეფასებისა და რანჟირების იდეა უფრო ზოგად ინსტრუმენტად იქცა შეფასებაში. აქ მოცემულია მაგალითი ჩვენი ბრმა სატესტო ნაკრების instruct და code-instruct დაყოფებიდან. ინტერაციის სიჩქარის თვალსაზრისით, ენობრივი მოდელის გამოყენება მოდელის გამოსავლის შესაფასებლად უაღრესად ეფექტურია, მაგრამ არსებობს მნიშვნელოვანი ხარვეზი: იმის გამოკვლევა, არის თუ არა შემდგომი ხელსაწყო-მოკლე გზა კალიბრირებული გაზომვის ორიგინალურ ფორმასთან.
ამ ბლოგ-პოსტში, ჩვენ დეტალურად განვიხილავთ, სად შეგიძლიათ და სად არ შეგიძლიათ ენდოთ თქვენი არჩეული LLM-დან მიღებულ მონაცემთა ეტიკეტებს, ღია LLM ლიდერბორდის შეფასების ნაკრების გაფართოებით. ლიდერბორდები უკვე გაჩნდა, როგორიცაა LMSYS, nomic / GPT4All, რათა შეადარონ ამ მოდელების ზოგიერთი ასპექტი, მაგრამ საჭიროა სრული წყარო, რომელიც შეადარებს მოდელის შესაძლებლობებს. ზოგი იყენებს არსებულ NLP ბენჩმარკებს, რომლებსაც შეუძლიათ კითხვა-პასუხის შესაძლებლობების ჩვენება, ზოგი კი არის კრაუდსორსული რანჟირება ღია ჩატის საფუძველზე.
შეფასებების უფრო ზოგადი სურათის წარმოსადგენად, Hugging Face-ის ღია LLM ლიდერბორდი გაფართოვდა, მათ შორის ავტომატური აკადემიური ბენჩმარკები, პროფესიონალური ადამიანური ეტიკეტები და GPT-4 შეფასებები. გაწვრთნის ნებისმიერი ეტაპი, სადაც ადამიანები არიან საჭირო მონაცემების კურირებისთვის, თავისი ბუნებით ძვირია. დღეისათვის, ამ მოდელების გაწვრთნისთვის ხელმისაწვდომია მხოლოდ რამდენიმე ადამიანურად მარკირებული უპირატესობის მონაცემთა ნაკრები, როგორიცაა Anthropic-ის HHH მონაცემები, OpenAssistant-ის დიალოგის რანჟირებები, ან OpenAI-ის Learning to Summarize / WebGPT მონაცემთა ნაკრებები. იგივე უპირატესობის ეტიკეტები შეიძლება გენერირდეს მოდელის გამოსავლებზე, რათა შეიქმნას შედარებითი Elo რანჟირება მოდელებს შორის (Elo რანჟირება, პოპულარული ჭადრაკში და გამოყენებული ვიდეო თამაშებში, არის მეთოდი გლობალური რანჟირების დონის შესაქმნელად მხოლოდ წყვილური შედარებების საფუძველზე — რაც უფრო მაღალია, მით უკეთესია). როდესაც მარკირებისათვის მიცემული ტექსტის წყარო გენერირებულია საინტერესო მოდელიდან, მონაცემები ორმაგად საინტერესო ხდება.
ჩვენი მოდელების გაწვრთნისას საინტერესო რაღაცეების შემჩნევა დავიწყეთ, ამიტომ გვინდოდა, ჩაგვეტარებინა არსებული ღია კოდის მოდელების უფრო კონტროლირებადი კვლევა და იმის დადგენა, თუ როგორ ითარგმნებოდა და შედარდებოდა უპირატესობების შეგროვების ეს პროცესი ამჟამად პოპულარულ GPT-4/ChatGPT შეფასებებთან. ამისათვის, ჩვენ შევკრიბეთ ინსტრუქციის მოთხოვნებისა და დასრულებების ნაკრები პოპულარული ღია კოდის მოდელებიდან: Koala 13b, Vicuna 13b, OpenAssistant 12b და Dolly 12b. ჩვენ შევაგროვეთ მაღალი ხარისხის, ადამიანის მიერ დაწერილი მოთხოვნების ნაკრები Self-Instruct შეფასების ნაკრებიდან და მონაცემთა მომწოდებლებთან ადრეული დისკუსიებიდან სხვადასხვა დავალების კატეგორიისთვის, მათ შორის გენერაცია, ბრეინსტორმინგი, კითხვა-პასუხი, შეჯამება, საღი აზრი და კოდირებასთან დაკავშირებული. მონაცემთა ნაკრები შეიცავს 327 მოთხოვნას ამ კატეგორიებში, აქედან 25 კოდირებასთან არის დაკავშირებული. აქ მოცემულია მოთხოვნის და დემონსტრაციის სიგრძის სტატისტიკა. ამ დასრულებებით, ჩვენ შევუდექით მოდელების ხარისხის შეფასებას Scale AI-ისა და GPT-4-ის დახმარებით. შეფასებების ჩასატარებლად, ჩვენ მივყევით Anthropic-ის რეცეპტს უპირატესობის მოდელებისთვის და შეფასების ავტორებს ვთხოვეთ ქულების მინიჭება ლიკერტის 1-დან 8-მდე სკალაზე. ამ სკალაზე, 1 ნიშნავს პირველი მოდელის მიმართ ძლიერ უპირატესობას, ხოლო 4 ნიშნავს პირველი მოდელის მიმართ მჭიდრო თანასწორობას. სკალის მოპირდაპირე მხარე საპირისპიროდ მოქმედებს, სადაც 8 არის ყველაზე მკაფიო შედარება. ჩვენ ვითანამშრომლეთ Scale AI-სთან მაღალი ხარისხის ადამიანური ანოტაციების შესაგროვებლად რამდენიმე ღია კოდის ინსტრუქციებზე გაწვრთნილი მოდელისთვის ჩვენს ბრმა სატესტო ნაკრებზე. ჩვენ ვთხოვეთ ანოტატორებს შეეფასებინათ პასუხები სარგებლიანობისა და სიმართლისთვის წყვილური შედარების კონტექსტში. ჩვენ შევქმენით n-დან 2-ის ამორჩევის კომბინაციები თითოეული მოთხოვნისთვის, სადაც n არის მოდელების რაოდენობა, რომლებსაც ვაფასებთ. აქ მოცემულია ინსტრუქციების და Scale-ის მიერ ჩვენი შეფასებებისთვის მოწოდებული ინტერფეისის მაგალითი. ამ მონაცემებით, ჩვენ შევქმენით ბუტსტრაპირებული Elo შეფასებები, რომლებიც ეფუძნებოდა ორ მოდელს შორის მოგების ალბათობებს. Elo პროცესის შესახებ მეტის გასაგებად, იხილეთ LMSYS-ის ნოუთბუქი. ჩვენი ბრმა სატესტო მონაცემების Elo ქულები მოცემულია ჩვენს ლიდერბორდზე. ამ ბლოგში, ჩვენ ვაჩვენებთ ბუტსტრაპირებულ Elo შეფასებებს შეცდომების შეფასებებთან ერთად. აქ მოცემულია რანჟირებები ადამიანური ანოტატორების გამოყენებით ჩვენს ბრმა სატესტო ნაკრებზე. Elo რანჟირებები ფრეების გარეშე (ბუტსტრაპირებული 1000 სათამაშო რაუნდიდან). ლიკერტის სკალის გათვალისწინებით, სადავოა, უნდა ჩაითვალოს თუ არა 4 ან 5 ქულა მოგებად, ამიტომ ჩვენ ასევე გამოვთვალეთ Elo რანჟირებები, სადაც 4 ან 5 ქულა ფრეს ნიშნავს. ამ შემთხვევაში, და მთელი სტატიის განმავლობაში, მოდელების რანჟირებაში ცოტა ცვლილება დავინახეთ.
თეგები:
#ხელოვნური ინტელექტი
#llm
#მონაცემთა ანალიზი
#hugging face
#rlhf
#ლიდერბორდი
#შეფასება
#gpt-4
#ადამიანური უკუკავშირი
#elo რანჟირება
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი