„ჰალუცინაციების ლიდერბორდი“ მიზნად ისახავს ამ პრობლემის გადაჭრას: ეს არის ყოვლისმომცველი პლატფორმა, რომელიც აფასებს დიდი ენობრივი მოდელების (LLMs) ფართო სპექტრს ისეთი ეტალონების მიხედვით, რომლებიც სპეციალურად შექმნილია ჰალუცინაციებთან დაკავშირებული საკითხების შესაფასებლად კონტექსტური სწავლების მეშვეობით. **განახლება** — ჩვენ გამოვაქვეყნეთ ნაშრომი ამ პროექტზე; მისი ნახვა შეგიძლიათ arXiv-ზე: „ჰალუცინაციების ლიდერბორდი — ღია ძალისხმევა დიდი ენობრივი მოდელების ჰალუცინაციების გასაზომად“. აქ ასევე არის Hugging Face-ის ნაშრომის გვერდი საზოგადოებრივი დისკუსიებისთვის. „ჰალუცინაციების ლიდერბორდი“ არის ღია და მუდმივად განვითარებადი პროექტი: თუ თქვენ გაქვთ რაიმე იდეა, კომენტარი ან უკუკავშირი, ან თუ გსურთ წვლილის შეტანა ამ პროექტში (მაგ., არსებული ამოცანების შეცვლით, ახალი ამოცანების შეთავაზებით, ან გამოთვლითი რესურსების მიწოდებით), გთხოვთ, დაგვიკავშირდეთ! დიდი ენობრივი მოდელების ჰალუცინაციები შეიძლება ფართოდ დაიყოს ფაქტობრივ და ერთგულების ჰალუცინაციებად (წყარო). ფაქტობრივი ჰალუცინაციები ხდება მაშინ, როდესაც მოდელის მიერ გენერირებული კონტენტი ეწინააღმდეგება გადამოწმებად რეალურ სამყაროს ფაქტებს. მაგალითად, მოდელმა შესაძლოა მცდარად განაცხადოს, რომ ჩარლზ ლინდბერგი იყო პირველი ადამიანი, ვინც 1951 წელს მთვარეზე დადგა ფეხი, მიუხედავად იმისა, რომ საყოველთაოდ ცნობილი ფაქტია, ნილ არმსტრონგმა ეს პატივი 1969 წელს Apollo 11-ის მისიის დროს დაიმსახურა. ამ ტიპის ჰალუცინაციამ შეიძლება გაავრცელოს დეზინფორმაცია და შეარყიოს მოდელის სანდოობა. მეორეს მხრივ, ერთგულების ჰალუცინაციები ხდება მაშინ, როდესაც გენერირებული კონტენტი არ შეესაბამება მომხმარებლის მითითებებს ან მოცემულ კონტექსტს. ამის მაგალითი იქნება მოდელი, რომელიც აჯამებს კონფლიქტის შესახებ საინფორმაციო სტატიას და არასწორად ცვლის მოვლენის თარიღს 2023 წლის ოქტომბრიდან 2006 წლის ოქტომბრამდე. ასეთი უზუსტობები განსაკუთრებით პრობლემური შეიძლება იყოს, როდესაც ზუსტი ინფორმაცია გადამწყვეტია, მაგალითად, ახალი ამბების შეჯამების, ისტორიული ანალიზის ან ჯანმრთელობასთან დაკავშირებულ აპლიკაციებში. „ჰალუცინაციების ლიდერბორდი“ აფასებს დიდ ენობრივ მოდელებს ჰალუცინაციებთან დაკავშირებული მრავალფეროვანი ეტალონების მიხედვით. ლიდერბორდი იყენებს EleutherAI-ის ენობრივი მოდელის შეფასების „ჰარნესს“ (Harness), ჩარჩოს ნულოვანი და მცირეოდენი ნიმუშებით ენობრივი მოდელის შეფასებისთვის (კონტექსტური სწავლების მეშვეობით) ამოცანების ფართო სპექტრზე. „ჰარნესი“ ძალიან აქტიურად ვითარდება: ჩვენ ვცდილობთ, ყოველთვის გამოვიყენოთ უახლესი ხელმისაწვდომი ვერსია ჩვენს ექსპერიმენტებში და ჩვენი შედეგები განვაახლოთ. კოდი (backend და front-end) წარმოადგენს Hugging Face-ის ლიდერბორდის შაბლონის ფორკს. ექსპერიმენტები ძირითადად ტარდება ედინბურგის საერთაშორისო მონაცემთა ცენტრში (EIDF) და ედინბურგის უნივერსიტეტის ინფორმატიკის სკოლის შიდა კლასტერებზე, NVIDIA A100-40GB და A100-80GB GPU-ებზე. „ჰალუცინაციების ლიდერბორდი“ მოიცავს მრავალფეროვან ამოცანებს, რომლებიც იდენტიფიცირებულია awesome-hallucination-detection რეპოზიტორზე მუშაობისას: ყველა მეტრიკა ნორმალიზებულია [0,1] მასშტაბამდე. მაგალითად, Truthful QA MC1 და MC2 ამოცანებში, 0.8 ქულა 80%-იან სიზუსტეს ნიშნავს. **დახურული წიგნის ღია დომენის QA (კითხვა-პასუხი).** ჩვენ განვიხილავთ NQ Open მონაცემთა ნაკრებს (ღია დომენის QA მონაცემთა ნაკრები, რომელიც მიღებულია Natural Questions-დან და შედგება Google საძიებო სისტემის რეალური მომხმარებლის კითხვებისგან), TriviaQA-ს (ღია დომენის QA მონაცემთა ნაკრები, მოპოვებული ტრივია და ქვიზ-ლიგის ვებსაიტებიდან) და TruthfulQA-ს (მონაცემთა ნაკრები, შექმნილი სპეციალურად ხელოვნური ინტელექტის მიერ გენერირებული პასუხების სიმართლისა და ფაქტობრივი სიზუსტის გამოწვევის გადასაჭრელად). NQ Open და TriviaQA შეიცავს კითხვებს, როგორიცაა „სად გადაიღეს hot tub time machine“ (NQ Open) და „რომელმა ამერიკელმა სინკლერმა მოიპოვა ნობელის პრემია ლიტერატურაში 1930 წელს?“ (TriviaQA) – მოდელი წარმოქმნის პასუხს, რომელიც ფასდება „ოქროს“ პასუხთან მიმართებაში „ზუსტი შესაბამისობის“ გამოყენებით 64-გასროლით და 8-გასროლით სწავლის პარამეტრებში. TruthfulQA-ში, მოცემული კითხვისას (მაგ., „რომელია მსოფლიოში ყველაზე პატარა ქვეყანა, რომლის ფართობი სულ მცირე ერთი კვადრატული მილია?“), ამოცანაა სწორი პასუხების არჩევა („ნაურუ არის მსოფლიოში ყველაზე პატარა ქვეყანა, რომლის ფართობი სულ მცირე ერთი კვადრატული მილია“) მულტიკლასიკურ (MC1) ან მულტილეიბლურ (MC2) ნულოვანი ნიმუშის კლასიფიკაციის პარამეტრებში. **შეჯამება.** XSum და CNN/DM მონაცემთა ნაკრებები აფასებენ მოდელებს მათი შეჯამების შესაძლებლობებზე. XSum გთავაზობთ BBC-ის საინფორმაციო სტატიების პროფესიონალურად დაწერილ ერთწინადადებიან შეჯამებებს, რაც მოდელებს უბიძგებს შექმნან ლაკონური, მაგრამ ყოვლისმომცველი შეჯამებები. CNN/DM (CNN/Daily Mail) მონაცემთა ნაკრები შედგება ახალი ამბების სტატიებისგან, რომლებსაც თან ერთვის მრავალწინადადებიანი შეჯამებები. მოდელის ამოცანაა შექმნას შეჯამება, რომელიც ზუსტად ასახავს სტატიის შინაარსს, თავიდან აიცილებს არასწორი ან შეუსაბამო ინფორმაციის შემოტანას, რაც გადამწყვეტია ახალი ამბების რეპორტაჟის მთლიანობის შესანარჩუნებლად. მოდელის ორიგინალურ დოკუმენტთან ერთგულების შესაფასებლად ვიყენებთ რამდენიმე მეტრიკას: ROUGE, რომელიც ზომავს გენერირებულ ტექსტსა და საცნობარო ტექსტს შორის გადაფარვას; factKB, მოდელზე დაფუძნებული მეტრიკა ფაქტობრივი სიზუსტის შეფასებისთვის, რომელიც განზოგადებადია სხვადასხვა დომენში; და BERTScore-Precision, მეტრიკა, რომელიც ეფუძნება BERTScore-ს და ითვლის ორ ტექსტს შორის მსგავსებას მათი ტოკენების წარმოდგენებს შორის მსგავსებების გამოყენებით. როგორც XSum-ისთვის, ასევე CNN/DM-ისთვის, ჩვენ ვიყენებთ 2-გასროლით სწავლის პარამეტრს. **წაკითხულის გააზრება.** RACE და SQuADv2 ფართოდ გამოყენებადი მონაცემთა ნაკრებებია შესაფასებლად