კომპანიას, რომელსაც სურს გამოიყენოს დიდი ენის მოდელი (LLM) გაყიდვების ანგარიშების შესაჯამებლად ან მომხმარებლის მოთხოვნების დასახარისხებლად, შეუძლია აირჩიოს ასობით უნიკალურ LLM-ს შორის, ათობით მოდელის ვარიაციით, რომელთაგან თითოეულს ოდნავ განსხვავებული შესრულება აქვს. არჩევანის შესამცირებლად, კომპანიები ხშირად ეყრდნობიან LLM-ის რეიტინგულ პლატფორმებს, რომლებიც აგროვებენ მომხმარებლის უკუკავშირს მოდელების ურთიერთქმედების შესახებ, რათა შეაფასონ უახლესი LLM-ები იმის მიხედვით, თუ როგორ მუშაობენ ისინი კონკრეტულ ამოცანებზე. თუმცა, MIT-ის მკვლევრებმა აღმოაჩინეს, რომ მომხმარებლის რამდენიმე ურთიერთქმედებას შეუძლია შედეგების დამახინჯება, რამაც შეიძლება ვინმეს შეცდომით დააჯეროს, რომ ერთი LLM იდეალური არჩევანია კონკრეტული გამოყენების შემთხვევისთვის. მათმა კვლევამ აჩვენა, რომ კრაუდსორსინგული მონაცემების მცირე ნაწილის ამოღებასაც კი შეუძლია შეცვალოს რომელი მოდელებია ყველაზე მაღალრეიტინგული. მათ შეიმუშავეს სწრაფი მეთოდი რეიტინგული პლატფორმების შესამოწმებლად და იმის დასადგენად, რამდენად არიან ისინი მგრძნობიარე ამ პრობლემის მიმართ. შეფასების ტექნიკა ავლენს ინდივიდუალურ ხმებს, რომლებიც ყველაზე მეტად არიან პასუხისმგებელნი შედეგების დამახინჯებაზე, რათა მომხმარებლებმა შეძლონ ამ გავლენიანი ხმების შემოწმება. მკვლევრები ამბობენ, რომ ეს ნაშრომი ხაზს უსვამს მოდელების რეიტინგების შეფასების უფრო მკაცრი სტრატეგიების საჭიროებას. მიუხედავად იმისა, რომ ამ კვლევაში მათ არ გაამახვილეს ყურადღება შემარბილებელ ზომებზე, მათ წარმოადგინეს წინადადებები, რომლებიც შესაძლოა გააუმჯობესონ ამ პლატფორმების მდგრადობა, მაგალითად, უფრო დეტალური უკუკავშირის შეგროვება რეიტინგების შესაქმნელად. კვლევა ასევე აფრთხილებს მომხმარებლებს, რომლებიც შესაძლოა დაეყრდნონ რეიტინგებს LLM-ებთან დაკავშირებული გადაწყვეტილებების მიღებისას, რამაც შეიძლება შორს მიმავალი და ძვირადღირებული გავლენა მოახდინოს ბიზნესზე ან ორგანიზაციაზე. „გაგვიკვირდა, რომ ეს რეიტინგული პლატფორმები ასე მგრძნობიარე იყო ამ პრობლემის მიმართ. თუ აღმოჩნდება, რომ ყველაზე მაღალრეიტინგული LLM ათიათასობით მომხმარებლის უკუკავშირიდან მხოლოდ ორ ან სამ ნაწილზეა დამოკიდებული, მაშინ არ შეიძლება ვივარაუდოთ, რომ ყველაზე მაღალრეიტინგული LLM მუდმივად აჯობებს ყველა სხვა LLM-ს მისი დანერგვისას“, – ამბობს თამარა ბროდერიკი, MIT-ის ელექტროინჟინერიისა და კომპიუტერული მეცნიერების (EECS) დეპარტამენტის ასოცირებული პროფესორი; ინფორმაციისა და გადაწყვეტილების სისტემების ლაბორატორიის (LIDS) და მონაცემთა, სისტემებისა და საზოგადოების ინსტიტუტის წევრი; კომპიუტერული მეცნიერებისა და ხელოვნური ინტელექტის ლაბორატორიის (CSAIL) ფილიალი; და ამ კვლევის უფროსი ავტორი. მას ნაშრომზე შეუერთდნენ წამყვანი ავტორები და EECS-ის კურსდამთავრებული სტუდენტები ჯენი ჰუანგი და იუნი შენი, ასევე დენის ვეი, IBM Research-ის უფროსი მკვლევარი მეცნიერი. კვლევა წარმოდგენილი იქნება სწავლის წარმოდგენების საერთაშორისო კონფერენციაზე. მონაცემების ამოღება: მიუხედავად იმისა, რომ არსებობს მრავალი სახის LLM-ის რეიტინგული პლატფორმა, ყველაზე პოპულარული ვარიაციები მომხმარებლებს სთხოვენ წარუდგინონ შეკითხვა ორ მოდელს და აირჩიონ, რომელი LLM იძლევა უკეთეს პასუხს. პლატფორმები აერთიანებენ ამ შედარებების შედეგებს რეიტინგების შესაქმნელად, რომლებიც აჩვენებს, თუ რომელი LLM-მა იმოქმედა საუკეთესოდ გარკვეულ ამოცანებზე, როგორიცაა კოდირება ან ვიზუალური გაგება. საუკეთესო მოქმედი LLM-ის არჩევით, მომხმარებელი სავარაუდოდ ელის, რომ ამ მოდელის მაღალი რეიტინგი განზოგადდება, რაც იმას ნიშნავს, რომ მან უნდა აჯობოს სხვა მოდელებს მათ მსგავს, მაგრამ არა იდენტურ, აპლიკაციაში ახალი მონაცემების ნაკრებით. MIT-ის მკვლევრები ადრე სწავლობდნენ განზოგადებას ისეთ სფეროებში, როგორიცაა სტატისტიკა და ეკონომიკა. ამ ნაშრომმა გამოავლინა გარკვეული შემთხვევები, როდესაც მონაცემების მცირე პროცენტის ამოღებას შეუძლია შეცვალოს მოდელის შედეგები, რაც მიუთითებს იმაზე, რომ ამ კვლევების დასკვნები შესაძლოა არ იყოს მართებული მათი ვიწრო გარემოს მიღმა. მკვლევრებს სურდათ ენახათ, შეიძლებოდა თუ არა იგივე ანალიზის გამოყენება LLM-ის რეიტინგულ პლატფორმებზე. „დღის ბოლოს, მომხმარებელს სურს იცოდეს, ირჩევს თუ არა ის საუკეთესო LLM-ს. თუ მხოლოდ რამდენიმე შეკითხვა განაპირობებს ამ რეიტინგს, ეს მიუთითებს იმაზე, რომ რეიტინგი შესაძლოა არ იყოს საბოლოო და სრულყოფილი გადაწყვეტილება“, – ამბობს ბროდერიკი. თუმცა, შეუძლებელი იქნებოდა მონაცემების ამოღების ფენომენის ხელით შემოწმება. მაგალითად, ერთ-ერთ რეიტინგს, რომელიც მათ შეაფასეს, 57 000-ზე მეტი ხმა ჰქონდა. მონაცემების 0,1 პროცენტის ამოღების შემოწმება ნიშნავს 57 000 ხმიდან 57 ხმის ყოველი ქვეჯგუფის ამოღებას (არსებობს 10^194-ზე მეტი ქვეჯგუფი) და შემდეგ რეიტინგის ხელახლა გაანგარიშებას. ამის ნაცვლად, მკვლევრებმა შეიმუშავეს ეფექტური აპროქსიმაციული მეთოდი, რომელიც დაფუძნებულია მათ წინა ნაშრომზე, და მოარგეს ის LLM-ის რეიტინგულ სისტემებს. „მიუხედავად იმისა, რომ ჩვენ გვაქვს თეორია იმის დასამტკიცებლად, რომ აპროქსიმაცია მუშაობს გარკვეული დაშვებების პირობებში, მომხმარებელს არ სჭირდება ამის ნდობა. ჩვენი მეთოდი მომხმარებელს საბოლოოდ უჩვენებს პრობლემურ მონაცემთა წერტილებს, ასე რომ მათ შეუძლიათ უბრალოდ ამოიღონ ეს მონაცემთა წერტილები, ხელახლა ჩაატარონ ანალიზი და შეამოწმონ, შეიცვლება თუ არა რეიტინგები“, – ამბობს ის. საოცრად მგრძნობიარე: როდესაც მკვლევრებმა თავიანთი ტექნიკა პოპულარულ რეიტინგულ პლატფორმას მიუსადაგეს