MIT-ის კვლევა: LLM-ის რეიტინგები მოულოდნელად მგრძნობიარეა მცირე მონაცემების მიმართ
MIT-ის მკვლევარებმა აღმოაჩინეს, რომ დიდი ენობრივი მოდელების (LLM) რეიტინგის პლატფორმები ძალზე მგრძნობიარეა მომხმარებლის მცირე რაოდენობის შეფასებების მიმართ. ამან შესაძლოა კომპანიები შეცდომაში შეიყვანოს LLM-ის არჩევისას. მათ შეიმუშავეს სწრაფი მეთოდი, რომელიც ავლენს შედეგების დამახინჯებაზე პასუხისმგებელ „გავლენიან“ ხმებს და ხაზს უსვამს მოდელის შეფასების უფრო მკაცრი სტრატეგიების საჭიროებას.
MIT News-ის ოფისის ვებგვერდზე ჩამოსატვირთი გამოსახულებები ხელმისაწვდომია არაკომერციული ორგანიზაციებისთვის, პრესისთვის და ფართო საზოგადოებისთვის Creative Commons-ის „მიწერა-არაკომერციული-არაგადაკეთებული“ (Attribution Non-Commercial No Derivatives) ლიცენზიის პირობებით. აკრძალულია მოწოდებული გამოსახულებების შეცვლა, გარდა მათი ზომის შესაბამისად მოჭრისა. გამოსახულებების რეპროდუცირებისას აუცილებელია წყაროს მითითება; თუკი ის ქვემოთ არ არის მოცემული, გამოსახულებების ავტორად მიუთითეთ „MIT“.
კომპანიას, რომელსაც სურს გამოიყენოს დიდი ენობრივი მოდელი (LLM) გაყიდვების ანგარიშების შესაჯამებლად ან მომხმარებელთა შეკითხვების დასალაგებლად, შეუძლია აირჩიოს ასობით უნიკალური LLM-დან, ათობით მოდელის ვარიაციით, რომელთაგან თითოეულს ოდნავ განსხვავებული შესრულება აქვს. არჩევანის შესამცირებლად, კომპანიები ხშირად ეყრდნობიან LLM-ის რეიტინგის პლატფორმებს, რომლებიც აგროვებენ მომხმარებლის უკუკავშირს მოდელების ურთიერთქმედების შესახებ, რათა შეაფასონ უახლესი LLM-ები იმის მიხედვით, თუ როგორ მუშაობენ ისინი კონკრეტულ ამოცანებზე. მაგრამ MIT-ის მკვლევარებმა აღმოაჩინეს, რომ მომხმარებლის რამდენიმე ურთიერთქმედებას შეუძლია შედეგების დამახინჯება, რის გამოც ვინმემ შეიძლება შეცდომით იფიქროს, რომ ერთი LLM იდეალური არჩევანია კონკრეტული გამოყენების შემთხვევისთვის. მათმა კვლევამ აჩვენა, რომ კრაუდსორსინგული მონაცემების მცირე ნაწილის ამოღებამაც კი შეიძლება შეცვალოს, რომელი მოდელები არიან საუკეთესო რეიტინგში. მათ შეიმუშავეს სწრაფი მეთოდი რეიტინგის პლატფორმების შესამოწმებლად და იმის დასადგენად, არიან თუ არა ისინი მიდრეკილნი ამ პრობლემისადმი. შეფასების ტექნიკა ავლენს ინდივიდუალურ ხმებს, რომლებიც ყველაზე მეტად არიან პასუხისმგებელი შედეგების დამახინჯებაზე, რათა მომხმარებლებმა შეძლონ ამ გავლენიანი ხმების შემოწმება. მკვლევარები აცხადებენ, რომ ეს ნაშრომი ხაზს უსვამს მოდელის რეიტინგების შეფასების უფრო მკაცრი სტრატეგიების საჭიროებას. მიუხედავად იმისა, რომ მათ ამ კვლევაში შემარბილებელ ზომებზე არ გაამახვილეს ყურადღება, ისინი გვთავაზობენ წინადადებებს, რომლებმაც შეიძლება გააუმჯობესონ ამ პლატფორმების მდგრადობა, მაგალითად, უფრო დეტალური უკუკავშირის შეგროვება რეიტინგების შესაქმნელად. კვლევა ასევე აფრთხილებს მომხმარებლებს, რომლებიც შეიძლება ეყრდნობოდნენ რეიტინგებს LLM-ებთან დაკავშირებული გადაწყვეტილებების მიღებისას, რასაც შეიძლება ჰქონდეს შორსმიმავალი და ძვირადღირებული შედეგები ბიზნესისთვის ან ორგანიზაციისთვის.
„გაგვიკვირდა, რომ ეს რეიტინგის პლატფორმები ასეთი მგრძნობიარე იყო ამ პრობლემის მიმართ. თუკი აღმოჩნდება, რომ ყველაზე მაღალი რეიტინგის მქონე LLM ათი ათასობით მომხმარებლის უკუკავშირიდან მხოლოდ ორ-სამ ნაწილზეა დამოკიდებული, მაშინ არ შეიძლება ვივარაუდოთ, რომ ის თანმიმდევრულად აჯობებს ყველა სხვა LLM-ს მისი დანერგვისას“, – ამბობს თამარა ბროდერიკი, MIT-ის ელექტროინჟინერიისა და კომპიუტერული მეცნიერების (EECS) დეპარტამენტის ასოცირებული პროფესორი; ინფორმაციისა და გადაწყვეტილების სისტემების ლაბორატორიის (LIDS) და მონაცემთა, სისტემებისა და საზოგადოების ინსტიტუტის წევრი; კომპიუტერული მეცნიერებისა და ხელოვნური ინტელექტის ლაბორატორიის (CSAIL) ასოცირებული წევრი; და ამ კვლევის უფროსი ავტორი. მას ნაშრომზე შეუერთდნენ წამყვანი ავტორები და EECS-ის მაგისტრატურის სტუდენტები ჯენი ჰუანგი და იუნი შენი, ასევე დენის ვეი, IBM Research-ის უფროსი მკვლევარი. კვლევა წარმოდგენილი იქნება სწავლის წარმოდგენების საერთაშორისო კონფერენციაზე.
მონაცემების გამორიცხვა მიუხედავად იმისა, რომ LLM-ის რეიტინგის პლატფორმების მრავალი ტიპი არსებობს, ყველაზე პოპულარული ვარიანტები მომხმარებლებს სთხოვენ, წარუდგინონ შეკითხვა ორ მოდელს და აირჩიონ, რომელი LLM უზრუნველყოფს უკეთეს პასუხს. პლატფორმები აგროვებენ ამ შედარებების შედეგებს რეიტინგების შესაქმნელად, რომლებიც აჩვენებს, თუ რომელი LLM შეასრულა საუკეთესოდ კონკრეტულ ამოცანებზე, როგორიცაა კოდირება ან ვიზუალური გაგება. საუკეთესოდ მოქმედი LLM-ის არჩევით, მომხმარებელი სავარაუდოდ ელოდება, რომ ამ მოდელის მაღალი რეიტინგი განზოგადდება, რაც იმას ნიშნავს, რომ მან უნდა აჯობოს სხვა მოდელებს მათ მსგავს, მაგრამ არა იდენტურ, აპლიკაციაზე ახალი მონაცემების ნაკრებით. MIT-ის მკვლევარები ადრე სწავლობდნენ განზოგადებას ისეთ სფეროებში, როგორიცაა სტატისტიკა და ეკონომიკა. ამ ნაშრომმა გამოავლინა კონკრეტული შემთხვევები, როდესაც მონაცემთა მცირე პროცენტის გამორიცხვას შეუძლია შეცვალოს მოდელის შედეგები, რაც მიუთითებს იმაზე, რომ ამ კვლევების დასკვნები შეიძლება არ იყოს მოქმედი მათი ვიწრო კონტექსტის მიღმა. მკვლევარებს სურდათ ენახათ, შეიძლებოდა თუ არა იგივე ანალიზის გამოყენება LLM-ის რეიტინგის პლატფორმებზე.
„საბოლოო ჯამში, მომხმარებელს სურს იცოდეს, ირჩევს თუ არა საუკეთესო LLM-ს. თუკი ამ რეიტინგს მხოლოდ რამდენიმე მოთხოვნა განაპირობებს, ეს მიგვანიშნებს, რომ რეიტინგი შეიძლება არ იყოს საბოლოო და ყოვლისმომცველი“, – ამბობს ბროდერიკი.
მაგრამ შეუძლებელი იქნებოდა მონაცემების გამორიცხვის ფენომენის ხელით ტესტირება. მაგალითად, ერთ რეიტინგს, რომელიც მათ შეაფასეს, 57 000-ზე მეტი ხმა ჰქონდა. მონაცემების 0,1 პროცენტის გამორიცხვის ტესტირება ნიშნავს 57 ხმის ყოველი ქვეჯგუფის ამოღებას 57 000-დან (არსებობს 10^194-ზე მეტი ქვეჯგუფი), შემდეგ კი რეიტინგის ხელახლა გამოთვლას. ამის ნაცვლად, მკვლევარებმა შეიმუშავეს ეფექტური მიახლოებითი მეთოდი, რომელიც დაფუძნებულია მათ წინა ნაშრომზე, და მოარგეს ის LLM-ის რეიტინგის სისტემებს.
„მიუხედავად იმისა, რომ ჩვენ გვაქვს თეორია იმის დასამტკიცებლად, რომ მიახლოება მუშაობს გარკვეული დაშვებების პირობებში, მომხმარებელს არ სჭირდება ამის ნდობა. ჩვენი მეთოდი საბოლოოდ აჩვენებს მომხმარებელს პრობლემურ მონაცემთა წერტილებს, ასე რომ მათ შეუძლიათ უბრალოდ გამორიცხონ ეს მონაცემთა წერტილები, ხელახლა ჩაატარონ ანალიზი და შეამოწმონ, შეიცვალა თუ არა რეიტინგები“, – ამბობს ის.
მოულოდნელად მგრძნობიარე როდესაც მკვლევარებმა თავიანთი ტექნიკა პოპულარულ სარეიტინგო პლატფორმაზე გამოიყენეს
თეგები:
#ხელოვნური ინტელექტი
#llm
#კვლევა
#მანქანური სწავლება
#მონაცემები
#mit
#ტექნოლოგია
#რეიტინგი
წყარო: news.mit.edu
AI-ით გადამუშავებული