ავტონომიური აგენტების შეფასების ორი ძირითადი გზა არსებობს: რეალური სამყაროს გარემოს გამოყენება და კონკრეტული უნარების შეზღუდული ნაკრები, როგორიცაა ხელსაწყოების გამოყენება ან კოდირების შესაძლებლობები, ან სიმულირებული ღია სამყაროს გარემოების გამოყენება. ეს უკანასკნელი უკეთ ასახავს აგენტის უნარს, ავტონომიურად იმოქმედოს საძიებო გარემოში, რომელიც მოითხოვს ხანგრძლივ, თვითმიმართულ მსჯელობას გრძელ და მზარდ კონტექსტზე, ამასთანავე მარტივია შესაფასებლად. მიუხედავად იმისა, რომ ეს მიმართულება ჯერ კიდევ ვითარდება, მან გაზრდილი ინტერესი გამოიწვია ისეთი ბენჩმარკების მეშვეობით, როგორიცაა Balrog, ARC-AGI, ასევე Claude-ისა და Gemini-ის მსგავსი მოდელების დემონსტრაციებით, რომლებიც Pokémon-ს თამაშობენ. ამ განვითარებად ნაშრომზე დაყრდნობით, ჩვენ წარმოგიდგენთ TextQuests-ს. TextQuests არის ბენჩმარკი, რომელიც დაფუძნებულია Infocom-ის 25 კლასიკურ ინტერაქციულ მხატვრულ თამაშზე. ეს ოდესღაც პოპულარული ტექსტური ვიდეო თამაშები, რომელთა ამოხსნას ადამიან მოთამაშეებს 30 საათზე მეტი და ასობით ზუსტი მოქმედება სჭირდებათ, წარმოადგენს დამაჯერებელ საცდელ გარემოს აგენტური მსჯელობის გამოწვევებისთვის. ისინი აგენტისგან მოითხოვენ: ხანგრძლივი კონტექსტური მსჯელობა: აგენტებმა უნდა შეიმუშაონ და განახორციელონ მრავალსაფეხურიანი გეგმები, მსჯელობდნენ მოქმედებებისა და დაკვირვებების ხანგრძლივ და მუდმივად მზარდ ისტორიაზე, ეყრდნობოდნენ მხოლოდ მათ შინაგან შესაძლებლობებს გარე ინსტრუმენტების დახმარების გარეშე. სწავლა ძიების გზით: თამაშები აგენტებს ავალდებულებს, ისწავლონ გამოცდილებიდან, გაანალიზონ საკუთარი წარუმატებლობები და განახორციელონ თანდათანობითი გაუმჯობესებები ცდისა და შეცდომის გზით უცნობი სამყაროს შესწავლისას. ამ თამაშებში წარმატება აგენტისგან მოითხოვს გაგების ჩამოყალიბებას გრძელი სათამაშო სესიის განმავლობაში. ეს იძლევა თავად LLM-ის, როგორც AI აგენტის სისტემის მსჯელობის ხერხემლის, უფრო პირდაპირ და ზუსტ შეფასებას. თითოეული მოდელისთვის ჩვენ ვატარებთ ორ განსხვავებულ შეფასებას: ერთი თამაშის ოფიციალურ მინიშნებებზე წვდომით (მინიშნებებით) და ერთი მათ გარეშე (მინიშნებების გარეშე). თითოეული გაშვება ხორციელდება მაქსიმუმ 500 ნაბიჯით და ჩერდება ნაადრევად, თუ აგენტი წარმატებით დაასრულებს თამაშს. მზარდი კონტექსტის სამართავად, თამაშის სრული ისტორია შენარჩუნებულია შეუკვეცავად გაშვების განმავლობაში. ეს ხანგრძლივი კონტექსტის შეფასება გამოთვლითად შესაძლებელია თანამედროვე LLM დასკვნითი ჩარჩოებში თანდაყოლილი მოთხოვნილების ქეშირების გამო. ჩვენ ვიყენებთ შეფასების ორ ძირითად მეტრიკას: თამაშის პროგრესი. თამაშის პროგრესის მეტრიკა გამოითვლება მარკირებული საკონტროლო წერტილების სერიის საფუძველზე, რომლებიც წარმოადგენს აუცილებელ მიზნებს თამაშის დასრულების გზაზე. ზიანი. აგენტების ეთიკური ქცევის შესაფასებლად, ჩვენ ვზომავთ ზიანს თამაშში კონკრეტული მოქმედებების თვალყურის დევნით, რომლებიც გარკვეულწილად საზიანოდ ითვლება. ეს ქულა შემდეგ საშუალოდ მიიღება ყველა თამაშზე, რათა შეფასდეს აგენტის საერთო ტენდენცია მსგავსი მოქმედებების შესასრულებლად. ხანგრძლივი კონტექსტური მსჯელობა. შეფასების დროს, კონტექსტის ფანჯარა შეიძლება აღემატებოდეს 100K ტოკენს, რაც LLM-ებს ავალდებულებს თანმიმდევრულად განახორციელონ ზუსტი მსჯელობა და დაგეგმვა დაკვირვებებისა და მინიშნებების ვრცელ ისტორიაზე, რათა ეფექტურად მიაღწიონ პროგრესს. კონტექსტის სიგრძის ზრდასთან ერთად, ჩვენ ვამჩნევთ, რომ მიმდინარე მოდელები ხშირად ჰალუცინირებენ წინა ურთიერთქმედებებზე, მაგალითად, სჯერათ, რომ მათ უკვე აიღეს ნივთი, როდესაც ეს ასე არ არის, ან ციკლში ჩარჩენილნი არიან ნავიგაციისას. გარდა ამისა, Gemini 2.5 Plays Pokémon-ში დაკვირვებების მსგავსად, LLM აგენტები ავლენენ გაზრდილ ტენდენციას, გაიმეორონ მოქმედებები მათი ისტორიიდან, ნაცვლად იმისა, რომ მოიგონონ ახალი გეგმები კონტექსტის გახანგრძლივებისას. ეს ხანგრძლივი კონტექსტის წარუმატებლობები განსაკუთრებით მკაფიოა სივრცით მსჯელობას მოითხოვს ამოცანებში. მაგალითად, Wishbringer-ში, LLM-ების უმეტესობას უჭირდა კლდიდან უკან ჩამოსვლა მას შემდეგ, რაც მასზე ავიდნენ. გამოსავალი უბრალოდ მოითხოვდა ასვლისთვის გამოყენებული მიმართულებების თანმიმდევრობის შებრუნებას – ინფორმაცია, რომელიც ხელმისაწვდომი იყო კონტექსტის ისტორიაში – რაც მიუთითებს გონებრივი რუკის შექმნისა და გამოყენების ფუნდამენტურ სირთულეზე. ანალოგიურად, ყველა მოწინავე LLM-ს უჭირს ნავიგაცია Zork I-ის სამარცხვინო ლაბირინთში. დინამიური აზროვნება. აგენტის საერთო ეფექტურობა განისაზღვრება როგორც მისი დავალების წარმატებით, ასევე ოპერაციული ეფექტურობით. LLM აგენტებისთვის, ეფექტურობა მჭიდროდ არის დაკავშირებული გამომავალი ან მსჯელობის ტოკენების რაოდენობასთან, რომლებსაც ის წარმოქმნის, რაც პირდაპირ გავლენას ახდენს დასკვნის ღირებულებაზე და შეფერხებაზე. მოდელები, რომლებიც იყენებენ უფრო მეტ გამოთვლას ტესტირების დროს, ზოგადად აღწევენ უფრო მაღალ შესრულებას. თუმცა, ეს ტენდენცია გარკვეული ბიუჯეტის შემდეგ იწყებს შემცირებას. ეს მოსაზრება მნიშვნელოვანია, რადგან TextQuests-ში მრავალი საძიებო ნაბიჯი (მაგალითად, ნავიგაციის ნაბიჯები) შუალედურია და წარმატებით შეიძლება შესრულდეს მსჯელობის დიდი სიღრმის გარეშე. დასასრულ, TextQuests არის შეფასება იმისა, თუ რამდენად კარგად შეუძლიათ მოდელებს თანმიმდევრულად მიაღწიონ პროგრესს კლასიკური ინტერაქციული მხატვრული თამაშების სერიაში, რომლებიც ოდესღაც პოპულარული იყო ადამიან მოთამაშეებში. ვიმედოვნებთ, რომ TextQuests-ის ღია კოდით გამოქვეყნება მკვლევარებს დაეხმარება უკეთ გაიგონ და შეაფასონ LLM აგენტების ამჟამინდელი შესაძლებლობები რთულ საძიებო გარემოში. ღია კოდის მოდელების შემქმნელებს შეუძლიათ წარადგინონ თავიანთი ნამუშევრები TextQuests ლიდერბორდზე, მოგვწერონ ელფოსტა [email protected]ზე. მეტი სტატია ჩვენი ბლოგიდან. ასევე შეგიძლიათ ისინი ჩართოთ MUD-ებში (რამდენიმე, რაც ჯერ კიდევ არსებობს მაინც!) ნახეთ ეს სკრიპტი, რომელიც შარშან შევკრიბე და რომელიც LLM-ებს ტელნეტთან აკავშირებს: https://github.com/CharlesCN