NPHardEval წარმოგიდგენთ დინამიურ, სირთულეზე დაფუძნებულ ჩარჩოს დიდი ენობრივი მოდელების (LLMs) მსჯელობის უნარების შესაფასებლად. ის მოიცავს 900 ალგორითმულ კითხვას, რომლებიც მოიცავს NP-რთული სირთულის კლასს და ქვედა დონეებს. ეს კითხვები შექმნილია LLM-ების მკაცრი ტესტირებისთვის და ყოველთვიურად განახლდება ზედმეტი მორგების (overfitting) თავიდან ასაცილებლად. NPHardEval განსაკუთრებულია იმით, რომ იყენებს გამოთვლითი სირთულის კლასებს, რაც LLM-ის მსჯელობის უნარების რაოდენობრივად გაზომვად და მტკიცე შეფასებას გვთავაზობს. ბენჩმარკის ამოცანები ასახავს რეალურ სამყაროში გადაწყვეტილების მიღების გამოწვევებს, რაც აძლიერებს მის რელევანტურობას და გამოყენებადობას. ბენჩმარკის მონაცემთა წერტილების რეგულარული ყოველთვიური განახლება ამცირებს მოდელის ზედმეტი მორგების რისკს, რაც უზრუნველყოფს სანდო შეფასებას. NPHardEval-ის ძირითადი წვლილი არის ახალი ბენჩმარკინგის სტრატეგიების გამოყენება (ავტომატური და დინამიური ბენჩმარკის შეთავაზება) და LLM-ის მსჯელობის შეფასების ახალი გზის დანერგვა. ბენჩმარკინგის სტრატეგიებთან დაკავშირებით, NPHardEval იყენებს ავტომატიზებულ მექანიზმს, როგორც კითხვების გენერირებისთვის, ასევე მათ შესამოწმებლად. ვინაიდან კითხვები ეფუძნება ალგორითმულად გამოთვლად პრობლემებს, ადამიანის ჩარევა არ არის საჭირო LLM-ების პასუხების სისწორის დასადგენად. ეს NPHardEval-ს საშუალებას აძლევს იყოს დინამიური ბენჩმარკი: რადგან კითხვები ავტომატურად გენერირდება, ბენჩმარკი შეიძლება ყოველთვიურად განახლდეს. ეს განახლებული ბენჩმარკი ხელს უწყობს მოდელის ზედმეტი მორგების თავიდან აცილებას, რადგან ჩვენ ყოველთვის შეგვიძლია შევქმნათ ახალი კითხვები სხვადასხვა სირთულის დონეებით შეფასებისთვის. თავად კითხვები იყენებს ახალ სისტემას LLM-ის მსჯელობის შესაფასებლად. ბენჩმარკის კითხვები ეფუძნება გამოთვლითი სირთულის იერარქიას, კარგად დამკვიდრებულ კონცეფციას, რომელიც ფართოდ არის შესწავლილი თეორიულ კომპიუტერულ მეცნიერებაში. ეს საფუძველი საშუალებას გვაძლევს გამოვიყენოთ არსებული კვლევები LLM-ის ლოგიკური მსჯელობის ხარისხის მკაცრად და რაოდენობრივად გასაზომად, მსჯელობის სირთულის კლასების მეშვეობით განსაზღვრით. ბენჩმარკი ასევე განზრახ გამორიცხავს რიცხვით გამოთვლებს კითხვებიდან, რადგან ეს არის საყოველთაოდ რთული ამოცანა LLM-ებისთვის. ლოგიკურ კითხვებზე ფოკუსირება იძლევა LLM-ის წმინდა ლოგიკური მსჯელობის უნარის უფრო ზუსტ შეფასებას, რადგან რიცხვითმა კითხვებმა შეიძლება დააბუნდოვანოს ეს შეფასება. NPHardEval იყენებს 100 კითხვას 9 სხვადასხვა ალგორითმისთვის, 10 სირთულის დონით, რაც ჯამში 900 კითხვას იძლევა სირთულისა და დონის მიხედვით. 9 ალგორითმი, მათ შორის 3 P, 3 NP-სრული და 3 NP-რთული კითხვა, ხასიათდება გამოთვლითი თეორიის მიხედვით. 900-ვე კითხვა სინთეზირდება და განახლდება ყოველთვიურად. LLM-ების მსჯელობის უნარის შესაფასებლად ვიყენებთ ორ მეტრიკას: **შეწონილი სიზუსტე (Weighted Accuracy)** და **წარუმატებლობის მაჩვენებელი (Failure Rate)**. **შეწონილი სიზუსტე (WA)** გამოიყენება პრობლემის გადაჭრის სიზუსტის შესაფასებლად. ეს მეთოდი გამოიყენება თითოეული პრობლემისთვის, ან სწორ პასუხთან შედარებით, ან ეტაპობრივი შედეგების შემოწმებით იმ პრობლემებისთვის, რომლებსაც არა აქვთ ერთიანი პასუხი. შედარებითი სიზუსტის უფრო ეფექტურად ასასახად, ჩვენ ვანიჭებთ წონას სხვადასხვა სირთულის დონეებს. თითოეული დონის წონა შეესაბამება მის ფარდობით მნიშვნელობას ან გამოწვევას, უფრო მაღალი სირთულის დონეები იღებენ მეტ წონას ხაზოვანი პროგრესიით (მაგალითად, 1-ლი დონეს აქვს 1 წონა, მე-2 დონეს 2 წონა და ა.შ.). შეწონილი სიზუსტის ფორმულა შემდეგია: w_i * A_i-ის ჯამი გაყოფილი w_i-ის ჯამზე. აქ, w_i წარმოადგენს წონას, რომელიც მიენიჭა სირთულის i დონეს (1-დან 10-მდე), ხოლო A_i არის სიზუსტე ამ დონეზე. კიდევ ერთი კრიტიკული მეტრიკაა **წარუმატებლობის მაჩვენებელი (FR)**. ეს საზომი ხელს უწყობს წარუმატებელი შედეგების სიხშირის შეფასებას სხვადასხვა პრობლემებსა და სირთულის დონეებზე. ის განსაკუთრებით გამოსადეგია იმ შემთხვევების იდენტიფიცირებისთვის, როდესაც LLM-ის შედეგი არ ემთხვევა მოსალოდნელ გამომავალ ფორმატს. წარუმატებლობის მაჩვენებელი გამოითვლება წარუმატებელი მცდელობების პროპორციის გათვალისწინებით, თითოეული სირთულის დონეზე მცდელობების საერთო რაოდენობასთან მიმართებაში. მცდელობა წარუმატებლად ითვლება, თუ მოდელი წარმოქმნის შედეგებს, რომელთა წარმატებით გაანალიზება შეუძლებელია ყველა საბოლოო ზარში. ჩვენ ვაყენებთ მცდელობების მაქსიმალურ რაოდენობას 10-ად. თითოეული პრობლემისთვის, წარუმატებლობის მაჩვენებელი შემდგომში ჯამდება ყველა სირთულის დონეზე, თითოეულ დონეზე 10 მცდელობის გათვალისწინებით. წარუმატებლობის მაჩვენებლის ფორმალური განმარტებაა: F_i გაყოფილი N_i-ზე (მცდელობების ჯამი), სადაც F_i აღნიშნავს წარუმატებელი მცდელობების რაოდენობას სირთულის i დონეზე. ბენჩმარკი მოიცავს ყოვლისმომცველ ექსპერიმენტებს LLM-ების გასაანალიზებლად სხვადასხვა სირთულის კლასებსა და დონეებზე. ის იკვლევს LLM-ის მუშაობის ნიუანსებს, რაც ღირებულ ინფორმაციას იძლევა მათი მსჯელობის სიძლიერეებისა და შეზღუდვების შესახებ. NPHardEval ბენჩმარკის დასაყენებლად საჭიროა რამდენიმე ნაბიჯის შესრულება. მაგალითად, GPT-4 Turbo მოდელის (GPT-4-1106-preview) და რედაქტირების მანძილის პრობლემის (EDP) გამოსაყენებლად შეფასებისთვის... ჩვენ ამჟამად მხარს ვუჭერთ რამდენიმე მაგალითს ერთიდაიგივე კითხვიდან (self) და შესაძლოა მომავალში მხარი დავუჭიროთ მაგალითებს სხვა კითხვებიდან (other). NPHardEval-ის ლიდერბორდი, მონაცემთა ნაკრები და კოდი ხელმისაწვდომია GitHub-ზე და Hugging Face-ზე საზოგადოების წვდომისა და წვლილისთვის. ჩვენ სიამოვნებით ვიხილავთ საზოგადოების ჩართულობას.