შესრულებაზე დაფუძნებული ლიდერბორდების უმეტესობისგან განსხვავებით, ჩვენ არ ვაფასებთ მოდელის მიერ მოცემულ ამოცანაზე მიღწეულ აბსოლუტურ სიზუსტეს, არამედ სიზუსტეს შორის სხვაობას აზროვნების ჯაჭვის (chain-of-thought) მოთხოვნის გამოყენებით და მის გარეშე. ეს საშუალებას გვაძლევს ჭეშმარიტად შევისწავლოთ აზროვნების ჯაჭვის გავლენა მოდელის სიზუსტეზე. შენიშვნა: CoT მოთხოვნის გარეშე, მრავალჯერადი არჩევანის შეფასებისას მოდელის შესაფასებლად ვიყენებთ ლოგარითმული ალბათობის სიზუსტეს (loglikelihood accuracy). აზროვნების ჯაჭვის (Chain-of-thought, CoT) მოთხოვნა არის უნივერსალურად გამოსაყენებელი მოთხოვნის სტრატეგია, რომელსაც შეუძლია გააუმჯობესოს LLM-ზე დაფუძნებული აპლიკაციებისა და აგენტების ახსნადობა და სიზუსტე (იხილეთ, მაგალითად, ეს კოლექცია უახლესი კვლევებისა და იმპლემენტაციებისთვის). ისეთი ფრეიმვორკებით, როგორიცაა Langchain ან LMQL, მარტივია აპლიკაციებში დახვეწილი მსჯელობის ჯაჭვების ჩასმა. მაგრამ მაშინაც კი, თუ არასდროს გსმენიათ აზროვნების ჯაჭვის შესახებ, ჩეთბოტის გამოყენებისას შესაძლოა შეგინიშნავთ, რომ ის ხშირად ეტაპობრივად მოქმედებს თქვენს შეკითხვაზე პასუხის გაცემამდე. ამიტომ, LLM-ების უნარის სისტემატური, განახლებული შედარება, რომლის მიხედვითაც ისინი აგენერირებენ ეფექტურ აზროვნების ჯაჭვებს, დაეხმარება შემქმნელებსა და მომხმარებლებს მოდელის არჩევისას გადაწყვეტილების მიღებაში. დროთა განმავლობაში, სტატიკური „სიზუსტეზე დაფუძნებული“ ბენჩმარკები რისკავს გახდეს ნაკლებად ინფორმაციული: აჩვენებს თუ არა მოდელი კარგ შედეგს თავისი უმაღლესი უნარების გამო, იმიტომ რომ მან სწორი პასუხები ნახა ტრენინგის დროს, თუ იმიტომ, რომ ის განვითარდა კონკურენტულ კონტექსტში, რომელიც მართულია სწორედ ამ ბენჩმარკით? ეს ფართოდ აღიარებული პრობლემები განიხილება შეფასების უახლესი მიდგომებით, როგორიცაა ჩეთბოტების არენები, LLM-ების გამოყენება მსაჯებად, ან დინამიური ბენჩმარკები პროგრამულად გენერირებული ამოცანებით. ვიმედოვნებთ, რომ ღია CoT ლიდერბორდი წვლილს შეიტანს ამ ძალისხმევაში, განსაკუთრებით კი იმით, რომ ის უფრო მდგრადია ტრენინგის მონაცემების დაბინძურების მიმართ: შეკითხვაზე პასუხის ცოდნა არ ნიშნავს, რომ ადამიანს შეუძლია ეფექტურად იმსჯელოს მის შესახებ. ღია CoT ლიდერბორდი აფასებს LLM-ების უნარს, შექმნან ეფექტური აზროვნების ჯაჭვის მსჯელობის კვალი შემდეგი ამოცანებისთვის: LogiQA-ის ორიგინალური ვერსიის გარდა, ყველა ეს ამოცანა AGIEval ბენჩმარკის ნაწილია და ხელახლა გამოქვეყნებულია როგორც logikon-bench. ჩვენ ეს ამოცანები იმიტომ შევარჩიეთ, რომ ყველა მათგანი მრავალჯერადი არჩევანის პრობლემის სახით არის წარმოდგენილი, სადაც პასუხის ვარიანტები მოთხოვნაშია ჩამოთვლილი. ჩვენ ვიყენებთ შემდეგ მოთხოვნის შაბლონს საბაზისო და CoT სიზუსტეების შესაფასებლად – მსჯელობის კვალი (რომელიც იწყება სიტყვით „მსჯელობა“) მხოლოდ „CoT-ის გამოყენებით“ შემთხვევაში ემატება: [#cot-generation] აზროვნების ჯაჭვის მოთხოვნების (CoT prompting) ლიტერატურა ბოლო ერთი წლის განმავლობაში სწრაფად გაიზარდა, და CoT-ისთვის მოთხოვნის სტრატეგიების სიმრავლე (მაგალითად, დეკოდირება, მოთხოვნის ფორმულირება, მოთხოვნის ჯაჭვები, დეკომპოზიცია, აგრეგაცია და მსჯელობის კვალის გადახედვა) უბრალოდ განსაცვიფრებელი გახდა. ამ მრავალფეროვნებასთან გასამკლავებლად, ღია CoT ლიდერბორდის უკან არსებული შეფასების მექანიზმი ახორციელებს CoT გენერაციას მოდულური და ადვილად გაფართოვებადი მოთხოვნის ჯაჭვებით. ამ დროისთვის, ჩვენ განვახორციელეთ ორი საკმაოდ მარტივი მოთხოვნის სტრატეგია: მოდით, გადავხედოთ მაგალითს. შემდეგი პრობლემა LSAT-ის ლოგიკური მსჯელობის ბენჩმარკიდანაა. Mixtral-8x7B-Instruct-v0.1 საკმაოდ კარგად აგენერირებს აზროვნების ჯაჭვის შემდეგ კვალს: არგუმენტის საფუძველია ის რწმენა, რომ სასკოლო კალენდრიდან ხანგრძლივი შესვენებების ამოღება ბავშვების ინტერესებს უფრო მოემსახურება, ვიდრე ამჟამინდელი კალენდარი. ეს არ არის პირდაპირ ნათქვამი სარედაქციო სტატიაში, მაგრამ ეს არის ძირითადი დაშვება, რომელიც ამართლებს შემოთავაზებულ ცვლილებას. ამიტომ, სწორი პასუხია: D) სასკოლო კალენდარი, რომელიც შედგება სასწავლო პერიოდებისგან ხანგრძლივი შესვენებების გარეშე, უფრო მოემსახურება ბავშვების ინტერესებს, ვიდრე სასკოლო კალენდარი ხანგრძლივი შესვენებებით. ამ ტიპის პრობლემებისთვის გავრცელებული შეცდომები მოიცავს: ამ პრობლემის გადაჭრის გეგმა შეიძლება იყოს: პრობლემის ეტაპობრივი გადაწყვეტა, გეგმის მიხედვით: არგუმენტის წინაპირობებია: არგუმენტის დასკვნაა: შესაძლო დაშვებები შეიძლება იყოს: თითოეული დაშვების შეფასება: ამიტომ, ის დაშვება, რაზეც სარედაქციო სტატიის არგუმენტია დამოკიდებული, არის D) სასკოლო კალენდარი, რომელიც შედგება სასწავლო პერიოდებისგან ხანგრძლივი შესვენებების გარეშე, უფრო მოემსახურება ბავშვების ინტერესებს, ვიდრე სასკოლო კალენდარი ხანგრძლივი შესვენებებით. ჩვენი ორი მოთხოვნის სტრატეგია – კლასიკური (Classic) და რეფლექტიური (Reflect) – გაერთიანებულია და გამოიყენება მრავალი დეკოდირების პარამეტრით. ეს გვაძლევს, ჯამში, ექვს „CoT გენერაციის რეჟიმს“. მოდელის შეფასებისას, ჩვენ მას ვაგენერირებინებთ, ტესტის მონაცემთა ნაკრების თითოეული მაგალითისთვის, ერთ აზროვნების ჯაჭვს თითოეული რეჟიმისთვის. გენერირებული კვალი შემდეგ ჩაისმება ზემოთ ნაჩვენებ მოთხოვნის შაბლონში, რომელსაც ვიყენებთ მოდელების შესაფასებლად. შესაბამისად, ვიღებთ ექვს სხვადასხვა რიცხვით ქულას აზროვნების ჯაჭვის სიზუსტისთვის (კერძოდ, თითო-თითო თითოეული რეჟიმისთვის). ღია CoT ლიდერბორდში ჩვენ ვაქვეყნებთ (ყოველი მოდელისა/ამოცანისთვის) საუკეთესო ზღვრულ სიზუსტის ზრდას, რომელიც მიღწეულია ნებისმიერი რეჟიმის პირობებში. ჩვენ თანდათან ვაფართოებთ ღია CoT ლიდერბორდს უფრო და უფრო მეტი მოდელის შეფასებით, მაგრამ ამჟამინდელი შედეგები (მოდელების რაოდენობა = 30) უკვე გვთავაზობს საინტერესო დასკვნებს. ჩვენ ვგეგმავთ წინსვლას სხვადასხვა მიმართულებით. და წვლილი ყველა ამ ძალისხმევაში...