ChatGPT-ის მსგავს დიდ ენობრივ მოდელებს (LLM) შეუძლიათ ესეს დაწერა ან მენიუს დაგეგმვა თითქმის მყისიერად. თუმცა, სულ ახლახან მათი დაბნევა ადვილი იყო. ეს მოდელები, რომლებიც მომხმარებლის მოთხოვნებზე პასუხის გასაცემად ენობრივ შაბლონებს ეყრდნობიან, ხშირად მარცხდებოდნენ მათემატიკურ ამოცანებში და არ იყვნენ კარგები კომპლექსურ მსჯელობაში. მოულოდნელად, ისინი ბევრად უკეთესები გახდნენ ამ საკითხებში. დიდი ენობრივი მოდელების ახალი თაობა, რომელიც „მსჯელობის მოდელების“ სახელით არის ცნობილი, კომპლექსური პრობლემების გადასაჭრელად გადის წვრთნას. ადამიანების მსგავსად, მათ გარკვეული დრო სჭირდებათ ასეთი ამოცანების გასააზრებლად — და, რაც საყურადღებოა, MIT-ის მაკგოვერნის ტვინის კვლევის ინსტიტუტის მეცნიერებმა აღმოაჩინეს, რომ ის პრობლემები, რომლებიც მსჯელობის მოდელებისგან ყველაზე მეტ დამუშავებას მოითხოვს, ზუსტად იგივე პრობლემებია, რასაც ადამიანებიც დიდი ყურადღებით უდგებიან. სხვა სიტყვებით რომ ვთქვათ, როგორც ისინი დღეს PNAS-ის ჟურნალში იტყობინებიან, მსჯელობის მოდელისთვის „აზროვნების ფასი“ ადამიანისთვის აზროვნების ფასის მსგავსია. მკვლევრები, რომლებსაც ხელმძღვანელობდა ტვინისა და კოგნიტური მეცნიერებების ასოცირებული პროფესორი და მაკგოვერნის ინსტიტუტის გამომძიებელი ეველინა ფედორენკო, ასკვნიან, რომ ერთი მნიშვნელოვანი გზით მაინც, მსჯელობის მოდელებს აზროვნების ადამიანის მსგავსი მიდგომა აქვთ. ეს, აღნიშნავენ ისინი, არ არის განზრახული. „ადამიანებს, რომლებიც ქმნიან ამ მოდელებს, არ აინტერესებთ, აკეთებენ თუ არა ამას ადამიანებივით. მათ უბრალოდ სურთ სისტემა, რომელიც საიმედოდ იმუშავებს ყველა სახის პირობებში და სწორ პასუხებს გასცემს“, — ამბობს ფედორენკო. „ის ფაქტი, რომ არსებობს გარკვეული კონვერგენცია, მართლაც საკმაოდ გასაოცარია.“ მსჯელობის მოდელები: ხელოვნური ინტელექტის მრავალი ფორმის მსგავსად, ახალი მსჯელობის მოდელები ხელოვნური ნერვული ქსელებია: გამოთვლითი ხელსაწყოები, რომლებიც სწავლობენ ინფორმაციის დამუშავებას, როდესაც მათ ეძლევათ მონაცემები და პრობლემა გადასაჭრელად. ხელოვნური ნერვული ქსელები ძალიან წარმატებულნი იყვნენ მრავალ იმ ამოცანაში, რასაც ტვინის საკუთარი ნერვული ქსელები კარგად ართმევენ თავს — და ზოგიერთ შემთხვევაში, ნეირომეცნიერებმა აღმოაჩინეს, რომ საუკეთესოდ მოქმედი მოდელები ტვინში ინფორმაციის დამუშავების გარკვეულ ასპექტებს იზიარებენ. მიუხედავად ამისა, ზოგიერთი მეცნიერი ამტკიცებდა, რომ ხელოვნური ინტელექტი არ იყო მზად ადამიანის ინტელექტის უფრო დახვეწილი ასპექტების აღსაქმელად. „სულ ახლახან, მე იმ ადამიანთა შორის ვიყავი, ვინც ამბობდა: „ეს მოდელები მართლაც კარგები არიან აღქმასა და ენაში, მაგრამ ჯერ კიდევ დიდი გზაა გასავლელი, სანამ გვექნება ნერვული ქსელის მოდელები, რომლებსაც მსჯელობა შეეძლებათ“, — ამბობს ფედორენკო. „შემდეგ გაჩნდა ეს დიდი მსჯელობის მოდელები და როგორც ჩანს, ისინი ბევრად უკეთესად ართმევენ თავს ბევრ ასეთ აზროვნებით ამოცანას, როგორიცაა მათემატიკური პრობლემების გადაჭრა და კომპიუტერული კოდის ნაწილების დაწერა.“ ანდრეა გრეგორ დე ვარდა, K. Lisa Yang ICoN ცენტრის თანამშრომელი და ფედორენკოს ლაბორატორიის პოსტდოკი, განმარტავს, რომ მსჯელობის მოდელები პრობლემებს ეტაპობრივად წყვეტენ. „რაღაც მომენტში ადამიანებმა გააცნობიერეს, რომ მოდელებს მეტი სივრცე სჭირდებოდათ იმ რეალური გამოთვლების შესასრულებლად, რომლებიც კომპლექსური პრობლემების გადასაჭრელად არის საჭირო“, — ამბობს ის. „შესრულება ბევრად, ბევრად ძლიერი გახდა, თუ მოდელებს პრობლემების ნაწილებად დაშლის საშუალებას მისცემდით.“ იმისათვის, რომ მოდელებმა კომპლექსური პრობლემები სწორი გადაწყვეტილებებისკენ მიმავალი ნაბიჯებით გადაჭრან, ინჟინრებს შეუძლიათ გამოიყენონ განმტკიცებითი სწავლება (reinforcement learning). მათი წვრთნის დროს, მოდელები ჯილდოვდებიან სწორი პასუხებისთვის და ისჯებიან არასწორი პასუხებისთვის. „მოდელები თავად იკვლევენ პრობლემურ სივრცეს“, — ამბობს დე ვარდა. „მოქმედებები, რომლებიც დადებით ჯილდოს იწვევს, განიმტკიცება, რათა მათ უფრო ხშირად მიიღონ სწორი გადაწყვეტილებები.“ ამ გზით გაწვრთნილი მოდელები, წინამორბედებთან შედარებით, ბევრად უფრო სავარაუდოა, რომ იმავე პასუხებს მიიღებენ, რასაც ადამიანი მიიღებდა მსჯელობის ამოცანის მიცემისას. მათი ეტაპობრივი პრობლემის გადაჭრა ნიშნავს, რომ მსჯელობის მოდელებს შეიძლება ცოტა მეტი დრო დასჭირდეთ პასუხის მოსაძებნად, ვიდრე წინა LLM-ებს — მაგრამ რადგან ისინი იღებენ სწორ პასუხებს იქ, სადაც წინა მოდელები ჩავარდებოდნენ, მათი პასუხები ლოდინად ღირს. მოდელების მიერ კომპლექსური პრობლემების გადასაჭრელად დროის საჭიროება უკვე მიანიშნებს ადამიანის აზროვნებასთან პარალელზე: თუ ადამიანს მოსთხოვთ, რომ რთული პრობლემა მყისიერად გადაჭრას, ის ალბათ ვერც ის შეძლებს ამას. დე ვარდას სურდა ამ ურთიერთობის უფრო სისტემატური შესწავლა. ამიტომ მან მსჯელობის მოდელებსა და მოხალისე ადამიანებს ერთი და იგივე პრობლემების ნაკრები მისცა და აკვირდებოდა არა მხოლოდ იმას, მიიღეს თუ არა სწორი პასუხები, არამედ იმასაც, თუ რამდენი დრო ან ძალისხმევა დასჭირდათ მათ ამის მისაღწევად. დრო ტოკენების წინააღმდეგ: ეს ნიშნავდა იმის გაზომვას, თუ რამდენი დრო დასჭირდათ ადამიანებს თითოეულ კითხვაზე პასუხის გასაცემად, მილიწამების სიზუსტით. მოდელებისთვის, დე ვარდამ სხვა მაჩვენებელი გამოიყენა. დამუშავების დროის გაზომვას აზრი არ ჰქონდა, რადგან ეს უფრო კომპიუტერულ აპარატურაზეა დამოკიდებული, ვიდრე მოდელის მიერ პრობლემის გადაჭრისთვის დახარჯულ ძალისხმევაზე. ამიტომ, ამის ნაცვლად, მან ტოკენები აკონტროლა, რომლებიც მოდელის აზროვნების შიდა ჯაჭვის ნაწილია. „ისინი წარმოქმნიან ტოკენებს, რომლებიც მომხმარებლისთვის სანახავად და სამუშაოდ არ არის განკუთვნილი, არამედ მხოლოდ იმისთვის, რომ ჰქონდეთ შიდა გამოთვლების რაიმე კვალი, რასაც ისინი აკეთებენ“, — განმარტავს დე ვარდა. „ეს ისეა, თითქოს ლაპარაკობდნენ.“