„PaTH Attention“: MIT-ის მკვლევრები ტრანსფორმერების „პოზიციურ მეხსიერებას“ აუმჯობესებენ
MIT-ისა და MIT-IBM Watson AI Lab-ის მკვლევრებმა შეიმუშავეს ახალი AI კოდირების ტექნიკა, სახელად „PaTH Attention“, რომელიც მიზნად ისახავს დიდი ენობრივი მოდელების (LLMs) შეზღუდვების დაძლევას მდგომარეობის თვალთვალისა და თანმიმდევრული მსჯელობის კუთხით. არსებული „ყურადღების მექანიზმები“ ვერ აღიქვამენ სიტყვების თანმიმდევრობას ისე ეფექტურად, როგორც საჭიროა. „PaTH Attention“ პოზიციურ ინფორმაციას ადაპტირებადს და კონტექსტის გათვალისწინებით ამუშავებს, სტატიკური მეთოდებისგან განსხვავებით, რითაც აუმჯობესებს მ
უმეტესი ენები მნიშვნელობის ამოსაღებად იყენებენ სიტყვების პოზიციასა და წინადადების სტრუქტურას. მაგალითად, „კატა ყუთზე იჯდა“ არ არის იგივე, რაც „ყუთი კატაზე იდო“. გრძელ ტექსტებში, როგორიცაა ფინანსური დოკუმენტი ან რომანი, ამ სიტყვების სინტაქსი სავარაუდოდ ვითარდება. ანალოგიურად, ადამიანმა შესაძლოა თვალი ადევნოს ცვლადებს კოდის ნაწილში ან მიჰყვეს ინსტრუქციებს, რომლებსაც აქვთ პირობითი ქმედებები. ეს არის მდგომარეობის ცვლილებებისა და თანმიმდევრული მსჯელობის მაგალითები, რაშიც ჩვენ ველოდებით, რომ ხელოვნური ინტელექტის უახლესი სისტემები წარმატებას მიაღწევენ; თუმცა, არსებულ, უახლეს „ყურადღების მექანიზმს“ (attention mechanism) ტრანსფორმერებში — ძირითად არქიტექტურაში, რომელიც გამოიყენება დიდ ენობრივ მოდელებში (LLMs) სიტყვების მნიშვნელობის დასადგენად — აქვს თეორიული და ემპირიული შეზღუდვები ასეთი შესაძლებლობების კუთხით.
„ყურადღების მექანიზმი“ LLM-ს საშუალებას აძლევს, გადახედოს მოთხოვნის ან დოკუმენტის ადრინდელ ნაწილებს და, მისი ვარჯიშის საფუძველზე, განსაზღვროს, რომელი დეტალები და სიტყვებია ყველაზე მნიშვნელოვანი; თუმცა, მხოლოდ ეს მექანიზმი არ ესმის სიტყვების თანმიმდევრობას. ის „ხედავს“ ყველა შეყვანის სიტყვას, ანუ ტოკენს, ერთდროულად და ამუშავებს მათ იმ თანმიმდევრობით, რომლითაც ისინი წარმოდგენილია, ამიტომ მკვლევრებმა შეიმუშავეს ტექნიკა პოზიციური ინფორმაციის კოდირებისთვის. ეს გადამწყვეტია მაღალსტრუქტურირებული დომენებისთვის, როგორიცაა ენა. მაგრამ დომინანტური პოზიციური კოდირების მეთოდი, სახელწოდებით „როტაციული პოზიციური კოდირება“ (rotary position encoding – RoPE), ითვალისწინებს მხოლოდ ტოკენებს შორის შედარებით მანძილს თანმიმდევრობაში და დამოუკიდებელია შეყვანის მონაცემებისგან. ეს ნიშნავს, რომ, მაგალითად, სიტყვები, რომლებიც ოთხი პოზიციით არიან დაშორებული, როგორც „კატა“ და „ყუთი“ ზემოთ მოცემულ მაგალითში, მიიღებენ ერთსა და იმავე ფიქსირებულ მათემატიკურ როტაციას, რომელიც სპეციფიკურია ამ შედარებითი მანძილისთვის.
ახლა MIT-ისა და MIT-IBM Watson AI Lab-ის მიერ ჩატარებულმა კვლევამ შექმნა კოდირების ტექნიკა, ცნობილი როგორც „PaTH Attention“, რომელიც პოზიციურ ინფორმაციას ადაპტირებადს და კონტექსტის გათვალისწინებით აქცევს, RoPE-ის სტატიკურობისგან განსხვავებით. „ტრანსფორმერები მრავალი დომენის ზუსტ და მასშტაბირებად მოდელირებას ააქტიურებენ, მაგრამ მათ აქვთ შეზღუდვები მდგომარეობის თვალთვალის კუთხით – ეს არის ფენომენების კლასი, რომელიც, სავარაუდოდ, ჩვენს AI სისტემებში სასურველი მნიშვნელოვანი შესაძლებლობების საფუძველს წარმოადგენს. ამიტომ, მნიშვნელოვანი კითხვაა: როგორ შევინარჩუნოთ ტრანსფორმერების მასშტაბურობა და ეფექტურობა, ხოლო ამავდროულად მდგომარეობის თვალთვალიც ჩავრთოთ?“ – ამბობს ნაშრომის უფროსი ავტორი იუნ კიმი, ელექტრო ინჟინერიისა და კომპიუტერული მეცნიერების დეპარტამენტის (EECS) ასოცირებული პროფესორი, კომპიუტერული მეცნიერებისა და ხელოვნური ინტელექტის ლაბორატორიის (CSAIL) წევრი და MIT-IBM Watson AI Lab-ის მკვლევარი. ამ ნაშრომის შესახებ ახალი სტატია ამ თვის დასაწყისში ნერვული ინფორმაციის დამუშავების სისტემების კონფერენციაზე (NeurIPS) იყო წარმოდგენილი.
კიმის თანაავტორები არიან წამყვანი ავტორი სონგლინ იანგი, EECS-ის ასპირანტი და MIT-IBM Watson AI Lab-ის საზაფხულო პროგრამის ყოფილი სტაჟიორი; კაიუე ვენი სტენფორდის უნივერსიტეტიდან; ლილიანგ რენი Microsoft-იდან; და იიკანგ შენი, შონ ტანი, მაიანკ მიშრა და რამესვარ პანდა IBM Research-დან და MIT-IBM Watson AI Lab-დან.
**გაგების გზა**
ნაცვლად იმისა, რომ თითოეულ სიტყვას მიანიჭოს ფიქსირებული როტაცია ტოკენებს შორის შედარებითი მანძილის საფუძველზე, როგორც ამას RoPE აკეთებს, PaTH Attention არის მოქნილი, შუალედურ სიტყვებს განიხილავს, როგორც გზას, რომელიც შედგება მცირე, მონაცემებზე დამოკიდებული ტრანსფორმაციებისგან. თითოეული ტრანსფორმაცია, რომელიც ეფუძნება მათემატიკურ ოპერაციას, სახელწოდებით „ჰაუსჰოლდერის ანარეკლი“ (Householder reflection), მოქმედებს როგორც პაწაწინა სარკე, რომელიც რეგულირდება ყოველი ტოკენის შინაარსის მიხედვით, რომელსაც ის გადის. თანმიმდევრობის ყოველ ნაბიჯს შეუძლია გავლენა მოახდინოს იმაზე, თუ როგორ ინტერპრეტირებს მოდელი ინფორმაციას მოგვიანებით. კუმულაციური ეფექტი სისტემას საშუალებას აძლევს, მოახდინოს იმის მოდელირება, თუ როგორ იცვლება მნიშვნელობა სიტყვებს შორის გზაზე და არა მხოლოდ რამდენად არიან ისინი ერთმანეთისგან დაშორებული. ეს მიდგომა ტრანსფორმერებს საშუალებას აძლევს, თვალი ადევნონ, თუ როგორ იცვლება ერთეულები და ურთიერთობები დროთა განმავლობაში, რითაც მათ „პოზიციური მეხსიერების“ შეგრძნებას აძლევს. იფიქრეთ ამაზე, როგორც გზაზე სიარული გარემოს აღქმისას და იმაზე, თუ როგორ მოქმედებს ის თქვენზე.
გარდა ამისა, გუნდმა შეიმუშავა აპარატურულად ეფექტური ალგორითმი, რათა უფრო ეფექტურად გამოთვალოს „ყურადღების ქულები“ (attention scores) ტოკენების ყველა წყვილს შორის, რათა PaTH Attention-ის კუმულაციური მათემატიკური ტრანსფორმაცია შეკუმშულიყო და დაიშალა მცირე გამოთვლებად, რათა ის თავსებადი იყოს GPU-ებზე სწრაფ დამუშავებასთან.
შემდეგ MIT-IBM-ის მკვლევრებმა შეისწავლეს PaTH Attention-ის შესრულება სინთეზურ და რეალურ სამყაროს ამოცანებზე, მათ შორის მსჯელობაზე, გრძელკონტექსტურ ბენჩმარკებზე და LLM-ის სრულ ვარჯიშზე, რათა დაედგინათ, აუმჯობესებდა თუ არა ის მოდელის უნარს, თვალყური ადევნოს ინფორმაციას დროთა განმავლობაში.
გუნდმა შეამოწმა მისი უნარი, მიჰყვებოდა უახლეს „ჩაწერის“ (write) ბრძანებას მრავალი ყურადღების გადამტანი ნაბიჯისა და მრავალსაფეხურიანი გახსენების ტესტების მიუხედავად – ეს არის ამოცანები, რომლებიც რთულია სტანდარტული პოზიციური კოდირების მეთოდებისთვის, როგორიცაა RoPE.
მკვლევრებმა ასევე გაავარჯიშეს საშუალო ზომის LLM-ები და შეადარეს ისინი სხვა მეთოდებთან. PaTH Attention-მა გააუმჯობესა „დაბნეულობა“ (perplexity) და აჯობა სხვა მეთოდებს მსჯელობის ბენჩმარკებზე, რაზეც ის არ იყო გაწვრთნილი. მათ ასევე შეაფასეს ინფორმაციის მოძიება (retrieval).
თეგები:
#ai
#ხელოვნური ინტელექტი
#llm
#მანქანური სწავლება
#mit
#ტრანსფორმერები
#path attention
#პოზიციური კოდირება
#ღრმა სწავლება
წყარო: news.mit.edu
AI-ით გადამუშავებული