MIT-ის მკვლევარები LLM-ების წვრთნის სიჩქარეს აორმაგებენ გამოთვლითი რესურსების ოპტიმიზაციით
მსხვილი ენობრივი მოდელების (LLM) წვრთნა უზარმაზარ გამოთვლით რესურსებს მოითხოვს, თუმცა პროცესის არაეფექტურობის გამო პროცესორების ნაწილი ხშირად უქმად რჩება. MIT-ის მკვლევარებმა შეიმუშავეს მეთოდი, რომელიც ამ გამოუყენებელ დროს იყენებს უფრო პატარა, სწრაფი მოდელის საწვრთნელად. ეს პატარა მოდელი წინასწარმეტყველებს დიდი LLM-ის გამომუშავებას, რასაც შემდეგ დიდი მოდელი ამოწმებს. აღნიშნული მიდგომა წვრთნის სიჩქარეს აორმაგებს და მნიშვნელოვნად ამცირებს მოწინავე LLM-ების განვითარების ღირებულებასა და ენერგოეფექტუ
მსჯელობის უნარის მქონე მსხვილი ენობრივი მოდელები (LLM) შექმნილია კომპლექსური პრობლემების გადასაჭრელად, მათი მცირე ნაბიჯებად დაყოფით. ეს მძლავრი მოდელები განსაკუთრებით კარგად ასრულებენ რთულ ამოცანებს, როგორიცაა მოწინავე პროგრამირება და მრავალსაფეხურიანი დაგეგმვა. თუმცა, მსჯელობის უნარის მქონე მოდელების განვითარება მოითხოვს უზარმაზარ გამოთვლით რესურსებს და ენერგიას, წვრთნის პროცესის არაეფექტურობის გამო. მაშინ როცა მაღალი სიმძლავრის პროცესორების ნაწილი განუწყვეტლივ მუშაობს რთულ მოთხოვნებზე, სხვები ჯგუფში უქმად არიან.
MIT-ისა და სხვა დაწესებულებების მკვლევარებმა იპოვეს გზა, თუ როგორ გამოიყენონ ეს გამოთვლითი „დასვენების დრო“ მსჯელობის მოდელების წვრთნის ეფექტურად დასაჩქარებლად. მათ მიერ შემუშავებული ახალი მეთოდი ავტომატურად წვრთნის უფრო პატარა, სწრაფ მოდელს, რათა იწინასწარმეტყველოს დიდი მსჯელობის უნარის მქონე LLM-ის გამომუშავება, რასაც შემდეგ დიდი მოდელი ამოწმებს. ეს ამცირებს იმ სამუშაოს მოცულობას, რომელიც მსჯელობის მოდელმა უნდა შეასრულოს, რითაც აჩქარებს წვრთნის პროცესს. ამ სისტემის გასაღები არის მისი უნარი, მოქნილად მოამზადოს და გამოიყენოს პატარა მოდელი, ასე რომ ის მხოლოდ მაშინ ირთვება, როდესაც ზოგიერთი პროცესორი უქმად არის. გამოთვლითი რესურსების გამოყენებით, რომლებიც სხვა შემთხვევაში დაიკარგებოდა, ის აჩქარებს წვრთნას დამატებითი ხარჯების გარეშე. მრავალ მსჯელობის უნარის მქონე LLM-ზე ტესტირებისას, მეთოდმა გააორმაგა წვრთნის სიჩქარე სიზუსტის შენარჩუნებით. ამან შეიძლება შეამციროს მოწინავე LLM-ების განვითარების ღირებულება და გაზარდოს ენერგოეფექტურობა ისეთი პროგრამებისთვის, როგორიცაა ფინანსური ტენდენციების პროგნოზირება ან ელექტრო ქსელებში რისკების გამოვლენა.
„ადამიანებს სურთ მოდელები, რომლებსაც უფრო რთული ამოცანების შესრულება შეუძლიათ. მაგრამ თუ ეს არის მოდელის განვითარების მიზანი, მაშინ ეფექტურობა უნდა იყოს პრიორიტეტი. ჩვენ ვიპოვეთ ამ პრობლემის უდანაკარგო გადაწყვეტა და შემდეგ შევიმუშავეთ სრულფასოვანი სისტემა, რომელსაც პრაქტიკაში საკმაოდ დრამატული აჩქარების მოტანა შეუძლია,“ - ამბობს ცინგჰაო ჰუ, MIT-ის პოსტდოქტორი და ამ ტექნიკის შესახებ სტატიის თანაავტორი. მასთან ერთად სტატიაზე მუშაობდნენ თანაავტორი შან იანგი, ელექტროინჟინერიისა და კომპიუტერული მეცნიერების (EECS) მაგისტრანტი; ძუნსიან გუო, EECS-ის მაგისტრანტი; უფროსი ავტორი სონგ ჰანი, EECS-ის ასოცირებული პროფესორი, ელექტრონიკის კვლევითი ლაბორატორიის წევრი და NVIDIA-ს გამორჩეული მეცნიერი; ასევე სხვა მკვლევარები NVIDIA-დან, ETH ციურიხიდან, MIT-IBM Watson AI Lab-დან და მასაჩუსეტსის უნივერსიტეტიდან ამჰერსტში. კვლევა წარმოდგენილი იქნება ACM-ის საერთაშორისო კონფერენციაზე "არქიტექტურული მხარდაჭერა პროგრამირების ენებისა და ოპერაციული სისტემებისთვის".
**წვრთნის შეფერხება**
დეველოპერებს სურთ, რომ მსჯელობის უნარის მქონე LLM-ებმა შეძლონ თავიანთი კრიტიკული აზროვნების პროცესში შეცდომების იდენტიფიცირება და გამოსწორება. ეს შესაძლებლობა მათ საშუალებას აძლევს წარმატებით გაართვან თავი რთულ შეკითხვებს, რაც სტანდარტულ LLM-ს გაუჭირდებოდა. ამ უნარის სასწავლებლად, დეველოპერები მსჯელობის უნარის მქონე LLM-ებს წვრთნიან გაძლიერებითი სწავლის (RL) ტექნიკის გამოყენებით. მოდელი წარმოქმნის მრავალ პოტენციურ პასუხს შეკითხვაზე, იღებს ჯილდოს საუკეთესო კანდიდატისთვის და განახლდება საუკეთესო პასუხის საფუძველზე. ეს ნაბიჯები ათასობითჯერ მეორდება, სანამ მოდელი სწავლობს. თუმცა, მკვლევარებმა აღმოაჩინეს, რომ მრავალი პასუხის გენერირების პროცესმა, რომელსაც „გაშლა“ (rollout) ეწოდება, შეიძლება RL წვრთნისთვის საჭირო შესრულების დროის 85 პროცენტამდე მოიხმაროს.
„მოდელის განახლება — რაც რეალური „წვრთნის“ ნაწილია — შედარებით ძალიან ცოტა დროს მოიხმარს“, — ამბობს ჰუ. ეს შეფერხება ხდება სტანდარტულ RL ალგორითმებში, რადგან წვრთნის ჯგუფში ყველა პროცესორმა უნდა დაასრულოს თავისი პასუხები, სანამ შემდეგ ეტაპზე გადავლენ. რადგან ზოგიერთი პროცესორი შეიძლება ძალიან ხანგრძლივ პასუხებზე მუშაობდეს, სხვები, რომლებმაც უფრო მოკლე პასუხები წარმოქმნეს, მათ დასრულებას ელოდებიან. „ჩვენი მიზანი იყო ეს უმოქმედო დრო სიჩქარის გაზრდისთვის გამოგვეყენებინა ყოველგვარი დანაკარგი ხარჯების გარეშე“, — დასძენს ჰუ.
მათ სცადეს არსებული ტექნიკის, სპეკულაციური დეკოდირების (speculative decoding) გამოყენება, პროცესის დასაჩქარებლად. სპეკულაციური დეკოდირება გულისხმობს უფრო პატარა მოდელის, „დრაფტერის“ (drafter) წვრთნას, რათა სწრაფად გამოიცნოს დიდი მოდელის მომავალი გამომუშავება. დიდი მოდელი ამოწმებს დრაფტერის ვარაუდებს და მის მიერ მიღებული პასუხები გამოიყენება წვრთნისთვის. რადგან დიდი მოდელს შეუძლია დრაფტერის ყველა ვარაუდის ერთდროულად შემოწმება, ნაცვლად თითოეული გამომუშავების თანმიმდევრულად გენერირებისა, ეს აჩქარებს პროცესს.
**ადაპტური გადაწყვეტა**
თუმცა, სპეკულაციური დეკოდირებისას, დრაფტერის მოდელი, როგორც წესი, მხოლოდ ერთხელ წვრთნება და სტატიკური რჩება. ეს ტექნიკას არაპრაქტიკულს ხდის გაძლიერებითი სწავლისთვის, რადგან მსჯელობის მოდელი ათასობითჯერ განახლდება წვრთნის დროს. სტატიკური დრაფტერი სწრაფად მოძველდება და უსარგებლო გახდება რამდენიმე ნაბიჯის შემდეგ. ამ პრობლემის დასაძლევად, მკვლევარებმა შექმნეს...
თეგები:
#ხელოვნური ინტელექტი
#llm
#კვლევა
#მანქანური სწავლება
#ეფექტურობა
#mit
#წვრთნა
#გაძლიერებითი სწავლა
#გამოთვლები
წყარო: news.mit.edu
AI-ით გადამუშავებული
მსგავსი სტატიები
მეცნიერება და ტექნოლოგია
კვანტური კომპიუტერები: ნილს ბორის ინსტიტუტმა ქუბითების მდგომარეობის მონიტორინგის სიჩქარე ასჯერ გაზარდა
მეცნიერება და ტექნოლოგია
ნეირომორფული კომპიუტერები რთულ მათემატიკურ ამოცანებს წყვეტენ: გზა ენერგოეფექტური სუპერკომპიუტერებისკენ
მეცნიერება და ტექნოლოგია