LLM-ების ოპტიმიზაცია: TRL-ის ახალი მიდგომა GRPO სწავლების მეხსიერების შესამცირებლად
დიდი ენობრივი მოდელების (LLM) დახვეწა განმტკიცებითი სწავლის (RL) გამოყენებით გადამწყვეტია რთული ქცევების მისაღწევად. ტრადიციულად ამისთვის გამოიყენება PPO ალგორითმი RLHF-თან ერთად, რაც, თუმცა, რესურსმომხმარებელია და მრავალი მოდელის მეხსიერებაში ჩატვირთვას მოითხოვს. DeepSeek-ის R1 მოდელთან ერთად პოპულარობას იძენს ჯგუფური შედარებითი პოლიტიკის ოპტიმიზაცია (GRPO), რომელიც იყენებს შემოწმებად ჯილდოს ფუნქციებს გარე ჯილდოს მოდელის გარეშე, რაც მნიშვნელოვან გაუმჯობესებას იძლევა. მიუხედავად ამისა, RL სწავლე
ენობრივი მოდელების დახვეწა განმტკიცებითი სწავლის (RL) გამოყენებით გადამწყვეტი ნაბიჯია მოდელის სწავლების სასიცოცხლო ციკლში, რათა მოდელები სასურველი ქცევებისკენ მიმართოს, რომლებიც უფრო რთულია, ვიდრე ტიპიური ზედამხედველობითი დახვეწით მიღწევადი. ტრადიციულად, განმტკიცებითი სწავლა (RL) გამოიყენება დიდი ენობრივი მოდელების (LLM) ოპტიმიზაციისთვის პროქსიმალური პოლიტიკის ოპტიმიზაციის (PPO) ალგორითმის გამოყენებით. ეს მიდგომა, რომელიც ხშირად ასოცირდება ადამიანის უკუკავშირზე დაფუძნებულ განმტკიცებით სწავლასთან (RLHF), იყენებს ცალკე გაწვრთნილ ჯილდოს მოდელს ძირითადი მოდელის დახვეწის გასამართავად.
თუმცა, RLHF PPO-სთან ერთად ძალიან რესურსმომხმარებელი მიდგომაა – PPO მოითხოვს მრავალი მოდელის მეხსიერებაში ჩატვირთვას (პოლიტიკის, ღირებულების, ჯილდოს და საცნობარო მოდელები) და ასევე საჭიროებს ჯილდოსა და საბაზისო მოდელების დახვეწის რამდენიმე იტერაციას სასურველი შედეგების მისაღწევად. RLHF-ის წარმატება ასევე დამოკიდებულია ჯილდოს მოდელის უნარზე, ეფექტურად განასხვავოს სასურველი და არასასურველი ქცევა ჩვენი მოდელისგან.
ჯგუფური შედარებითი პოლიტიკის ოპტიმიზაცია (GRPO) ბოლო დროს მნიშვნელოვან პოპულარობას იძენს DeepSeek-ის R1 მოდელთან ერთად. GRPO თავს არიდებს RLHF-ში გამოყენებულ წინასწარ გაწვრთნილ ჯილდოს მოდელსა და ღირებულების მოდელებს და სანაცვლოდ ეყრდნობა შემოწმებად ჯილდოს ფუნქციებს, რომლებსაც შეუძლიათ მოდელის გამოსავლის სისწორის შემოწმება დახურული ფორმით, გარე ჯილდოს მოდელის საჭიროების გარეშე. ამან გამოიწვია მასიური გაუმჯობესება GRPO-ს გამოყენებისას PPO-ს ნაცვლად იმ სფეროების დახვეწისას, რომლებიც ადვილად შემოწმებადია, მაგალითად, მოდელისთვის მსჯელობის სწავლება და მათემატიკური და კოდირების ამოცანებში კარგი შედეგების მიღწევა.
მიუხედავად ამისა, RL სწავლება მაინც დიდ GPU მეხსიერებას მოიხმარს, ამიტომ ოპტიმიზაციისთვის ჯერ კიდევ ბევრი ადგილია. ამ ბლოგპოსტში ვისაუბრებთ ოპტიმიზაციაზე, რომელიც ცოტა ხნის წინ დავამატეთ TRL-ს, რაც GRPO სწავლების დროს პიკური მეხსიერების მოხმარებას 40%-ით ამცირებს, ასევე განვიხილავთ, თუ როგორ უნდა მასშტაბირდეს GRPO მრავალ GPU-სა და კვანძზე მუშაობის ან სისწორის დაკარგვის გარეშე.
ჩვენ გავაფართოვეთ Liger-ის დანაწევრებული დანაკარგის (Liger Chunked Loss) მიდგომა GRPO დანაკარგისთვის, რაც გვაძლევს საშუალებას თავიდან ავიცილოთ სრული ლოგიტების მეხსიერებაში შენახვა ყოველი სწავლების ეტაპზე. ლოგიტების გამოთვლა, რომელიც მოიცავს მოდელის გამოსავლის (output) ხელმძღვანელს (head), მნიშვნელოვან წვლილს შეაქვს მეხსიერების პიკურ მოხმარებაში, განსაკუთრებით დიდ ლექსიკონებთან, გრძელ თანმიმდევრობის სიგრძეებთან ან დიდ პარტიულ ზომებთან (batch sizes) მუშაობისას. ამ პრობლემას ვწყვეტთ lm_head-ის შეყვანის დანაწევრებით პარტიის მასშტაბით და პირდაპირი გადაცემის (forward pass) გაშვებით თითო-თითო ნაწილად (chunk).
მაგრამ თუ მას უბრალოდ პირდაპირი გზით განახორციელებთ, პიკური მეხსიერების შემცირებას რეალურად ვერ შეძლებთ, რადგან უკუ გადაცემისთვის (backward pass) მაინც დაგჭირდებათ ყველა ლოგიტის GPU მეხსიერებაში შენახვა. ამის თავიდან ასაცილებლად, ჩვენ ვიანგარიშებთ გრადიენტებს დანაკარგის (loss) თითოეული ნაწილისთვის (შეყვანის ნაწილთან და lm_head წონასთან მიმართებაში) პირდაპირი გადაცემის დროს, შემდეგ კი ვაგროვებთ მათ თითოეული ნაწილის გავლისას.
ცოტა ხნის წინ ჩვენ Liger GRPO ინტეგრირებული გავუშვით TRL-ში PR #3184-ში, ასე რომ, ახლა შეგიძლიათ გამოიყენოთ Liger GRPO დანაკარგი უბრალოდ use_liger_loss პარამეტრის True-ზე დაყენებით თქვენს GRPOConfig-ში და ისიამოვნოთ მეხსიერების დაზოგვით! გაითვალისწინეთ: ეს ფუნქციები ჯერ არ არის TRL-ის უახლეს ვერსიაში, ამიტაპზე დაგჭირდებათ TRL-ის წყაროდან ინსტალაცია.
ჩვენ ჩავატარეთ GRPO ექსპერიმენტების სერია Liger GRPO დანაკარგით და მის გარეშე, რათა შეგვედარებინა შედეგები. პოლიტიკის მოდელისთვის გამოვიყენეთ Qwen3-0.6B და ვცადეთ სხვადასხვა პარტიული ზომები (batch sizes). ყველა ექსპერიმენტი ჩატარდა gsm8k მონაცემთა ნაკრებზე მისი ჯილდოს ფუნქციების გამოყენებით. აქ მოცემულია პიკური მეხსიერების მოხმარების გრაფიკები პარტიული ზომის მიხედვით FP32 და BF16 სწავლებისთვის. როგორც მოსალოდნელი იყო, მეხსიერების დაზოგვა უმჯობესდება უფრო დიდი პარტიული ზომების დროს, რადგან დანაწევრებას პარტიული განზომილების გასწვრივ ვახორციელებთ. ასე რომ, როდესაც პარტიული ზომა იზრდება, Liger-ის დანაწევრებული დანაკარგი გაცილებით ნაკლებ მეხსიერებას იყენებს, 40%-მდე ნაკლებს, სტანდარტულ (არა-Liger) ვერსიასთან შედარებით.
მოკლე შენიშვნა: ამჟამად ჩვენ მხოლოდ FP32-ს ვუჭერთ მხარს, მაგრამ ვმუშაობთ TRL-ში Liger GRPO-სთვის BF16 მხარდაჭერის ღია კოდის გახსნაზე. აქ ნაჩვენები BF16 შედეგები არის შიდა პატჩებიდან, რომლებსაც ვამოწმებდით.
ჩვენ ასევე ვაჩვენებთ, რომ Liger დანაკარგი ეფექტურად ზუსტია. როგორც გრაფიკზე ჩანს, ჯილდოები სწავლების ეტაპებზე თითქმის იგივე რჩება, რაც სტანდარტული TRL იმპლემენტაციის გამოყენებისას.
ჩვენ ასევე დავამატეთ FSDP და PEFT მხარდაჭერა Liger GRPO დანაკარგისთვის PR #3260 და PR #3355-ში, შესაბამისად, რაც მომხმარებლებს საშუალებას აძლევს მარტივად მოახდინონ თავიანთი ექსპერიმენტების მასშტაბირება მრავალ GPU-ზე ან კვანძზე. PEFT ტექნიკები, როგორიცაა LoRA და QLoRA, ამცირებენ საწვრთნელი პარამეტრების რაოდენობას მხოლოდ მცირე ადაპტერის წონების დახვეწით ორიგინალური მოდელის თავზე, რაც მნიშვნელოვნად ამცირებს მეხსიერების დატვირთვას, რადგან მთელი მოდელისთვის გრადიენტები, აქტივაციები და ოპტიმიზატორის მდგომარეობები არ საჭიროებს მეხსიერებაში შენახვას. გარდა ამისა, PEFT-ის გამოყენება GRPO-ში იძლევა საშუალებას, თავიდან ავიცილოთ ცალკე საცნობარო მოდელის ჩატვირთვა სწავლების დროს, რადგან ორიგინალური, შეუცვლელი მოდელის მიღება შეგვიძლია სწავლების დროს LoRA ადაპტერის უბრალოდ გამორთვით.
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#ოპტიმიზაცია
#gpu
#დიდი ენობრივი მოდელები
#trl
#rlhf
#ppo
#grpo
#peft
#liger
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი