დიფუზიური მოდელები (მაგ., DALL-E 2, Stable Diffusion) არის გენერაციული მოდელების კლასი, რომლებიც ფართოდ გამოიყენება გამოსახულებების, განსაკუთრებით ფოტო-რეალისტური სურათების, წარმატებით გენერირებისთვის. თუმცა, ამ მოდელების მიერ შექმნილი გამოსახულებები ყოველთვის არ შეესაბამება ადამიანის პრეფერენციებს ან განზრახვებს. აქედან გამომდინარე ჩნდება "შესაბამისობის პრობლემა": როგორ უნდა დავრწმუნდეთ, რომ მოდელის გამოსავლები შეესაბამება ადამიანურ პრეფერენციებს, როგორიცაა „ხარისხი“, ან რომ გამოსავლები შეესაბამება განზრახვას, რომლის გამოხატვა მოთხოვნებით რთულია? სწორედ აქ შემოდის თამაშში გაძლიერებითი სწავლა (Reinforcement Learning - RL). დიდი ენობრივი მოდელების (Large Language Models - LLM) სამყაროში, გაძლიერებითი სწავლა (RL) აღმოჩნდა ძალიან ეფექტური ინსტრუმენტი ამ მოდელების ადამიანურ პრეფერენციებთან შესაბამისობაში მოსაყვანად. ის არის ერთ-ერთი მთავარი კომპონენტი ChatGPT-ის მსგავსი სისტემების მაღალი ეფექტურობის უკან. უფრო ზუსტად, RL არის გაძლიერებითი სწავლის კრიტიკული ინგრედიენტი ადამიანის უკუკავშირით (Reinforcement Learning from Human Feedback - RLHF), რაც ChatGPT-ს საშუალებას აძლევს, ადამიანებივით ისაუბროს. ნაშრომში „დიფუზიური მოდელების სწავლება გაძლიერებითი სწავლით“, ბლეკი და სხვები გვიჩვენებენ, თუ როგორ უნდა გავაუმჯობესოთ დიფუზიური მოდელები RL-ის გამოყენებით, რათა დავაზუსტოთ ისინი მიზნობრივი ფუნქციის მიხედვით მეთოდის მეშვეობით, სახელწოდებით „დენოიზინგის დიფუზიური პოლიტიკის ოპტიმიზაცია“ (Denoising Diffusion Policy Optimization - DDPO). ამ ბლოგ პოსტში ჩვენ განვიხილავთ, თუ როგორ შეიქმნა DDPO, მოკლედ აღვწერთ მის მუშაობას და როგორ შეიძლება DDPO-ის ინტეგრირება RLHF-ის სამუშაო პროცესში, რათა მივიღოთ მოდელის გამოსავლები, რომლებიც უფრო მეტად შეესაბამება ადამიანის ესთეტიკას. შემდეგ სწრაფად გადავალთ იმაზე, თუ როგორ შეგიძლიათ გამოიყენოთ DDPO თქვენს მოდელებზე trl ბიბლიოთეკიდან ახლად ინტეგრირებული DDPOTrainer-ის საშუალებით და განვიხილავთ ჩვენს დასკვნებს Stable Diffusion-ზე DDPO-ის გაშვებიდან. DDPO არ არის ერთადერთი ეფექტური პასუხი კითხვაზე, თუ როგორ უნდა დავაზუსტოთ დიფუზიური მოდელები RL-ის გამოყენებით. სანამ სიღრმისეულად ჩავუღრმავდებით, გასათვალისწინებელია ორი ძირითადი ასპექტი ერთი RL გადაწყვეტის უპირატესობის გასაგებად მეორეზე. DDPO-მდე, ჯილდოზე დაფუძნებული რეგრესია (Reward-weighted regression - RWR) იყო გაძლიერებითი სწავლის გამოყენების დადგენილი მეთოდი დიფუზიური მოდელების დაზუსტებისთვის. RWR ხელახლა იყენებს დიფუზიური მოდელის დენოიზინგის დანაკარგის ფუნქციას სასწავლო მონაცემებთან ერთად, რომლებიც თავად მოდელიდან არის აღებული, და ნიმუშის მიხედვით დანაკარგის შეწონვას, რომელიც დამოკიდებულია საბოლოო ნიმუშებთან დაკავშირებულ ჯილდოზე. ეს ალგორითმი უგულებელყოფს შუალედურ დენოიზინგის ნაბიჯებს/ნიმუშებს. მიუხედავად იმისა, რომ ეს მუშაობს, ორი რამ უნდა აღინიშნოს: მიახლოების ორ დონეს მნიშვნელოვანი გავლენა აქვს როგორც შესრულებაზე, ასევე რთული მიზნების დამუშავების უნარზე. DDPO ამ მეთოდს საწყის წერტილად იყენებს. იმის ნაცვლად, რომ დენოიზინგის ნაბიჯი ერთ ნაბიჯად განვიხილოთ მხოლოდ საბოლოო ნიმუშზე ფოკუსირებით, DDPO მთელ დენოიზინგის პროცესს აყალიბებს როგორც მრავალსაფეხურიან მარკოვის გადაწყვეტილების პროცესს (Markov Decision Process - MDP), სადაც ჯილდო მიიღება ყველაზე ბოლოს. ეს ფორმულირება, ფიქსირებული შემგროვებლის გამოყენებასთან ერთად, გზას უხსნის აგენტის პოლიტიკას, რომ გახდეს იზოტროპული გაუსისებრი განაწილება, ნაცვლად თვითნებურად რთული განაწილებისა. ასე რომ, საბოლოო ნიმუშის მიახლოებითი ალბათობის გამოყენების ნაცვლად (რომელიც RWR-ის გზაა), აქ გამოიყენება თითოეული დენოიზინგის ნაბიჯის ზუსტი ალბათობა, რომლის გამოთვლაც უკიდურესად მარტივია ( ℓ(μ,σ2;x)=−n2log⁡(2π)−n2log⁡(σ2)−12σ2∑i=1n(xi−μ)2 ). თუ DDPO-ს შესახებ მეტი დეტალის გაგება გაინტერესებთ, გირჩევთ გაეცნოთ ორიგინალურ ნაშრომს და თანმხლებ ბლოგ პოსტს. დენოიზინგის პროცესის თანმიმდევრული ბუნების მოდელირებისთვის გამოყენებული MDP (მარკოვის გადაწყვეტილების პროცესი) ჩარჩოსა და სხვა შემდგომი მოსაზრებების გათვალისწინებით, ოპტიმიზაციის პრობლემის გადასაჭრელად შერჩეული ინსტრუმენტი არის პოლიტიკის გრადიენტის მეთოდი. კონკრეტულად, პროქსიმალური პოლიტიკის ოპტიმიზაცია (Proximal Policy Optimization - PPO). DDPO ალგორითმი თითქმის იდენტურია PPO-სი, მაგრამ აღსანიშნავია, რომ ტრაექტორიის შეგროვების ნაწილი PPO-ში არის მაღალკონფიგურირებული. [მოყვანილია დიაგრამა ნაკადის შესაჯამებლად: (დიაგრამა არ არის მოწოდებული ტექსტში)]. RLHF-ის ზოგადი სწავლების ასპექტი უხეშად შეიძლება დაიყოს შემდეგ ეტაპებად: უნდა აღინიშნოს, რომ პრეფერენციული მონაცემები არის ადამიანის უკუკავშირის აღბეჭდვის ძირითადი წყარო RLHF-ის კონტექსტში. როდესაც DDPO-ს ვამატებთ, სამუშაო პროცესი შემდეგნაირად იცვლება: [მოყვანილია სხვა დიაგრამა/სია]. აღსანიშნავია, რომ ზოგადი RLHF სამუშაო პროცესის მე-3 ნაბიჯი გამოტოვებულია მოცემულ ეტაპების სიაში, რადგან ემპირიულად ნაჩვენებია (როგორც თავად ნახავთ), რომ ეს არ არის საჭირო. იმისათვის, რომ დიფუზიურმა მოდელმა შექმნას გამოსახულებები, რომლებიც უფრო მეტად შეესაბამება ადამიანის აღქმას ესთეტიკის შესახებ, ჩვენ მივყვებით შემდეგ ეტაპებს: [მოყვანილია კიდევ ერთი დიაგრამა/სია]. ამ ეტაპებს გავითვალისწინებთ, როდესაც გადავალთ მათ პრაქტიკულ განხორციელებაზე, რაც აღწერილია შემდეგ სექციებში. დასაწყებად, რაც შეეხება აპარატურულ მხარეს და DDPO-ს ამ იმპლემენტაციას, წარმატებული სწავლებისთვის საჭიროა მინიმუმ NVIDIA A100 GPU-ზე წვდომა. ამ GPU ტიპზე დაბალი ნებისმიერი აპარატურა მალევე წააწყდება მეხსიერების ამოწურვის პრობლემებს (Out-of-memory issues). trl ბიბლიოთეკის ინსტალაციისთვის გამოიყენეთ pip.