აქტორ-კრიტიკოსის მეთოდები ღრმა განმტკიცებით სწავლაში
სტატია განიხილავს აქტორ-კრიტიკოსის მეთოდებს, ჰიბრიდულ მიდგომას ღრმა განმტკიცებით სწავლაში, რომელიც აერთიანებს პოლიტიკაზე დაფუძნებულ და ღირებულებაზე დაფუძნებულ მეთოდებს. ეს მიდგომა მიზნად ისახავს ისეთი პოლიტიკის გრადიენტული ალგორითმების, როგორიცაა Reinforce, მაღალი დისპერსიის პრობლემის გადაჭრას, რაც ხელს უწყობს სწავლის სტაბილიზაციასა და დაჩქარებას. სტატია მოიცავს Advantage Actor Critic (A2C) მეთოდს და მის გამოყენებას რობოტულ გარემოში Stable-Baselines3-ის მეშვეობით.
⚠️ სტატიის განახლებული ვერსია ხელმისაწვდომია აქ 👉 https://huggingface.co/deep-rl-course/unit1/introduction ეს სტატია ღრმა განმტკიცებითი სწავლის კურსის ნაწილია. უფასო კურსი დამწყებიდან ექსპერტამდე. სასწავლო გეგმას გაეცანით აქ.
⚠️ სტატიის განახლებული ვერსია ხელმისაწვდომია აქ 👉 https://huggingface.co/deep-rl-course/unit1/introduction ეს სტატია ღრმა განმტკიცებითი სწავლის კურსის ნაწილია. უფასო კურსი დამწყებიდან ექსპერტამდე. სასწავლო გეგმას გაეცანით აქ.
მე-5 ერთეულში ჩვენ შევისწავლეთ ჩვენი პირველი პოლიტიკაზე დაფუძნებული ალგორითმი, სახელწოდებით Reinforce.
პოლიტიკაზე დაფუძნებულ მეთოდებში ჩვენი მიზანია პოლიტიკის პირდაპირი ოპტიმიზაცია ღირებულების ფუნქციის გამოყენების გარეშე. უფრო ზუსტად, Reinforce არის პოლიტიკაზე დაფუძნებული მეთოდების ქვეკლასის, პოლიტიკის გრადიენტის მეთოდების ნაწილი. ეს ქვეკლასი პირდაპირ ოპტიმიზაციას უკეთებს პოლიტიკას ოპტიმალური პოლიტიკის წონების შეფასებით გრადიენტული ასვლის გამოყენებით. ჩვენ ვნახეთ, რომ Reinforce კარგად მუშაობდა. თუმცა, რადგან ჩვენ ვიყენებთ მონტე-კარლოს სემპლირებას ამონაგების შესაფასებლად (მთელ ეპიზოდს ვიყენებთ ამონაგების გამოსათვლელად), ჩვენ გვაქვს მნიშვნელოვანი დისპერსია პოლიტიკის გრადიენტის შეფასებაში. გახსოვდეთ, რომ პოლიტიკის გრადიენტის შეფასება არის ამონაგების ყველაზე მკვეთრი ზრდის მიმართულება. ანუ, როგორ განვაახლოთ ჩვენი პოლიტიკის წონები ისე, რომ ქმედებებს, რომლებიც კარგ ამონაგებს იწვევს, უფრო მაღალი ალბათობა ჰქონდეთ განხორციელების. მონტე-კარლოს დისპერსია, რომელსაც ამ ერთეულში უფრო დეტალურად შევისწავლით, იწვევს სწავლის შენელებას, რადგან მის შესამცირებლად ბევრი ნიმუში გვჭირდება.
დღეს ჩვენ შევისწავლით აქტორ-კრიტიკოსის მეთოდებს, ჰიბრიდულ არქიტექტურას, რომელიც აერთიანებს ღირებულებაზე დაფუძნებულ და პოლიტიკაზე დაფუძნებულ მეთოდებს, რათა შეამციროს დისპერსია და დაასტაბილუროს სწავლა: ჩვენ შევისწავლით ერთ-ერთ ასეთ ჰიბრიდულ მეთოდს, სახელწოდებით Advantage Actor Critic (A2C), და ჩვენს აგენტს მოვამზადებთ Stable-Baselines3-ის გამოყენებით რობოტულ გარემოში, სადაც ორ აგენტს სიარულს ვასწავლით: საინტერესოდ ჟღერს? დავიწყოთ!
Reinforce-ში ჩვენ გვსურს ტრაექტორიაში მოქმედებების ალბათობა გავზარდოთ იმის პროპორციულად, თუ რამდენად მაღალია ამონაგები. ეს ამონაგები R(τ)R(\tau)R(τ) გამოითვლება მონტე-კარლოს სემპლირების გამოყენებით. მართლაც, ჩვენ ვაგროვებთ ტრაექტორიას და ვანგარიშობთ დისკონტირებულ ამონაგებს, და ამ ქულას ვიყენებთ მოცემულ ტრაექტორიაში ყოველი შესრულებული მოქმედების ალბათობის გასაზრდელად ან შესამცირებლად. თუ ამონაგები კარგია, ყველა მოქმედება იქნება „განმტკიცებული“ მათი განხორციელების ალბათობის გაზრდით. R(τ)=Rt+1+γRt+2+γ2Rt+3+...R(\tau) = R_{t+1} + \gamma R_{t+2} + \gamma^2 R_{t+3} + ...R(τ)=Rt+1+γRt+2+γRt+3+... ამ მეთოდის უპირატესობა ის არის, რომ ის მიუკერძოებელია. რადგან ჩვენ არ ვაფასებთ ამონაგებს, ჩვენ ვიყენებთ მხოლოდ ნამდვილ ამონაგებს, რომელსაც ვიღებთ. მაგრამ პრობლემა ის არის, რომ დისპერსია მაღალია, რადგან ტრაექტორიებმა შეიძლება გამოიწვიოს სხვადასხვა ამონაგები გარემოს სტოქასტიკურობის (შემთხვევითი მოვლენები ეპიზოდის განმავლობაში) და პოლიტიკის სტოქასტიკურობის გამო. შესაბამისად, ერთი და იგივე საწყის მდგომარეობას შეიძლება მოჰყვეს ძალიან განსხვავებული ამონაგები.
ამის გამო, ერთი და იგივე მდგომარეობიდან დაწყებული ამონაგები შეიძლება მნიშვნელოვნად განსხვავდებოდეს ეპიზოდების მიხედვით. გამოსავალი არის დისპერსიის შემცირება მრავალი ტრაექტორიის გამოყენებით, იმ იმედით, რომ ნებისმიერ ერთ ტრაექტორიაში შემოტანილი დისპერსია შემცირდება ჯამურად და უზრუნველყოფს ამონაგების "ნამდვილ" შეფასებას. თუმცა, პაკეტის ზომის მნიშვნელოვნად გაზრდა ამცირებს ნიმუშის ეფექტურობას. ამიტომ ჩვენ გვჭირდება დამატებითი მექანიზმების მოძიება დისპერსიის შესამცირებლად. Reinforce ალგორითმის დისპერსიის შესამცირებლად და ჩვენი აგენტის უფრო სწრაფად და უკეთ მოსამზადებლად გამოსავალი არის პოლიტიკაზე დაფუძნებული და ღირებულებაზე დაფუძნებული მეთოდების კომბინაციის გამოყენება: აქტორ-კრიტიკოსის მეთოდი.
აქტორ-კრიტიკოსის გასაგებად, წარმოიდგინეთ, რომ ვიდეო თამაშს თამაშობთ. შეგიძლიათ მეგობართან ერთად ითამაშოთ, რომელიც უკუკავშირს მოგაწვდით. თქვენ ხართ აქტორი, ხოლო თქვენი მეგობარი - კრიტიკოსი. თავიდან არ იცით თამაში, ამიტომ შემთხვევით ცდით ზოგიერთ მოქმედებას. კრიტიკოსი აკვირდება თქვენს მოქმედებას და გაწვდით უკუკავშირს. ამ უკუკავშირიდან სწავლისას თქვენ განაახლებთ თქვენს პოლიტიკას და გაუმჯობესდებით თამაშში. მეორეს მხრივ, თქვენი მეგობარი (კრიტიკოსი) ასევე განაახლებს უკუკავშირის მიწოდების საკუთარ მეთოდს, რათა შემდეგ ჯერზე უკეთესი იყოს. ეს არის აქტორ-კრიტიკოსის იდეა. ჩვენ ვსწავლობთ ორ ფუნქციურ აპროქსიმაციას:
* პოლიტიკას, რომელიც აკონტროლებს, თუ როგორ მოქმედებს ჩვენი აგენტი: πθ(s,a) \pi_{\theta}(s,a) πθ(s,a)
* ღირებულების ფუნქციას, რომელიც ეხმარება პოლიტიკის განახლებას იმის გაზომვით, თუ რამდენად კარგია შესრულებული მოქმედება: q^w(s,a) \hat{q}_{w}(s,a) q^w(s,a)
ახლა, როცა ვნახეთ აქტორ-კრიტიკოსის დიდი სურათი, მოდით, უფრო ღრმად ჩავუღრმავდეთ, რათა გავიგოთ, როგორ უმჯობესდებიან აქტორი და კრიტიკოსი ერთად სწავლის განმავლობაში. როგორც ვნახეთ, აქტორ-კრიტიკოსის მეთოდებით არსებობს ორი ფუნქციური აპროქსიმაცია (ორი ნერვული ქსელი): ვნახოთ სწავლის პროცესი, რათა გავიგოთ, როგორ ხდება აქტორისა და კრიტიკოსის ოპტიმიზაცია:
ყოველ დროის ნაბიჯში, t, ჩვენ ვიღებთ მიმდინარე მდგომარეობას St S_tSt გარემოდან და გადავცემთ მას როგორც შეტანას ჩვენს აქტორსა და კრიტიკოსში. ჩვენი პოლიტიკა იღებს მდგომარეობას და გამოსცემს მოქმედებას At A_t At. მისი განახლებული პარამეტრების წყალობით, აქტორი წარმოქმნის შემდეგ მოქმედებას At+1 A_{t+1} At+1 მოცემული ახალი მდგომარეობით St+1 S_{t+1} St+1. შემდეგ კრიტიკოსი ანახლებს თავის ღირებულების პარამეტრებს. ჩვენ შეგვიძლია სწავლის სტაბილიზაცია
თეგები:
#ხელოვნური ინტელექტი
#ღრმა სწავლა
#მანქანური სწავლა
#a2c
#განმტკიცებითი სწავლა
#აქტორ-კრიტიკოსი
#პოლიტიკის გრადიენტი
#reinforce
#დისპერსიის შემცირება
#stable-baselines3
წყარო: huggingface.co
AI-ით გადამუშავებული