⚠️ ამ სტატიის ახალი, განახლებული ვერსია ხელმისაწვდომია აქ 👉 https://huggingface.co/deep-rl-course/unit1/introduction. ეს სტატია წარმოადგენს ღრმა გაძლიერებითი სწავლების კლასის ნაწილს. უფასო კურსი დამწყებიდან ექსპერტამდე. სილაბუსს გაეცანით აქ. წინა მოდულში ჩვენ შევისწავლეთ ღრმა Q-სწავლება (Deep Q-Learning). ამ ღირებულებაზე დაფუძნებულ ღრმა გაძლიერებითი სწავლების ალგორითმში, ჩვენ ვიყენებდით ღრმა ნერვულ ქსელს, რათა მიახლოებით გამოგვეთვალა Q-მნიშვნელობები მოცემულ მდგომარეობაში შესაძლო ყოველი მოქმედებისთვის. მართლაც, კურსის დასაწყისიდან ჩვენ მხოლოდ ღირებულებაზე დაფუძნებულ მეთოდებს ვსწავლობდით, სადაც ოპტიმალური პოლიტიკის მოსაძებნად შუალედურ ნაბიჯად ვაფასებთ ღირებულების ფუნქციას. ეს იმიტომ, რომ ღირებულებაზე დაფუძნებულ მეთოდებში, π (პოლიტიკა) არსებობს მხოლოდ მოქმედების ღირებულების შეფასებების გამო, ვინაიდან პოლიტიკა არის უბრალოდ ფუნქცია (მაგალითად, ხარბი პოლიტიკა), რომელიც მოცემულ მდგომარეობაში ირჩევს უმაღლესი ღირებულების მოქმედებას. მაგრამ, პოლიტიკაზე დაფუძნებული მეთოდებით, ჩვენ გვსურს უშუალოდ პოლიტიკის ოპტიმიზაცია, ღირებულების ფუნქციის სწავლის შუალედური ნაბიჯის გარეშე. ასე რომ, დღეს ჩვენ შევისწავლით ჩვენს პირველ პოლიტიკაზე დაფუძნებულ მეთოდს: Reinforce. და ჩვენ მას ნულიდან დავწერთ PyTorch-ის გამოყენებით. მის სიმტკიცეს შევამოწმებთ CartPole-v1, PixelCopter და Pong-ის გამოყენებით. დავიწყოთ: პოლიტიკური გრადიენტი (Policy-Gradient) არის პოლიტიკაზე დაფუძნებული მეთოდების ქვე-კლასი, ალგორითმების კატეგორია, რომელიც მიზნად ისახავს პოლიტიკის უშუალო ოპტიმიზაციას, ღირებულების ფუნქციის გამოყენების გარეშე, სხვადასხვა ტექნიკის მეშვეობით. განსხვავება პოლიტიკაზე დაფუძნებულ მეთოდებთან არის ის, რომ პოლიტიკური გრადიენტის მეთოდები არის ალგორითმების სერია, რომელიც მიზნად ისახავს პოლიტიკის უშუალო ოპტიმიზაციას ოპტიმალური პოლიტიკის წონების შეფასებით გრადიენტული ასვლის (Gradient Ascent) გამოყენებით. რატომ ვახდენთ პოლიტიკის უშუალო ოპტიმიზაციას ოპტიმალური პოლიტიკის წონების შეფასებით გრადიენტული ასვლის გამოყენებით პოლიტიკური გრადიენტის მეთოდებში? გავიხსენოთ, რომ გაძლიერებითი სწავლების მიზანია ოპტიმალური ქცევის სტრატეგიის (პოლიტიკის) პოვნა, რათა მაქსიმალურად გაიზარდოს მოსალოდნელი კუმულაციური ჯილდო. ასევე უნდა გვახსოვდეს, რომ პოლიტიკა არის ფუნქცია, რომელიც მოცემული მდგომარეობისთვის გამოსცემს მოქმედებების განაწილებას (ჩვენს შემთხვევაში სტოქასტური პოლიტიკის გამოყენებით). ჩვენი მიზანი პოლიტიკური გრადიენტებით არის მოქმედებების ალბათური განაწილების კონტროლი პოლიტიკის მორგებით ისე, რომ კარგი მოქმედებები (რომლებიც მაქსიმალურად ზრდის შემოსავალს) უფრო ხშირად იყოს შერჩეული მომავალში. ავიღოთ მარტივი მაგალითი: ჩვენ ვაგროვებთ ეპიზოდს ჩვენი პოლიტიკის გარემოსთან ურთიერთქმედებით. შემდეგ ვუყურებთ ეპიზოდის ჯილდოების ჯამს (მოსალოდნელი შემოსავალი). თუ ეს ჯამი დადებითია, ჩვენ მივიჩნევთ, რომ ეპიზოდების განმავლობაში განხორციელებული მოქმედებები კარგი იყო: ამიტომ, ჩვენ გვსურს გავზარდოთ P(a|s) (ამ მოქმედების განხორციელების ალბათობა ამ მდგომარეობაში) ყოველი მდგომარეობა-მოქმედების წყვილისთვის. პოლიტიკური გრადიენტის ალგორითმი (გამარტივებული) ასე გამოიყურება: [აქ მოცემულია დიაგრამა/ფორმულა, რომელიც არ არის ტექსტში]. მაგრამ ღრმა Q-სწავლება შესანიშნავია! რატომ გამოვიყენოთ პოლიტიკური გრადიენტის მეთოდები? არსებობს მრავალი უპირატესობა ღრმა Q-სწავლების მეთოდებთან შედარებით. მოდით ვნახოთ ზოგიერთი მათგანი: ინტეგრაციის სიმარტივე: ჩვენ შეგვიძლია პოლიტიკის უშუალოდ შეფასება დამატებითი მონაცემების (მოქმედების ღირებულებების) შენახვის გარეშე. პოლიტიკური გრადიენტის მეთოდებს შეუძლიათ ისწავლონ სტოქასტური პოლიტიკა, მაშინ როდესაც ღირებულების ფუნქციებს ეს არ შეუძლიათ. ამას ორი შედეგი აქვს: ა. ჩვენ არ გვჭირდება ხელით განვახორციელოთ კვლევა/ექსპლუატაციის კომპრომისი (exploration/exploitation trade-off). ვინაიდან ჩვენ გამოგვაქვს ალბათური განაწილება მოქმედებებზე, აგენტი იკვლევს მდგომარეობათა სივრცეს ყოველთვის ერთი და იმავე ტრაექტორიის გავლენის გარეშე. ბ. ჩვენ ასევე ვთავისუფლდებით აღქმითი ალიასინგის (perceptual aliasing) პრობლემისგან. აღქმითი ალიასინგი არის მაშინ, როდესაც ორი მდგომარეობა მსგავსია (ან იდენტურია), მაგრამ საჭიროებს განსხვავებულ მოქმედებებს. ავიღოთ მაგალითი: გვყავს ინტელექტუალური მტვერსასრუტი, რომლის მიზანია მტვრის შეწოვა და ზაზუნების არ მოკვლა. ჩვენს მტვერსასრუტს შეუძლია აღიქვას მხოლოდ ის, თუ სად არის კედლები. პრობლემა ის არის, რომ ორი წითელი უჯრა ალიასირებული მდგომარეობაა, რადგან აგენტი თითოეულისთვის აღიქვამს ზედა და ქვედა კედელს. დეტერმინისტული პოლიტიკის პირობებში, პოლიტიკა წითელ მდგომარეობაში ყოფნისას ან მარჯვნივ იმოძრავებს, ან მარცხნივ. ორივე შემთხვევაში ჩვენი აგენტი გაიჭედება და ვერასოდეს შეწოვს მტვერს. ღირებულებაზე დაფუძნებული RL ალგორითმის პირობებში, ჩვენ ვსწავლობთ კვაზი-დეტერმინისტულ პოლიტიკას („ხარბი ეპსილონის სტრატეგია“). შედეგად, ჩვენს აგენტს შეუძლია დიდი დრო დახარჯოს მტვრის პოვნამდე. მეორეს მხრივ, ოპტიმალური სტოქასტური პოლიტიკა შემთხვევით იმოძრავებს მარცხნივ ან მარჯვნივ ნაცრისფერ მდგომარეობებში. შესაბამისად, ის არ გაიჭედება და მაღალი ალბათობით მიაღწევს სამიზნე მდგომარეობას. მართლაც, ღრმა Q-სწავლების პრობლემა ის არის, რომ მათი პროგნოზები ანიჭებენ ქულას (მაქსიმალური მოსალოდნელი მომავალი ჯილდო) თითოეულ შესაძლო მოქმედებას, ყოველ დროის საფეხურზე, მოცემული მიმდინარე მდგომარეობის გათვალისწინებით. მაგრამ რა მოხდება, თუ მოქმედებების უსასრულო შესაძლებლობა გვაქვს? მაგალითად, თვითმავალი მანქანის შემთხვევაში, ყოველ მდგომარეობაზე შეიძლება გქონდეთ (თითქმის) უსასრულო არჩევანი მოქმედებებისა (საჭის 15°, 17.2°, 19.4°-ით მობრუნება, სიგნალის მიცემა და ა.შ.). ჩვენ მოგვიწევს Q-მნიშვნელობის გამოტანა თითოეული შესაძლო მოქმედებისთვის! და უწყვეტი გამომავალი მონაცემებიდან მაქსიმალური მოქმედების არჩევა თავისთავად ოპტიმიზაციის პრობლემაა.