⚠️ ამ სტატიის ახალი, განახლებული ვერსია ხელმისაწვდომია აქ 👉 https://huggingface.co/deep-rl-course/unit1/introduction ეს სტატია ღრმა გაძლიერებითი სწავლის (Deep Reinforcement Learning) კლასის ნაწილია. ეს არის უფასო კურსი დამწყებიდან ექსპერტამდე. სასწავლო გეგმის ნახვა შეგიძლიათ აქ. კლასის პირველ თავში ჩვენ შევისწავლეთ გაძლიერებითი სწავლება (RL), RL პროცესი და RL პრობლემის გადაჭრის სხვადასხვა მეთოდები. ჩვენ ასევე გავავარჯიშეთ ჩვენი პირველი დამსმელი აგენტი, რათა სწორად დაშვებულიყო მთვარეზე 🌕 და ავტვირთეთ ის Hugging Face Hub-ზე. ამრიგად, დღეს ჩვენ უფრო ღრმად ჩავუღრმავდებით გაძლიერებითი სწავლის ერთ-ერთ მეთოდს: ღირებულებაზე დაფუძნებულ მეთოდებს და შევისწავლით ჩვენს პირველ RL ალგორითმს: Q-სწავლებას. ჩვენ ასევე ნულიდან განვახორციელებთ ჩვენს პირველ RL აგენტს: Q-სწავლის აგენტს და გავავარჯიშებთ მას ორ გარემოში: ეს ერთეული 2 ნაწილად იყოფა: პირველ ნაწილში ჩვენ შევისწავლით ღირებულებაზე დაფუძნებულ მეთოდებს და განსხვავებას მონტე კარლოსა (Monte Carlo) და დროითი სხვაობის სწავლებას (Temporal Difference Learning) შორის. მეორე ნაწილში კი შევისწავლით ჩვენს პირველ RL ალგორითმს: Q-სწავლებას და განვახორციელებთ ჩვენს პირველ RL აგენტს. ეს ერთეული ფუნდამენტურია, თუ გსურთ იმუშაოთ ღრმა Q-სწავლებაზე (Deep Q-Learning, მესამე ერთეული): პირველი ღრმა RL ალგორითმი, რომელსაც შეეძლო Atari თამაშების თამაში და ზოგიერთ მათგანში ადამიანის დონის დამარცხება (მაგალითად, breakout, space invaders…). მაშ ასე, დავიწყოთ! RL-ში ჩვენ ვაშენებთ აგენტს, რომელსაც შეუძლია ჭკვიანი გადაწყვეტილებების მიღება. მაგალითად, აგენტი, რომელიც სწავლობს ვიდეო თამაშის თამაშს. ან სავაჭრო აგენტი, რომელიც სწავლობს სარგებლის მაქსიმიზაციას ჭკვიანი გადაწყვეტილებების მიღებით, თუ რა აქციები იყიდოს და როდის გაყიდოს. მაგრამ, ინტელექტუალური გადაწყვეტილებების მისაღებად, ჩვენი აგენტი ისწავლის გარემოსგან მასთან ცდისა და შეცდომის გზით ურთიერთქმედებით და ჯილდოების (დადებითი ან უარყოფითი) მიღებით, როგორც უნიკალური უკუკავშირი. მისი მიზანია მაქსიმალურად გაზარდოს მოსალოდნელი კუმულაციური ჯილდო (ჯილდოს ჰიპოთეზის გამო). აგენტის გადაწყვეტილების მიღების პროცესს პოლიტიკა π ეწოდება: მოცემული მდგომარეობისთვის, პოლიტიკა გამოიმუშავებს მოქმედებას ან ალბათურ განაწილებას მოქმედებებზე. ანუ, გარემოს დაკვირვების გათვალისწინებით, პოლიტიკა უზრუნველყოფს მოქმედებას (ან მრავალ ალბათობას თითოეული მოქმედებისთვის), რომელიც აგენტმა უნდა განახორციელოს. ჩვენი მიზანია ვიპოვოთ ოპტიმალური პოლიტიკა π*, ანუ პოლიტიკა, რომელიც იწვევს საუკეთესო მოსალოდნელ კუმულაციურ ჯილდოს. ამ ოპტიმალური პოლიტიკის საპოვნელად (შესაბამისად, RL პრობლემის გადასაჭრელად), არსებობს RL მეთოდების ორი ძირითადი ტიპი: ამ თავში ჩვენ უფრო ღრმად ჩავუღრმავდებით ღირებულებაზე დაფუძნებულ მეთოდებს. ღირებულებაზე დაფუძნებულ მეთოდებში ჩვენ ვსწავლობთ ღირებულების ფუნქციას, რომელიც მდგომარეობას აკავშირებს ამ მდგომარეობაში ყოფნის მოსალოდნელ ღირებულებასთან. მდგომარეობის ღირებულება არის მოსალოდნელი დისკონტირებული შემოსავალი, რომელიც აგენტს შეუძლია მიიღოს, თუ ის დაიწყებს ამ მდგომარეობიდან და შემდეგ იმოქმედებს ჩვენი პოლიტიკის შესაბამისად. თუ დაგავიწყდათ, რა არის დისკონტირება, შეგიძლიათ წაიკითხოთ შესაბამისი სექცია. მაგრამ რას ნიშნავს ჩვენი პოლიტიკის შესაბამისად მოქმედება? ყოველივე ამის შემდეგ, ღირებულებაზე დაფუძნებულ მეთოდებში ჩვენ არ გვაქვს პოლიტიკა, რადგან ჩვენ ვწვრთნით ღირებულების ფუნქციას და არა პოლიტიკას. გაიხსენეთ, რომ RL აგენტის მიზანია ჰქონდეს ოპტიმალური პოლიტიკა π. მის საპოვნელად, ჩვენ ვისწავლეთ, რომ არსებობს ორი განსხვავებული მეთოდი: პოლიტიკა იღებს მდგომარეობას, როგორც შეტანას და გამოიმუშავებს, თუ რა ქმედება უნდა განხორციელდეს ამ მდგომარეობაში (დეტერმინისტული პოლიტიკა). შესაბამისად, ჩვენ ხელით არ განვსაზღვრავთ ჩვენი პოლიტიკის ქცევას; სწორედ წვრთნა განსაზღვრავს მას. მაგრამ, რადგან ჩვენ არ გავავარჯიშეთ ჩვენი პოლიტიკა, ჩვენ უნდა განვსაზღვროთ მისი ქცევა. მაგალითად, თუ გვსურს პოლიტიკა, რომელიც, ღირებულების ფუნქციის გათვალისწინებით, ყოველთვის მიიღებს მოქმედებებს, რომლებიც უდიდეს ჯილდოს მოიტანს, ჩვენ შევქმნით ხარბ პოლიტიკას (Greedy Policy). ამის შედეგად, როგორი მეთოდიც არ უნდა გამოიყენოთ თქვენი პრობლემის გადასაჭრელად, გექნებათ პოლიტიკა, მაგრამ ღირებულებაზე დაფუძნებული მეთოდების შემთხვევაში თქვენ არ წვრთნით მას, თქვენი პოლიტიკა არის უბრალოდ მარტივი ფუნქცია, რომელსაც თქვენ განსაზღვრავთ (მაგალითად, ხარბი პოლიტიკა) და ეს პოლიტიკა იყენებს ღირებულების ფუნქციის მიერ მოცემულ ღირებულებებს თავისი მოქმედებების შესარჩევად. ასე რომ, განსხვავება არის: სინამდვილეში, უმეტეს შემთხვევაში, ღირებულებაზე დაფუძნებულ მეთოდებში, თქვენ გამოიყენებთ ეპსილონ-ხარბ პოლიტიკას (Epsilon-Greedy Policy), რომელიც ამუშავებს კვლევა/ექსპლუატაციის კომპრომისს; ამაზე ვისაუბრებთ, როდესაც ამ ერთეულის მეორე ნაწილში Q-სწავლებაზე ვილაპარაკებთ. მაშ ასე, ჩვენ გვაქვს ღირებულებაზე დაფუძნებული ფუნქციების ორი ტიპი: მდგომარეობის ღირებულების ფუნქციას პოლიტიკის π ქვეშ ასე ვწერთ: თითოეული მდგომარეობისთვის, მდგომარეობის ღირებულების ფუნქცია გამოიმუშავებს მოსალოდნელ შემოსავალს, თუ აგენტი დაიწყებს ამ მდგომარეობიდან და შემდეგ სამუდამოდ მიჰყვება პოლიტიკას (ყველა სამომავლო დროის ნაბიჯისთვის, თუ გნებავთ). მოქმედების ღირებულების ფუნქციაში, თითოეული მდგომარეობისა და მოქმედების წყვილისთვის, მოქმედების ღირებულების ფუნქცია გამოიმუშავებს მოსალოდნელ შემოსავალს, თუ აგენტი დაიწყებს ამ მდგომარეობიდან და განახორციელებს მოქმედებას, შემდეგ კი სამუდამოდ მიჰყვება პოლიტიკას. მოქმედების n-ის ღირებულება მდგომარეობაში s პოლიტიკის π ქვეშ არის: ჩვენ ვხედავთ, რომ განსხვავება არის: ნებისმიერ შემთხვევაში, რა ღირებულების ფუნქციასაც არ უნდა ავირჩიოთ (მდგომარეობის ღირებულების ან მოქმედების ღირებულების ფუნქცია), ღირებულება არის მოსალოდნელი შემოსავალი. თუმცა, პრობლემა ის არის, რომ ეს გულისხმობს...