⚠️ ამ სტატიის განახლებული ვერსია ხელმისაწვდომია აქ 👉 https://huggingface.co/deep-rl-course/unit1/introduction ეს სტატია ღრმა განმტკიცებითი სწავლების კლასის ნაწილია. უფასო კურსი დამწყებიდან ექსპერტამდე. სასწავლო გეგმა იხილეთ აქ. კეთილი იყოს თქვენი მობრძანება ხელოვნური ინტელექტის ყველაზე მომხიბვლელ თემაში: ღრმა განმტკიცებითი სწავლება. ღრმა განმტკიცებითი სწავლება (DRL) მანქანური სწავლების ტიპია, სადაც აგენტი სწავლობს, თუ როგორ მოიქცეს გარემოში მოქმედებების შესრულებითა და შედეგების დანახვით. 2013 წლიდან, Deep Q-Learning სტატიის შემდეგ, უამრავი გარღვევა ვიხილეთ. OpenAI five-იდან, რომელმაც მსოფლიოს საუკეთესო Dota2 მოთამაშეები დაამარცხა, Dexterity პროექტამდე, ჩვენ ღრმა განმტკიცებითი სწავლების კვლევის საინტერესო მომენტში ვცხოვრობთ. გარდა ამისა, 2018 წლიდან თქვენ უკვე გაქვთ წვდომა უამრავ საოცარ გარემოსა და ბიბლიოთეკაზე თქვენი აგენტების შესაქმნელად. სწორედ ამიტომ არის საუკეთესო დრო სასწავლად, და ამ კურსით თქვენ სწორ ადგილას ხართ. დიახ, რადგანაც ეს სტატია ღრმა განმტკიცებითი სწავლების კლასის პირველი ერთეულია, უფასო კლასი დამწყებიდან ექსპერტამდე, სადაც ისწავლით თეორიასა და პრაქტიკას ცნობილი ღრმა განმტკიცებითი სწავლების ბიბლიოთეკების გამოყენებით, როგორიცაა Stable Baselines3, RL Baselines3 Zoo და RLlib. ამ უფასო კურსში თქვენ ისწავლით ღრმა განმტკიცებითი სწავლების საფუძვლებს. შემდეგ კი გაავარჯიშებთ თქვენს პირველ ლენდერის აგენტს, რათა სწორად დაეშვას მთვარეზე 🌕 და ატვირთავთ მას Hugging Face Hub-ში, უფასო, ღია პლატფორმაზე, სადაც ადამიანებს შეუძლიათ გააზიარონ ML მოდელები, მონაცემთა ნაკრებები და დემოები. აუცილებელია ამ ელემენტების ათვისება, სანამ ღრმა განმტკიცებითი სწავლების აგენტების იმპლემენტაციას დაიწყებდეთ. ამ თავის მიზანია მოგცეთ მყარი საფუძვლები. თუ გირჩევნიათ, შეგიძლიათ უყუროთ 📹 ამ თავის ვიდეო ვერსიას: მაშ ასე, დავიწყოთ! 🚀 განმტკიცებითი სწავლების გასაგებად, მოდით, დავიწყოთ ზოგადი სურათით. განმტკიცებითი სწავლების იდეა მდგომარეობს იმაში, რომ აგენტი (AI) ისწავლის გარემოდან მასთან ურთიერთქმედებით (ცდისა და შეცდომის გზით) და მოქმედებების შესრულების უკუკავშირის სახით ჯილდოების (უარყოფითი ან დადებითი) მიღებით. გარემოსთან ურთიერთქმედებით სწავლა ჩვენი ბუნებრივი გამოცდილებიდან მოდის. მაგალითად, წარმოიდგინეთ, რომ თქვენს პატარა ძმას ვიდეო თამაშის წინ დასვამთ, რომელიც არასოდეს უთამაშია, ხელში კონტროლერს მიაწვდით და მარტო დატოვებთ. თქვენი ძმა გარემოსთან (ვიდეო თამაში) იმოქმედებს სწორი ღილაკის დაჭერით (მოქმედება). მან მონეტა მიიღო, ეს არის +1 ჯილდო. ეს დადებითია, მას ახლახან ესმოდა, რომ ამ თამაშში მონეტები უნდა შეაგროვოს. მაგრამ შემდეგ, ის კვლავ დააჭერს ღილაკს და მტერს შეეხება, ის უბრალოდ მოკვდა, -1 ჯილდო. გარემოსთან ცდისა და შეცდომის გზით ურთიერთქმედებით, თქვენმა პატარა ძმამ გაიგო, რომ ამ გარემოში მონეტები უნდა მიეღო, მაგრამ მტრებს უნდა მოერიდოს. ყოველგვარი ზედამხედველობის გარეშე, ბავშვი უკეთესად და უკეთესად ითამაშებს თამაშს. ასე სწავლობენ ადამიანები და ცხოველები – ურთიერთქმედებით. განმტკიცებითი სწავლება უბრალოდ სწავლის კომპიუტერული მიდგომაა მოქმედებიდან. თუ ახლა ფორმალურ განმარტებას ავიღებთ: განმტკიცებითი სწავლება არის ჩარჩო საკონტროლო ამოცანების (ასევე გადაწყვეტილების პრობლემების) გადასაჭრელად, აგენტების შექმნით, რომლებიც სწავლობენ გარემოდან მასთან ურთიერთქმედებით ცდისა და შეცდომის გზით და ჯილდოების (დადებითი ან უარყოფითი) მიღებით, როგორც უნიკალური უკუკავშირი. ⇒ მაგრამ როგორ მუშაობს განმტკიცებითი სწავლება? განმტკიცებითი სწავლების პროცესის გასაგებად, წარმოვიდგინოთ აგენტი, რომელიც სწავლობს პლატფორმული თამაშის თამაშს: ეს RL მარყუჟი გამოიმუშავებს მდგომარეობის, მოქმედების, ჯილდოს და შემდეგი მდგომარეობის თანმიმდევრობას. აგენტის მიზანია მაქსიმალურად გაზარდოს თავისი კუმულაციური ჯილდო, რომელსაც მოსალოდნელი უკუგება ეწოდება. ⇒ რატომ არის აგენტის მიზანი მოსალოდნელი უკუგების მაქსიმიზაცია? რადგანაც განმტკიცებითი სწავლება ეფუძნება ჯილდოს ჰიპოთეზას, რაც გულისხმობს, რომ ყველა მიზანი შეიძლება აღიწეროს, როგორც მოსალოდნელი უკუგების (მოსალოდნელი კუმულაციური ჯილდოს) მაქსიმიზაცია. სწორედ ამიტომ, განმტკიცებით სწავლებაში, საუკეთესო ქცევის მისაღებად, ჩვენ უნდა მოვახდინოთ მოსალოდნელი კუმულაციური ჯილდოს მაქსიმიზაცია. სტატიებში ნახავთ, რომ განმტკიცებითი სწავლების პროცესს მარკოვის გადაწყვეტილების პროცესი (MDP) ეწოდება. მარკოვის თვისებაზე ისევ ვისაუბრებთ შემდეგ ერთეულებში. მაგრამ თუ დღეს რამე უნდა დაიმახსოვროთ ამის შესახებ, მარკოვის თვისება გულისხმობს, რომ ჩვენს აგენტს სჭირდება მხოლოდ მიმდინარე მდგომარეობა იმის გადასაწყვეტად, თუ რა ქმედება უნდა განახორციელოს და არა ყველა იმ მდგომარეობისა და მოქმედების ისტორია, რომელიც მანამდე განახორციელა. დაკვირვებები/მდგომარეობები არის ინფორმაცია, რომელსაც ჩვენი აგენტი იღებს გარემოდან. ვიდეო თამაშის შემთხვევაში, ეს შეიძლება იყოს კადრი (ეკრანის ანაბეჭდი). სავაჭრო აგენტის შემთხვევაში, ეს შეიძლება იყოს გარკვეული აქციის ღირებულება და ა.შ. არსებობს განსხვავება დაკვირვებასა და მდგომარეობას შორის: ჭადრაკის თამაშში, ჩვენ ვიღებთ მდგომარეობას გარემოდან, რადგან გვაქვს წვდომა მთელი დაფის ინფორმაციაზე. ჭადრაკის თამაშისას, ჩვენ სრულად დაკვირვებად გარემოში ვართ, რადგან გვაქვს წვდომა მთელი დაფის ინფორმაციაზე. Super Mario-ში...