Q-სწავლა: ნულიდან RL აგენტის შექმნის გზამკვლევი
აღმოაჩინეთ Q-სწავლის ალგორითმი, ღრმა გაძლიერებითი სწავლის კლასის ფუნდამენტური ნაწილი. ეს სტატია განმარტავს Q-ფუნქციის, Q-ცხრილისა და ეფსილონ-ხარბი სტრატეგიის მუშაობის პრინციპებს, გასწავლით თუ როგორ შექმნათ თქვენი პირველი გაძლიერებითი სწავლის აგენტი ნულიდან და განაახლოთ მისი ქცევის მოდელი გარემოსთან ურთიერთქმედებისას.
⚠️ ამ სტატიის ახალი, განახლებული ვერსია ხელმისაწვდომია აქ 👉 https://huggingface.co/deep-rl-course/unit1/introduction ეს სტატია ღრმა გაძლიერებითი სწავლის კლასის ნაწილია. უფასო კურსი დამწყებთათვის ექსპერტამდე. სილაბუსის ნახვა შეგიძლიათ აქ.
⚠️ ამ სტატიის ახალი, განახლებული ვერსია ხელმისაწვდომია აქ 👉 https://huggingface.co/deep-rl-course/unit1/introduction ეს სტატია ღრმა გაძლიერებითი სწავლის კლასის ნაწილია. უფასო კურსი დამწყებთათვის ექსპერტამდე. სილაბუსის ნახვა შეგიძლიათ აქ.
ამ ერთეულის პირველ ნაწილში ჩვენ შევისწავლეთ ღირებულებაზე დაფუძნებული მეთოდები და განსხვავება მონტე კარლოსა და დროითი სხვაობის (Temporal Difference) სწავლას შორის. ამრიგად, მეორე ნაწილში შევისწავლით Q-სწავლას და ნულიდან განვახორციელებთ ჩვენს პირველ RL აგენტს – Q-სწავლის აგენტს, რომელსაც ორ გარემოში გავწვრთნით. ეს ერთეული ფუნდამენტურია, თუ გსურთ ღრმა Q-სწავლაზე (მოდული 3) მუშაობა შეძლოთ. მოდით დავიწყოთ! 🚀
Q-სწავლა არის off-policy (არასაპოლიტიკო) ღირებულებაზე დაფუძნებული მეთოდი, რომელიც იყენებს TD (დროითი სხვაობის) მიდგომას თავისი მოქმედება-ღირებულების ფუნქციის საწვრთნელად:
Q-სწავლა არის ალგორითმი, რომელსაც ვიყენებთ ჩვენი Q-ფუნქციის მოსამზადებლად. ეს არის მოქმედება-ღირებულების ფუნქცია, რომელიც განსაზღვრავს კონკრეტულ მდგომარეობაში ყოფნის და ამ მდგომარეობაში სპეციფიკური მოქმედების შესრულების ღირებულებას. "Q" მომდინარეობს ამ მოქმედების "ხარისხიდან" (Quality) მოცემულ მდგომარეობაში. შინაგანად, ჩვენს Q-ფუნქციას აქვს Q-ცხრილი, ცხრილი, სადაც თითოეული უჯრედი შეესაბამება მდგომარეობა-მოქმედების ღირებულების წყვილს. წარმოიდგინეთ ეს Q-ცხრილი, როგორც ჩვენი Q-ფუნქციის მეხსიერება ან „შპარგალკა“. თუ განვიხილავთ ლაბირინთის ამ მაგალითს: Q-ცხრილი ინიციალიზებულია. სწორედ ამიტომ არის ყველა მნიშვნელობა = 0. ეს ცხრილი შეიცავს, თითოეული მდგომარეობისთვის, ოთხ მდგომარეობა-მოქმედების ღირებულებას. აქ ვხედავთ, რომ საწყისი მდგომარეობისა და ზემოთ ასვლის მდგომარეობა-მოქმედების ღირებულება არის 0: ამრიგად, Q-ფუნქცია შეიცავს Q-ცხრილს, რომელშიც მოცემულია თითოეული მდგომარეობა-მოქმედების წყვილის ღირებულება. და მოცემული მდგომარეობისა და მოქმედების შემთხვევაში, ჩვენი Q-ფუნქცია მოძებნის თავის Q-ცხრილში და გამოიტანს ღირებულებას.
თუ შევაჯამებთ, Q-სწავლა არის RL ალგორითმი, რომელიც: მაგრამ თავიდან, ჩვენი Q-ცხრილი უსარგებლოა, რადგან ის აბსტრაქტულ მნიშვნელობებს აძლევს თითოეულ მდგომარეობა-მოქმედების წყვილს (უმეტესად, Q-ცხრილს 0 მნიშვნელობებით ვაინიციალიზებთ). მაგრამ, როდესაც შევისწავლით გარემოს და განვაახლებთ ჩვენს Q-ცხრილს, ის უფრო და უფრო ზუსტ მიახლოებებს მოგვცემს. ახლა, როცა გვესმის რა არის Q-სწავლა, Q-ფუნქცია და Q-ცხრილი, მოდით უფრო ღრმად ჩავუღრმავდეთ Q-სწავლის ალგორითმს.
ეს არის Q-სწავლის ფსევდოკოდი; მოდით შევისწავლოთ თითოეული ნაწილი და ვნახოთ, როგორ მუშაობს ის მარტივი მაგალითით, სანამ მის იმპლემენტაციას დავიწყებთ. ნუ შეშინდებით, ეს უფრო მარტივია, ვიდრე ჩანს! ჩვენ განვიხილავთ თითოეულ ნაბიჯს.
ნაბიჯი 1: Q-ცხრილის ინიციალიზაცია
ჩვენ უნდა მოვახდინოთ Q-ცხრილის ინიციალიზაცია თითოეული მდგომარეობა-მოქმედების წყვილისთვის. უმეტესად, ჩვენ ვაინიციალიზებთ 0-ის მნიშვნელობებით.
ნაბიჯი 2: მოქმედების არჩევა ეფსილონ-ხარბი სტრატეგიის გამოყენებით
ეფსილონ-ხარბი სტრატეგია არის პოლიტიკა, რომელიც მართავს კვლევა/ექსპლუატაციის კომპრომისს. იდეა ისაა, რომ ჩვენ განვსაზღვრავთ ეფსილონს ɛ = 1.0: სწავლის დასაწყისში, კვლევის ალბათობა უზარმაზარი იქნება, რადგან ɛ ძალიან მაღალია, ამიტომ უმეტესად გამოვიკვლევთ. მაგრამ როგორც სწავლა გრძელდება და ჩვენი Q-ცხრილი სულ უფრო და უფრო უკეთეს შეფასებებს იძლევა, ჩვენ თანდათან ვამცირებთ ეფსილონის მნიშვნელობას, რადგან სულ უფრო ნაკლები კვლევა და მეტი ექსპლუატაცია დაგვჭირდება.
ნაბიჯი 3: მოქმედების შესრულება At, ვიღებთ ჯილდოს Rt+1 და შემდეგ მდგომარეობას St+1
ნაბიჯი 4: Q(St, At) განახლება
გაიხსენეთ, რომ TD სწავლაში ჩვენ ვაახლებთ ჩვენს პოლიტიკას ან ღირებულების ფუნქციას (დამოკიდებულია RL მეთოდზე, რომელსაც ვირჩევთ) ინტერაქციის ერთი ნაბიჯის შემდეგ. ჩვენი TD სამიზნის შესაქმნელად, ჩვენ გამოვიყენეთ დაუყოვნებელი ჯილდო Rt+1 პლუს შემდეგი მდგომარეობის საუკეთესო მდგომარეობა-მოქმედების წყვილის ფასდაკლებული ღირებულება (ამას ჩვენ ვუწოდებთ „ბუტსტრაპს“). ამიტომ, ჩვენი Q(St,At) განახლების ფორმულა ასე გამოიყურება: ეს ნიშნავს, რომ ჩვენი Q(St,At) განახლებისთვის: როგორ ვაყალიბებთ TD სამიზნეს? შემდეგ, როდესაც ამ Q-მნიშვნელობის განახლება დასრულდება. ჩვენ ვიწყებთ ახალ მდგომარეობაში და ვირჩევთ ჩვენს მოქმედებას კვლავ ჩვენი ეფსილონ-ხარბი პოლიტიკის გამოყენებით. ამიტომაც ვამბობთ, რომ ეს არის off-policy ალგორითმი. განსხვავება დახვეწილია: მაგალითად, Q-სწავლის შემთხვევაში, ეფსილონ-ხარბი პოლიტიკა (მოქმედი პოლიტიკა) განსხვავდება ხარბი პოლიტიკისგან, რომელიც გამოიყენება მომავალი მდგომარეობის საუკეთესო მოქმედების ღირებულების შესარჩევად ჩვენი Q-მნიშვნელობის განახლების მიზნით (განახლების პოლიტიკა). ის განსხვავდება იმ პოლიტიკისგან, რომელსაც ვიყენებთ სწავლის ნაწილში: მაგალითად, Sarsa-ს შემთხვევაში, რომელიც ღირებულებაზე დაფუძნებული კიდევ ერთი ალგორითმია, ეფსილონ-ხარბი პოლიტიკა ირჩევს შემდეგი მდგომარეობა-მოქმედების წყვილს და არა ხარბი პოლიტიკას. Q-სწავლის უკეთ გასაგებად, მოდით განვიხილოთ მარტივი მაგალითი: ჩვენი აგენტის ოპტიმალური პოლიტიკის შესამუშავებლად (ანუ პოლიტიკა, რომელიც მიდის მარჯვნივ, მარჯვნივ, ქვემოთ), ჩვენ გამოვიყენებთ Q-სწავლის ალგორითმს. ნაბიჯი 1: ჩვენ ვაინიციალიზებთ Q-ცხრილს. ასე რომ, ჯერჯერობით, ჩვენი Q-ცხრილი უსარგებლოა; ჩვენ გვჭირდება ჩვენი Q-ფუნქციის სწავლება Q-სწავლის ალგორითმის გამოყენებით. მოდით გავაკეთოთ ეს 2 საწვრთნელი დროითი ნაბიჯისთვის: სწავლის დროითი ნაბიჯი 1: ნაბიჯი 2: მოქმედების არჩევა ეფსილონ-ხარბი სტრატეგიის გამოყენებით. რადგან ეფსილონი დიდია = 1.0, მე ვიღებ შემთხვევით მოქმედებას, ამ შემთხვევაში, მივდივარ მარჯვნივ. ნაბიჯი 3: მოქმედების შესრულება At, ვიღებთ Rt+1 და St+1. მარჯვნივ წასვლით, მე მივიღე პატარა ყველი, ასე რომ Rt+1=1.
თეგები:
#ღრმა სწავლა
#მანქანური სწავლა
#გაძლიერებითი სწავლა
#q-სწავლა
#rl აგენტი
#q-ფუნქცია
#q-ცხრილი
#ეფსილონ-ხარბი სტრატეგია
#td სწავლა
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი