დღეს სიხარულით ვაცხადებთ, რომ Decision Transformer, ოფლაინ გაძლიერებული სწავლის (Offline Reinforcement Learning) მეთოდი, ინტეგრირებულია ჩვენს 🤗 ტრანსფორმერების ბიბლიოთეკაში (🤗 transformers library) და Hugging Face ჰაბში. ღრმა გაძლიერებული სწავლის (Deep RL) სფეროში ხელმისაწვდომობის გაუმჯობესებასთან დაკავშირებით საინტერესო გეგმები გვაქვს და მოუთმენლად ველით მათ გაზიარებას მომდევნო კვირებისა და თვეების განმავლობაში. ღრმა გაძლიერებული სწავლება (Deep Reinforcement Learning - RL) არის ჩარჩო გადაწყვეტილების მიმღები აგენტების შესაქმნელად. ეს აგენტები მიზნად ისახავენ ისწავლონ ოპტიმალური ქცევა (პოლიტიკა) გარემოსთან ურთიერთქმედებით ცდისა და შეცდომის მეთოდით და ჯილდოების, როგორც უნიკალური უკუკავშირის, მიღებით. აგენტის მიზანია მისი კუმულაციური ჯილდოს, ანუ "ამონაგების" (return) მაქსიმიზაცია. ეს იმიტომ, რომ RL ეფუძნება ჯილდოს ჰიპოთეზას: ყველა მიზანი შეიძლება აღიწეროს, როგორც მოსალოდნელი კუმულაციური ჯილდოს მაქსიმიზაცია. ღრმა გაძლიერებული სწავლის აგენტები სწავლობენ გამოცდილების პარტიებით (batches of experience). ჩნდება კითხვა, როგორ აგროვებენ ისინი ამ გამოცდილებას? ონლაინ გაძლიერებულ სწავლებაში (Online Reinforcement Learning) აგენტი მონაცემებს უშუალოდ აგროვებს: ის აგროვებს გამოცდილების პარტიას გარემოსთან ურთიერთქმედებით. შემდეგ, ის ამ გამოცდილებას დაუყოვნებლივ (ან განმეორებითი ბუფერის საშუალებით) იყენებს მისგან სასწავლად (პოლიტიკის განახლება). თუმცა, ეს გულისხმობს, რომ თქვენ ან ავარჯიშებთ თქვენს აგენტს უშუალოდ რეალურ სამყაროში, ან გაქვთ სიმულატორი. თუ არ გაქვთ, მისი აშენება მოგიწევთ, რაც შეიძლება იყოს ძალიან რთული (როგორ უნდა აისახოს რეალური სამყაროს რთული რეალობა გარემოში?), ძვირი და სახიფათო, რადგან თუ სიმულატორს აქვს ხარვეზები, აგენტი მათ გამოიყენებს, თუკი ისინი კონკურენტულ უპირატესობას მისცემენ. მეორე მხრივ, ოფლაინ გაძლიერებულ სწავლებაში (Offline Reinforcement Learning) აგენტი იყენებს მხოლოდ სხვა აგენტების ან ადამიანის დემონსტრაციებიდან შეგროვებულ მონაცემებს. ის არ ურთიერთქმედებს გარემოსთან. პროცესი შემდეგია: ამ მეთოდს აქვს ერთი ნაკლი: კონტრფაქტული კითხვების პრობლემა (counterfactual queries problem). რას ვაკეთებთ, თუ ჩვენი აგენტი გადაწყვეტს გააკეთოს ისეთი რამ, რისთვისაც მონაცემები არ გვაქვს? მაგალითად, გზაჯვარედინზე მარჯვნივ მოხვევა, მაგრამ ჩვენ არ გაგვაჩნია ასეთი ტრაექტორია. ამ თემაზე უკვე არსებობს გარკვეული გადაწყვეტილებები, მაგრამ თუ გსურთ მეტი გაიგოთ ოფლაინ გაძლიერებული სწავლის შესახებ, შეგიძლიათ ნახოთ ეს ვიდეო. Decision Transformer მოდელი წარდგენილი იქნა Chen L. et al.-ის მიერ ნაშრომში „Decision Transformer: Reinforcement Learning via Sequence Modeling“. ის წარმოაჩენს გაძლიერებულ სწავლებას, როგორც პირობით-მიმდევრობის მოდელირების პრობლემას (conditional-sequence modeling problem). მთავარი იდეა ის არის, რომ RL მეთოდების გამოყენებით პოლიტიკის გაწვრთნის (მაგალითად, ღირებულების ფუნქციის მორგება, რომელიც გვეტყვის, რა ქმედება განვახორციელოთ მაქსიმალური ამონაგების (კუმულაციური ჯილდოს) მისაღებად) ნაცვლად, ჩვენ ვიყენებთ მიმდევრობის მოდელირების ალგორითმს (ტრანსფორმატორი), რომელიც მოცემული სასურველი ამონაგების, წარსული მდგომარეობებისა და მოქმედებების საფუძველზე, გენერირებს მომავალ მოქმედებებს ამ სასურველი ამონაგების მისაღწევად. ეს არის ავტორეგრესიული მოდელი, რომელიც სასურველი ამონაგების, წარსული მდგომარეობებისა და მოქმედებების საფუძველზე გენერირებს მომავალ მოქმედებებს სასურველი ამონაგების მისაღწევად. ეს გაძლიერებული სწავლის პარადიგმის სრული ცვლილებაა, რადგან ჩვეულებრივი RL ალგორითმების ჩასანაცვლებლად ვიყენებთ გენერაციულ ტრაექტორიის მოდელირებას (მდგომარეობების, მოქმედებების და ჯილდოების მიმდევრობის ერთობლივი განაწილების მოდელირება). ეს ნიშნავს, რომ Decision Transformers-ში ჩვენ არ ვახდენთ ამონაგების მაქსიმიზაციას, არამედ ვქმნით მომავალი მოქმედებების სერიას, რომელიც სასურველ ამონაგებს მიაღწევს. პროცესი ასეთია: Decision Transformer-ის არქიტექტურა. მდგომარეობები, მოქმედებები და ამონაგებები გადაეცემა მოდალობის სპეციფიკურ ხაზოვან ჩაშენებებს და ემატება პოზიციური ეპიზოდური დროის საფეხურის კოდირება. ტოკენები გადაეცემა GPT არქიტექტურას, რომელიც ავტორეგრესიულად იწინასწარმეტყველებს მოქმედებებს მიზეზობრივი თვითყურადღების ნიღბის გამოყენებით. სურათი [1]-დან. Decision Transformer მოდელი ახლა ხელმისაწვდომია 🤗 ტრანსფორმერების ბიბლიოთეკის ნაწილად. გარდა ამისა, ჩვენ ვთავაზობთ ცხრა წინასწარ გაწვრთნილი მოდელის საკონტროლო წერტილს (checkpoints) უწყვეტი კონტროლის ამოცანებისთვის Gym გარემოში. მაგალითად, „ექსპერტი“ Decision Transformers მოდელი, რომელიც გაწვრთნილია ოფლაინ RL-ის გამოყენებით Gym Walker2d გარემოში. Decision Transformer-ის გამოყენება შედარებით მარტივია, მაგრამ რადგან ეს ავტორეგრესიული მოდელია, საჭიროა გარკვეული სიფრთხილე მოდელის შეყვანების მოსამზადებლად ყოველ დროის საფეხურზე. ჩვენ მოვამზადეთ როგორც Python სკრიპტი, ასევე Colab ნოუთბუქი, რომელიც გვიჩვენებს, როგორ გამოვიყენოთ ეს მოდელი. წინასწარ გაწვრთნილი Decision Transformer-ის ჩატვირთვა მარტივია 🤗 ტრანსფორმერების ბიბლიოთეკაში: ჩვენ გთავაზობთ წინასწარ გაწვრთნილ საკონტროლო წერტილებს Gym Hopper, Walker2D და Halfcheetah გარემოებისთვის. Atari გარემოებისთვის საკონტროლო წერტილები მალე იქნება ხელმისაწვდომი. მოდელი ასრულებს ავტორეგრესიულ პროგნოზირებას; ეს ნიშნავს, რომ მიმდინარე დროის საფეხურზე t გაკეთებული პროგნოზები თანმიმდევრულად არის დამოკიდებული წინა დროის საფეხურების შედეგებზე. ეს ფუნქცია საკმაოდ რთულია, ამიტომ შევეცდებით მისი კომენტარებში ახსნას. მოდელის შესაფასებლად, დამატებითი ინფორმაცია გვჭირდება; მდგომარეობების საშუალო და სტანდარტული გადახრა, რომლებიც გამოყენებული იყო წვრთნის დროს. საბედნიეროდ, ისინი ხელმისაწვდომია თითოეული საკონტროლო წერტილის მოდელის ბარათზე Hugging Face Hub-ზე! ასევე გვჭირდება მოდელისთვის სამიზნე ამონაგები. ეს არის ამონაგებზე დაფუძნებული (return conditioned) მიდგომის ძალა...