Hugging Face-ი Decision Transformer-ს აინტეგრირებს: ახალი მიდგომა გაძლიერებით სწავლებაში
Hugging Face-მა Decision Transformer, ოფლაინ გაძლიერებითი სწავლის (Offline Reinforcement Learning) მეთოდი, თავის 🤗 transformers ბიბლიოთეკასა და Hugging Face Hub-ში ინტეგრირება მოახდინა. ეს ინტეგრაცია მნიშვნელოვან ნაბიჯს წარმოადგენს Deep Reinforcement Learning-ის (Deep RL) სფეროში ხელმისაწვდომობის გასაუმჯობესებლად. Decision Transformer წარმოადგენს პარადიგმის ცვლას, სადაც ტრადიციული RL მეთოდების ნაცვლად გამოიყენება მიმდევრობის მოდელირების ალგორითმი სასურველი შედეგის მისაღწევად მომავალი მოქმედებები
დღეს მოხარულნი ვართ განვაცხადოთ, რომ Decision Transformer, ოფლაინ გაძლიერებითი სწავლის (Offline Reinforcement Learning) მეთოდი, 🤗 transformers ბიბლიოთეკასა და Hugging Face Hub-ში ინტეგრირდა. ჩვენ გვაქვს საინტერესო გეგმები Deep RL-ის სფეროში ხელმისაწვდომობის გასაუმჯობესებლად და მოუთმენლად ველით მათ გაზიარებას მომდევნო კვირებსა და თვეებში.
Deep Reinforcement Learning (RL) არის გადაწყვეტილების მიმღები აგენტების შესაქმნელი ჩარჩო. ეს აგენტები მიზნად ისახავენ ოპტიმალური ქცევის (პოლიტიკის) სწავლას გარემოსთან ცდისა და შეცდომის გზით ურთიერთქმედებით და ჯილდოების, როგორც უნიკალური უკუკავშირის, მიღებით. აგენტის მიზანია დააგროვოს მაქსიმალური ჯილდო, რომელსაც ეწოდება „return“ (ჯამური ჯილდო). ეს იმიტომ, რომ RL ეფუძნება ჯილდოს ჰიპოთეზას: ყველა მიზანი შეიძლება აღიწეროს, როგორც მოსალოდნელი ჯამური ჯილდოს მაქსიმიზაცია.
Deep Reinforcement Learning აგენტები სწავლობენ გამოცდილების პარტიებით. კითხვა ისმის, როგორ აგროვებენ მას?:
გაძლიერებითი სწავლის ონლაინ და ოფლაინ რეჟიმების შედარება (ილუსტრაცია ამ პოსტიდანაა აღებული).
ონლაინ გაძლიერებით სწავლებაში აგენტი მონაცემებს უშუალოდ აგროვებს: ის აგროვებს გამოცდილების პარტიას გარემოსთან ურთიერთქმედებით. შემდეგ, ის ამ გამოცდილებას დაუყოვნებლივ იყენებს (ან რაიმე replay buffer-ის მეშვეობით) მისგან სასწავლად (განაახლებს თავის პოლიტიკას). მაგრამ ეს გულისხმობს, რომ თქვენ ან ავარჯიშებთ აგენტს უშუალოდ რეალურ სამყაროში, ან გჭირდებათ სიმულატორი. თუ ის არ გაქვთ, უნდა ააგოთ, რაც შეიძლება იყოს ძალიან რთული (როგორ აისახოს რეალური სამყაროს რთული რეალობა გარემოში?), ძვირი და სახიფათო, რადგან თუ სიმულატორს ხარვეზები აქვს, აგენტი მათ გამოიყენებს, თუ ეს კონკურენტულ უპირატესობას მისცემს.
მეორე მხრივ, ოფლაინ გაძლიერებით სწავლებაში აგენტი იყენებს მხოლოდ სხვა აგენტების ან ადამიანის დემონსტრაციებიდან შეგროვებულ მონაცემებს. ის არ ურთიერთქმედებს გარემოსთან. პროცესი შემდეგნაირად მიმდინარეობს:
ამ მეთოდს აქვს ერთი ნაკლი: კონტრფაქტული შეკითხვების პრობლემა (counterfactual queries problem). რა უნდა ვქნათ, თუ ჩვენი აგენტი გადაწყვეტს გააკეთოს ისეთი რამ, რისთვისაც მონაცემები არ გაგვაჩნია? მაგალითად, კვეთაზე მარჯვნივ მოხვევა, მაგრამ ჩვენ არ გვაქვს ამ ტრაექტორიის მონაცემები.
ამ თემაზე უკვე არსებობს რამდენიმე გამოსავალი, მაგრამ თუ გსურთ მეტი გაიგოთ ოფლაინ გაძლიერებითი სწავლის შესახებ, შეგიძლიათ ნახოთ ეს ვიდეო.
Decision Transformer მოდელი წარდგენილი იქნა ნაშრომში „Decision Transformer: Reinforcement Learning via Sequence Modeling“ Chen L. et al.-ის მიერ. ის გაძლიერებით სწავლებას (Reinforcement Learning) აღწერს, როგორც პირობით-მიმდევრობის მოდელირების ამოცანას. ძირითადი იდეა ის არის, რომ პოლიტიკის გაწვრთნის ნაცვლად RL მეთოდების გამოყენებით, როგორიცაა მნიშვნელობის ფუნქციის (value function) მორგება, რომელიც გვეტყვის, თუ რა ქმედება უნდა განვახორციელოთ ჯამური ჯილდოს (cumulative reward) მაქსიმიზაციისთვის, ჩვენ ვიყენებთ მიმდევრობის მოდელირების ალგორითმს (Transformer), რომელიც, მოცემული სასურველი ჯამური ჯილდოს, წარსული მდგომარეობებისა და მოქმედებების საფუძველზე, გამოიმუშავებს მომავალ მოქმედებებს ამ სასურველი ჯამური ჯილდოს მისაღწევად. ეს არის ავტორეგრესიული მოდელი, რომელიც სასურველი ჯამური ჯილდოს, წარსული მდგომარეობებისა და მოქმედებების საფუძველზე გენერირებს მომავალ ქმედებებს, რომლებიც სასურველ ჯამურ ჯილდოს მიაღწევენ. ეს არის სრული ცვლილება გაძლიერებითი სწავლის პარადიგმაში, რადგან ჩვენ ვიყენებთ გენერაციულ ტრაექტორიის მოდელირებას (მდგომარეობების, მოქმედებებისა და ჯილდოების მიმდევრობის ერთობლივი განაწილების მოდელირებას) ჩვეულებრივი RL ალგორითმების ჩასანაცვლებლად. ეს ნიშნავს, რომ Decision Transformers-ში ჩვენ არ ვახდენთ ჯამური ჯილდოს მაქსიმიზაციას, არამედ ვგენერირებთ მომავალი მოქმედებების სერიას, რომლებიც სასურველ ჯამურ ჯილდოს აღწევენ. პროცესი ასე მიმდინარეობს:
Decision Transformer-ის არქიტექტურა. მდგომარეობები, მოქმედებები და ჯამური ჯილდოები შეყვანილია მოდელ სპეციფიკურ ხაზოვან ჩაშენებებში (linear embeddings) და ემატება პოზიციური ეპიზოდური დროის ნაბიჯის კოდირება (positional episodic timestep encoding). ტოკენები შეყვანილია GPT არქიტექტურაში, რომელიც მოქმედებებს ავტორეგრესიულად პროგნოზირებს მიზეზობრივი თვითყურადღების ნიღბის (causal self-attention mask) გამოყენებით. სურათი [1]-დან.
Decision Transformer მოდელი ახლა ხელმისაწვდომია 🤗 transformers ბიბლიოთეკის ნაწილად. გარდა ამისა, ჩვენ ვუზიარებთ ცხრა წინასწარ გაწვრთნილი მოდელის ჩექპოინტს (checkpoints) უწყვეტი კონტროლის ამოცანებისთვის Gym გარემოში. „ექსპერტი“ Decision Transformers მოდელი, რომელიც ისწავლა ოფლაინ RL-ის გამოყენებით Gym Walker2d გარემოში.
Decision Transformer-ის გამოყენება შედარებით მარტივია, მაგრამ ვინაიდან ეს ავტორეგრესიული მოდელია, გარკვეული სიფრთხილეა საჭირო მოდელის შეყვანის მოსამზადებლად ყოველ დროის ნაბიჯზე. ჩვენ მოვამზადეთ როგორც Python სკრიპტი, ასევე Colab ნოუთბუქი, რომელიც აჩვენებს ამ მოდელის გამოყენებას.
წინასწარ გაწვრთნილი Decision Transformer-ის ჩატვირთვა მარტივია 🤗 transformers ბიბლიოთეკაში:
ჩვენ გთავაზობთ წინასწარ გაწვრთნილ ჩექპოინტებს Gym Hopper, Walker2D და Halfcheetah გარემოებისთვის. Atari გარემოებისთვის ჩექპოინტები მალე იქნება ხელმისაწვდომი.
მოდელი ახორციელებს ავტორეგრესიულ პროგნოზირებას; ეს ნიშნავს, რომ მიმდინარე დროის ნაბიჯზე t გაკეთებული პროგნოზები თანმიმდევრულად არის დამოკიდებული წინა დროის ნაბიჯებიდან მიღებულ შედეგებზე. ეს ფუნქცია საკმაოდ მოცულობითია, ამიტომ შევეცდებით ავხსნათ ის კომენტარებში.
მოდელის შესაფასებლად, გვჭირდება დამატებითი ინფორმაცია: მდგომარეობების საშუალო და სტანდარტული გადახრა, რომლებიც გამოყენებული იყო გაწვრთნის დროს. საბედნიეროდ, ისინი ხელმისაწვდომია თითოეული ჩექპოინტის მოდელის ბარათზე Hugging Face Hub-ზე! ასევე გვჭირდება მიზნობრივი ჯამური ჯილდო (target return) მოდელისთვის. ეს არის ჯამური ჯილდოზე დაფუძნებული (return conditioned) მიდგომის ძალა...
თეგები:
#მანქანური სწავლება
#hugging face
#transformer
#deep learning
#ტრანსფორმერი
#გაძლიერებითი სწავლება
#decision transformer
#reinforcement learning
#deep rl
#offline rl
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი