მოხარულნი ვართ წარმოგიდგინოთ „ყველაფრის ოსტატი“ (JAT), პროექტი, რომლის მიზანიც ზოგადი დანიშნულების აგენტის შექმნაა. პროექტი დაიწყო როგორც Gato-ს (Reed et al., 2022) ნაშრომის ღია რეპროდუქცია, რომელიც გვთავაზობდა ტრანსფორმერის გაწვრთნას ისე, რომ მას შეეძლო როგორც ხედვისა და ენის, ისე გადაწყვეტილების მიღების ამოცანების შესრულება. ამგვარად, ჩვენ დავიწყეთ Gato-ს მონაცემთა ნაკრების ღია ვერსიის შექმნით. შემდეგ ამაზე გავწვრთნეთ მულტიმოდალური ტრანსფორმერული მოდელები, რომლებშიც შევიტანეთ რამდენიმე გაუმჯობესება Gato-სთან შედარებით თანმიმდევრული მონაცემებისა და უწყვეტი მნიშვნელობების დასამუშავებლად. ტრადიციულად, გამაძლიერებელი სწავლება (RL) გულისხმობს პოლიტიკების გაწვრთნას ერთ გარემოში. ამ ექსპერტი პოლიტიკების გამოყენება არის ეფექტური საშუალება მრავალმხრივი აგენტის შესაქმნელად. ჩვენ შევარჩიეთ გარემოების ფართო სპექტრი, განსხვავებული ბუნებისა და სირთულის, მათ შორის Atari, BabyAI, Meta-World და MuJoCo. თითოეული ამ გარემოსთვის, ჩვენ გავწვრთნეთ აგენტი მანამ, სანამ მან არ მიაღწია უახლეს შესრულებას (BabyAI-სთვის, ჩვენ გამოვიყენეთ BabyAI ბოტი). მიღებულ აგენტებს ეწოდება ექსპერტი აგენტები და ისინი გამოქვეყნებულია 🤗 Hub-ზე. ყველა აგენტის სია შეგიძლიათ იხილოთ JAT მონაცემთა ნაკრების ბარათში. ჩვენ ვავრცელებთ JAT მონაცემთა ნაკრებს, პირველ მონაცემთა ნაკრებს ზოგადი დანიშნულების აგენტების გაწვრთნისთვის. JAT მონაცემთა ნაკრები შეიცავს ასობით ათას ექსპერტულ ტრაექტორიას, რომლებიც შეგროვდა ზემოთ ხსენებული ექსპერტი აგენტების გამოყენებით. ამ მონაცემთა ნაკრების გამოსაყენებლად, უბრალოდ ჩატვირთეთ ის, როგორც ნებისმიერი სხვა მონაცემთა ნაკრები 🤗 Hub-დან. RL მონაცემების გარდა, ჩვენ ვრთავთ ტექსტურ მონაცემთა ნაკრებებს, რათა მომხმარებლისთვის უნიკალური ინტერფეისი უზრუნველვყოთ. ამიტომაც, თქვენ ასევე იპოვით ქვე-ნაკრებებს Wikipedia-სთვის, Oscar-ისთვის, OK-VQA-სთვის და Conceptual-Captions-ისთვის. JAT-ის არქიტექტურა ეფუძნება ტრანსფორმერს, EleutherAI-ის GPT-Neo იმპლემენტაციის გამოყენებით. JAT-ის თავისებურება მდგომარეობს მის ჩაშენების მექანიზმში, რომელიც შექმნილია თანმიმდევრული გადაწყვეტილების ამოცანების შინაგანად დასამუშავებლად. ჩვენ ვცვლით დაკვირვების ჩაშენებებს მოქმედების ჩაშენებებით, შესაბამის ჯილდოებთან ერთად. ამრიგად, თითოეული ჩაშენება შეესაბამება ან დაკვირვებას (დაკავშირებული ჯილდოსთან), ან მოქმედებას. მაგრამ როგორ ახდენს JAT ამ ინფორმაციის კოდირებას? ეს დამოკიდებულია მონაცემთა ტიპზე. თუ მონაცემები (დაკვირვება ან მოქმედება) არის სურათი (როგორც Atari-ს შემთხვევაში), მაშინ JAT იყენებს CNN-ს. თუ ეს უწყვეტი ვექტორია, მაშინ JAT იყენებს წრფივ ფენას. და ბოლოს, თუ ეს დისკრეტული მნიშვნელობაა, JAT იყენებს წრფივი პროექციის ფენას. იგივე პრინციპი გამოიყენება მოდელის გამოსავლისთვისაც, პროგნოზირებადი მონაცემთა ტიპის მიხედვით. პროგნოზირება მიზეზობრივია, დაკვირვებების 1 დროის ნაბიჯით გადაწევის გზით. ამ გზით, აგენტმა უნდა იწინასწარმეტყველოს შემდეგი მოქმედება ყველა წინა დაკვირვებისა და მოქმედების საფუძველზე. გარდა ამისა, ვიფიქრეთ, რომ საინტერესო იქნებოდა ჩვენი აგენტის გაწვრთნა NLP და CV ამოცანების შესასრულებლად. ამისათვის, ენკოდერს მივეცით ტექსტური და გამოსახულების მონაცემების შეყვანის შესაძლებლობა. ტექსტური მონაცემებისთვის ვიყენებთ GPT-2 ტოკენიზაციის სტრატეგიას, ხოლო სურათებისთვის – ViT-ტიპის ენკოდერს. იმის გათვალისწინებით, რომ მონაცემთა მოდალობა შეიძლება შეიცვალოს ერთი გარემოდან მეორეში, როგორ ითვლის JAT დანაკარგს? იგი ითვლის დანაკარგს თითოეული მოდალობისთვის ცალკე. სურათებისთვის და უწყვეტი მნიშვნელობებისთვის იყენებს MSE დანაკარგს. დისკრეტული მნიშვნელობებისთვის იყენებს ჯვარედინი ენტროპიის დანაკარგს. საბოლოო დანაკარგი არის თანმიმდევრობის თითოეული ელემენტისთვის მიღებული დანაკარგების საშუალო. დაველოდოთ, ნიშნავს თუ არა ეს, რომ ჩვენ თანაბარ წონას ვანიჭებთ მოქმედებებისა და დაკვირვებების პროგნოზირებას? რეალურად, არა, მაგრამ ამაზე მოგვიანებით ვისაუბრებთ. ჩვენ შევაფასეთ JAT ყველა 157 სავარჯიშო ამოცანაზე. შეგროვდა 10 ეპიზოდი და ჩაიწერა საერთო ჯილდო. წაკითხვის გასაადვილებლად, ჩვენ დავაჯგუფეთ შედეგები დომენების მიხედვით. თუ ამ შედეგებს ერთი ციფრით შევაჯამებდით, ეს იქნებოდა 65.8%, რაც JAT ექსპერტთან შედარებით საშუალო შესრულებას წარმოადგენს 4 დომენზე. ეს გვიჩვენებს, რომ JAT-ს შეუძლია ექსპერტული შესრულების მიბაძვა ამოცანების ძალიან ფართო სპექტრზე. მოდით, ცოტა მეტი დეტალებით განვიხილოთ: ყველაზე შთამბეჭდავია ის, რომ JAT ამ შესრულებას აღწევს ერთი ქსელის გამოყენებით ყველა დომენისთვის. ამ შესრულების შესაფასებლად, ვნახოთ JAT-ის მუშაობა რამდენიმე ამოცანაზე. გსურთ მისი გამოცდა? შეგიძლიათ! JAT მოდელი ხელმისაწვდომია 🤗 Hub-ზე! ტექსტური ამოცანებისთვის ჩვენი მოდელი აჩვენებს ელემენტარულ შესაძლებლობებს; დეტალებისთვის მკითხველს ვურჩევთ მიმართოს ნაშრომს. RL აგენტის გაწვრთნისას, მთავარი მიზანია მომავალი ჯილდოების მაქსიმიზაცია. მაგრამ რა მოხდება, თუ აგენტს ვთხოვთ, იწინასწარმეტყველოს ისიც, რასაც მომავალში დააკვირდება? ეს დამატებითი ამოცანა ხელს შეუწყობს თუ შეაფერხებს სწავლის პროცესს? ამ კითხვაზე ორი საპირისპირო შეხედულება არსებობს. ერთის მხრივ, დაკვირვებების პროგნოზირების სწავლამ შეიძლება გააღრმაოს გარემოს გაგება, რასაც უკეთეს და სწრაფ სწავლამდე მივყავართ. მეორეს მხრივ, ამან შეიძლება აგენტი გადაიტანოს მისი ძირითადი მიზნიდან, რის შედეგადაც მივიღებთ საშუალო შესრულებას როგორც დაკვირვების, ისე მოქმედების პროგნოზირებაში. ამ დებატების გადასაჭრელად, ჩვენ ჩავატარეთ ექსპერიმენტი, სადაც გამოვიყენეთ დანაკარგის ფუნქცია, რომელიც აერთიანებს დაკვირვების დანაკარგს და მოქმედების დანაკარგს, შეწონვის პარამეტრით κ (კაპა) ამ ორი მიზნის დასაბალანსებლად. შედეგები აღსანიშნავი იყო. როდესაც κ (კაპა) ძალიან მაღალი იყო (0.5), დაკვირვებების პროგნოზირების დამატებითი მიზანი, როგორც ჩანს, აფერხებდა სწავლის პროცესს. მაგრამ...