JAT: ხელოვნური ინტელექტის ახალი ეტაპი – უნივერსალური აგენტი
პროექტი „ჯეკი ყველა ხელობაში“ (JAT) მიზნად ისახავს გენერალისტი AI აგენტის შექმნას, Gato-ს ნამუშევრის რეპროდუცირებითა და გაუმჯობესებით. JAT იყენებს მულტიმოდალურ ტრანსფორმერულ მოდელებს თანმიმდევრული მონაცემების დასამუშავებლად. პროექტის შედეგად შეიქმნა ექსპერტული აგენტების მონაცემთა ნაკრები და თავად JAT მოდელი, რომელმაც სხვადასხვა ამოცანაზე ექსპერტული შესრულების 65.8% საშუალო შედეგი აჩვენა, რაც მის მრავალმხრივობას ადასტურებს.
მოხარულნი ვართ წარმოგიდგინოთ „ჯეკი ყველა ხელობაში“ (JAT) – პროექტი, რომლის მიზანია გენერალისტი აგენტის შექმნა. პროექტი დაიწყო Gato-ს (რიდი და სხვ., 2022) ნამუშევრის ღია რეპროდუქციით, რომელიც გვთავაზობდა ტრანსფორმერის გაწვრთნას, რომელსაც შეეძლო როგორც ვიზუალური და ენობრივი, ასევე გადაწყვეტილების მიღების ამოცანების შესრულება. ამგვარად, ჩვენ დავიწყეთ Gato-ს მონაცემთა ნაკრების ღია ვერსიის შექმნით. შემდეგ ამ მონაცემებზე გავწვრთენით მულტიმოდალური ტრანსფორმერული მოდელები, რომლებშიც შევიტანეთ რამდენიმე გაუმჯობესება Gato-სთან შედარებით, თანმიმდევრული მონაცემებისა და უწყვეტი მნიშვნელობების დამუშავებისთვის.
საერთო ჯამში, პროექტი შემდეგ შედეგამდე მივიდა: გაძლიერებითი სწავლება (RL) ტრადიციულად გულისხმობს პოლიტიკების გაწვრთნას ცალკეულ გარემოებებში. ამ ექსპერტული პოლიტიკების გამოყენება არის ჭეშმარიტი გზა მრავალმხრივი აგენტის შესაქმნელად. ჩვენ შევარჩიეთ გარემოებების ფართო სპექტრი, სხვადასხვა ხასიათისა და სირთულის, მათ შორის Atari, BabyAI, Meta-World და MuJoCo. თითოეულ ამ გარემოში ჩვენ ვწვრთნიდით აგენტს, სანამ ის უახლესი დონის შესრულებას არ მიაღწევდა. (BabyAI-სთვის, ჩვენ ვიყენებთ BabyAI ბოტს). მიღებულ აგენტებს ეწოდებათ ექსპერტი აგენტები და გამოქვეყნებულია 🤗 ჰაბზე. ყველა აგენტის სია შეგიძლიათ იხილოთ JAT მონაცემთა ნაკრების ბარათში.
ჩვენ ვაქვეყნებთ JAT მონაცემთა ნაკრებს – პირველ მონაცემთა ნაკრებს გენერალისტი აგენტის გაწვრთნისთვის. JAT მონაცემთა ნაკრები შეიცავს ასობით ათას ექსპერტულ ტრაექტორიას, რომლებიც შეგროვებულია ზემოაღნიშნული ექსპერტი აგენტების დახმარებით. ამ მონაცემთა ნაკრების გამოსაყენებლად, უბრალოდ ჩატვირთეთ ის, როგორც ნებისმიერი სხვა მონაცემთა ნაკრები 🤗 ჰაბიდან:
გაძლიერებითი სწავლის (RL) მონაცემების გარდა, ჩვენ ჩავრთეთ ტექსტური მონაცემთა ნაკრებები, რათა მომხმარებლისთვის უნიკალური ინტერფეისი შეგვექმნა. სწორედ ამიტომ, თქვენ ასევე იპოვით ქვედანაყოფებს ვიკიპედიის, ოსკარის, OK-VQA-სა და კონცეპტუალური წარწერებისთვის.
JAT-ის არქიტექტურა დაფუძნებულია ტრანსფორმერზე, EleutherAI-ის GPT-Neo იმპლემენტაციის გამოყენებით. JAT-ის თავისებურება მდგომარეობს მის ჩაშენების მექანიზმში, რომელიც შექმნილია თანმიმდევრული გადაწყვეტილების მიღების ამოცანების შინაგანი დამუშავებისთვის. ჩვენ ერთმანეთში ვურევთ დაკვირვების ჩაშენებებს მოქმედების ჩაშენებებთან, შესაბამის ჯილდოებთან ერთად. ამდენად, თითოეული ჩაშენება შეესაბამება ან დაკვირვებას (ჯილდოსთან დაკავშირებულს), ან მოქმედებას.
მაგრამ როგორ ახდენს JAT ამ ინფორმაციის კოდირებას? ეს დამოკიდებულია მონაცემთა ტიპზე. თუ მონაცემები (დაკვირვება ან მოქმედება) არის გამოსახულება (როგორც Atari-ის შემთხვევაში), მაშინ JAT იყენებს CNN-ს. თუ ეს უწყვეტი ვექტორია, მაშინ JAT იყენებს წრფივ ფენას. და ბოლოს, თუ ეს დისკრეტული მნიშვნელობაა, JAT იყენებს წრფივი პროექციის ფენას. იგივე პრინციპი გამოიყენება მოდელის გამოსავლისთვის, პროგნოზირებული მონაცემთა ტიპის მიხედვით. პროგნოზირება მიზეზობრივია, დაკვირვებების 1 დროის ნაბიჯით გადაადგილებით. ამ გზით, აგენტმა უნდა იწინასწარმეტყველოს შემდეგი მოქმედება ყველა წინა დაკვირვებისა და მოქმედებიდან. გარდა ამისა, ვიფიქრეთ, რომ სახალისო იქნებოდა ჩვენი აგენტის გაწვრთნა ბუნებრივი ენის დამუშავების (NLP) და კომპიუტერული ხედვის (CV) ამოცანების შესასრულებლად. ამისათვის, ჩვენ ენკოდერს ასევე მივეცით ტექსტური და გამოსახულების მონაცემების შეყვანის შესაძლებლობა. ტექსტური მონაცემებისთვის, ჩვენ ვახდენთ ტოკენიზაციას GPT-2 ტოკენიზაციის სტრატეგიის გამოყენებით, ხოლო გამოსახულებებისთვის ვიყენებთ ViT-ტიპის ენკოდერს.
იმის გათვალისწინებით, რომ მონაცემთა მოდალობა შეიძლება შეიცვალოს ერთი გარემოდან მეორეში, როგორ ითვლის JAT დანაკარგს? ის ითვლის დანაკარგს თითოეული მოდალობისთვის ცალკე. გამოსახულებებისა და უწყვეტი მნიშვნელობებისთვის, ის იყენებს MSE დანაკარგს. დისკრეტული მნიშვნელობებისთვის, ის იყენებს ჯვარედინი ენტროპიის დანაკარგს. საბოლოო დანაკარგი არის თანმიმდევრობის თითოეული ელემენტის დანაკარგების საშუალო არითმეტიკული.
მოიცადეთ, ნიშნავს თუ არა ეს, რომ ჩვენ თანაბარ წონას ვანიჭებთ მოქმედებებისა და დაკვირვებების პროგნოზირებას? რეალურად არა, მაგრამ ამაზე მოგვიანებით ვისაუბრებთ. ჩვენ შევაფასეთ JAT ყველა 157 სავარჯიშო ამოცანაზე. ჩვენ შევაგროვეთ 10 ეპიზოდი და ჩავიწერეთ ჯამური ჯილდო. წაკითხვის გასაადვილებლად, ჩვენ მოვახდინეთ შედეგების აგრეგირება დომენების მიხედვით. თუ ამ შედეგებს ერთი რიცხვით შევაჯამებდით, ეს იქნებოდა 65.8% – საშუალო შესრულება JAT ექსპერტთან შედარებით ოთხ დომენზე. ეს გვიჩვენებს, რომ JAT-ს შეუძლია ექსპერტული შესრულების იმიტაცია ამოცანების ძალიან ფართო სპექტრზე.
ცოტა უფრო დეტალურად განვიხილოთ: ყველაზე შთამბეჭდავი ის არის, რომ JAT ამ შესრულებას აღწევს ერთიანი ქსელის გამოყენებით ყველა დომენისთვის. ამ შესრულების შესაფასებლად, ვნახოთ JAT-ის მუშაობა რამდენიმე ამოცანაზე: გსურთ სცადოთ? შეგიძლიათ! JAT მოდელი ხელმისაწვდომია 🤗 ჰაბზე! ტექსტური ამოცანებისთვის, ჩვენი მოდელი რუდიმენტულ შესაძლებლობებს აჩვენებს, დამატებითი დეტალებისთვის მკითხველს სტატიაზე მივმართავთ.
RL აგენტის გაწვრთნისას, ძირითადი მიზანია მომავალი ჯილდოების მაქსიმიზაცია. მაგრამ რა მოხდება, თუ აგენტს ასევე ვთხოვთ იწინასწარმეტყველოს, რას დააკვირდება მომავალში? ეს დამატებითი ამოცანა ხელს შეუწყობს თუ შეუშლის სწავლის პროცესს? ამ საკითხზე ორი საპირისპირო მოსაზრება არსებობს. ერთი მხრივ, დაკვირვებების პროგნოზირების სწავლამ შეიძლება უზრუნველყოს გარემოს უფრო ღრმა გაგება, რაც გამოიწვევს უკეთეს და სწრაფ სწავლას. მეორე მხრივ, მას შეუძლია აგენტის ყურადღება გადაიტანოს მისი ძირითადი მიზნიდან, რაც გამოიწვევს საშუალო დონის შესრულებას როგორც დაკვირვების, ასევე მოქმედების პროგნოზირებაში. ამ დებატების გადასაჭრელად, ჩვენ ჩავატარეთ ექსპერიმენტი დანაკარგის ფუნქციის გამოყენებით, რომელიც აერთიანებს დაკვირვების დანაკარგსა და მოქმედების დანაკარგს, შეწონვის პარამეტრით κ (კაპა), რათა დააბალანსოს ეს ორი მიზანი. შედეგები აღსანიშნავი იყო. როდესაც κ ძალიან მაღალი იყო (0.5), დაკვირვებების პროგნოზირების დამატებითი მიზანი, როგორც ჩანს, ხელს უშლიდა სწავლის პროცესს. მაგრამ
თეგები:
#მანქანური სწავლება
#მულტიმოდალური ai
#მონაცემთა ნაკრები
#ტრანსფორმერი
#გაძლიერებითი სწავლება
#jat
#გენერალისტი აგენტი
#ai კვლევა
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი