ამ სტატიაში: ვიზუალურ-ენობრივ-მოქმედებითი (VLA) მოდელების ბოლოდროინდელმა მიღწევებმა რობოტებს საშუალება მისცა შეასრულონ მრავალფეროვანი ამოცანები – მარტივი ბრძანებებიდან, როგორიცაა „აიღე კუბი“, უფრო კომპლექსურ აქტივობებამდე, მაგალითად, სამრეცხაოს დაკეცვა ან მაგიდის გაწმენდა. ამ მოდელების მიზანია განზოგადების მიღწევა: ამოცანების შესრულების უნარი ახალ გარემოში, უცნობი ობიექტებით და სხვადასხვა პირობებში. „რობოტიკაში ყველაზე დიდი გამოწვევა სისწრაფე კი არა, არამედ განზოგადებაა – ფიზიკურ, ვიზუალურ და სემანტიკურ დონეზე.“ – Physical Intelligence. რობოტმა უნდა „გაარკვიოს, როგორ შეასრულოს სწორად თუნდაც მარტივი დავალება ახალ გარემოში ან ახალ ობიექტებთან ერთად“, რაც მოითხოვს როგორც მყარ უნარებს, ასევე სამყაროს საღ აზრზე დაფუძნებულ გაგებას. თუმცა, პროგრესი ხშირად შეზღუდულია ასეთი რობოტული სისტემებისთვის მრავალფეროვანი მონაცემების ხელმისაწვდომობით. „განზოგადება მრავალ დონეზე უნდა მოხდეს. დაბალ დონეზე, რობოტმა უნდა გაიგოს, როგორ აიღოს კოვზი (სახელურით) ან თეფში (პირით), მაშინაც კი, თუ მას არასოდეს უნახავს ეს კონკრეტული კოვზები ან თეფშები, და მაშინაც კი, თუ ისინი ჭუჭყიანი ჭურჭლის გროვაშია მოთავსებული. უფრო მაღალ დონეზე, რობოტმა უნდა გაიგოს თითოეული ამოცანის სემანტიკა – სად უნდა დადოს ტანსაცმელი და ფეხსაცმელი (იდეალურად, სარეცხის კალათაში ან კარადაში, არა საწოლზე), და რა სახის ხელსაწყოა შესაფერისი დაღვრილის მოსაწმენდად. ეს განზოგადება მოითხოვს როგორც მყარ ფიზიკურ უნარებს, ასევე გარემოს საღ აზრზე დაფუძნებულ გაგებას, რათა რობოტმა ერთდროულად მრავალ დონეზე შეძლოს განზოგადება – ფიზიკურიდან ვიზუალურამდე, სემანტიკურამდე. ამას კიდევ უფრო ართულებს ასეთი რობოტული სისტემებისთვის მრავალფეროვანი მონაცემების შეზღუდული ხელმისაწვდომობა.“ – Physical Intelligence. გამარტივების მიზნით, განზოგადებული პოლიტიკის არსი მარტივ იდეაში მდგომარეობს: ჰეტეროგენულ მონაცემთა ნაკრებებზე თანა-ტრენინგი. VLA მოდელების სხვადასხვა გარემოს, ამოცანისა და რობოტის განსახიერების ზემოქმედებით, ჩვენ შეგვიძლია მოდელებს ვასწავლოთ არა მხოლოდ როგორ მოიქცნენ, არამედ რატომ – როგორ განმარტონ სცენა, გაიგონ მიზანი და მოარგონ უნარები სხვადასხვა კონტექსტს. 💡 „განზოგადება მხოლოდ მოდელის თვისება კი არა, მონაცემების ფენომენია.“ ის გამომდინარეობს სავარჯიშო მონაცემების მრავალფეროვნებიდან, ხარისხიდან და აბსტრაქციის დონიდან. ეს მიგვიყვანს ფუნდამენტურ კითხვამდე: არსებული მონაცემთა ნაკრებების გათვალისწინებით, როგორია განზოგადების ზედა ზღვარი, რომელსაც შეგვიძლია ველოდოთ? შეუძლია თუ არა რობოტს აზრიანად უპასუხოს სრულიად ახალ მოთხოვნას – მაგალითად, „მოაწყე სიურპრიზი დაბადების დღის წვეულება“ – თუ მას არასოდეს შეხვედრია რაიმე მსგავსი ვარჯიშის დროს? განსაკუთრებით მაშინ, როდესაც მონაცემთა უმეტესობა შეგროვებულია აკადემიურ ლაბორატორიებში, შეზღუდული რაოდენობის ადამიანების მიერ, კარგად კონტროლირებულ პირობებში? ჩვენ განზოგადებას მონაცემებზე ორიენტირებულ ხედვად ვაყალიბებთ: მას განვიხილავთ, როგორც მონაცემებიდან უფრო ფართო შაბლონების აბსტრაქციის პროცესს – არსებითად „მასშტაბის შემცირებას“ ამოცანისგან დამოუკიდებელი სტრუქტურებისა და პრინციპების გამოსავლენად. პერსპექტივის ეს ცვლილება ხაზს უსვამს მონაცემთა ნაკრების მრავალფეროვნების როლს და არა მხოლოდ მოდელის არქიტექტურისას, განზოგადების მართვაში. აქამდე რობოტიკის მონაცემთა ნაკრებების უმეტესობა სტრუქტურირებული აკადემიური გარემოდან მოდის. მაშინაც კი, თუ მილიონობით დემონსტრაციამდე გავზრდით, ერთი მონაცემთა ნაკრები ხშირად დომინირებს, რაც ზღუდავს მრავალფეროვნებას. ImageNet-ისგან განსხვავებით, რომელმაც ინტერნეტის მასშტაბის მონაცემები მოაგროვა და რეალური სამყარო უფრო ჰოლისტურად ასახა, რობოტიკას აკლია შედარებით მრავალფეროვანი, საზოგადოებაზე ორიენტირებული ბენჩმარკი. ეს დიდწილად იმის გამო ხდება, რომ რობოტიკისთვის მონაცემების შეგროვება ფიზიკურ აპარატურასა და მნიშვნელოვან ძალისხმევას მოითხოვს. სწორედ ამიტომ, LeRobot-ში ვმუშაობთ რობოტიკის მონაცემთა შეგროვების უფრო ხელმისაწვდომად ქცევაზე – სახლში, სკოლაში თუ ნებისმიერ სხვა ადგილას. ჩვენ უკვე ვხედავთ შედეგებს: Hub-ზე საზოგადოების მიერ შეტანილი მონაცემთა ნაკრებების რაოდენობა სწრაფად იზრდება. LeRobot-ის მონაცემთა ნაკრებების ზრდა Hugging Face Hub-ზე დროთა განმავლობაში. თუ ატვირთულ მონაცემთა ნაკრებებს რობოტის ტიპის მიხედვით დავყოფთ, ვნახავთ, რომ უმეტესი წვლილი So100-სა და Koch-ის ტიპის რობოტებზე მოდის, რაც რობოტულ მკლავებსა და მანიპულაციის ამოცანებს LeRobot-ის მონაცემთა ლანდშაფტის მთავარ აქცენტად აქცევს. თუმცა, მნიშვნელოვანია გვახსოვდეს, რომ პოტენციალი გაცილებით ფართოა. ისეთ სფეროებს, როგორიცაა ავტონომიური მანქანები, დამხმარე რობოტები და მობილური ნავიგაცია, ასევე შეუძლიათ სარგებლობა მიიღონ საერთო მონაცემებიდან. ეს იმპულსი გვაახლოებს მომავალთან, სადაც მონაცემთა ნაკრებები გლობალურ ძალისხმევას ასახავს და არა მხოლოდ ერთი ლაბორატორიის ან ინსტიტუტის წვლილს. LeRobot-ის მონაცემთა ნაკრებების განაწილება რობოტის ტიპის მიხედვით. წარმოგიდგენთ რამდენიმე გამორჩეულ საზოგადოების მიერ შეტანილ მონაცემთა ნაკრებს, რომლებიც აჩვენებს, თუ რამდენად მრავალფეროვანი და წარმოსახვითი შეიძლება იყოს რობოტიკა: დამატებითი კრეატიული მონაცემთა ნაკრებების სანახავად იხილეთ LeRobot-ის ტეგი Hugging Face Hub-ზე და ინტერაქტიულად დაათვალიერეთ ისინი LeRobot Dataset Visualizer-ში. რამდენადაც რობოტიკის მონაცემთა შეგროვება უფრო დემოკრატიული ხდება, მონაცემების კურირება იქცევა შემდეგ გამოწვევად. მიუხედავად იმისა, რომ ეს მონაცემთა ნაკრებები ჯერ კიდევ შეზღუდულ გარემოში გროვდება, ისინი გადამწყვეტი ნაბიჯია ხელმისაწვდომი, ზოგადი დანიშნულების რობოტული პოლიტიკისკენ. ყველას არ აქვს წვდომა ძვირადღირებულ აპარატურაზე – მაგრამ საერთო ინფრასტრუქტურით და ღია თანამშრომლობით, ჩვენ შეგვიძლია შევქმნათ ბევრად უფრო დიდი რამ. 🧠 „განზოგადება ლაბორატორიაში არ წყდება – მას სამყარო ასწავლის.“ რაც უფრო მრავალფეროვანი იქნება ჩვენი მონაცემები, მით უფრო ქმედითუნარიანი იქნება ჩვენი მოდელები. რატომ არის მნიშვნელოვანი მონაცემების ხარისხი?