SmolVLA: ახალი კომპაქტური, ღია კოდის VLA მოდელი რობოტიკისთვის, რომელიც ხელმისაწვდომს ხდის AI კვლევებს
დღეს წარმოდგენილია SmolVLA – კომპაქტური (450M), ღია კოდის Vision-Language-Action (VLA) მოდელი რობოტიკისთვის, რომელიც მომხმარებლისთვის განკუთვნილ აპარატურაზე მუშაობს. მიუხედავად იმისა, რომ ხელოვნური ინტელექტის სფეროში ტრანსფორმერებმა მნიშვნელოვან პროგრესს მიაღწიეს, რობოტიკაში განვითარება შედარებით ნელი ტემპით მიმდინარეობდა, რაც განპირობებულია მაღალი ხარისხის მონაცემების ნაკლებობით და დახურული, ძვირადღირებული მოდელების დომინირებით. SmolVLA მიზნად ისახავს ამ ხარვეზის აღმოფხვრას ღია კოდის, ეფექტური
დღეს წარმოგიდგენთ SmolVLA-ს, კომპაქტურ (450M), ღია კოდის Vision-Language-Action (VLA) მოდელს რობოტიკისთვის, რომელიც მომხმარებლისთვის განკუთვნილ აპარატურაზე მუშაობს. სასარგებლო ბმულები:
ბოლო რამდენიმე წლის განმავლობაში, ტრანსფორმერებმა ხელოვნური ინტელექტის სფეროში მნიშვნელოვან პროგრესს მიაღწიეს, დაწყებული ენობრივი მოდელებიდან, რომლებსაც ადამიანის მსგავსი მსჯელობა შეუძლიათ, დამთავრებული მულტიმოდალური სისტემებით, რომლებიც ერთდროულად აღიქვამენ როგორც სურათებს, ასევე ტექსტს. თუმცა, რეალურ სამყაროში რობოტიკის მიმართულებით განვითარება გაცილებით ნელი ტემპით მიმდინარეობდა. რობოტებს ჯერ კიდევ უჭირთ სხვადასხვა ობიექტის, გარემოსა და ამოცანის განზოგადება. ეს შეზღუდული პროგრესი გამოწვეულია მაღალი ხარისხის, მრავალფეროვანი მონაცემების ნაკლებობით და ისეთი მოდელების არარსებობით, რომლებსაც ფიზიკურ სამყაროში ადამიანის მსგავსი მსჯელობა და მოქმედება შეუძლიათ.
ამ გამოწვევების საპასუხოდ, სფერო ცოტა ხნის წინ Vision-Language-Action (VLA) მოდელებისკენ შეტრიალდა, რომელთა მიზანია აღქმის, ენის გაგების და მოქმედების პროგნოზირების გაერთიანება ერთიან არქიტექტურაში. VLA-ები, როგორც წესი, იღებენ ნედლ ვიზუალურ დაკვირვებებს და ბუნებრივი ენის ინსტრუქციებს შეყვანის სახით, და გამოაქვთ რობოტის შესაბამისი მოქმედებები. მიუხედავად პერსპექტიულობისა, VLA-ების ბოლო მიღწევების უმეტესობა კვლავ დახურული, საკუთრების მოდელების მიღმა რჩება, რომლებიც გაწვრთნილია მსხვილმასშტაბიან კერძო მონაცემთა ბაზებზე და ხშირად საჭიროებს ძვირადღირებულ აპარატურულ კონფიგურაციებსა და ვრცელ საინჟინრო რესურსებს. შედეგად, რობოტიკის კვლევითი საზოგადოება მნიშვნელოვან ბარიერებს აწყდება ამ მოდელების რეპროდუცირებასა და მათზე დაფუძნებულ განვითარებაში.
SmolVLA ავსებს ამ ხარვეზს ღია კოდის, კომპაქტური და ეფექტური VLA მოდელის შეთავაზებით, რომლის გაწვრთნა შესაძლებელია სამომხმარებლო კლასის აპარატურაზე მხოლოდ საჯაროდ ხელმისაწვდომი მონაცემთა ბაზების გამოყენებით. მოდელის წონების გამოშვებით და ძალიან ხელმისაწვდომი ღია კოდის აპარატურის გამოყენებით, SmolVLA მიზნად ისახავს Vision-Language-Action მოდელებზე ხელმისაწვდომობის დემოკრატიზაციას და ზოგადი რობოტული აგენტებისკენ მიმართული კვლევის დაჩქარებას.
სურათი 1: SmolVLA-ს შედარება ამოცანების ვარიაციების მიხედვით. მარცხნიდან მარჯვნივ: (1) ასინქრონული კუბების აღება-განთავსება და დათვლა, (2) სინქრონული კუბების აღება-განთავსება და დათვლა, (3) კუბების აღება-განთავსება და დათვლა დარღვევების პირობებში, და (4) განზოგადება ლეგოს ბლოკის აღება-განთავსებაზე რეალური სამყაროს SO101-თან ერთად.
SmolVLA-450M არის ჩვენი ღია კოდის, კომპაქტური, მაგრამ ამავდროულად მძლავრი VLA მოდელი. ის დიდი ენობრივი მოდელების (LLMs) სწავლების პარადიგმებით შთაგონებული, SmolVLA გადის წინასწარი სწავლების ფაზას ზოგადი მანიპულაციის მონაცემებზე, რასაც მოჰყვება ამოცანისთვის სპეციფიკური შემდგომი სწავლება. არქიტექტურულად, ის აერთიანებს ტრანსფორმერებს ნაკადის შესაბამისობის დეკოდერებთან (flow-matching decoders) და ოპტიმიზებულია სიჩქარისა და დაბალი შეყოვნების ინფერენციისთვის შემდეგი დიზაინის გადაწყვეტილებებით: მიუხედავად იმისა, რომ იყენებს 30 ათასზე ნაკლებ სასწავლო ეპიზოდს — რიგით ნაკლებს, ვიდრე სხვა VLA-ები — SmolVLA შეესაბამება ან აღემატება ბევრად უფრო დიდი მოდელების მუშაობას, როგორც სიმულაციაში, ასევე რეალურ სამყაროში. რეალურ დროში რობოტიკის გამოსაყენებლად უფრო მარტივი რომ გახდეს, ჩვენ წარმოგიდგენთ ასინქრონული ინფერენციის დასტას (asynchronous inference stack). ეს ტექნოლოგია აცალკევებს, თუ როგორ ასრულებენ რობოტები მოქმედებებს იმისგან, თუ როგორ ესმით მათ რას ხედავენ და ისმენენ. ამ გამიჯვნის გამო, რობოტებს შეუძლიათ უფრო სწრაფად რეაგირება სწრაფად ცვალებად გარემოში.
სურათი 2. SmolVLA იღებს შეყვანის სახით RGB გამოსახულებების თანმიმდევრობას მრავალი კამერიდან, რობოტის ამჟამინდელ სენსომოტორულ მდგომარეობას და ბუნებრივი ენის ინსტრუქციას. VLM ამ მონაცემებს გარდაქმნის კონტექსტურ მახასიათებლებად, რომლებიც განაპირობებენ მოქმედების ექსპერტს, რომ შექმნას მოქმედებების უწყვეტი თანმიმდევრობა.
SmolVLA შექმნილია იმისთვის, რომ იყოს მარტივი გამოსაყენებელი და ინტეგრირებადი — იქნება ეს თქვენი საკუთარი მონაცემების დაზუსტება (finetuning) თუ მისი არსებულ რობოტულ სისტემაში ჩართვა. პირველ რიგში, დააინსტალირეთ საჭირო დამოკიდებულებები: გამოიყენეთ smolvla_base, ჩვენი წინასწარ გაწვრთნილი 450M მოდელი, lerobot სწავლების ფრეიმვორქთან ერთად: თუ გსურთ ააგოთ არქიტექტურიდან (წინასწარ გაწვრთნილი VLM + მოქმედების ექსპერტი) წინასწარ გაწვრთნილი კონტროლური წერტილის (checkpoint) ნაცვლად: ასევე შეგიძლიათ პირდაპირ ჩატვირთოთ SmolVLAPolicy:
SmolVLA არის არა მხოლოდ მსუბუქი, მაგრამ მძლავრი მოდელი, არამედ ზოგადი რობოტული პოლიტიკის (policies) გაწვრთნისა და შეფასების მეთოდიც. ამ განყოფილებაში წარმოგიდგენთ SmolVLA-ს მოდელის არქიტექტურას და ასინქრონული ინფერენციის დაყენებას, რომელიც გამოიყენება შეფასებისთვის და რომელიც უფრო ადაპტირებადი და სწრაფი აღდგენის უნარიანი აღმოჩნდა. SmolVLA შედგება ორი ძირითადი კომპონენტისგან: Vision-Language Model (VLM), რომელიც ამუშავებს მულტიმოდალურ შეყვანებს, და მოქმედების ექსპერტი, რომელიც გამოაქვს რობოტის მართვის ბრძანებები. ქვემოთ წარმოგიდგენთ SmolVLA-ს არქიტექტურის ძირითადი კომპონენტების და ასინქრონული ინფერენციის დეტალებს. დამატებითი ინფორმაციისთვის იხილეთ ჩვენი ტექნიკური ანგარიში.
ჩვენ ვიყენებთ SmolVLM2-ს ჩვენი VLM ხერხემლის სახით (backbone). ის ოპტიმიზებულია მრავალგამოსახულებიანი შეყვანებისთვის და შედგება SigLIP ვიზუალური ენკოდერისა და SmolLM2 ენობრივი დეკოდერისგან. დეკოდერის ფენები ამუშავებენ კონკატენირებულ სურათის, ენისა და მდგომარეობის ტოკენებს. მიღებული მახასიათებლები შემდეგ გადაეცემა მოქმედების ექსპერტს. SmolVLA-ს მოქმედების ექსპერტი არის კომპაქტური ტრანსფორმერი (~100M პარამეტრი), რომელიც წარმოქმნის მოქმედებების ნაწილებს (action chunks), ანუ რობოტის მომავალი მოქმედებების თანმიმდევრობებს, VLM-ის გამომავალი მონაცემების მიხედვით. ის გაწვრთნილია ნაკადის შესაბამისობის (flow matching) ამოცანის გამოყენებით, რომელიც მოდელს ასწავლის ხმაურიანი ნიმუშების ჭეშმარიტებისკენ (ground truth) მიმართვას. ამის საპირისპიროდ, მიუხედავად იმისა, რომ დისკრეტული მოქმედების წარმოდგენები (მაგ., ტოკენიზაციის საშუალებით) მძლავრია, ისინი ხშირად საჭიროებენ ავტორეგრესიულ დეკოდირებას, რაც ნელია და არაეფექტურია.
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი