Physical Intelligence-ი წარმოგიდგენთ π0-ს და π0-FAST-ს: რობოტების მრავალმხრივი კონტროლისთვის
კომპანია Physical Intelligence-მა შექმნა π0 და π0-FAST – პროტოტიპული გენერალისტი რობოტ მოდელები, რომლებიც მიზნად ისახავს ხელოვნურ ინტელექტსა და ფიზიკურ სამყაროს შორის არსებული უფსკრულის ამოვსებას. ეს ხედვა-ენა-მოქმედების (VLA) მოდელები, რომლებიც გაწვრთნილია მრავალფეროვან რობოტულ მონაცემებზე, გამოირჩევიან მრავალმხრივი კონტროლით სხვადასხვა ამოცანასა და რობოტის ტიპებზე, ნაკადის შესაბამისობის (flow matching) მეთოდის გამოყენებით ეფექტური, რეალურ დროში მოქმედების გენერაციისთვის. ისინი სძლევენ ტრადიციუ
ჩვენს რეპოზიტორიუმში შეგიძლიათ გაეცნოთ მოდელების კოლექციას და PyTorch ვერსიას: Huggingface-ის π0 მოდელების კოლექცია | Huggingface-ის π0+FAST მოდელების კოლექცია | LeRobot-ის რეპოზიტორიუმი.
როგორც რობერტ ჰაინლაინი აღნიშნავდა, მრავალმხრივ განვითარებულმა ადამიანმა უნდა შეძლოს მრავალფეროვანი ამოცანების – როგორც ინტელექტუალური, ისე ფიზიკური – შესრულება, ვიდრე მხოლოდ ერთ სფეროში ვიწრო სპეციალიზაცია. ამ მოსაზრებასთან პარალელის გავლება მანქანურ ინტელექტთან: AI სისტემები მნიშვნელოვნად განსხვავდება, თუმცა ადამიანის ინტელექტი გამოირჩევა მრავალმხრივობით – ის ადაპტირდება ამოცანებთან, გარემოსთან და მოულოდნელობებთან. მიუხედავად იმისა, რომ დიდ ენობრივ (LLM) და ხედვა-ენობრივ (VLM) მოდელებს დიდი პოტენციალი აქვთ, მათ არ აქვთ ურთიერთობა ფიზიკურ სამყაროსთან. ამ ხარვეზის აღმოსაფხვრელად გვჭირდება რობოტულ მონაცემებზე გაწვრთნილი მოდელები. გენერალისტი რობოტ მოდელები აუმჯობესებენ ადაპტირებადობას, მრავალფეროვანი მონაცემების გამოყენებით განზოგადებისა და მდგრადობის გასაუმჯობესებლად. ცალკეულ ამოცანებზე წვრთნის ნაცვლად, მრავალფეროვან რობოტულ მონაცემებზე წინასწარი წვრთნა – LLM-ების მსგავსად – ზრდის ეფექტურობასა და შესრულებას.
გენერალისტი რობოტ პოლიტიკების, ანუ რობოტის ფუნდამენტური მოდელების, შემუშავებას სამი ძირითადი გამოწვევა ახლავს თან: ფართომასშტაბიანი კვლევების საჭიროება, რათა სრულად იქნას გამოყენებული წინასწარი წვრთნის უპირატესობები. ისეთი მოდელის არქიტექტურის შექმნა, რომელსაც შეუძლია სხვადასხვა მონაცემთა წყაროების ინტეგრირება, თანაც რთული ფიზიკური ინტერაქციების აღბეჭდვა. ამ კუთხით ერთ-ერთი მთავარი გამოწვევაა კროს-განსახიერების წვრთნა (cross-embodiment training), როდესაც მოდელმა უნდა ისწავლოს სხვადასხვა ტიპის რობოტებისგან, რომლებსაც აქვთ განსხვავებული კონფიგურაციები, კონტროლის სივრცეები და მოქმედების წარმოდგენები. არსებული მიდგომები ამას უმკლავდება: ეფექტური წვრთნის მეთოდოლოგიის შექმნით, რადგან NLP-სა და ხედვაში ბოლო მიღწევები დიდწილად დამოკიდებული იყო წინასწარი და შემდგომი წვრთნის ფრთხილ სტრატეგიებზე.
ამ პოსტში წარმოგიდგენთ π0-ს და π0-FAST-ს, პროტოტიპულ მოდელებსა და სასწავლო ფრეიმვორკებს, რომლებიც Physical Intelligence-მა შეიმუშავა ამ გამოწვევების დასაძლევად. ნაშრომი | Jax კოდი.
π0 (Pi-Zero) არის ხედვა-ენა-მოქმედების (VLA) მოდელი, რომელიც Physical Intelligence-ის გუნდმა შეიმუშავა გენერალისტი რობოტის კონტროლისთვის. ის ეფუძნება ფართომასშტაბიან წინასწარ წვრთნას და ნაკადის შესაბამისობაზე (flow matching) დაფუძნებულ მოქმედების გენერაციას, რაც რობოტებს საშუალებას აძლევს შეასრულონ მოქნილი მანიპულირების ამოცანები სხვადასხვა განსახიერებაზე. π0 გაწვრთნილია 7 რობოტული პლატფორმისა და 68 უნიკალური ამოცანის მონაცემებზე, რაც აჩვენებს მის მაღალ zero-shot და დაზუსტებულ (fine-tuned) შესრულებას რთულ, რეალური სამყაროს ამოცანებზე, როგორიცაა თეთრეულის დაკეცვა, მაგიდის დალაგება, პროდუქტების შეფუთვა, ყუთების აწყობა და ობიექტების მოძიება. სტანდარტული რობოტული პოლიტიკებისგან განსხვავებით, π0 იყენებს ნაკადის შესაბამისობას (flow matching) გლუვი, რეალურ დროში მოქმედების ტრაექტორიების წარმოსაქმნელად 50 ჰც სიხშირით, რაც მას უაღრესად ეფექტურს, ზუსტსა და ადაპტირებადს ხდის რეალურ სამყაროში გამოსაყენებლად. ნაკადის შესაბამისობა (Flow matching) გამოყენებული იყო უწყვეტ ნორმალიზებად ნაკადებში (continuous normalizing flows) და აუმჯობესებდა გენერაციის ხარისხს დიფუზიურ მოდელებში. π0-ის მიერ გამოყენებული ხმაურის მოცილების პროცესი ანალოგიურად მუშაობს: ის იწყება შემთხვევითი ხმაურით, რომელიც თანდათანობით უახლოვდება მოტორული მოქმედებების აზრიან თანმიმდევრობას.
პირველ რიგში, საჭიროა თქვენი LeRobot ინსტალაციის განახლება, რომელიც ახლა transformers-ს იყენებს დამოკიდებულებად! ეს უბრალოდ გააკეთეთ git clone-ის შემდეგ. π0 მოდელები ფუნდამენტური მოდელებია, რომლებიც, PaliGemma-ს მსგავსად, შექმნილია იმისათვის, რომ ადაპტირდეს სხვადასხვა ფრეიმვორკთან, გარემოსთან და სცენის შეყვანის პარამეტრებთან. ძირითადი მოდელები, კერძოდ π0, აქ გამოსადეგია ისე, როგორც არის. თუმცა, შესრულება შემცირებულია, რადგან ეს არის JAX-დან PyTorch-ზე კონვერტაცია და კონკრეტული გარემოდან. გირჩევთ, რომ თქვენი საკუთარი π0 დააზუსტოთ (fine-tune) თქვენს გარემოზე, როგორც ეს მოცემულია ქვემოთ. π0 მოდელის დასაზუსტებლად openpi-დან pi0_base checkpoint-ის გამოყენებით, გაუშვით შესაბამისი ბრძანება. π0 ნერვული ქსელის დასაზუსტებლად PaliGemma-სთან და Expert Gemma-სთან ერთად, რომლებიც წინასწარ იყო გაწვრთნილი VLM-ის ნაგულისხმევი პარამეტრებით π0-ის დაზუსტებამდე, შეასრულეთ შესაბამისი მოქმედება. ასევე შეგიძლიათ გამოიყენოთ წინასწარ გაწვრთნილი π0 მოდელი დამოუკიდებლად LeRobot-ის სასწავლო ფრეიმვორკისგან, შესაბამისი კოდის გამოყენებით.
ხედვა-ენობრივ (VLM) და ხედვა-ენა-მოქმედების (VLA) მოდელებს საერთო საფუძველი აქვთ: ტრანსფორმერები. თუმცა, მთავარი განსხვავება მოქმედების წარმოდგენაში მდგომარეობს. სანამ VLM-ები ამუშავებენ და წარმოქმნიან მულტიმოდალურ წარმოდგენებს (სურათები და ტექსტი), VLA-ები ამას აფართოებენ მოქმედებისა და დაკვირვების მდგომარეობის ტოკენების ჩართვით. ამ დამატებითი ტოკენების არსებობის შემთხვევაში, შემდეგი გამოწვევაა იმის გაგება, თუ როგორ გამოითვლება ყურადღება (attention). გავაფართოვოთ ჩვენი ლექსიკა და შემოვიტანოთ ძირითადი ტერმინები: ეს ტოკენები მოიცავს: ისინი ემატება პრეფიქსის ნაწილის (სურათები + ტექსტი) შემდეგ, ასე რომ პრეფიქსი კონტექსტის როლს ასრულებს (მაგალითად, სცენის სურათი, ენობრივი ინსტრუქციები, როგორიცაა „იყავი კარგი რობოტი“ ან „გადაიტანე კუბი“), ხოლო სუფიქსი აღბეჭდავს პოლიტიკის სპეციფიკურ მახასიათებლებს. თუმცა, π0-ში ყურადღების (attention) ეფექტურად მართვა საკუთარ გამოწვევებს შეიცავს. მისი ყურადღების ნიღბის უნიკალური ფორმა გავლენას ახდენს იმაზე, თუ როგორ გამოითვლება ყურადღება – მოდით ჩავუღრმავდეთ დეტალებს! შედეგად მიღებული 2D კაუზალური ნიღაბი აჩვენებს ძლიერ ბლოკურ სიმწირეს, მაგრამ თითოეული ბლოკის საზღვრების განსაზღვრა – განსაკუთრებით ნიმუშების პარტიაში – საკმაოდ რთულია. ჩვენ მიჩვეული ვართ კაუზალურ ნიღბებს სამკუთხა სტრუქტურებით ავტორეგრესიული მოდელირებისთვის, მაგრამ ეს არ არის ერთ-ერთი ასეთი შემთხვევა. როგორც ხედავთ მაგალითში: გამოსახულებას (პირველ ელემენტს) აქვს გარკვეული შევსება (padding).
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#რობოტიკა
#huggingface
#lerobot
#წინასწარი წვრთნა
#vla მოდელები
#π0
#physical intelligence
#π0-fast
#გენერალისტი რობოტი
#ხედვა-ენა-მოქმედება
#ნაკადის შესაბამისობა
#რობოტის ფუნდამენტური მოდელები
წყარო: huggingface.co
AI-ით გადამუშავებული