ფიზიკური ინტელექტის ინოვაცია: რობოტების გენერალისტი კონტროლის მოდელები π0 და π0-FAST
Physical Intelligence-მა წარმოადგინა π0 და π0-FAST, პროტოტიპული მოდელები და სასწავლო ფრეიმვორკები, რომლებიც შექმნილია რობოტების გენერალისტური კონტროლისთვის. ისინი მიზნად ისახავს ხიდის გადებას ხელოვნური ინტელექტის სისტემებსა და ფიზიკურ სამყაროს შორის არსებულ ხარვეზებს შორის, LLM-ებისა და VLM-ებისგან განსხვავებით, რომელთაც ფიზიკურ სამყაროსთან ურთიერთქმედება აკლიათ. π0, ხედვით-ენობრივ-მოქმედებითი (VLA) მოდელი, გაწვრთნილია 7 რობოტული პლატფორმისა და 68 უნიკალური ამოცანის მონაცემებზე, რაც მას საშუალებ
ჩვენს საცავში გაეცანით მოდელების კოლექციას და PyTorch-ის ვერსიას:
Huggingface-ის Pi0 მოდელების კოლექცია | Huggingface-ის Pi0+FAST მოდელების კოლექცია | LeRobot-ის საცავი
რობერტ ჰაინლაინი მიიჩნევს, რომ ყოვლისმომცველი ადამიანი უნდა იყოს უნარიანი შეასრულოს მრავალფეროვანი ამოცანები — როგორც ინტელექტუალური, ისე ფიზიკური — ნაცვლად იმისა, რომ ვიწროდ იყოს სპეციალიზებული ერთ სფეროში. თუ პარალელს გავავლებთ ყოვლისმომცველ ადამიანსა და მანქანურ ინტელექტს შორის: AI სისტემები მნიშვნელოვნად განსხვავდება, მაგრამ ადამიანის ინტელექტი გამოირჩევა მრავალმხრივობით — ამოცანებთან, გარემოსთან და მოულოდნელობებთან ადაპტირებით. მიუხედავად იმისა, რომ დიდი ენობრივი და ხედვით-ენობრივი მოდელები (LLM, VLM) პერსპექტიულად გამოიყურება, მათ აკლიათ ფიზიკურ სამყაროსთან ურთიერთქმედება. ამ ხარვეზის შესავსებად, ჩვენ გვჭირდება რობოტულ მონაცემებზე გაწვრთნილი მოდელები. გენერალისტი რობოტების მოდელებს შეუძლიათ გააუმჯობესონ ადაპტირება, მრავალფეროვანი მონაცემების გამოყენებით განზოგადებისა და გამძლეობის გასაუმჯობესებლად. იზოლირებულ ამოცანებზე წვრთნის ნაცვლად, მრავალფეროვან რობოტულ მონაცემებზე წინასწარი წვრთნა — LLM-ების მსგავსად — ზრდის ეფექტურობას და შესრულებას.
გენერალისტი რობოტული პოლიტიკების, ანუ რობოტების ფუნდამენტური მოდელების შემუშავება სამ ძირითად გამოწვევას აყენებს:
1. ფართომასშტაბიანი კვლევის საჭიროება, რათა სრულად იქნას გამოყენებული წინასწარი წვრთნის სარგებელი.
2. მოდელის არქიტექტურების შემუშავება, რომლებსაც შეუძლიათ მონაცემთა მრავალფეროვანი წყაროების ინტეგრირება და რთული ფიზიკური ინტერაქციების აღქმა. ამ მხრივ საკვანძო გამოწვევაა სხვადასხვა ემბოდიმენტზე წვრთნა (cross-embodiment training), სადაც მოდელმა უნდა ისწავლოს სხვადასხვა ტიპის რობოტებისგან, განსხვავებული კონფიგურაციებით, კონტროლის სივრცეებით და მოქმედების წარმოდგენებით.
არსებული მიდგომები ამას უმკლავდება:
* ეფექტური წვრთნის მეთოდოლოგიის (training recipe) შექმნით, რადგან NLP-სა და ხედვის ბოლო მიღწევები დიდწილად ეფუძნებოდა წინასწარი წვრთნისა და შემდგომი წვრთნის (pre-training and post-training) ფრთხილ სტრატეგიებს.
ამ პოსტში წარმოგიდგენთ π0-ს და π0-FAST-ს, პროტოტიპულ მოდელებსა და სასწავლო ფრეიმვორკებს, რომლებიც შემუშავებულია Physical Intelligence-ის მიერ ამ გამოწვევების დასაძლევად. Paper | Jax Code
π0 (Pi-Zero) არის ხედვით-ენობრივ-მოქმედებითი (VLA) მოდელი, რომელიც შემუშავებულია Physical Intelligence-ის გუნდის მიერ გენერალისტი რობოტების კონტროლისთვის. ის ეფუძნება ფართომასშტაბიან წინასწარ წვრთნას და ნაკადის შეხამებაზე (flow matching) დაფუძნებულ მოქმედების გენერაციას, რაც რობოტებს საშუალებას აძლევს შეასრულონ მარჯვე მანიპულაციის ამოცანები სხვადასხვა ემბოდიმენტზე. π0 გაწვრთნილია 7 რობოტული პლატფორმისა და 68 უნიკალური ამოცანის მონაცემებზე, რაც აჩვენებს ძლიერ ნულოვანი-გასროლის (zero-shot) და დაზუსტებული წვრთნის (fine-tuned) შესრულებას რეალურ, კომპლექსურ ამოცანებზე, როგორიცაა სარეცხის დაკეცვა, მაგიდის გაწმენდა, სასურსათო პროდუქტების შეფუთვა, ყუთების აწყობა და ობიექტების ამოღება. სტანდარტული რობოტული პოლიტიკებისგან განსხვავებით, π0 იყენებს ნაკადის შეხამებას გლუვი, რეალურ დროში მოქმედების ტრაექტორიების 50 ჰერცის სიხშირით წარმოსაქმნელად, რაც მას უაღრესად ეფექტურს, ზუსტს და ადაპტირებადს ხდის რეალურ სამყაროში განთავსებისთვის. ნაკადის შეხამება გამოიყენებოდა უწყვეტ ნორმალიზებად ნაკადებში და გააუმჯობესა გენერაციის ხარისხი დიფუზიურ მოდელებში. ხმაურის შემცირების პროცესი, რომელსაც π0 იყენებს, მუშაობს ანალოგიურად, დაწყებული შემთხვევითი ხმაურით, რომელიც თანდათანობით უახლოვდება მოტორული მოქმედებების თანმიმდევრობას, რომელსაც აზრი აქვს.
პირველ რიგში, თქვენ უნდა განაახლოთ თქვენი lerobot-ის ინსტალაცია, რომელიც ახლა იყენებს transformers-ს, როგორც დამოკიდებულებას! უბრალოდ გააკეთეთ git clone-ის შემდეგ.
π0 მოდელები ფუნდამენტური მოდელებია, რომლებიც, ისევე როგორც PaliGemma, შექმნილია მრავალფეროვან ფრეიმვორკებთან, გარემოებებთან და სცენის შეყვანებთან ადაპტირებისთვის. აქ მოცემული საბაზისო მოდელები გამოსადეგია ისე, როგორც არის, კერძოდ π0. თუმცა, შესრულება შემცირებულია, რადგან ეს არის გარდაქმნა jax-დან torch-ზე და კონკრეტული გარემოდან. ჩვენ გირჩევთ, დააზუსტოთ (fine-tune) თქვენი საკუთარი π0 თქვენს გარემოზე, როგორც ქვემოთაა მოცემული. π0 მოდელის დასაზუსტებლად openpi-დან pi0_base checkpoint-ის გამოყენებით, გაუშვით შემდეგი ბრძანება:
```bash
# Example command for fine-tuning
```
π0 ნერვული ქსელის დასაზუსტებლად PaliGemma-სა და Expert Gemma-ს გამოყენებით, რომლებიც წინასწარ იყო გაწვრთნილი VLM-ის ნაგულისხმევი პარამეტრებით π0-ის დაზუსტებამდე, შეასრულეთ:
```bash
# Example command for fine-tuning with PaliGemma and Expert Gemma
```
თქვენ ასევე შეგიძლიათ გამოიყენოთ წინასწარ გაწვრთნილი π0 მოდელი LeRobot-ის სასწავლო ფრეიმვორკისგან დამოუკიდებლად შემდეგი კოდით:
```python
# Example Python code for independent usage
```
ხედვით-ენობრივ მოდელებს (VLM) და ხედვით-ენობრივ-მოქმედებით მოდელებს (VLA) აქვთ საერთო საფუძველი: ტრანსფორმერები. თუმცა, ძირითადი განსხვავება მოქმედების წარმოდგენაშია. მაშინ როცა VLM-ები ამუშავებენ და წარმოქმნიან მულტიმოდალურ წარმოდგენებს (სურათები და ტექსტი), VLA-ები ამას აფართოებენ მოქმედებისა და დაკვირვების მდგომარეობის ტოკენების ჩართვით. ამ დამატებითი ტოკენების არსებობის შემთხვევაში, შემდეგი გამოწვევაა იმის გაგება, თუ როგორ გამოითვლება ყურადღება. მოდით გავაფართოვოთ ჩვენი ლექსიკა და შემოვიტანოთ ძირითადი ტერმინები: ეს ტოკენები აერთიანებს:
ისინი დაერთვის პრეფიქსის ნაწილს (სურათები + ტექსტი) შემდეგ, ასე რომ პრეფიქსი კონტექსტად გვევლინება (მაგ., სცენის სურათი, ენობრივი ინსტრუქციები, როგორიცაა „იყავი კარგი რობოტი“ ან „გადაიტანე კუბი“), ხოლო სუფიქსი აღწერს პოლიტიკასთან დაკავშირებულ მახასიათებლებს. თუმცა, π0-ში ყურადღების ეფექტურად მართვას თან ახლავს საკუთარი გამოწვევები. მისი ყურადღების ნიღბის უნიკალური ფორმა გავლენას ახდენს იმაზე, თუ როგორ გამოითვლება ყურადღება — მოდით, ჩავუღრმავდეთ დეტალებს! მიღებულ 2D კაუზალურ ნიღაბს აქვს ძლიერი ბლოკური სპარსულობა (block sparsity), მაგრამ თითოეული ბლოკის საზღვრების განსაზღვრა — განსაკუთრებით ნიმუშების პაკეტში — ცოტა რთულია. ჩვენ შეჩვეულები ვართ კაუზალურ ნიღბებს სამკუთხა სტრუქტურებით ავტორეგრესიული მოდელირებისთვის, მაგრამ ეს არ არის ერთ-ერთი ასეთი შემთხვევა. როგორც ხედავთ ქვემოთ მოცემულ მაგალითში: სურათს (პირველი ელემენტი) აქვს გარკვეული დამატებითი სივრცე (padding).
თეგები:
#ai
#მანქანური სწავლება
#რობოტიკა
#pytorch
#vla მოდელები
#π0
#physical intelligence
#გენერალისტი რობოტები
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი