Pollen-vision: ღია კოდის ბიბლიოთეკა, რომელიც რობოტებს უცნობი ობიექტების ავტონომიურ დაჭერაში ეხმარება
წარდგენილია Pollen-vision, ახალი ღია კოდის ბიბლიოთეკა, რომელიც რობოტებს გარემოს ვიზუალური აღქმის საფუძველზე გაგებაში და 3D ობიექტების დეტექციაში ეხმარება. მისი მთავარი მიზანია რობოტების ავტონომიური ფუნქციონირება უცნობი ობიექტების წინასწარი წვრთნის გარეშე დაჭერის მიზნით.
ავტონომიური ქცევების კონტექსტში, რობოტის გამოყენებადობის არსი მდგომარეობს მის უნარში, გაიგოს გარემო და იმოქმედოს მასთან. ეს გაგება უპირველეს ყოვლისა ვიზუალური აღქმიდან მოდის, რაც რობოტებს საშუალებას აძლევს ამოიცნონ ობიექტები, აღიარონ ადამიანები, ორიენტირება გააკეთონ სივრცეში და მრავალი სხვა. მოხარულნი ვართ გაცნობოთ ჩვენი ღია კოდის ბიბლიოთეკა pollen-vision-ის თავდაპირველი გაშვების შესახებ. ეს არის პირველი ნაბიჯი ჩვენი რობოტებისთვის უცნობი ობიექტების ავტონომიურად დაჭერის შესაძლებლობის მინიჭებისკენ.
ეს ბიბლიოთეკა წარმოადგენს ვიზუალური მოდელების საფუძვლიანად შერჩეულ კოლექციას, რომელიც რობოტიკაში პირდაპირი გამოყენებადობის გამო შეირჩა. Pollen-vision შექმნილია მარტივი ინსტალაციისა და გამოყენებისთვის, შედგება დამოუკიდებელი მოდულებისგან, რომლებიც შეიძლება გაერთიანდეს 3D ობიექტის დეტექციის კონვეიერის შესაქმნელად, რაც ობიექტების პოზიციას 3D სივრცეში (x, y, z) განსაზღვრავს. ჩვენ ფოკუსირებული ვიყავით zero-shot მოდელების შერჩევაზე, რითაც აღმოვფხვერით ნებისმიერი წვრთნის საჭიროება და ეს ხელსაწყოები დაუყოვნებლივ გამოსაყენებელი გახდა. ჩვენი თავდაპირველი გამოშვება ორიენტირებულია 3D ობიექტის დეტექციაზე – საფუძველს უყრის ისეთ ამოცანებს, როგორიცაა რობოტული დაჭერა, ობიექტების სივრცითი კოორდინატების საიმედო შეფასების უზრუნველყოფით. ამჟამად, ფუნქციონალი შემოიფარგლება 3D სივრცეში პოზიციონირებით (არ ვრცელდება სრულ 6D პოზის შეფასებაზე), თუმცა ის ქმნის მყარ საფუძველს რობოტული მანიპულაციის ძირითადი ამოცანებისთვის.
ბიბლიოთეკა მოიცავს რამდენიმე ძირითად მოდელს. ჩვენ გვსურს, რომ გამოყენებული მოდელები იყოს zero-shot და მრავალმხრივი, რაც საშუალებას მისცემს ამოიცნოს ობიექტების ფართო სპექტრი ხელახალი წვრთნის გარეშე. მოდელებს ასევე უნდა ჰქონდეთ „რეალურ დროში მუშაობის უნარი“, რაც ნიშნავს, რომ მათ უნდა იმუშაონ მინიმუმ რამდენიმე კადრი წამში სამომხმარებლო GPU-ზე. პირველი მოდელები, რომლებიც ავირჩიეთ, არის:
ქვემოთ მოცემულია მაგალითი, თუ როგორ გამოიყენება pollen-vision მარტივი ობიექტის დეტექციისა და სეგმენტაციის კონვეიერის შესაქმნელად, მხოლოდ გამოსახულებებისა და ტექსტის შეყვანით.
OWL-VIT-ის ინფერენციის დრო დამოკიდებულია მოწოდებული მოთხოვნების რაოდენობაზე (ანუ, ამოსაცნობი ობიექტების რაოდენობაზე). ლეპტოპზე RTX 3070 GPU-თი, შესაბამისად, საინტერესოა, შესრულების თვალსაზრისით, OWL-VIT-ისთვის მხოლოდ იმ ობიექტების მითითება, რომლებიც ვიცით, რომ გამოსახულებაზეა. სწორედ აქ არის ოპერატიული მეხსიერება (RAM) სასარგებლო, რადგან ის სწრაფია და ზუსტად ამ ინფორმაციას გვაწვდის. ობიექტის სეგმენტაციის ნიღბით, ჩვენ შეგვიძლია შევაფასოთ მისი (u, v) პოზიცია პიქსელურ სივრცეში ბინარული ნიღბის ცენტროიდის გამოთვლით. აქ სეგმენტაციის ნიღბის ქონა ძალიან სასარგებლოა, რადგან ის საშუალებას გვაძლევს სიღრმის მნიშვნელობების საშუალო გამოვითვალოთ ნიღბის შიგნით, ვიდრე სრული შემომფარგლავი ყუთის შიგნით, რომელიც ასევე შეიცავს ფონს, რაც საშუალოს დაამახინჯებდა. ამის ერთ-ერთი გზაა ნიღბის არანულოვანი პიქსელების u და v კოორდინატების საშუალოს გამოთვლა.
ახლა შეგვიძლია სიღრმის ინფორმაცია შევიტანოთ ობიექტის z კოორდინატის შესაფასებლად. სიღრმის მნიშვნელობები უკვე მეტრებშია, მაგრამ (u, v) კოორდინატები გამოხატულია პიქსელებში. ობიექტის ცენტროიდის (x, y, z) პოზიციის მეტრებში მიღება შეგვიძლია კამერის შიდა მატრიცის (K) გამოყენებით. ახლა ჩვენ გვაქვს ობიექტის 3D პოზიციის შეფასება კამერის საცნობარო სისტემაში. თუ ვიცით, სად არის კამერა განლაგებული რობოტის საწყის ჩარჩოსთან მიმართებაში, შეგვიძლია შევასრულოთ მარტივი ტრანსფორმაცია, რათა მივიღოთ ობიექტის 3D პოზიცია რობოტის ჩარჩოში. ეს ნიშნავს, რომ ჩვენ შეგვიძლია ჩვენი რობოტის ბოლო ეფექტორი გადავაადგილოთ იქ, სადაც ობიექტია, და დავიჭიროთ იგი! რაც ამ პოსტში წარმოვაჩინეთ, არის პირველი ნაბიჯი ჩვენი მიზნისკენ, რომელიც არის უცნობი ობიექტების ავტონომიური დაჭერა რეალურ გარემოში. ჯერ კიდევ არსებობს რამდენიმე საკითხი, რომელიც მოგვარებას საჭიროებს. გსურთ pollen-vision-ის გამოცდა? იხილეთ ჩვენი Github საცავი!
თეგები:
#ხელოვნური ინტელექტი
#რობოტიკა
#კომპიუტერული ხედვა
#ღია კოდი
#ავტონომიური სისტემები
#3d დეტექცია
#pollen-vision
წყარო: huggingface.co
AI-ით გადამუშავებული