შენიშვნები ან უკუკავშირი? MIT News-ის ოფისის ვებსაიტზე გადმოსაწერი სურათები ხელმისაწვდომია არაკომერციული ორგანიზაციებისთვის, პრესისთვის და ფართო საზოგადოებისთვის Creative Commons Attribution Non-Commercial No Derivatives ლიცენზიის ქვეშ. მოწოდებული სურათების შეცვლა დაუშვებელია, გარდა მათი ზომაზე მორგებისა. სურათების რეპროდუცირებისას უნდა იქნას გამოყენებული საავტორო მითითება; თუკი ის ქვემოთ არ არის მითითებული, სურათების წყაროდ მიუთითეთ „MIT“. კომპიუტერული დიზაინის (CAD) სისტემები გამოცდილი და დადასტურებული ინსტრუმენტებია, რომლებიც გამოიყენება მრავალი ფიზიკური ობიექტის შესაქმნელად, რომლებსაც ყოველდღიურად ვიყენებთ. თუმცა, CAD პროგრამული უზრუნველყოფის დაუფლება ვრცელ ექსპერტიზას მოითხოვს და მრავალი ინსტრუმენტი იმდენად დეტალურადაა გათვლილი, რომ არ გამოდგება იდეების გენერირებისთვის ან სწრაფი პროტოტიპირებისთვის. დიზაინის დაჩქარებისა და არასპეციალისტებისთვის ხელმისაწვდომობის გაზრდის მიზნით, MIT-ისა და სხვა დაწესებულებების მკვლევრებმა შეიმუშავეს ხელოვნური ინტელექტის მქონე რობოტული აწყობის სისტემა, რომელიც ადამიანებს საშუალებას აძლევს, შექმნან ფიზიკური ობიექტები უბრალოდ სიტყვებით მათი აღწერით. მათი სისტემა იყენებს გენერაციულ AI მოდელს ობიექტის გეომეტრიის 3D წარმოდგენის შესაქმნელად მომხმარებლის მოთხოვნის საფუძველზე. შემდეგ, მეორე გენერაციული AI მოდელი აანალიზებს სასურველ ობიექტს და განსაზღვრავს, სად უნდა განთავსდეს სხვადასხვა კომპონენტი, ობიექტის ფუნქციისა და გეომეტრიის შესაბამისად. სისტემას შეუძლია ავტომატურად ააწყოს ობიექტი წინასწარ დამზადებული ნაწილების ნაკრებიდან, რობოტული აწყობის გამოყენებით. მას ასევე შეუძლია დიზაინის გაუმჯობესება მომხმარებლის უკუკავშირის საფუძველზე. მკვლევრებმა გამოიყენეს ეს სრულყოფილი სისტემა ავეჯის, მათ შორის სკამებისა და თაროების დასამზადებლად, ორი ტიპის წინასწარ დამზადებული კომპონენტისგან. კომპონენტების დაშლა და ხელახლა აწყობა შესაძლებელია სურვილისამებრ, რაც ამცირებს წარმოების პროცესში წარმოქმნილი ნარჩენების რაოდენობას. მათ შეაფასეს ეს დიზაინები მომხმარებლის კვლევის მეშვეობით და დაადგინეს, რომ მონაწილეთა 90 პროცენტზე მეტმა უპირატესობა მიანიჭა მათი AI-სისტემის მიერ შექმნილ ობიექტებს, სხვა მიდგომებთან შედარებით. მიუხედავად იმისა, რომ ეს ნაშრომი საწყისი დემონსტრაციაა, ეს ჩარჩო განსაკუთრებით გამოსადეგი იქნება რთული ობიექტების, როგორიცაა საჰაერო-კოსმოსური კომპონენტები და არქიტექტურული ობიექტები, სწრაფი პროტოტიპირებისთვის. გრძელვადიან პერსპექტივაში, ის შეიძლება გამოყენებულ იქნას სახლებში ავეჯის ან სხვა ობიექტების ადგილობრივად დასამზადებლად, ცენტრალური საწყობიდან მოცულობითი პროდუქტების ტრანსპორტირების საჭიროების გარეშე. „ადრე თუ გვიან, ჩვენ გვსურს, რომ შევძლოთ რობოტთან და AI სისტემასთან კომუნიკაცია და საუბარი ისევე, როგორც ერთმანეთთან, რათა ერთად შევქმნათ რაღაცები. ჩვენი სისტემა პირველი ნაბიჯია ამ მომავლისკენ“, — ამბობს წამყვანი ავტორი ალექს ქიავ, MIT-ის ელექტროინჟინერიისა და კომპიუტერული მეცნიერების (EECS) და არქიტექტურის დეპარტამენტების მაგისტრი. ნაშროდზე ქიავსთან ერთად მუშაობდნენ რიჩა გუპტა, MIT-ის არქიტექტურის მაგისტრი; ფაეზ აჰმედი, მექანიკური ინჟინერიის ასოცირებული პროფესორი; ლორენს სასი, პროფესორი და არქიტექტურის დეპარტამენტის გამოთვლითი ჯგუფის ხელმძღვანელი; უფროსი ავტორი რენდალ დევისი, EECS-ის პროფესორი და კომპიუტერული მეცნიერებისა და ხელოვნური ინტელექტის ლაბორატორიის (CSAIL) წევრი; ასევე სხვები Google Deepmind-დან და Autodesk Research-დან. ნაშრომი ცოტა ხნის წინ წარმოდგენილი იყო ნერვული ინფორმაციის დამუშავების სისტემების კონფერენციაზე. მრავალკომპონენტიანი დიზაინის გენერირება. მიუხედავად იმისა, რომ გენერაციული AI მოდელები კარგად ქმნიან 3D წარმოდგენებს, ცნობილს როგორც „mesh“, ტექსტური მოთხოვნებიდან გამომდინარე, უმეტესობა არ აწარმოებს ობიექტის გეომეტრიის ერთგვაროვან წარმოდგენებს, რომლებსაც აქვთ რობოტული აწყობისთვის საჭირო კომპონენტების დონის დეტალები. ამ „mesh“-ების კომპონენტებად დაყოფა მოდელისთვის რთულია, რადგან კომპონენტების მინიჭება დამოკიდებულია ობიექტისა და მისი ნაწილების გეომეტრიასა და ფუნქციონალურობაზე. მკვლევრებმა ეს გამოწვევები გადალახეს ვიზუალური ენის მოდელის (VLM) გამოყენებით, მძლავრი გენერაციული AI მოდელის, რომელიც წინასწარ არის გაწვრთნილი სურათებისა და ტექსტის გასაგებად. მათ დაავალეს VLM-ს გაერკვია, თუ როგორ უნდა მოერგოს ერთმანეთს წინასწარ დამზადებული ნაწილების ორი ტიპი – სტრუქტურული კომპონენტები და პანელური კომპონენტები – ობიექტის შესაქმნელად. „არსებობს მრავალი გზა, თუ როგორ შეგვიძლია პანელების განთავსება ფიზიკურ ობიექტზე, მაგრამ რობოტს სჭირდება გეომეტრიის დანახვა და ამ გეომეტრიის გაანალიზება გადაწყვეტილების მისაღებად. VLM, რომელიც რობოტის როგორც თვალების, ასევე ტვინის ფუნქციას ასრულებს, საშუალებას აძლევს რობოტს ამის გაკეთება“, — ამბობს ქიავ. მომხმარებელი სისტემას ტექსტით მიმართავს, მაგალითად, წერს „გამიკეთე სკამი“ და საწყისად აწვდის AI-ს მიერ გენერირებულ სკამის გამოსახულებას. შემდეგ, VLM აანალიზებს სკამს და განსაზღვრავს, სად უნდა განთავსდეს პანელური კომპონენტები სტრუქტურულ კომპონენტებზე, მრავალი ნიმუშის ობიექტის ფუნქციონალურობის საფუძველზე, რომლებიც მას მანამდე უნახავს. მაგალითად, მოდელს შეუძლია განსაზღვროს, რომ სავარძელსა და საზურგეს უნდა ჰქონდეს პანელები, რათა ზედაპირები იყოს სკამზე მჯდომი და მიყრდნობილი ადამიანისთვის. ის ამ ინფორმაციას ტექსტის სახით გამოსცემს, მაგალითად, „სავარძელი“ ან „საზურგე“. სკამის თითოეულ ზედაპირს შემდეგ ენიჭება ნომრები და ინფორმაცია უკან მიეწოდება VLM-ს. შემდეგ VLM ირჩევს იმ ეტიკეტებს, რომლებიც შეესაბამება