CLIPSeg: რევოლუციური „ნულოვანი კადრის“ სეგმენტაცია, რომელიც ცვლის კომპიუტერულ ხედვას
გამოსახულების სეგმენტაცია კომპიუტერული ხედვის მნიშვნელოვანი ამოცანაა, რომელიც ობიექტების კონტურების ამოცნობას უზრუნველყოფს. ტრადიციული მოდელების შეზღუდვა ისაა, რომ ისინი მხოლოდ ფიქსირებულ კატეგორიებთან მუშაობენ და ახალი ობიექტების დასამატებლად ხელახალ ვარჯიშს საჭიროებენ. CLIPSeg, „ნულოვანი კადრის“ სეგმენტაციის ინოვაციური მოდელი, ამ პრობლემას წყვეტს. ის CLIP-ის მძლავრი შესაძლებლობების გამოყენებით საშუალებას იძლევა თითქმის ნებისმიერი ობიექტის სეგმენტაცია მოხდეს დამატებითი ვარჯიშის გარეშე, რაც დროს
გამოსახულების სეგმენტაცია კომპიუტერული ხედვის სფეროში კარგად ცნობილი ამოცანაა. ის კომპიუტერს საშუალებას აძლევს, არა მხოლოდ იცოდეს, რა არის გამოსახულებაზე (კლასიფიკაცია), სად მდებარეობს ობიექტები გამოსახულებაზე (დეტექცია), არამედ ასევე მათი კონტურები. ობიექტების კონტურების ცოდნა აუცილებელია ისეთ სფეროებში, როგორიცაა რობოტიკა და ავტონომიური მართვა. მაგალითად, რობოტმა უნდა იცოდეს ობიექტის ფორმა, რათა სწორად აიღოს იგი. სეგმენტაცია ასევე შეიძლება გაერთიანდეს გამოსახულების აღდგენასთან (inpainting), რათა მომხმარებლებს საშუალება მიეცეთ აღწერონ, გამოსახულების რომელი ნაწილის შეცვლა სურთ.
გამოსახულების სეგმენტაციის მოდელების უმეტესობის ერთ-ერთი შეზღუდვა ისაა, რომ ისინი მხოლოდ კატეგორიების ფიქსირებული სიით მუშაობენ. მაგალითად, ფორთოხლებზე გაწვრთნილი სეგმენტაციის მოდელის გამოყენება ვაშლის სეგმენტაციისთვის უბრალოდ შეუძლებელია. სეგმენტაციის მოდელისთვის დამატებითი კატეგორიის შესასწავლად, საჭიროა ახალი კატეგორიის მონაცემების მარკირება და ახალი მოდელის გაწვრთნა, რაც შეიძლება ძვირი და შრომატევადი იყოს. მაგრამ რა მოხდება, თუ არსებობს მოდელი, რომელსაც უკვე შეუძლია თითქმის ნებისმიერი სახის ობიექტის სეგმენტაცია, დამატებითი ვარჯიშის გარეშე?
სწორედ ამას აღწევს CLIPSeg – „ნულოვანი კადრის“ სეგმენტაციის მოდელი. ამჟამად CLIPSeg-ს ჯერ კიდევ აქვს თავისი შეზღუდვები. მაგალითად, მოდელი იყენებს 352 x 352 პიქსელის ზომის გამოსახულებებს, ამიტომ გამომავალი შედეგი საკმაოდ დაბალი გარჩევადობისაა. ეს ნიშნავს, რომ თანამედროვე კამერებიდან მიღებულ გამოსახულებებთან მუშაობისას პიქსელურად ზუსტ შედეგებს ვერ მოველით. თუ უფრო ზუსტი სეგმენტაცია გვსურს, შეგვიძლია უახლესი სეგმენტაციის მოდელის დახვეწა (fine-tuning), როგორც ეს ჩვენს წინა ბლოგ პოსტში იყო ნაჩვენები. ამ შემთხვევაში, ჩვენ მაინც შეგვიძლია გამოვიყენოთ CLIPSeg სავარაუდო მარკირებების შესაქმნელად, შემდეგ კი მათი დახვეწა ისეთ მარკირების ხელსაწყოში, როგორიცაა Segments.ai. სანამ აღვწერთ, როგორ გავაკეთოთ ეს, მოდით ჯერ ვნახოთ, როგორ მუშაობს CLIPSeg.
CLIP, რაც ნიშნავს კონტრასტულ ენასა და გამოსახულებაზე წინასწარ ვარჯიშს (Contrastive Language–Image Pre-training), არის მოდელი, რომელიც 2021 წელს OpenAI-მ შექმნა. CLIP-ს შეგიძლიათ მიაწოდოთ გამოსახულება ან ტექსტის ნაწილი, და CLIP გამოიტანს თქვენი შეყვანილი მონაცემების აბსტრაქტულ წარმოდგენას. ეს აბსტრაქტული წარმოდგენა, რომელსაც ასევე ემბედინგს უწოდებენ, სინამდვილეში უბრალოდ ვექტორია (რიცხვების სია). შეგიძლიათ ეს ვექტორი მაღალგანზომილებიან სივრცეში წერტილად წარმოიდგინოთ. CLIP გაწვრთნილია ისე, რომ მსგავსი სურათებისა და ტექსტების წარმოდგენებიც მსგავსი იყოს. ეს ნიშნავს, რომ თუ ჩვენ შევიყვანთ გამოსახულებას და მის შესაბამის ტექსტურ აღწერილობას, გამოსახულებისა და ტექსტის წარმოდგენები მსგავსი იქნება (ანუ, მაღალგანზომილებიანი წერტილები ერთმანეთთან ახლოს იქნება).
თავიდან ეს შეიძლება არც ისე სასარგებლოდ მოგვეჩვენოს, მაგრამ სინამდვილეში ის ძალიან მძლავრია. მაგალითად, მოდით, სწრაფად გადავხედოთ, როგორ შეიძლება CLIP-ის გამოყენება გამოსახულებების კლასიფიკაციისთვის ისე, რომ ის ამ ამოცანაზე არასოდეს ყოფილა გაწვრთნილი. გამოსახულების კლასიფიკაციისთვის, ჩვენ CLIP-ს ვაწვდით გამოსახულებას და სხვადასხვა კატეგორიებს, რომელთაგან არჩევა გვსურს (მაგალითად, ვაწვდით გამოსახულებას და სიტყვებს „ვაშლი“, „ფორთოხალი“, ...). შემდეგ CLIP გვიბრუნებს გამოსახულების და თითოეული კატეგორიის ემბედინგს. ახლა უბრალოდ უნდა შევამოწმოთ, რომელი კატეგორიის ემბედინგია ყველაზე ახლოს გამოსახულების ემბედინგთან, და ვოილა! ჯადოსნურია, არა?
უფრო მეტიც, CLIP არა მხოლოდ კლასიფიკაციისთვისაა სასარგებლო, არამედ მისი გამოყენება შესაძლებელია გამოსახულების ძიებისთვის (ხედავთ, როგორ ჰგავს ეს კლასიფიკაციას?), ტექსტიდან გამოსახულების გენერირების მოდელებისთვის (DALL-E 2 CLIP-ით მუშაობს), ობიექტების ამოცნობისთვის (OWL-ViT) და ჩვენთვის ყველაზე მნიშვნელოვანი: გამოსახულების სეგმენტაციისთვის. ახლა უკვე ხედავთ, რატომ იყო CLIP ნამდვილი გარღვევა მანქანურ სწავლებაში. CLIP-ის ასეთი კარგი მუშაობის მიზეზი ისაა, რომ მოდელი გაწვრთნილი იყო ტექსტური აღწერილობების მქონე გამოსახულებების უზარმაზარ მონაცემთა ნაკრებზე. მონაცემთა ნაკრები შეიცავდა 400 მილიონ გამოსახულება-ტექსტის წყვილს, რომლებიც ინტერნეტიდან იყო აღებული. ეს გამოსახულებები შეიცავს ობიექტებისა და კონცეფციების მრავალფეროვან დიაპაზონს, და CLIP შესანიშნავად ქმნის წარმოდგენას თითოეული მათგანისთვის.
CLIPSeg არის მოდელი, რომელიც CLIP-ის წარმოდგენებს იყენებს გამოსახულების სეგმენტაციის ნიღბების შესაქმნელად. ის ტიმო ლუდეკემ და ალექსანდრე ეკერმა გამოაქვეყნეს. მათ მიაღწიეს „ნულოვანი კადრის“ გამოსახულების სეგმენტაციას CLIP მოდელზე დაფუძნებული ტრანსფორმატორული დეკოდერის გაწვრთნით, რომელიც „გაყინულია“ (არ იცვლება ვარჯიშის დროს). დეკოდერი იღებს გამოსახულების CLIP წარმოდგენას და იმ ობიექტის CLIP წარმოდგენას, რომლის სეგმენტაციაც გსურთ. ამ ორი შეყვანის გამოყენებით, CLIPSeg დეკოდერი ქმნის ბინარული სეგმენტაციის ნიღაბს. უფრო ზუსტად რომ ვთქვათ, დეკოდერი იყენებს არა მხოლოდ სეგმენტირებული გამოსახულების საბოლოო CLIP წარმოდგენას, არამედ CLIP-ის ზოგიერთი ფენის გამომავალ შედეგებსაც.
დეკოდერი გაწვრთნილია PhraseCut მონაცემთა ნაკრებზე, რომელიც შეიცავს 340,000-ზე მეტ ფრაზას შესაბამისი გამოსახულების სეგმენტაციის ნიღბებით. ავტორებმა ასევე ექსპერიმენტები ჩაატარეს სხვადასხვა აუგმენტაციით, რათა გაეფართოებინათ მონაცემთა ნაკრების ზომა. მიზანი აქ არა მხოლოდ ისაა, რომ შესაძლებელი იყოს მონაცემთა ნაკრებში არსებული კატეგორიების სეგმენტაცია, არამედ ასევე უცნობი კატეგორიების სეგმენტაცია. ექსპერიმენტები ნამდვილად აჩვენებს, რომ დეკოდერს შეუძლია უცნობ კატეგორიებზე განზოგადება. CLIPSeg-ის ერთი საინტერესო მახასიათებელია ის, რომ როგორც მოთხოვნა (გამოსახულება, რომლის სეგმენტაციაც გვსურს), ასევე მითითება (ობიექტი, რომლის სეგმენტაციაც გამოსახულებაზე გვსურს) შეყვანილია CLIP ემბედინგების სახით. მითითებისთვის განკუთვნილი CLIP ემბედინგი შეიძლება მომდინარეობდეს ტექსტის ნაწილიდან (კატეგორიის სახელი), ან სხვა გამოსახულებიდან. ეს ნიშნავს, რომ თქვენ შეგიძლიათ სეგმენტირება...
თეგები:
#ხელოვნური ინტელექტი
#openai
#მანქანური სწავლება
#კომპიუტერული ხედვა
#გამოსახულების სეგმენტაცია
#clipseg
#clip
#zero-shot
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი