ობიექტის ამოცნობის ლიდერბორდი: მეტრული მაჩვენებლების გაგება და კრიტიკული შეფასება
Hugging Face Hub-მა გამოაქვეყნა ობიექტის ამოცნობის ლიდერბორდი, რომელიც აფასებს მოდელებს სხვადასხვა მეტრიკის საფუძველზე, როგორიცაა „კვეთა გაერთიანებაზე“ (IoU), „საშუალო სიზუსტე“ (AP) და „საშუალო გახსენება“ (AR). ეს ბლოგი დეტალურად განიხილავს მოდელების შეფასების მეთოდებს, განმარტავს გამოყენებულ მეტრიკას და მიზნად ისახავს შეფასებისას წარმოშობილი სირთულეების გამარტივებას, რათა მომხმარებლებს შეეძლოთ მოდელის მუშაობის კრიტიკულად შეფასება. ასევე ახსნილია ობიექტის ამოცნობის კონცეფცია, მისი აპლიკაციები და
ცოტა ხნის წინ გამოვაქვეყნეთ ჩვენი ობიექტის ამოცნობის ლიდერბორდი, რომელშიც მოცემული მეტრული მაჩვენებლების მიხედვით დალაგებულია Hub-ში არსებული ობიექტის ამოცნობის მოდელები. ამ ბლოგში ვაჩვენებთ, თუ როგორ შეფასდა მოდელები და განვმარტავთ ობიექტის ამოცნობაში გამოყენებულ პოპულარულ მეტრიკას, დაწყებული „კვეთა გაერთიანებაზე“ (IoU) და დამთავრებული „საშუალო სიზუსტით“ (AP) და „საშუალო გახსენებით“ (AR). რაც მთავარია, ყურადღებას გავამახვილებთ შეფასების დროს წარმოშობილ შინაგან განსხვავებებსა და ხარვეზებზე, რათა თქვენ აღიჭურვოთ ცოდნით არა მხოლოდ მოდელის მუშაობის გასაგებად, არამედ მისი კრიტიკულად შესაფასებლად. ყველა დეველოპერი და მკვლევარი ისწრაფვის მოდელისკენ, რომელსაც შეუძლია ობიექტების ზუსტად ამოცნობა და გამოკვეთა. ჩვენი ობიექტის ამოცნობის ლიდერბორდი სწორედ ის ადგილია, სადაც შეგიძლიათ იპოვოთ ღია კოდის მოდელი, რომელიც საუკეთესოდ შეესაბამება თქვენს აპლიკაციის საჭიროებებს. მაგრამ რას ნიშნავს „ზუსტი“ ამ კონტექსტში? რომელ მეტრიკას უნდა ვენდოთ? როგორ გამოითვლება ისინი? და, შესაძლოა, უფრო მნიშვნელოვანია, რატომ შეიძლება ზოგიერთმა მოდელმა განსხვავებული შედეგები აჩვენოს სხვადასხვა ანგარიშში? ამ ყველა კითხვას გაეცემა პასუხი ამ ბლოგში. მაშ ასე, მოდით, ერთად დავიწყოთ ეს კვლევა და ამოვხსნათ ობიექტის ამოცნობის ლიდერბორდის საიდუმლოებები! თუ გირჩევნიათ გამოტოვოთ შესავალი და გაიგოთ, თუ როგორ გამოითვლება ობიექტის ამოცნობის მეტრიკა, გადადით „მეტრიკის“ განყოფილებაში. თუ გსურთ გაიგოთ, თუ როგორ უნდა აირჩიოთ საუკეთესო მოდელები ობიექტის ამოცნობის ლიდერბორდის საფუძველზე, შეგიძლიათ ნახოთ „ობიექტის ამოცნობის ლიდერბორდის“ განყოფილება.
კომპიუტერული ხედვის სფეროში, ობიექტის ამოცნობა გულისხმობს გამოსახულებაში ინდივიდუალური ობიექტების იდენტიფიცირებისა და ლოკალიზაციის ამოცანას. გამოსახულების კლასიფიკაციისგან განსხვავებით, სადაც ამოცანაა გამოსახულებაში უპირატესი ობიექტის ან სცენის დადგენა, ობიექტის ამოცნობა არა მხოლოდ ახდენს არსებული ობიექტის კლასების კატეგორიზაციას, არამედ იძლევა სივრცულ ინფორმაციასაც, შემოხაზავს რა შემოსაზღვრელ ყუთებს თითოეული აღმოჩენილი ობიექტის გარშემო. ობიექტის დეტექტორს ასევე შეუძლია თითოეული აღმოჩენისთვის გამოიტანოს „ქულა“ (ან „დარწმუნების ქულა“). ის წარმოადგენს ალბათობას, მოდელის მიხედვით, რომ აღმოჩენილი ობიექტი მიეკუთვნება პროგნოზირებულ კლასს თითოეული შემოსაზღვრელი ყუთისთვის. მაგალითად, ქვემოთ მოცემული სურათი აჩვენებს ხუთ აღმოჩენას: ერთი „ბურთი“ 98%-იანი დარწმუნების ქულით და ოთხი „ადამიანი“ 98%, 95%, 97% და 97%-იანი დარწმუნების ქულით. ობიექტის ამოცნობის მოდელები მრავალმხრივია და გამოყენების ფართო სპექტრი აქვთ სხვადასხვა სფეროში. ზოგიერთი გამოყენების შემთხვევა მოიცავს ავტონომიურ მანქანებში ხედვას, სახის ამოცნობას, მეთვალყურეობასა და უსაფრთხოებას, სამედიცინო გამოსახულებას, გაფართოებულ რეალობას, სპორტის ანალიზს, ჭკვიან ქალაქებს, ჟესტების ამოცნობას და ა.შ. Hugging Face Hub-ს აქვს ასობით ობიექტის ამოცნობის მოდელი, რომლებიც გაწვრთნილია სხვადასხვა მონაცემთა ნაკრებზე და შეუძლიათ სხვადასხვა ობიექტის კლასების იდენტიფიცირება და ლოკალიზაცია.
ობიექტის ამოცნობის მოდელების ერთი კონკრეტული ტიპი, რომელსაც „ნულოვანი გასროლის“ (zero-shot) მოდელი ეწოდება, შეუძლია მიიღოს დამატებითი ტექსტური მოთხოვნები ტექსტში აღწერილი სამიზნე ობიექტების მოსაძებნად. ამ მოდელებს შეუძლიათ ამოიცნონ ობიექტები, რომლებიც მათ არ უნახავთ სწავლების დროს, ნაცვლად იმისა, რომ შემოფარგლული იყვნენ სწავლების დროს გამოყენებული კლასების ნაკრებით. დეტექტორების მრავალფეროვნება სცილდება მათ მიერ ამოცნობილი გამომავალი კლასების დიაპაზონს. ისინი განსხვავდებიან ძირითადი არქიტექტურების, მოდელის ზომების, დამუშავების სიჩქარისა და პროგნოზირების სიზუსტის მიხედვით. ობიექტის ამოცნობის მოდელის მიერ გაკეთებული პროგნოზების სიზუსტის შესაფასებლად გამოყენებული პოპულარული მეტრიკაა „საშუალო სიზუსტე“ (AP) და მისი ვარიანტები, რომლებიც მოგვიანებით იქნება ახსნილი ამ ბლოგში. ობიექტის ამოცნობის მოდელის შეფასება მოიცავს რამდენიმე კომპონენტს, როგორიცაა მონაცემთა ნაკრები რეალური მონაცემების ანოტაციებით, აღმოჩენები (გამომავალი პროგნოზი) და მეტრიკა. ეს პროცესი ნაჩვენებია ნახაზზე 2 მოცემულ სქემაში: ჯერ ირჩევა სერტიფიცირების მონაცემთა ნაკრები, რომელიც შეიცავს გამოსახულებებს რეალური შემოსაზღვრელი ყუთების ანოტაციებით და შეჰყავთ ობიექტის ამოცნობის მოდელში. მოდელი პროგნოზირებს შემოსაზღვრელ ყუთებს თითოეული გამოსახულებისთვის, მიანიჭებს რა შესაბამის კლასის ეტიკეტებს და დარწმუნების ქულებს თითოეულ ყუთს. შეფასების ფაზაში, ეს პროგნოზირებული შემოსაზღვრელი ყუთები შედარებულია მონაცემთა ნაკრების რეალურ ყუთებთან. შეფასება იძლევა მეტრიკების ერთობლიობას, რომელთაგან თითოეული მერყეობს [0, 1] დიაპაზონში, რაც ასახავს კონკრეტულ შეფასების კრიტერიუმს. შემდეგ ნაწილში დეტალურად განვიხილავთ მეტრიკების გამოთვლას.
ეს განყოფილება დეტალურად შეეხება საშუალო სიზუსტისა და საშუალო გახსენების (AP და AR) განმარტებას, მათ ვარიაციებს და მათთან დაკავშირებულ გამოთვლის მეთოდოლოგიებს. საშუალო სიზუსტე (AP) არის ერთი რიცხვი, რომელიც აჯამებს სიზუსტე x გახსენების მრუდს. სანამ ავხსნით, თუ როგორ გამოვთვალოთ ის, ჯერ უნდა გავიგოთ „კვეთა გაერთიანებაზე“ (IoU) კონცეფცია და როგორ დავახარისხოთ აღმოჩენა როგორც „ჭეშმარიტი დადებითი“ ან „ცრუ დადებითი“. IoU არის მეტრიკა, რომელიც წარმოდგენილია 0-დან 1-მდე რიცხვით და ზომავს გადაფარვას პროგნოზირებულ შემოსაზღვრელ ყუთსა და რეალურ (რეალური მონაცემების) შემოსაზღვრელ ყუთს შორის. ის გამოითვლება იმ არეალის გაყოფით, სადაც ორი ყუთი გადაფარავს ერთმანეთს, ორივე ყუთის მიერ ერთად დაფარულ არეალზე. ნახაზი 3 ვიზუალურად აჩვენებს IoU-ს პროგნოზირებული ყუთისა და მისი შესაბამისი რეალური მონაცემების ყუთის მაგალითის გამოყენებით. თუ რეალური მონაცემები და აღმოჩენილი ყუთები იზიარებენ იდენტურ კოორდინატებს, რაც წარმოადგენს ერთსა და იმავე რეგიონს
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#კომპიუტერული ხედვა
#მოდელის შეფასება
#ლიდერბორდი
#hugging face hub
#მეტრიკა
#ობიექტის ამოცნობა
#iou
#ap
#ar
წყარო: huggingface.co
AI-ით გადამუშავებული