ხედვითი ენის მოდელები: შესაძლებლობები, შეფასება და სწავლება
ხედვითი ენის მოდელები (VLM) არის ხელოვნური ინტელექტის მოდელები, რომლებსაც შეუძლიათ ერთდროულად ისწავლონ გამოსახულებებიდან და ტექსტებიდან, რაც მათ საშუალებას აძლევს შეასრულონ მრავალი დავალება, როგორიცაა ვიზუალურ კითხვებზე პასუხის გაცემა და გამოსახულების აღწერა. ისინი გენერაციული მოდელებია, რომლებიც იღებენ გამოსახულებისა და ტექსტის შეტანას და წარმოქმნიან ტექსტურ გამოსავალს. ამ მოდელებს გააჩნიათ კარგი „ნულოვანი-კადრის“ (zero-shot) შესაძლებლობები და გამოიყენება გამოსახულებებზე საუბრისთვის, დოკუმენტებ
ხედვითი ენის მოდელები (VLM) არის მოდელები, რომლებსაც შეუძლიათ ერთდროულად ისწავლონ როგორც გამოსახულებებიდან, ასევე ტექსტებიდან, რათა შეასრულონ მრავალი დავალება, დაწყებული ვიზუალურ კითხვებზე პასუხის გაცემიდან გამოსახულების აღწერამდე. ამ პუბლიკაციაში ჩვენ განვიხილავთ ხედვითი ენის მოდელების ძირითად შემადგენელ ნაწილებს: მიმოვიხილავთ მათ მუშაობას, გავიგებთ, როგორ მოვძებნოთ სწორი მოდელი, როგორ გამოვიყენოთ ისინი ინფერენციისთვის და როგორ მარტივად დავარეგულიროთ (fine-tune) ისინი trl-ის დღეს გამოშვებული ახალი ვერსიით!
ხედვითი ენის მოდელები ფართოდ არის განსაზღვრული, როგორც მულტიმოდალური მოდელები, რომლებსაც შეუძლიათ ისწავლონ გამოსახულებებიდან და ტექსტიდან. ეს არის გენერაციული მოდელების ტიპი, რომელიც იღებს გამოსახულებისა და ტექსტის შეტანას და წარმოქმნის ტექსტურ გამოსავალს. დიდ ხედვითი ენის მოდელებს აქვთ კარგი "ნულოვანი-კადრის" (zero-shot) შესაძლებლობები, კარგად აზოგადებენ ინფორმაციას და შეუძლიათ იმუშაონ მრავალი ტიპის გამოსახულებასთან, მათ შორის დოკუმენტებთან, ვებგვერდებთან და სხვა. გამოყენების შემთხვევები მოიცავს გამოსახულებებზე საუბარს, გამოსახულების ამოცნობას ინსტრუქციების საშუალებით, ვიზუალურ კითხვებზე პასუხის გაცემას, დოკუმენტების გაგებას, გამოსახულების აღწერას და სხვა. ზოგიერთ ხედვითი ენის მოდელს შეუძლია ასევე აღბეჭდოს გამოსახულების სივრცითი თვისებები. ამ მოდელებს შეუძლიათ გამოიტანონ შემომფარგლავი ყუთები (bounding boxes) ან სეგმენტაციის ნიღბები (segmentation masks), როდესაც მოეთხოვებათ კონკრეტული ობიექტის აღმოჩენა ან სეგმენტაცია, ან მათ შეუძლიათ მოახდინონ სხვადასხვა ერთეულების ლოკალიზება ან უპასუხონ კითხვებს მათი ფარდობითი ან აბსოლუტური პოზიციების შესახებ. არსებობს დიდი მრავალფეროვნება არსებულ დიდ ხედვითი ენის მოდელებში, მონაცემებში, რომლებზეც ისინი იქნა გაწვრთნილი, იმაში, თუ როგორ ახდენენ გამოსახულებების კოდირებას, და შესაბამისად, მათ შესაძლებლობებში.
Hugging Face Hub-ზე მრავალი ღია ხედვითი ენის მოდელია ხელმისაწვდომი. არსებობს მრავალი გზა თქვენი გამოყენების შემთხვევისთვის ყველაზე შესაფერისი მოდელის შესარჩევად. Vision Arena არის რეიტინგული ცხრილი, რომელიც ეფუძნება მხოლოდ მოდელის გამოსავალების ანონიმურ კენჭისყრას და მუდმივად ახლდება. ამ არენაზე მომხმარებლები შეაქვთ გამოსახულება და მოთხოვნა (prompt), და ანონიმურად ირჩევა ორი განსხვავებული მოდელის გამოსავალი, შემდეგ კი მომხმარებელს შეუძლია აირჩიოს სასურველი გამოსავალი. ამგვარად, რეიტინგული ცხრილი აგებულია მხოლოდ ადამიანის პრეფერენციების საფუძველზე.
Open VLM Leaderboard არის კიდევ ერთი რეიტინგული ცხრილი, სადაც სხვადასხვა ხედვითი ენის მოდელები რანჟირებულია მოცემული მეტრიკებისა და საშუალო ქულების მიხედვით. თქვენ ასევე შეგიძლიათ გაფილტროთ მოდელები მოდელის ზომის, საკუთრების ან ღია კოდის ლიცენზიების მიხედვით და დაარანჟიროთ სხვადასხვა მეტრიკისთვის.
VLMEvalKit არის ინსტრუმენტთა ნაკრები, რომელიც გამოიყენება ხედვითი ენის მოდელებზე ბენჩმარკების გასატარებლად და უზრუნველყოფს Open VLM Leaderboard-ის მუშაობას. კიდევ ერთი შეფასების პაკეტია LMMS-Eval, რომელიც გთავაზობთ სტანდარტულ ბრძანების ხაზის ინტერფეისს (command line interface) Hugging Face-ის თქვენთვის სასურველი მოდელების შესაფასებლად Hugging Face Hub-ზე განთავსებული მონაცემთა ნაკრებებით. როგორც Vision Arena, ასევე Open VLM Leaderboard შეზღუდულია იმ მოდელებით, რომლებიც მათშია წარდგენილი, და საჭიროებს განახლებებს ახალი მოდელების დასამატებლად. თუ გსურთ იპოვოთ დამატებითი მოდელები, შეგიძლიათ დაათვალიეროთ Hub-ი "image-text-to-text" დავალების ქვეშ არსებული მოდელებისთვის.
არსებობს სხვადასხვა ბენჩმარკები ხედვითი ენის მოდელების შესაფასებლად, რომლებსაც შეიძლება შეხვდეთ რეიტინგულ ცხრილებში. ჩვენ განვიხილავთ რამდენიმეს. ექსპერტული AGI-სთვის მასიური მულტიდისციპლინარული მულტიმოდალური გაგების და მსჯელობის ბენჩმარკი (MMMU) არის ყველაზე ყოვლისმომცველი ბენჩმარკი ხედვითი ენის მოდელების შესაფასებლად. ის შეიცავს 11.5K მულტიმოდალურ გამოწვევას, რომელიც მოითხოვს კოლეჯის დონის საგნობრივ ცოდნას და მსჯელობას სხვადასხვა დისციპლინებში, როგორიცაა ხელოვნება და ინჟინერია. MMBench არის შეფასების ბენჩმარკი, რომელიც შედგება 3000 ერთარჩევითი კითხვისგან 20 სხვადასხვა უნარზე, მათ შორის OCR, ობიექტის ლოკალიზაცია და სხვა. ნაშრომი ასევე წარმოადგენს შეფასების სტრატეგიას სახელწოდებით CircularEval, სადაც კითხვის პასუხის ვარიანტები სხვადასხვა კომბინაციით არის არეული, და მოდელს ყოველ ჯერზე სწორი პასუხის გაცემა მოეთხოვება.
არსებობს სხვა უფრო სპეციფიკური ბენჩმარკები სხვადასხვა დომენში, მათ შორის MathVista (ვიზუალური მათემატიკური მსჯელობა), AI2D (დიაგრამების გაგება), ScienceQA (მეცნიერული კითხვებზე პასუხის გაცემა) და OCRBench (დოკუმენტების გაგება). ხედვითი ენის მოდელის წინასწარი ვარჯიშისთვის (pretrain) მრავალი გზა არსებობს. მთავარი ხრიკი არის გამოსახულებისა და ტექსტის წარმოდგენის გაერთიანება და მისი ტექსტურ დეკოდერისთვის მიწოდება გენერაციისთვის. ყველაზე გავრცელებული და გამორჩეული მოდელები ხშირად შედგება გამოსახულების ენკოდერისგან, ჩანერგვის პროექტორისგან (embedding projector) გამოსახულებისა და ტექსტის წარმოდგენების გასასწორებლად (ხშირად მკვრივი ნეირონული ქსელი) და ტექსტური დეკოდერისგან, რომლებიც ამ თანმიმდევრობით არიან განლაგებული. რაც შეეხება ვარჯიშის ნაწილებს, სხვადასხვა მოდელები სხვადასხვა მიდგომებს იყენებენ. მაგალითად, LLaVA შედგება CLIP გამოსახულების ენკოდერისგან, მულტიმოდალური პროექტორისგან და Vicuna ტექსტური დეკოდერისგან. ავტორებმა GPT-4-ს მიაწოდეს გამოსახულებებისა და აღწერილობების მონაცემთა ნაკრები და შექმნეს კითხვები, რომლებიც დაკავშირებული იყო აღწერილობასთან და გამოსახულებასთან. ავტორებმა გაყინეს (frozen) გამოსახულების ენკოდერი და ტექსტური დეკოდერი და ავარჯიშეს მხოლოდ მულტიმოდალური პროექტორი, რათა გაესწორებინათ გამოსახულებისა და ტექსტის მახასიათებლები მოდელისთვის გამოსახულებებისა და გენერირებული კითხვების მიწოდებით და მოდელის გამოსავლის შედარებით რეალურ (ground truth) აღწერილობებთან. პროექტორის წინასწარი ვარჯიშის შემდეგ, მათ გამოსახულების ენკოდერი დატოვეს გაყინული, გააუქმეს ტექსტური დეკოდერის გაყინვა და ავარჯიშეს პროექტორი დეკოდერთან ერთად.
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#ღრმა სწავლება
#vlm
#მულტიმოდალური ai
#hugging face
#მოდელების შეფასება
#ბენჩმარკინგი
#ხედვითი ენის მოდელები
#llava
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები და ხელოვნური ინტელექტი
Sophie AI Chatbot: ინოვაციური მიდგომა ხელოვნურ ინტელექტთან ურთიერთობაში
ტექნოლოგიები და ხელოვნური ინტელექტი
Cloudflare-ისა და FastRTC-ის პარტნიორობა: AI-ზე დაფუძნებული რეალურ დროში კომუნიკაციის გამარტივება
ტექნოლოგიები და ხელოვნური ინტელექტი