დღეს Google-მა გამოუშვა მრავალენოვანი ვიზუალურ-ლინგვისტური ენკოდერების ახალი და გაუმჯობესებული ოჯახი, SigLIP 2. ავტორებმა გააფართოვეს SigLIP-ის (სიგმოიდური დანაკარგი) სწავლების მიზანი დამატებითი ამოცანებით, სემანტიკური გაგების, ლოკალიზაციისა და მკვრივი მახასიათებლების გასაუმჯობესებლად. SigLIP 2-ის მოდელები ყველა მასშტაბით აღემატება ძველ SigLIP მოდელებს ძირითად შესაძლებლობებში, მათ შორის ნულოვანი კადრის კლასიფიკაციაში, გამოსახულება-ტექსტის მოძიებასა და ტრანსფერის შესრულებაში, როდესაც ვიზუალური წარმოდგენები გამოიყენება ვიზუალურ-ლინგვისტური მოდელებისთვის (VLMs). დამატებითი უპირატესობაა დინამიური რეზოლუციის (naflex) ვარიანტი, რომელიც სასარგებლოა შემდგომი ამოცანებისთვის, რომლებიც მგრძნობიარეა ასპექტის თანაფარდობისა და რეზოლუციის მიმართ. ვიზუალური ენკოდერები მარტივია – ისინი იღებენ გამოსახულებას, გარდაქმნიან მას წარმოდგენად, და ეს წარმოდგენა გამოიყენება შემდგომი ამოცანებისთვის, როგორიცაა კლასიფიკაცია, ობიექტის ამოცნობა, გამოსახულების სეგმენტაცია და სხვა ვიზუალური ამოცანები. მკვლევრები მუდმივად ეძებენ ვიზუალურ წარმოდგენებს, რომლებიც მკვრივი, ლოკალურობის მცოდნე და სემანტიკურად მდიდარია. CLIP და ALIGN არის გამოსახულების ენკოდერებისა და ტექსტის ენკოდერების პირველი მაგალითები, რომლებიც ერთობლივი სწავლების გზით იქნა შეწყვილებული. ამ მიდგომამ ახალი გზები გახსნა ვიზუალური მოდელების სწავლებისთვის. SigLIP-მა კიდევ უფრო წინ წაიწია, CLIP-ის კონტრასტული დანაკარგი სიგმოიდური დანაკარგით ჩაანაცვლა, რათა მიეღო კიდევ უფრო უკეთესი ენკოდერები. რა დასკვნა შეგვიძლია გამოვიტანოთ? უფრო ჭკვიანი სწავლების მიზნებით, ჩვენ ვაგრძელებთ ვიზუალური ენკოდერების შექმნას, რომლებიც უფრო სტრუქტურირებულია, დეტალიზებული და მძლავრია. SigLIP 2 სწორედ ასეთია – უამრავი მართლაც საინტერესო და ჭკვიანი სწავლების მიზანი, რომლებიც SigLIP-ის მოდელს დაემატა უკეთესი და ძლიერი ვიზუალურ-ლინგვისტური ენკოდერების შესაქმნელად. ამ სიახლის ავტორები გვთავაზობენ SigLIP 2-ის გაუმჯობესებების გაცნობის განსხვავებულ მიდგომას. ნაცვლად იმისა, რომ პირდაპირ გადმოსცენ სიახლეები, ისინი SigLIP-ის მოდელიდან იწყებენ და შეკითხვა-პასუხის ფორმატში ეტაპობრივად განიხილავენ SigLIP 2-ის ყველა განახლებას. მოგზაურობა იწყება ვიზუალური ენკოდერით, სადაც პაჩის ზომა 16-ია, ხოლო გამოსახულების რეზოლუცია – 256. სწავლებისთვის ხელმისაწვდომია ოთხი ვარიანტი: პირველი გაუმჯობესება SigLIP 2-ის სწავლების რეცეპტში დაკავშირებულია დამხმარე სწავლების მიზნებთან, რომლებიც ხელს უწყობს უკეთესი ვიზუალური წარმოდგენების შესწავლას (მდებარეობის ცნობიერების და ლოკალურობის გაგების თვალსაზრისით). ამ მიზნით, SigLIP-ის არსებულ გამოსახულების ენკოდერსა და ტექსტის ენკოდერს დაემატა ტექსტის დეკოდერი. დეკოდერი სამ ამოცანას ასრულებს და დამატებით სიგნალს აწვდის ვიზუალურ ენკოდერს, რითაც მას მდებარეობის ამომცნობად ხდის. ეს არის SigLIP 2-ის სწავლების რეცეპტის პირველი გაუმჯობესება. გამოსახულების წარმოდგენის დეტალიზებული ლოკალური სემანტიკის გასაუმჯობესებლად, SigLIP 2-ში დაინერგა სწავლების ორი ძირითადი მიზანი: გლობალურ-ლოკალური დანაკარგი (Global-Local Loss) და ნიღბიანი წინასწარმეტყველების დანაკარგი (Masked Prediction Loss). თვითკონტროლირებადი სწავლების ლიტერატურით შთაგონებით, გამოყენებულია თვითდისტილაციის მეთოდი, სადაც ერთი და იგივე მოდელი მასწავლებლისა და მოსწავლის როლს ასრულებს. ყოველ იტერაციაზე მასწავლებელი მოსწავლის პარამეტრების მოძრავი საშუალოა. ეს მიზნები ვიზუალურ ენკოდერს სივრცულად შეგნებულს ხდის და აუმჯობესებს მის ლოკალურ სემანტიკას. ავტორები ამ დანაკარგს მხოლოდ სწავლების 80%-ის შემდეგ ამატებენ, სიგმოიდური და დეკოდერის დანაკარგთან ერთად, რათა დაზოგონ გამოთვლითი რესურსები (დამატებითი დანაკარგები საკმაოდ ძვირია) და არ იქონიონ უარყოფითი გავლენა ენკოდერებზე. მოდელების სხვადასხვა რეზოლუციებთან ადაპტაციისთვის, SigLIP 2 გვთავაზობს ორ განსხვავებულ მეთოდოლოგიას. ცნობილია, რომ გამოსახულების მოდელები ძალზე მგრძნობიარეა ცვლადი რეზოლუციებისა და ასპექტის თანაფარდობების მიმართ. აქედან გამომდინარე, -naflex სუფიქსის მქონე მოდელები დინამიური რეზოლუციის ვარიანტებია. თუ ფიქსირებული რეზოლუციის მოდელების გამოყენება შესაძლებელია არსებული SiglipModel კლასით, naflex ვარიანტებისთვის საჭიროა Siglip2Model-ის გამოყენება. Pipeline API-ის გამოყენებისას ეს პროცესი ავტომატურად ხორციელდება. ეს არის SigLIP-დან SigLIP 2-მდე ევოლუციის ძირითადი ასპექტები. მოდელებზე ინფერენციის გაშვება საკმაოდ მარტივია. SigLIP 2-ზე ინფერენციის გასაშვებად საჭიროა transformers-ის ბიბლიოთეკის დაყენება, მაგალითად, ბრძანებით: `pip install git+https://github.com/huggingface/[email protected]`. pipeline API გამოიყენება SigLIP 2-ის ნულოვანი კადრის კლასიფიკაციის შესაძლებლობების დემონსტრირებისთვის. გამოქვეყნებული SigLIP 2 მოდელების ცხრილის დათვალიერებისას, SigLIP-თან შედარებით ორი მკაფიო ცვლილება შეინიშნება. SigLIP 2-ის შეფასების ცხრილი ნათლად აჩვენებს მის უპირატესობას SigLIP-ზე. ხელმისაწვდომია დემო ვერსიაც, სადაც შესაძლებელია SigLIP 1-ისა და SigLIP 2-ის ნულოვანი კადრის კლასიფიკაციის შედეგების შედარება. ვიზუალურ-ლინგვისტური მოდელების (VLM) აგების გავრცელებული მიდგომა...