Google-მა PaliGemma 2 წარმოადგინა: ახალი მოდელები გაუმჯობესებული შესაძლებლობებით
Google-მა გამოუშვა PaliGemma 2, ვიზუალურ-ენობრივი მოდელის განახლებული ვერსია, რომელიც წარმოდგენილია 3B, 10B და 28B პარამეტრის ზომებში, სხვადასხვა შეყვანის რეზოლუციის მხარდაჭერით (224x224, 448x448, 896x896). ეს სიახლე მოდელს უფრო მოქნილს ხდის სხვადასხვა გამოყენების შემთხვევებისთვის, წინა 3B ვარიანტთან შედარებით. PaliGemma 2 აერთიანებს SigLIP გამოსახულების ენკოდერს Gemma 2 ენობრივ მოდელთან და შექმნილია მარტივი დაზუსტებისთვის, რაც მომხმარებლებს საშუალებას აძლევს, უკეთ მოარგონ ის კონკრეტულ ამოცანებს
PaliGemma 2 ახალი წინასწარ გაწვრთნილი (pt) მოდელებით გამოდის, რომელთა პარამეტრების რაოდენობაა 3B, 10B და 28B. ყველა მათგანი მხარს უჭერს სხვადასხვა შეყვანის რეზოლუციებს: 224x224, 448x448 და 896x896. ეს კომბინაციები დიდ მოქნილობას უზრუნველყოფს სხვადასხვა გამოყენების შემთხვევებისთვის, რაც პრაქტიკოსებს საშუალებას აძლევს, აირჩიონ მათთვის საჭირო ბალანსი ხარისხსა და ეფექტურობას შორის. ამის საპირისპიროდ, წინა PaliGemma ხელმისაწვდომი იყო მხოლოდ 3B ვარიანტში. წინასწარ გაწვრთნილი მოდელები შექმნილია შემდგომი ამოცანებისთვის მარტივი დაზუსტების (fine-tuning) მიზნით.
პირველი PaliGemma ფართოდ იქნა მიღებული საზოგადოების მიერ მრავალი მიზნისთვის. დამატებითი ვარიანტებით გაზრდილი მოქნილობისა და წინასწარი გაწვრთნის უკეთესი ხარისხის გათვალისწინებით, მოუთმენლად ველით, თუ რას შეძლებს საზოგადოება ამჯერად. მაგალითად, Google ასევე ავრცელებს რამდენიმე დაზუსტებულ ვარიანტს DOCCI მონაცემთა ნაკრებზე, რომელიც აჩვენებს მრავალმხრივ და მტკიცე წარწერების შექმნის შესაძლებლობებს, რომლებიც გრძელი, ნიუანსირებული და დეტალურია. DOCCI-ზე დაზუსტებული მოდელები ხელმისაწვდომია 3B და 10B ვარიანტებისთვის და მხარს უჭერს 448x448 შეყვანის რეზოლუციას.
ეს გამოცემა მოიცავს ყველა ღია მოდელის რეპოზიტორიას, Transformers-ის ინტეგრაციას, დაზუსტების სკრიპტებს და მოდელის დემოს, რომელიც ჩვენ თვითონ დავაზუსტეთ VQAv2 მონაცემთა ნაკრებზე ვიზუალური შეკითხვებზე პასუხის გასაცემად. ასევე ხელმისაწვდომია ტექნიკური ანგარიში, მოდელის შესაძლებლობების დემო და რესურსები Transformers-თან გამოსაყენებლად და მოდელის დასაზუსტებლად.
PaliGemma 2 არის Google-ის მიერ მაისში გამოშვებული PaliGemma ვიზუალურ-ენობრივი მოდელის ახალი იტერაცია. PaliGemma 2 აერთიანებს მძლავრ SigLIP გამოსახულების ენკოდერს Gemma 2 ენობრივ მოდელთან. ახალი მოდელები დაფუძნებულია Gemma 2 2B, 9B და 27B ენობრივ მოდელებზე, რის შედეგადაც მივიღეთ შესაბამისი 3B, 10B და 28B PaliGemma 2 ვარიანტები, რომელთა სახელები ითვალისწინებს (კომპაქტური) გამოსახულების ენკოდერის დამატებით პარამეტრებს. როგორც ზემოთ აღინიშნა, ისინი მხარს უჭერენ სამ სხვადასხვა რეზოლუციას, რაც დიდ მოქნილობას უზრუნველყოფს შემდგომი ამოცანების დაზუსტებისთვის.
PaliGemma 2 ვრცელდება Gemma ლიცენზიით, რომელიც იძლევა გადაცემის, კომერციული გამოყენების, დაზუსტებისა და მოდელის წარმოებულების შექმნის საშუალებას. ეს გამოცემა მოიცავს შემდეგ საკონტროლო წერტილებს bfloat16 სიზუსტით:
* **9 წინასწარ გაწვრთნილი მოდელი:** 3B, 10B და 28B 224x224, 448x448 და 896x896 რეზოლუციებით.
* **2 მოდელი დაზუსტებული DOCCI-ზე:** ორი მოდელი დაზუსტებულია DOCCI მონაცემთა ნაკრებზე (გამოსახულება-ტექსტის წარწერების წყვილი), რომელიც მხარს უჭერს 3B და 10B PaliGemma 2 ვარიანტებს და 448x448 შეყვანის რეზოლუციას.
როგორც წინა PaliGemma-ს გამოშვებაში ვნახეთ, წინასწარ გაწვრთნილი (pt) მოდელები შესანიშნავად მუშაობს შემდგომი ამოცანების დაზუსტებისთვის. pt მოდელები წინასწარ არის გაწვრთნილი შემდეგი მონაცემთა ნარევზე. წინასწარი გაწვრთნის მონაცემთა ნაკრების მრავალფეროვნება საშუალებას იძლევა, რომ მსგავს დომენებში შემდგომი ამოცანების დაზუსტება განხორციელდეს შედარებით ნაკლები მაგალითის გამოყენებით:
* **WebLI:** ვებ-მასშტაბის მულტილინგვური გამოსახულება-ტექსტის მონაცემთა ნაკრები, შექმნილი საჯარო ვებიდან. WebLI-ის ფართო სპექტრის დაყოფები გამოიყენება მოდელის მრავალმხრივი შესაძლებლობების მისაღებად, როგორიცაა ვიზუალური სემანტიკური გაგება, ობიექტის ლოკალიზაცია, ვიზუალურად სიტუაციური ტექსტის გაგება და მულტილინგვალურობა.
* **CC3M-35L:** ვებგვერდებიდან შეგროვებული ინგლისური გამოსახულება-alt_ტექსტის წყვილები (Sharma et al., 2018). ამ მონაცემთა ნაკრების დასალეიბლად, ავტორებმა გამოიყენეს Google Cloud Translation API 34 დამატებით ენაზე სათარგმნად.
* **ვიზუალური კითხვების გენერაცია კითხვებზე პასუხის ვალიდაციით (VQ2A):** გაუმჯობესებული მონაცემთა ნაკრები კითხვებზე პასუხის გასაცემად. მონაცემთა ნაკრები ნათარგმნია იმავე 34 დამატებით ენაზე Google Cloud Translation API-ის გამოყენებით.
* **OpenImages:** ობიექტის ამოცნობაზე ორიენტირებული კითხვები და პასუხები (Piergiovanni et al. 2022), გენერირებული ხელით შექმნილი წესებით OpenImages მონაცემთა ნაკრებზე.
* **WIT:** ვიკიპედიიდან შეგროვებული გამოსახულებები და ტექსტები (Srinivasan et al., 2021).
PaliGemma 2-ის გუნდმა შიდა რესურსებით დააზუსტა PT მოდელები ვიზუალურ-ენობრივი გაგების ამოცანების ფართო სპექტრზე და წარმოადგენს ამ დაზუსტებული მოდელების ბენჩმარკებს მოდელის ბარათსა და ტექნიკურ ანგარიშში. DOCCI მონაცემთა ნაკრებზე დაზუსტებულ PaliGemma 2-ს შეუძლია წარწერების შექმნის ამოცანების ფართო სპექტრის შესრულება, მათ შორის ტექსტის რენდერინგი, სივრცითი მიმართებების აღწერა და მსოფლიო ცოდნის ჩართვა წარწერებში.
ქვემოთ შეგიძლიათ იხილოთ DOCCI-ზე დაზუსტებული PaliGemma 2-ის საკონტროლო წერტილების შესრულება, სხვა მოდელებთან შედარებით (აღებულია ტექნიკური ანგარიშის ცხრილი 6-დან) და მოდელის რამდენიმე გამომავალი, რომელიც აჩვენებს მოდელის მრავალმხრივობას. დემონსტრაციის მიზნით, Hugging Face-ის გუნდმა დააზუსტა PaliGemma 2 3B 448x448 რეზოლუციით VQAv2 მონაცემთა ნაკრების მცირე ნაწილზე LoRA და PEFT დაზუსტების მეთოდების გამოყენებით.
PaliGemma 2 მოდელებზე დასკვნის გაშვება შესაძლებელია 🤗 Transformers-ის გამოყენებით, PaliGemmaForConditionalGeneration და AutoProcessor API-ების მეშვეობით. ამისათვის საჭიროა Transformers-ის ვერსია 4.47 ან უფრო ახალი.
თეგები:
#ხელოვნური ინტელექტი
#google
#მანქანური სწავლება
#ტრანსფორმერები
#gemma 2
#დაზუსტება
#პალიჯემა 2
#ვიზუალურ-ენობრივი მოდელი
#docci
#vqav2
#siglip
წყარო: huggingface.co
AI-ით გადამუშავებული