გასული დეკემბრის თვეში Google-მა გამოუშვა PaliGemma 2: წინასწარ გაწვრთნილი (pt) PaliGemma ვიზუალური ენის მოდელების (VLMs) ახალი ოჯახი, რომელიც დაფუძნებულია SigLIP-სა და Gemma 2-ზე. მოდელები წარმოდგენილია სამი სხვადასხვა ზომით (3B, 10B, 28B) და სამი სხვადასხვა რეზოლუციით (224x224, 448x448, 896x896). დღეს Google-ი ავრცელებს PaliGemma 2 mix-ს: რომელიც დაზუსტებულია ვიზუალური ენის ამოცანების ნაზავზე, მათ შორის OCR-ზე (ოპტიკური სიმბოლოების ამოცნობა), მოკლე და გრძელი აღწერილობების გენერირებაზე და სხვა. PaliGemma 2-ის წინასწარ გაწვრთნილი (pt) ვარიანტები შესანიშნავი ვიზუალური ენის მოდელებია მოცემულ ამოცანაზე გადასატანად. ყველა pt საკონტროლო წერტილი განკუთვნილია შემდგომ ამოცანებზე დასაზუსტებლად და სწორედ ამ მიზნით იქნა გამოშვებული. "Mix" მოდელები სწრაფ წარმოდგენას იძლევა იმ შესრულებაზე, რასაც მიიღებს მომხმარებელი წინასწარ გაწვრთნილი საკონტროლო წერტილების შემდგომ ამოცანაზე დაზუსტებისას. PaliGemma მოდელების ოჯახის მთავარი მიზანია, უზრუნველყოს წინასწარ გაწვრთნილი მოდელები, რომლებსაც შეუძლიათ უკეთ ისწავლონ შემდგომ ამოცანაზე, ვიდრე უნივერსალური ჩატის მოდელის მიწოდება. Mix მოდელები კარგ სიგნალს იძლევა იმის შესახებ, თუ როგორ მუშაობენ pt მოდელები აკადემიური მონაცემთა ნაკრებების ნაზავზე დაზუსტებისას. PaliGemma 2-ის შესახებ მეტის წაკითხვა შეგიძლიათ ამ ბლოგ-პოსტში. ყველა mix მოდელსა და დემო ვერსიას ნახავთ ამ კოლექციაში. PaliGemma 2 mix მოდელებს შეუძლიათ შეასრულონ მრავალფეროვანი ამოცანები. მათი დაყოფა შესაძლებელია ქვეამოცანების მიხედვით შემდეგნაირად: გაითვალისწინეთ, რომ ქვეამოცანების ეს სია ამომწურავი არ არის და ამოცანების სრულ სიასთან დაკავშირებით მეტი ინფორმაციის მიღება შეგიძლიათ PaliGemma 2-ის დოკუმენტაციაში. PaliGemma 2 mix მოდელებთან ურთიერთობისას, შეგვიძლია გამოვიყენოთ ღია ფორმატის მოთხოვნები (open-ended prompts). PaliGemma-ს წინასწარ გაწვრთნილი მოდელების წინა იტერაციაში, საჭირო იყო ამოცანის პრეფიქსის დამატება მოთხოვნაზე, იმისდა მიხედვით, თუ რა ამოცანის შესრულება გვსურდა მოცემულ ენაზე. ეს მეთოდი კვლავ მუშაობს, მაგრამ ღია ფორმატის მოთხოვნები უკეთეს შედეგებს იძლევა. ამოცანის პრეფიქსის მქონე მოთხოვნები ასე გამოიყურება: მხოლოდ ორი ამოცანა, რომელიც ექსკლუზიურად ამოცანის პრეფიქსებთან მუშაობს, არის ობიექტის ამოცნობა (object detection) და გამოსახულების სეგმენტაცია (image segmentation). მოთხოვნები ასე გამოიყურება:. თუ გსურთ დაუყოვნებლივ დაიწყოთ მუშაობა, შეგიძლიათ გადახვიდეთ ბლოგის ამ სექციაზე, ან სცადოთ დემო ვერსია. ამ სექციაში განვიხილავთ აღნიშნულ შესაძლებლობებს, როგორ მუშაობს PaliGemma 2 mix მათზე, და შევადარებთ სხვადასხვა ზომისა და რეზოლუციის ვარიანტებს რამდენიმე ამოცანაზე. აქ, ჩვენ ვამოწმებთ მოდელს რამდენიმე "რეალურ სამყაროს" მაგალითზე. ჩვენ შევაფასეთ PaliGemma 2 mix ვარიანტები მათი ლოკალიზაციასთან დაკავშირებული შესაძლებლობების მიხედვით. მოცემული მოთხოვნისას "detect {object description};{another object description}" სხვადასხვა საინტერესო ობიექტით, PaliGemma-ს შეუძლია სხვადასხვა საინტერესო ობიექტის ამოცნობა. მოთხოვნა აქ არ შემოიფარგლება მოკლე კლასებით, როგორიცაა "ფრინველი", არამედ შეიძლება იყოს "ფრინველი ჯოხზე". ქვემოთ, შეგიძლიათ იხილოთ ამოცნობისა და სეგმენტაციის შედეგები სხვადასხვა ვარიანტისა, ფიქსირებული 448x448 რეზოლუციით. ვიზუალიზაციის მიზნით, ვადიდებთ საინტერესო ობიექტს. შეგიძლიათ გამოიყენოთ PaliGemma 2 mix მოდელები Transformers ბიბლიოთეკის მეშვეობით. ჩვენ გვაქვს დეტალური სახელმძღვანელო PaliGemma 2-ის დაზუსტებისთვის (fine tuning). იგივე ნოუთბუქის გამოყენება შესაძლებელია mix საკონტროლო წერტილების დაზუსტებისთვისაც. ჩვენ ვუშვებთ 10B მოდელის დემო ვერსიას 448x448 რეზოლუციით. შეგიძლიათ ითამაშოთ მასთან ქვემოთ, ან გადახვიდეთ აპლიკაციაზე ამ ბმულზე. წაიკითხეთ და შეიტყვეთ მეტი PaliGemma მოდელების შესახებ ქვემოთ. მადლობას ვუხდით საიაკ პოლს და ვაიბჰავ სრივასტავს ამ ბლოგ-პოსტის განხილვისთვის. მადლობას ვუხდით Google-ის გუნდს ამ საოცარი და ღია მოდელის ოჯახის გამოშვებისთვის. დიდი მადლობა პაბლო მონტალვოს მოდელის Transformers-ში ინტეგრირებისთვის, და ლისანდრეს, რაუშანს, ართურს, იიჰ-დარს და დანარჩენ გუნდს განხილვის, ტესტირებისა და უმოკლეს დროში გაერთიანებისთვის. მეტი სტატია ჩვენი ბლოგიდან გამარჯობა, შესაძლებელია თუ არა 'from transformers import AutoProcessor, AutoModelForVision2Seq'-ის გამოყენება ყველა VLM-ისთვის, თუ უნდა გამოვიყენოთ 'from transformers import PaliGemmaProcessor, PaliGemmaForConditionalGeneration' PaliGemma-სთვის და 'from transformers import Qwen2_5_VLForConditionalGeneration, AutoTokenizer, AutoProcessor' QwenVL-სთვის? ჩემი მიზანია, მქონდეს ერთიანი სკრიპტი Hub-ზე არსებული ყველა VLM-ისთვის, 'model_name' არგუმენტის სახით. Transformers-ის ასახვას რომ ვუყურებ, თითქმის დარწმუნებული ვარ, რომ Auto კლასს შეეძლება PaliGemma-ს და Qwen2_5-ის ერთდროულად ამოღება. კომენტარის დასატოვებლად დარეგისტრირდით ან შეხვიდით სისტემაში.