Google-მა წარმოადგინა PaliGemma: ვიზუალური ენობრივი მოდელების ახალი თაობა
Google-მა წარმოადგინა PaliGemma, ვიზუალური ენობრივი მოდელების ახალი ოჯახი, რომელსაც შეუძლია გამოსახულებისა და ტექსტის კომბინირებული დამუშავება ტექსტის გენერირებისთვის. ეს ინოვაციური მოდელი SigLIP-ის გამოსახულების ენკოდერსა და Gemma-2B-ის ტექსტის დეკოდერს აერთიანებს, რაც მას მძლავრ ინსტრუმენტად აქცევს. PaliGemma ხელმისაწვდომია სხვადასხვა ტიპის, რეზოლუციისა და სიზუსტის ვარიანტებში და უზრუნველყოფს ფართო შესაძლებლობებს, მათ შორის გამოსახულების აღწერას, კითხვებზე პასუხის გაცემას, ობიექტის ამოცნობასა
PaliGemma Google-ის ვიზუალური ენობრივი მოდელების ახალი ოჯახია. PaliGemma-ს შეუძლია მიიღოს გამოსახულება და ტექსტი და გამოიტანოს ტექსტი. Google-ის გუნდმა გამოუშვა სამი ტიპის მოდელი: წინასწარ გაწვრთნილი (pt) მოდელები, შერეული (mix) მოდელები და დახვეწილი (ft) მოდელები. თითოეული მათგანი ხელმისაწვდომია სხვადასხვა რეზოლუციითა და მრავალი სიზუსტის ვარიანტით, მომხმარებლის მოხერხებულობისთვის. ყველა მოდელი განთავსებულია Hugging Face Hub-ის მოდელების რეპოზიტორიებში, შესაბამისი მოდელის ბარათებითა და ლიცენზიებით, და გააჩნია 'transformers' ინტეგრაცია.
PaliGemma (Github) არის ვიზუალური-ენობრივი მოდელების ოჯახი, რომლის არქიტექტურა მოიცავს SigLIP-So400m-ს, როგორც გამოსახულების ენკოდერს, და Gemma-2B-ს, როგორც ტექსტის დეკოდერს. SigLIP არის უახლესი მოდელი, რომელსაც შეუძლია როგორც გამოსახულებების, ისე ტექსტის გაგება. CLIP-ის მსგავსად, ის შედგება გამოსახულებისა და ტექსტის ენკოდერებისგან, რომლებიც ერთობლივად არის გაწვრთნილი. PaLI-3-ის მსგავსად, კომბინირებული PaliGemma მოდელი წინასწარ გაწვრთნილია გამოსახულება-ტექსტის მონაცემებზე და შემდეგ ადვილად შეიძლება დახვეწილი იყოს შემდგომი ამოცანებისთვის, როგორიცაა გამოსახულების აღწერა ან სეგმენტაცია. Gemma არის მხოლოდ დეკოდერის მოდელი ტექსტის გენერირებისთვის. SigLIP-ის გამოსახულების ენკოდერის Gemma-სთან ხაზოვანი ადაპტერის გამოყენებით დაკავშირება PaliGemma-ს აქცევს მძლავრ ვიზუალურ ენობრივ მოდელად.
PaliGemma-ს გამოშვება მოიცავს მოდელების სამ ტიპს: მოდელები წარმოდგენილია სამი სხვადასხვა რეზოლუციით (224x224, 448x448, 896x896) და სამი სხვადასხვა სიზუსტით (bfloat16, float16 და float32). თითოეული რეპოზიტორია შეიცავს შესაბამისი რეზოლუციისა და ამოცანის საკონტროლო წერტილებს, თითოეული ხელმისაწვდომი სიზუსტისთვის სამი ვერსიით. თითოეული რეპოზიტორიის ძირითადი ფილიალი შეიცავს float32 საკონტროლო წერტილებს, ხოლო bfloat16 და float16 ვერსიები შეიცავს შესაბამის სიზუსტეებს. არსებობს ცალკეული რეპოზიტორიები 🤗 transformers-თან და ორიგინალურ JAX იმპლემენტაციასთან თავსებადი მოდელებისთვის. როგორც დეტალურად არის განმარტებული, მაღალი რეზოლუციის მოდელებს გაშვებისთვის გაცილებით მეტი მეხსიერება ესაჭიროებათ, რადგან შეყვანის თანმიმდევრობები გაცილებით გრძელია. მათ შეუძლიათ დაეხმარონ ისეთ დეტალურ ამოცანებში, როგორიცაა OCR, თუმცა ხარისხის ზრდა უმეტეს ამოცანებში მცირეა. 224x224 ვერსიები შესანიშნავია უმეტესი მიზნებისთვის. ყველა მოდელისა და 'Spaces'-ის ნახვა შეგიძლიათ ამ კოლექციაში. PaliGemma არის ერთჯერადი ვიზუალური ენობრივი მოდელი, რომელიც არ არის განკუთვნილი საუბრისთვის და ის საუკეთესოდ მუშაობს კონკრეტულ გამოყენების შემთხვევაზე დახვეწისას.
მოდელის მიერ შესასრულებელი ამოცანის კონფიგურაცია შესაძლებელია ამოცანის პრეფიქსებით, როგორიცაა „ამოცნობა“ (detect) ან „სეგმენტაცია“ (segment). წინასწარ გაწვრთნილი მოდელები სწორედ ამ მეთოდით გაიწვრთნა, რათა მათ მრავალი შესაძლებლობა ჰქონოდათ (კითხვებზე პასუხის გაცემა, გამოსახულების აღწერა, სეგმენტაცია და ა.შ.). თუმცა, ისინი არ არის შექმნილი პირდაპირი გამოყენებისთვის, არამედ კონკრეტულ ამოცანებზე გადასატანად (დახვეწის გზით) მსგავსი მოთხოვნის სტრუქტურის გამოყენებით. ინტერაქტიული ტესტირებისთვის შეგიძლიათ გამოიყენოთ „შერეული“ (mix) მოდელების ოჯახი, რომლებიც დახვეწილია სხვადასხვა ამოცანების ნაზავზე. ქვემოთ მოცემული მაგალითები იყენებს შერეულ საკონტროლო წერტილებს ზოგიერთი შესაძლებლობის დემონსტრირებისთვის. PaliGemma-ს შეუძლია გამოსახულებების აღწერა შესაბამისი მოთხოვნისას. შეგიძლიათ სცადოთ სხვადასხვა აღწერის მოთხოვნები შერეული საკონტროლო წერტილებით, რათა ნახოთ, როგორ რეაგირებენ ისინი. PaliGemma-ს შეუძლია უპასუხოს შეკითხვებს გამოსახულების შესახებ, ამისათვის საკმარისია თქვენი შეკითხვა გამოსახულებასთან ერთად გადასცეთ.
PaliGemma-ს შეუძლია გამოსახულებაზე ობიექტების ამოცნობა „detect [entity]“ მოთხოვნის გამოყენებით. ის გამოიტანს შემომფარგლავი ყუთის კოორდინატების მდებარეობას სპეციალური ტოკენების სახით, სადაც 'value' არის რიცხვი, რომელიც ნორმალიზებულ კოორდინატს წარმოადგენს. თითოეული ამოცნობა წარმოდგენილია ოთხი მდებარეობის კოორდინატით შემდეგი თანმიმდევრობით: y_min, x_min, y_max, x_max, რასაც მოსდევს ყუთში ამოცნობილი ობიექტის აღწერა. მნიშვნელობების კოორდინატებად გადასაყვანად, ჯერ რიცხვები უნდა გაყოთ 1024-ზე, შემდეგ კი y გაამრავლოთ გამოსახულების სიმაღლეზე და x მის სიგანეზე. ეს მოგცემთ შემომფარგლავი ყუთების კოორდინატებს, ორიგინალური გამოსახულების ზომასთან შედარებით.
PaliGemma-ს შერეულ საკონტროლო წერტილებს ასევე შეუძლიათ ობიექტების სეგმენტაცია გამოსახულებაზე „segment [entity]“ მოთხოვნის მიცემისას. ამას მოიხსენიებენ როგორც სეგმენტაციას ბუნებრივი ენის გამოყენებით, რადგან საინტერესო ობიექტებს ბუნებრივი ენის აღწერებით მივუთითებთ. გამოსავალი არის მდებარეობისა და სეგმენტაციის ტოკენების თანმიმდევრობა. მდებარეობის ტოკენები წარმოადგენს შემომფარგლავ ყუთს, როგორც ზემოთ იყო აღწერილი. სეგმენტაციის ტოკენები შეიძლება შემდგომში დამუშავდეს სეგმენტაციის ნიღბების შესაქმნელად.
PaliGemma-ს შერეულ საკონტროლო წერტილებს გააჩნიათ დოკუმენტების გააზრებისა და მსჯელობის შესანიშნავი შესაძლებლობები. ქვემოთ შეგიძლიათ იხილოთ შერეული საკონტროლო წერტილების შეფასებები. წინასწარ გაწვრთნილი და შერეული მოდელების გარდა, Google-მა გამოუშვა მოდელები, რომლებიც უკვე გადატანილია სხვადასხვა ამოცანებზე. ისინი შეესაბამება აკადემიურ ბენჩმარკებს, რომლებიც შეიძლება გამოყენებულ იქნას კვლევითი საზოგადოების მიერ მათი მუშაობის შესადარებლად. ქვემოთ შეგიძლიათ იხილოთ რამდენიმე შერჩეული. ეს მოდელები ასევე ხელმისაწვდომია სხვადასხვა რეზოლუციით. ნებისმიერი მოდელის ბარათში შეგიძლიათ შეამოწმოთ ყველა მეტრიკა. ამ გამოშვების ფარგლებში გვაქვს დემო, რომელიც big_vision რეპოზიტორიაში არსებულ საცნობარო იმპლემენტაციას აერთიანებს და მარტივ გზას გვთავაზობს შერეულ მოდელებთან მუშაობისთვის. ასევე გვაქვს დემოს ვერსია, რომელიც თავსებადია Transformers-თან, რათა ვაჩვენოთ, როგორ გამოვიყენოთ PaliGemma-ს Transformers API.
თეგები:
#ai
#google
#მანქანური სწავლება
#ტექნოლოგია
#კომპიუტერული ხედვა
#paligemma
#ნეირონული ქსელები
#ვიზუალური ენა
#მოდელები
წყარო: huggingface.co
AI-ით გადამუშავებული