UCLA-ს მკვლევრებმა LMM-ების შესაფასებლად კონტექსტზე მგრძნობიარე ვიზუალური ამოცანების ახალი მონაცემთა ბაზა – ConTextual შექმნეს
კალიფორნიის უნივერსიტეტის ლოს-ანჯელესის (UCLA) მკვლევრებმა წარმოადგინეს ConTextual – ინოვაციური მონაცემთა ბაზა, რომელიც მიზნად ისახავს დიდი მულტიმოდალური მოდელების (LMMs) კონტექსტზე მგრძნობიარე, ტექსტით მდიდარი ვიზუალური მსჯელობის შესაძლებლობების შეფასებას. ეს მონაცემთა ბაზა 506 რთულ ინსტრუქციას მოიცავს 8 რეალური სამყაროს სცენარში, რათა შეავსოს არსებული შეფასების მეთოდების ხარვეზები, რომლებიც ხშირად უგულებელყოფენ კონტექსტის გაგებას. პროექტის ფარგლებში ასევე შეიქმნა ლიდერბორდი, სადაც საზოგადოებას
ამ ამოცანებს ჩვენ ვუწოდებთ „კონტექსტზე მგრძნობიარე, ტექსტით მდიდარ ვიზუალური მსჯელობის ამოცანებს“.
ამჟამად, ინსტრუქციებზე მორგებული დიდი მულტიმოდალური მოდელების (LMMs) შეფასებების უმეტესობა ფოკუსირებულია იმაზე, თუ რამდენად კარგად შეუძლიათ მოდელებს რეაგირება ადამიანის ინსტრუქციებზე, რომლებიც კითხვების ან იმპერატიული წინადადებების სახითაა დასმული („ეს დაითვალე“, „ის ჩამოთვალე“ და ა.შ.) გამოსახულებებზე... მაგრამ არა იმაზე, თუ რამდენად კარგად ესმით მათ კონტექსტზე მგრძნობიარე, ტექსტით მდიდარი სცენები!
ამიტომ ჩვენ (კალიფორნიის უნივერსიტეტის ლოს-ანჯელესის მკვლევრებმა) შევქმენით ConTextual – კონტექსტზე მგრძნობიარე, ტექსტით მდიდარი ვიზუალური მსჯელობის მონაცემთა ბაზა LMM-ების შესაფასებლად. ჩვენ ასევე გამოვაქვეყნეთ ლიდერბორდი, რათა საზოგადოებამ თავად ნახოს, რომელი მოდელებია საუკეთესო ამ ამოცანაში. სიღრმისეული გაცნობისთვის, შეგიძლიათ ასევე გაეცნოთ დამატებით რესურსებს: ნაშრომს, კოდს, მონაცემთა ბაზას, ვალიდაციის მონაცემთა ბაზას და ლიდერბორდს.
ConTextual არის კონტექსტზე მგრძნობიარე, ტექსტით მდიდარი ვიზუალური მსჯელობის მონაცემთა ბაზა, რომელიც შედგება 506 რთული ინსტრუქციისგან LMM შეფასებისთვის. ჩვენ ვქმნით ინსტრუქციების მრავალფეროვან ნაკრებს ტექსტით მდიდარ გამოსახულებებზე, იმ შეზღუდვით, რომ მათ უნდა მოითხოვონ კონტექსტზე მგრძნობიარე ერთობლივი მსჯელობა გამოსახულებაში არსებული ტექსტური და ვიზუალური მინიშნებების საფუძველზე.
ის მოიცავს 8 რეალური სამყაროს ვიზუალურ სცენარს – დროის წაკითხვა, შოპინგი, ნავიგაცია, აბსტრაქტული სცენები, მობილური აპლიკაცია, ვებგვერდები, ინფოგრაფიკა და სხვადასხვა ბუნებრივი სცენები. (თითოეული მონაცემთა ნაკრების ნიმუშისთვის იხილეთ სურათი).
თითოეული ნიმუში შედგება:
მონაცემთა ბაზა გამოქვეყნებულია ორი ფორმით:
ლიდერბორდი შეიცავს მოდელების შედეგებს როგორც ვალიდაციის, ასევე ტესტის მონაცემთა ბაზებზე (ინფორმაცია ასევე მოცემულია ნაშრომში). განვითარების ნაკრები პრაქტიკოსებს საშუალებას აძლევს მარტივად შეამოწმონ და დახვეწონ თავიანთი მიდგომები. შეფასების ქვიშის ყუთი (sandbox) ხელმისაწვდომია ჩვენს GitHub-ზე.
ჩვენი საწყისი ექსპერიმენტებისთვის, ჩვენმა ბენჩმარკმა შეაფასა 13 მოდელის მუშაობა. ჩვენ ისინი სამ კატეგორიად დავყავით:
ჩვენი მონაცემთა ბაზა მოიცავს საცნობარო პასუხს თითოეული ინსტრუქციისთვის, რაც საშუალებას გვაძლევს გამოვცადოთ სხვადასხვა ავტომატური შეფასების მეთოდი. შეფასებისთვის, ჩვენ ვიყენებთ LLM-როგორც-მოსამართლის (LLM-as-a-judge) მიდგომას და GPT-4-ს ვაწვდით ინსტრუქციას, საცნობარო პასუხს და პროგნოზირებულ პასუხს. მოდელმა უნდა დააბრუნოს, არის თუ არა პროგნოზირებული პასუხი მისაღები. (GPT-4 შეირჩა, რადგან ჩვენს ექსპერიმენტებში ის ყველაზე მეტად კორელაციაში იყო ადამიანის შეფასებასთან.)
მოდით გადავხედოთ რამდენიმე მაგალითს!
**მაგალითი 1:** ამ შემთხვევაში, GPT-4V იძლევა არასწორ პასუხს ინსტრუქციაზე, მიუხედავად მისი ლოგიკური მსჯელობისა. მწვანე ფერი მიუთითებს პასუხებზე, რომლებიც ემთხვევა საცნობარო პასუხს, ხოლო წითელი ხაზს უსვამს შეცდომებს პასუხებში. გარდა ამისა, მოცემულია შეჯამებული მსჯელობა (Summarized Reasoning), რათა აღწერილი იყოს GPT-4V-ის მიერ გამოყენებული ლოგიკა პასუხის მისაღებად.
**მაგალითი 2:** ამ მაგალითში, GPT-4V სწორად პასუხობს ინსტრუქციას. თუმცა, ShareGPT-4V-7B (საუკეთესო მოქმედი ღია კოდის LMM) და GPT-4 განლაგებაზე მორგებული OCR-ით + წარწერით (გაფართოებული LLM) იძლევა არასწორ პასუხს, ტექსტსა და გამოსახულებაზე ერთობლივი მსჯელობის ნაკლებობის გამო. მსგავს მაგალითებს ჩვენი ნაშრომის დანართში იხილავთ!
ამაზე მუშაობისას აღმოვაჩინეთ, რომ:
ჩვენი ანალიზი გვთავაზობს პერსპექტიულ შემდგომ ნაბიჯებს, მათ შორის:
ეს, თავის მხრივ, გამოიწვევს უფრო ეფექტურ კონტექსტზე მგრძნობიარე, ტექსტით მდიდარ ვიზუალურ მსჯელობას. სიამოვნებით შევაფასებდით თქვენს მოდელებსაც, რათა ერთობლივად წავიწიოთ წინ ხედვის ენობრივი მოდელების განვითარებაში! წარდგენისთვის, გთხოვთ, მიჰყვეთ ქვემოთ მოცემულ მითითებებს.
ვიმედოვნებთ, რომ ეს ბენჩმარკი ხელს შეუწყობს ნიუანსური ხედვა-ენის შეთანხმების ტექნიკების შემუშავებას და მივესალმებით ნებისმიერი სახის თანამშრომლობას! შეგიძლიათ დაგვიკავშირდეთ აქ: Rohan და Hritik, ხოლო გუნდის შესახებ მეტი ინფორმაციის მისაღებად იხილეთ აქ: Rohan, Hritik, Kai-Wei Chang, Nanyun (Violet) Peng.
ჩვენ ვიღებთ წარდგენებს როგორც ტესტის, ასევე ვალიდაციის ნაკრებებისთვის. გთხოვთ, მიჰყევით შესაბამის პროცედურას ქვემოთ. თქვენი ვალიდაციის შედეგების ლიდერბორდზე წარსადგენად, შეგიძლიათ გაუშვათ ჩვენი ავტომატური შეფასების კოდი (შეფასების პაიპლაინი GPT-4-ით), ამ ინსტრუქციების დაცვით. ჩვენ ველოდებით წარდგენებს JSON ფორმატში, როგორც ნაჩვენებია ქვემოთ: უნდა იყოს 100 პროგნოზი, რომელიც შეესაბამება ვალიდაციის ნაკრების 100 URL-ს. წარდგენის გასაკეთებლად, გთხოვთ, გადახვიდეთ HuggingFace-ზე განთავსებულ ლიდერბორდზე და შეავსოთ წარდგენის ფორმა. როგორც კი კმაყოფილი იქნებით თქვენი ვალიდაციის შედეგებით, შეგიძლიათ თქვენი მოდელის პროგნოზები გაუგზავნოთ როჰანს და ჰრიტიკს. გთხოვთ, თქვენს ელფოსტაში მიუთითოთ: ჩვენ ველოდებით წარდგენებს JSON ფორმატში, ვალიდაციის ნაკრების მსგავსად, როგორც ნაჩვენებია ქვემოთ: უნდა იყოს 506 პროგნოზი, რომელიც შეესაბამება ტესტის ნაკრების 506 URL-ს.
მეტ სტატიას ჩვენს ბლოგზე იხილავთ. კომენტარის დასატოვებლად, გთხოვთ, დარეგისტრირდეთ ან შეხვიდეთ სისტემაში.
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლა
#მონაცემთა ბაზა
#შეფასება
#gpt-4
#lmms
#contextual
#ucla
#ვიზუალური მსჯელობა
წყარო: huggingface.co
AI-ით გადამუშავებული