ამ ამოცანებს ვუწოდებთ „კონტექსტზე მგრძნობიარე, ტექსტით მდიდარ ვიზუალურ მსჯელობის ამოცანებს“. ამჟამად, ინსტრუქციებზე მორგებული მსხვილი მულტიმოდალური მოდელების (LMMs) შეფასებების უმეტესობა ფოკუსირებულია იმაზე, თუ რამდენად კარგად შეუძლიათ მოდელებს რეაგირება ადამიანის ინსტრუქციებზე, რომლებიც დასმულია შეკითხვების ან იმპერატიული წინადადებების სახით („დაითვალე ეს“, „ჩამოთვალე ის“ და ა.შ.) გამოსახულებებზე... მაგრამ არა იმაზე, თუ რამდენად კარგად ესმით მათ კონტექსტზე მგრძნობიარე, ტექსტით მდიდარი სცენები! სწორედ ამიტომ, ჩვენ (კალიფორნიის უნივერსიტეტის, ლოს-ანჯელესი, მკვლევრებმა) შევქმენით ConTextual, კონტექსტზე მგრძნობიარე, ტექსტით მდიდარი ვიზუალური მსჯელობის მონაცემთა ნაკრები LMM-ების შესაფასებლად. ჩვენ ასევე გამოვაქვეყნეთ ლიდერბორდი, რათა საზოგადოებამ თავად ნახოს, რომელი მოდელებია საუკეთესო ამ ამოცანაში. სიღრმისეული გაცნობისთვის, შეგიძლიათ იხილოთ ეს დამატებითი რესურსებიც: ნაშრომი, კოდი, მონაცემთა ნაკრები, ვალიდაციის მონაცემთა ნაკრები და ლიდერბორდი. ConTextual არის კონტექსტზე მგრძნობიარე, ტექსტით მდიდარი ვიზუალური მსჯელობის მონაცემთა ნაკრები, რომელიც შედგება 506 რთული ინსტრუქციისგან LMM-ის შესაფასებლად. ჩვენ შევქმენით მრავალფეროვანი ინსტრუქციების ნაკრები ტექსტით მდიდარ გამოსახულებებზე იმ პირობით, რომ ისინი მოითხოვენ კონტექსტზე მგრძნობიარე ერთობლივ მსჯელობას გამოსახულებაში არსებულ ტექსტურ და ვიზუალურ მინიშნებებზე. ის მოიცავს 8 რეალურ ვიზუალურ სცენარს - დროის წაკითხვა, შოპინგი, ნავიგაცია, აბსტრაქტული სცენები, მობილური აპლიკაციები, ვებგვერდები, ინფოგრაფიკა და სხვადასხვა ბუნებრივი სცენები. (იხილეთ ფიგურა თითოეული მონაცემთა ნაკრების ნიმუშისთვის). თითოეული ნიმუში შედგება: მონაცემთა ნაკრები გამოშვებულია ორი ფორმით: ლიდერბორდი შეიცავს მოდელების შედეგებს როგორც ვალიდაციის, ასევე ტესტის მონაცემთა ნაკრებებზე (ინფორმაცია ასევე მოცემულია ნაშრომში). დეველოპმენტის ნაკრები საშუალებას აძლევს პრაქტიკოსებს, ადვილად გამოსცადონ და დახვეწონ თავიანთი მიდგომები. შეფასების sandbox ხელმისაწვდომია ჩვენს GitHub-ზე. ჩვენი საწყისი ექსპერიმენტებისთვის, ჩვენმა ბენჩმარკმა შეაფასა 13 მოდელის მუშაობა. ჩვენ დავყავით ისინი სამ კატეგორიად: ჩვენი მონაცემთა ნაკრები მოიცავს საცნობარო პასუხს თითოეული ინსტრუქციისთვის, რაც საშუალებას გვაძლევს გამოვცადოთ შეფასების სხვადასხვა ავტომატური მეთოდი. შეფასებისთვის ვიყენებთ „LLM-როგორც-მოსამართლე“ მიდგომას და GPT-4-ს ვთხოვთ ინსტრუქციას, საცნობარო პასუხს და პროგნოზირებულ პასუხს. მოდელმა უნდა დააბრუნოს, მისაღებია თუ არა პროგნოზირებული პასუხი. (GPT-4 შეირჩა, რადგან ჩვენს ექსპერიმენტებში ის ყველაზე მეტად კორელაციაში იყო ადამიანის შეფასებასთან.) მოდით, გადავხედოთ რამდენიმე მაგალითს! მაგალითი 1: ამ შემთხვევაში, GPT-4V აწვდის არასწორ პასუხს ინსტრუქციაზე, მიუხედავად მისი ლოგიკური მსჯელობისა. მწვანე ფერი მიუთითებს საცნობარო პასუხთან შესაბამისობაზე, ხოლო წითელი ხაზს უსვამს შეცდომებს პასუხებში. გარდა ამისა, მოწოდებულია შეჯამებული მსჯელობა, რათა გამოიკვეთოს GPT-4V-ის მიერ გამოყენებული საფუძველი პასუხის მისაღებად. მაგალითი 2: ამ მაგალითში, GPT-4V სწორად პასუხობს ინსტრუქციას. თუმცა, ShareGPT-4V-7B (საუკეთესო ღია კოდის LMM) და GPT-4 განლაგებაზე მგრძნობიარე OCR + წარწერით (გაძლიერებული LLM) არასწორ პასუხს იძლევა ტექსტსა და გამოსახულებაზე ერთობლივი მსჯელობის ნაკლებობის გამო. მსგავს მაგალითებს ნახავთ ჩვენი ნაშრომის დანართში! ამაზე მუშაობისას აღმოვაჩინეთ, რომ: ჩვენი ანალიზი გვთავაზობს პერსპექტიულ შემდგომ ნაბიჯებს, მათ შორის: ეს, თავის მხრივ, გამოიწვევს უფრო ეფექტურ კონტექსტზე მგრძნობიარე, ტექსტით მდიდარ ვიზუალურ მსჯელობას. ჩვენ სიამოვნებით შევაფასებთ თქვენს მოდელებსაც, რათა ერთობლივად ხელი შევუწყოთ ხედვის ენის მოდელების განვითარებას! წარდგენისთვის, გთხოვთ, მიჰყვეთ ქვემოთ მოცემულ მითითებებს. ვიმედოვნებთ, რომ ეს ბენჩმარკი დაგვეხმარება ნიუანსირებული ხედვის-ენის გასწორების ტექნიკის შემუშავებაში და მივესალმებით ნებისმიერი სახის თანამშრომლობას! შეგიძლიათ დაგვიკავშირდეთ აქ: როჰანი და ჰრიტიკი, ხოლო გუნდის შესახებ მეტი ინფორმაცია იხილოთ აქ: როჰანი, ჰრიტიკი, კაი-ვეი ჩანგი, ნანიუნ (ვაიოლეტ) პენგი. ჩვენ ვიღებთ წარდგენებს როგორც ტესტის, ასევე ვალიდაციის ნაკრებებისთვის. გთხოვთ, მიჰყვეთ შესაბამის პროცედურას ქვემოთ. ვალიდაციის შედეგების ლიდერბორდზე წარსადგენად, შეგიძლიათ გაუშვათ ჩვენი ავტო-შეფასების კოდი (შეფასების კონვეიერი GPT-4-ით), ამ ინსტრუქციების მიხედვით. ჩვენ ველოდებით წარდგენებს JSON ფორმატში, როგორც ნაჩვენებია ქვემოთ: უნდა იყოს 100 პროგნოზი, რომლებიც შეესაბამება ვალიდაციის ნაკრების 100 URL-ს. წარდგენის გასაკეთებლად, გთხოვთ, გადახვიდეთ HuggingFace-ზე განთავსებულ ლიდერბორდზე და შეავსოთ წარდგენის ფორმა. მას შემდეგ, რაც კმაყოფილი იქნებით თქვენი ვალიდაციის შედეგებით, შეგიძლიათ გაუგზავნოთ თქვენი მოდელის პროგნოზები როჰანს და ჰრიტიკს. გთხოვთ, თქვენს მეილში მიუთითოთ: ჩვენ ველოდებით წარდგენებს JSON ფორმატში, ვალიდაციის ნაკრების მსგავსად, როგორც ნაჩვენებია ქვემოთ: უნდა იყოს 506 პროგნოზი, რომლებიც შეესაბამება ტესტის ნაკრების 506 URL-ს. მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის.