Aya Vision არის Cohere For AI-ის უახლესი ღია წონის, მულტილინგვური და მულტიმოდალური მოდელების ოჯახი, რომელიც შექმნილია, როგორც მძლავრი საფუძველი ენისა და ვიზუალური ინფორმაციის გასაგებად 23 ენაზე. ის ეფუძნება Aya Expanse-ის, ხელოვნური ინტელექტის ულტრათანამედროვე მულტილინგვური ენობრივი მოდელების, წარმატებას და აფართოებს მას მოწინავე ტექნიკების კომბინაციის გამოყენებით. ესენია: სინთეზური ანოტაციები, მულტილინგვური მონაცემების გაფართოება თარგმანისა და გადაფორმების გზით, და მულტიმოდალური მოდელების შერწყმა – ძირითადი მეთოდები, რომლებიც აუმჯობესებენ როგორც ენის, ისე ვიზუალური ინფორმაციის გაგებას მულტილინგვურ გარემოში. შედეგად, ჩვენი მოდელები კარგად მუშაობენ სხვადასხვა ამოცანებში, მათ შორის გამოსახულების აღწერაში (image captioning), ვიზუალურ შეკითხვებზე პასუხის გაცემაში (visual question answering), ტექსტის გენერაციაში და როგორც ტექსტის, ისე გამოსახულებების გარდაქმნაში გასაგებ, ბუნებრივ ენობრივ ტექსტად. ჩვენ შევაფასეთ Aya Vision-ის მოდელები მონაცემთა ნაკრებებზე, მათ შორის ჩვენს ახალ ღია ხედვა-ენობრივ ბენჩმარკზე AyaVisionBench-ზე და Wild Vision Bench-ის მულტილინგვურ ვერსიაზე (mWildVision), რომელიც 23 ენაზეა ნათარგმნი. ორივე მათგანს ვაქვეყნებთ კვლევისთვის. წყვილთა შედარებისას, Aya Vision 32B აღემატება თავისზე 2-ჯერ დიდ მოდელებს, როგორიცაა Llama-3.2 90B Vision, Molmo 72B და Qwen2.5-VL 72B. მისი მოგების მაჩვენებლები მერყეობს 50%-დან 64%-მდე AyaVisionBench-ზე და 52%-დან 72%-მდე mWildVision-ზე, 23 ენის საშუალო მონაცემებით. ჩვენი კომპაქტური და უფრო ეფექტური მოდელი Aya Vision 8B აღწევს საუკეთესო მულტილინგვურ მულტიმოდალურ მუშაობას თავის პარამეტრულ კლასში, აღემატება წამყვან მოდელებს, როგორიცაა Qwen2.5-VL 7B, Pixtral 12B, Gemini Flash 1.5 8B, Llama-3.2 11B Vision, Molmo-D 7B და Pangea 7B-ს, მოგების მაჩვენებლით 79%-მდე AyaVisionBench-ზე და 81%-მდე mWildBench-ზე. ჩვენ ვაქვეყნებთ როგორც 8B, ასევე 32B მოდელებს ღია წონით კვლევითი საზოგადოებისთვის, რათა კიდევ უფრო დავაჩქაროთ მულტილინგვური მულტიმოდალური პროგრესი. ამ ბლოგ პოსტში, ჩვენ გაგიზიარებთ Aya Vision მოდელების ძირითად ტექნიკურ დეტალებს. მაღალეფექტური ხედვა-ენობრივი მოდელისთვის მნიშვნელოვანია გამოსახულებების დამუშავება თვითნებური რეზოლუციებით, განსაკუთრებით მაღალი რეზოლუციის გამოსახულებების. ამ შესაძლებლობის მისაცემად Aya Vision-ისთვის, ჩვენ დინამიურად ვცვლით ზომას და ვყოფთ ნებისმიერ მაღალი რეზოლუციის გამოსახულებას მრავალ „კრამიტად“ (tiles), რათა გამოსახულების ენკოდერიდან (image encoder) მივიღოთ მდიდარი გამოსახულების მახასიათებლები. Aya Vision მოდელებში, ვიზუალური ენკოდერის ინიციალიზაციისთვის ვიყენებთ ახლახან გამოშვებულ SigLIP2-patch14-384 მოდელს. მიუხედავად იმისა, რომ დინამიური ზომის შეცვლა უზრუნველყოფს მაღალი რეზოლუციის გამოსახულებების დამუშავებას, ის ასევე იწვევს გამოსახულების ტოკენების უფრო დიდ რაოდენობას, რომლებიც გადიან ხედვა-ენობრივ კონექტორსა და LLM დეკოდერში. შეყოვნების (latency) და გამტარუნარიანობის (throughput) გასაუმჯობესებლად, ჩვენ ვიყენებთ შემცირების მეთოდს, სახელწოდებით Pixel Shuffle, რათა 4-ჯერ შევკუმშოთ გამოსახულების ტოკენების რაოდენობა. შემცირების შემდეგ, გამოსახულების ტოკენები გასწორებულია ენობრივი მოდელის შეყვანის ჩანერგვასთან (input embeddings) ხედვა-ენობრივი კონექტორის მეშვეობით და გადაეცემა LLM დეკოდერს. ტექსტის დეკოდერისთვის ვიყენებთ ჩვენს მულტილინგვურ ენობრივ მოდელებს. Aya Vision 8B-სთვის ვიყენებთ LLM-ს, რომელიც ინიციალიზებულია Cohere Command R7B-დან გაუმჯობესებული ინსტრუქციების შესრულებისა და მსოფლიო ცოდნისთვის, და შემდგომში გადამზადებულია Aya Expanse-ის რეცეპტის გამოყენებით, რომელიც მოიცავს მრავალფეროვან მულტილინგვურ მონაცემებს, მოდელების შერწყმას და უპირატესობის სწავლებას. Aya Vision 32B-სთვის ენობრივ მოდელს ინიციალიზაციას ვუკეთებთ Aya Expanse 32B-დან, მისი ულტრათანამედროვე მულტილინგვური მუშაობის საფუძველზე. ჩვენ Aya Vision-ის მოდელები ვავარჯიშეთ 2 ეტაპად – ხედვა-ენის გასწორება (vision-language alignment) და კონტროლირებადი დაზუსტება (supervised fine-tuning - SFT). ხედვა-ენის გასწორების ეტაპზე ვავარჯიშებთ მხოლოდ ხედვა-ენის კონექტორს, ხოლო ვიზუალური ენკოდერისა და ენობრივი მოდელის წონები გაყინულია. ეს შესაძლებელს ხდის ელემენტარულ ხედვა-ენობრივ გაგებას გამოსახულების ენკოდერის მახასიათებლების ენობრივი მოდელის ჩანერგვის სივრცეში ასახვით. SFT ეტაპზე, როგორც კონექტორს, ასევე ენობრივ მოდელს ვავარჯიშებთ მრავალფეროვან მულტიმოდალურ ამოცანებზე 23 ენაზე. მულტილინგვური ხედვა-ენობრივი მოდელის შემუშავების ერთ-ერთი უდიდესი გამოწვევა ნაკლებად წარმოდგენილ ენებზე მაღალი შესრულების უზრუნველყოფაა. ამის მოსაგვარებლად, ჩვენ თავდაპირველად შევაგროვეთ სინთეზური ანოტაციები ინგლისურ ენაზე არსებული მაღალი ხარისხის მონაცემთა მრავალფეროვანი ნაკრების გამოყენებით, რაც საფუძვლად დაედო ჩვენს მულტილინგვურ მულტიმოდალურ ანოტაციას. ინგლისური მონაცემთა ნაკრებების სინთეზური ანოტაციების შემდეგ, ჩვენ მონაცემების დიდი მოცულობა 23 ენაზე ვთარგმნეთ. თარგმანის არტეფაქტების თავიდან ასაცილებლად და პასუხებში ზუსტი და გამართული ტექსტუალური მახასიათებლების შესანარჩუნებლად, ჩვენ შემდგომში გადავაფორმეთ ნათარგმნი მოთხოვნა/გენერაციის წყვილები, შევადარეთ რა ისინი ორიგინალურ მაღალი ხარისხის სინთეზურ ნიმუშებს, რითაც გავაფართოვეთ ენობრივი დაფარვა იქ, სადაც რეალური სამყაროს მონაცემები მწირია. ეს აუმჯობესებს როგორც ლინგვისტურ გამართულობას, ასევე ხედვასა და ტექსტს შორის შესაბამისობას, რაც Aya Vision-ს საშუალებას აძლევს გამოავლინოს გამოსახულების უკეთესი გაგება მრავალ ენაზე. ჩვენი 8B მოდელი, როდესაც ის მხოლოდ ორიგინალური აკადემიური მონაცემთა ნაკრებებით არის კონტროლირებადი დაზუსტებული, აღწევს 40.9%-იან მოგების მაჩვენებელს 23 ენაზე AyaVisionBench-ზე Pangea 7B-სთან შედარებით (რომელიც მულტილინგვური VLM-ია), ხოლო სინთეზური ანოტაციები და მულტილინგვური მონაცემების გაფართოება იწვევს 58.1%-იან მოგების მაჩვენებელს, 17.2%-იანი ზრდით. ეს მნიშვნელოვანი გაუმჯობესება აჩვენებს მნიშვნელოვანი ინვესტიციის გავლენას...