ხედვა-ენის თანხვედრაზე ფოკუსირებით შექმნილი „ვიზუალური სალამანდრა“ (Visual Salamandra) ეფუძნება „სალამანდრა ინსტრუქტულ 7B“ (Salamandra Instructed 7B) მოდელს, Google-ის SigLIP ენკოდერის (SigLIP-So400m), 2-ფენიანი MLP პროჟექტორისა და მოწინავე გვიანი შერწყმის ტექნიკების ინტეგრაციის გზით, რათა დაძლიოს ვიზუალურ და ტექსტურ მოდალობებს შორის არსებული უფსკრული. მიღებული არქიტექტურა „ვიზუალურ სალამანდრას“ საშუალებას აძლევს გაიგოს და შექმნას კონტექსტურად ზუსტი პასუხები მრავალფეროვანი შეყვანიდან, დაწყებული ერთჯერადი და მრავალჯერადი გამოსახულებებითა და ვიდეოებით, დამთავრებული წმინდა ტექსტური ინსტრუქციებით. ეს განვითარება ასახავს ლაბორატორიის ფართო ვალდებულებას, მხარი დაუჭიროს მყარ, მრავალენოვან და მულტიმოდალურ ხელოვნური ინტელექტის სისტემებს – განსაკუთრებით კი მათ, რომლებიც პრიორიტეტს ანიჭებენ ევროპულ ენობრივ მრავალფეროვნებას. „სალამანდრას“ ვიზუალური შეყვანისთვის ადაპტირების მიზნით, ლაბორატორიამ დანერგა ოთხფაზიანი წვრთნის პროცესი, რომელიც გვიანი შერწყმის არქიტექტურაზეა ორიენტირებული. ამ კონფიგურაციაში, წინასწარ გაწვრთნილი გამოსახულების ენკოდერი (SigLIP, 14 „პაჩი“ 384x384 გარჩევადობით) წარმოქმნის გამოსახულების ემბედინგებს, რომლებიც შემდეგ გასწორდება დიდ ენობრივ მოდელთან (LLM) საბაჟო წესით გაწვრთნილი მრავალფენიანი პერცეპტრონის (MLP) პროჟექტორის მეშვეობით. ოთხი საწვრთნელი ფაზა მოიცავს: • ფაზა 1: პროჟექტორის წინასწარი წვრთნა – მხოლოდ პროჟექტორი წვრთნება გამოსახულების მახასიათებლების LLM-ის ლატენტურ სივრცეში ასახვისთვის. • ფაზა 2: მაღალი ხარისხის ვიზუალური წინასწარი წვრთნა – დახვეწილი მონაცემთა ნაკრებების (მაგ., OCR და ხელახლა დასათაურებული სურათები) გამოყენებით, მთელი არქიტექტურა (ენკოდერი, პროჟექტორი და LLM) გადის ერთობლივ წვრთნას. • ფაზა 3: ინსტრუქციების დახვეწა – მოდელი სწავლობს მომხმარებლის ინსტრუქციების შესრულებას ვიზუალური კითხვა-პასუხის (VQA), OCR-ის და სხვა ვიზუალურად დაფუძნებული ამოცანების მეშვეობით. • ფაზა 4: სრული მულტიმოდალური დახვეწა – მოიცავს ერთჯერად/მრავალჯერად გამოსახულებებსა და ვიდეო მონაცემებს, ასევე მხოლოდ ტექსტურ მაგალითებს, რათა მოხდეს მოდელის განზოგადების ოპტიმიზაცია რეალური სამყაროს, მრავალჯერადი შეყვანის სცენარებისთვის. მონაცემთა მრავალფეროვნებამ გადამწყვეტი როლი ითამაშა მთელი წვრთნის განმავლობაში. გამოყენებული იქნა ჯამში 6.1 მილიონი ინსტრუქციების დახვეწის შემთხვევა, მათ შორის 842,000 მხოლოდ ტექსტური ნიმუში. საწვრთნელი კორპუსი შეიცავდა მონაცემებს ისეთი წყაროებიდან, როგორიცაა AI2D, Cambrian და LLaVA Next, რომლებიც შერჩეული იყო ვიზუალური დაფუძნების, დოკუმენტების გაგების, მათემატიკური მსჯელობისა და OCR-ის გასაუმჯობესებლად. ენის ტექნოლოგიების ლაბორატორიის წინა მოდელების მსგავსად, „ვიზუალური სალამანდრა“ აგრძელებს მრავალენოვანი ინკლუზიურობისადმი ერთგულებას, განსაკუთრებული აქცენტით ევროპულ ენებზე. ეს მიდგომა უზრუნველყოფს, რომ ნაკლებად წარმოდგენილი ენები ისარგებლებენ ინსტრუქციების დახვეწითა და ვიზუალურ ამოცანებთან გასწორებით, რაც ხელს შეუწყობს მულტიმოდალური AI კვლევის რესურსების უფსკრულის ამოვსებას. „ვიზუალური სალამანდრა“ არის ერთ-ერთი პირველი მოდელი, რომელიც ახდენს ასეთი ენობრივი მრავალფეროვნების ინტეგრაციას მულტიმოდალურ, ინსტრუქციებით გაწვრთნილ ჩარჩოში. „ვიზუალური სალამანდრა“ ხსნის ფართო სპექტრის აპლიკაციებს ენისა და ხედვის გადაკვეთაზე, როგორიცაა: • ვიზუალური კითხვა-პასუხი (VQA): დასვით კითხვები გამოსახულების ან ვიდეოს შესახებ და მიიღეთ კონტექსტზე ორიენტირებული, ზუსტი პასუხები. • ოპტიკური სიმბოლოების ამოცნობა (OCR): ზუსტად წაიკითხეთ და გადაწერეთ ტექსტი დოკუმენტებიდან, სცენებიდან და დიაგრამებიდან. • დოკუმენტებისა და დიაგრამების გაგება: გააანალიზეთ რთული ვიზუალური დოკუმენტები ან გრაფიკული შინაარსი ჩაშენებული ტექსტით. • მათემატიკური მსჯელობა: ამოხსენით ვიზუალურად დაფუძნებული მათემატიკური ამოცანები მულტიმოდალური მსჯელობის მეშვეობით. • ინსტრუქციებზე დაფუძნებული გამოსახულების ურთიერთქმედება: მიჰყევით დეტალურ ინსტრუქციებს ვიზუალურ კონტექსტებში, მათ შორის გამოსახულების აღწერასა და ლოკალიზაციის ამოცანებში. ვიდეო შესაძლებლობების ჩართვა ასევე ხსნის გზას ვიდეოების შეჯამების, მოვლენების გამოვლენისა და მულტიმოდალური თხრობის შემდგომი განვითარებისთვის. „ვიზუალური სალამანდრას“ საშუალებით, ენის ტექნოლოგიების ლაბორატორია აჩვენებს თავის მუდმივ ლიდერობას ინკლუზიური, მაღალეფექტური ფუნდამენტური მოდელების შექმნაში. უახლესი ვიზუალური ენკოდერების ძლიერ მრავალენოვან LLM-ებთან ჰარმონიზაციით, გუნდი საფუძველს უყრის შემდეგი თაობის AI სისტემებს, რომლებიც ხედავენ, ესმით და ურთიერთობენ — მოდალობებსა და ენებზე. მიუხედავად იმისა, რომ „ვიზუალური სალამანდრა“ ავლენს ძლიერ მულტიმოდალურ შესაძლებლობებს, მნიშვნელოვანია აღინიშნოს მისი შეზღუდვები: • მას შეუძლია „ჰალუცინაცია“ მოახდინოს სავარაუდო, მაგრამ არასწორი პასუხების, განსაკუთრებით მაშინ, როდესაც ვიზუალური შეყვანა ორაზროვანია. • კომპლექსურ OCR-სა და მკვრივ დოკუმენტურ განლაგებებზე მუშაობა ჯერ კიდევ რთულია. • მოდელი გაწვრთნილია გაფილტრული და ლიცენზირებული მონაცემთა ნაკრებებით, თუმცა მომხმარებლებმა სიფრთხილე უნდა შეინარჩუნონ პოტენციური მიკერძოების ან უზუსტობების მიმართ, განსაკუთრებით მგრძნობიარე აპლიკაციებში მისი გამოყენებისას. ჩვენ გირჩევთ „ვიზუალური სალამანდრას“ გამოყენებას იმ კონტექსტებში, სადაც შესაძლებელია ადამიანის ზედამხედველობა და მაღალი რისკის შემცველი აპლიკაციების თავიდან აცილებას სათანადო შეფასების გარეშე. „ვიზუალური სალამანდრა“ გამოშვებულია Apache ლიცენზიით, ვერსია 2.0, რაც იძლევა კვლევითი და არაკომერციული გამოყენების საშუალებას. თვალყური ადევნეთ „ვიზუალური სალამანდრაზე“ აგებულ მომავალ გამოშვებებსა და ხელსაწყოებს, და გაეცანით მოდელის სრულ დეტალებს ჩვენს ნაშრომში. ენის ტექნოლოგიების ლაბორატორიის გუნდი ეს ნაშრომი მხარდაჭერილი და დაფინანსებულია ციფრული ტრანსფორმაციისა და საჯარო ფუნქციის სამინისტროსა და აღდგენის, ტრანსფორმაციის გეგმის მიერ.