Visual Salamandra: ახალი თაობის მულტიმოდალური AI ევროპული ენების აქცენტით
ენის ტექნოლოგიების ლაბორატორიამ წარმოადგინა Visual Salamandra, ინოვაციური მულტიმოდალური AI მოდელი, რომელიც აერთიანებს Google-ის SigLIP ენკოდერს Salamandra Instructed 7B მოდელთან. ეს სისტემა შექმნილია ვიზუალურ და ტექსტურ მონაცემებს შორის ხარვეზის შესავსებად, რის შედეგადაც მას შეუძლია გაიგოს და შექმნას კონტექსტურად ზუსტი პასუხები მრავალფეროვანი შეყვანის საფუძველზე, მათ შორის სურათებიდან, ვიდეოებიდან და ტექსტური ინსტრუქციებიდან. Visual Salamandra გამოირჩევა მრავალენოვანი ინკლუზიურობით, განსაკუთრები
მხედველობა-ენის გასწორებაზე დაფუძნებული Visual Salamandra აგებულია Salamandra Instructed 7B მოდელის ბაზაზე, Google-ის SigLIP ენკოდერის (SigLIP-So400m), 2-ფენიანი MLP პროჟექტორისა და გვიანი შერწყმის მოწინავე ტექნიკების ინტეგრირებით, ვიზუალურ და ტექსტურ მოდალობებს შორის არსებული უფსკრულის ამოსავსებად. მიღებული არქიტექტურა Visual Salamandra-ს საშუალებას აძლევს, გაიგოს და შექმნას კონტექსტურად ზუსტი პასუხები მრავალფეროვანი შეყვანის საფუძველზე, იქნება ეს ერთი ან მრავალი გამოსახულება, ვიდეო, თუ წმინდა ტექსტური ინსტრუქციები. ეს განვითარება ასახავს ლაბორატორიის ფართო ვალდებულებას, მხარი დაუჭიროს მძლავრ, მრავალენოვან და მულტიმოდალურ AI სისტემებს – განსაკუთრებით კი მათ, რომლებიც პრიორიტეტს ანიჭებენ ევროპულ ლინგვისტურ მრავალფეროვნებას.
Salamandra-ს ვიზუალური შეყვანისთვის ადაპტირების მიზნით, ლაბორატორიამ დანერგა ოთხფაზიანი სწავლების პროცესი, რომელიც გვიანი შერწყმის არქიტექტურაზეა ორიენტირებული. ამ კონფიგურაციაში, წინასწარ გაწვრთნილი გამოსახულების ენკოდერი (SigLIP, 14 პატჩი 384x384 გარჩევადობით) წარმოქმნის გამოსახულების ჩაშენებებს (embeddings), რომლებიც შემდეგ უკავშირდება LLM-ს სპეციალურად გაწვრთნილი მრავალფენიანი პერცეპტრონის (MLP) პროჟექტორის მეშვეობით. ოთხი სასწავლო ფაზა მოიცავს:
* **ფაზა 1: პროჟექტორის წინასწარი გაწვრთნა** – მხოლოდ პროჟექტორი გადის წვრთნას, რათა გამოსახულების მახასიათებლები LLM-ის ლატენტურ სივრცეში დაასახოს.
* **ფაზა 2: მაღალი ხარისხის ვიზუალური წინასწარი გაწვრთნა** – დახვეწილი მონაცემთა ნაკრებების (მაგ. OCR და ხელახლა წარწერილი გამოსახულებები) გამოყენებით, მთელი არქიტექტურა (ენკოდერი, პროჟექტორი და LLM) გადის ერთობლივ წვრთნას.
* **ფაზა 3: ინსტრუქციების დარეგულირება** – მოდელი სწავლობს მომხმარებლის ინსტრუქციების მიყოლას ვიზუალური კითხვა-პასუხის (VQA), OCR-ის და სხვა ვიზუალური ამოცანების მეშვეობით.
* **ფაზა 4: სრული მულტიმოდალური დარეგულირება** – მოიცავს ერთ/მრავალ გამოსახულებას და ვიდეო მონაცემებს, ასევე მხოლოდ ტექსტურ მაგალითებს, რათა ოპტიმიზებული იყოს მოდელის განზოგადება რეალურ სამყაროს, მრავალჯერადი შეყვანის სცენარებზე.
მონაცემთა მრავალფეროვნებამ გადამწყვეტი როლი ითამაშა მთელი წვრთნის განმავლობაში. საერთო ჯამში გამოყენებული იქნა 6.1 მილიონი ინსტრუქციების დარეგულირების ინსტანცია, მათ შორის 842,000 მხოლოდ ტექსტური ნიმუში. სავარჯიშო კორპუსი შეიცავდა მონაცემებს წყაროებიდან, როგორიცაა AI2D, Cambrian და LLaVA Next, რომლებიც შერჩეული იყო ვიზუალური დასაბუთების, დოკუმენტების გაგების, მათემატიკური მსჯელობისა და OCR-ის გასაუმჯობესებლად.
**ფიგურა 1. მონაცემთა განაწილება Visual Salamandra 7B-ის წვრთნის პროცესში**
როგორც ენის ტექნოლოგიების ლაბორატორიის წინა მოდელების შემთხვევაში, Visual Salamandra აგრძელებს მრავალენოვანი ინკლუზიურობისადმი ერთგულებას, განსაკუთრებული აქცენტით ევროპულ ენებზე. ეს მიდგომა უზრუნველყოფს, რომ ნაკლებად წარმოდგენილი ენები ისარგებლებენ ინსტრუქციების დარეგულირებითა და ვიზუალურ ამოცანებთან გასწორებით, რაც ხელს უწყობს მულტიმოდალური AI კვლევების რესურსების ხარვეზის შემცირებას. Visual Salamandra არის ერთ-ერთი პირველი ასეთი მოდელი, რომელიც ასეთ ლინგვისტურ პლურალიზმს აერთიანებს მულტიმოდალურ, ინსტრუქციებით დარეგულირებულ ჩარჩოში.
**ფიგურა 2. მრავალენოვანი გენერაციის მაგალითები მოდელით, რომელიც გაწვრთნილია ტექსტის რეგულარიზაციით და შერწყმულია ორიგინალურ LLM-თან.**
Visual Salamandra ხსნის აპლიკაციების ფართო სპექტრს ენისა და მხედველობის გადაკვეთაზე, როგორიცაა:
* **ვიზუალური კითხვა-პასუხი (VQA):** დასვით კითხვები გამოსახულების ან ვიდეოს შესახებ და მიიღეთ კონტექსტის გათვალისწინებით ზუსტი პასუხები.
* **ოპტიკური სიმბოლოების ამოცნობა (OCR):** ზუსტად წაიკითხეთ და გადაწერეთ ტექსტი დოკუმენტებიდან, სცენებიდან და დიაგრამებიდან.
* **დოკუმენტებისა და დიაგრამების გაგება:** გააანალიზეთ რთული ვიზუალური დოკუმენტები ან გრაფიკული შინაარსი ჩაშენებული ტექსტით.
* **მათემატიკური მსჯელობა:** გადაჭერით ვიზუალურად დასაბუთებული მათემატიკური ამოცანები მულტიმოდალური მსჯელობის გზით.
* **ინსტრუქციებზე დაფუძნებული გამოსახულების ინტერაქცია:** მიჰყევით დეტალურ ინსტრუქციებს ვიზუალურ კონტექსტში, მათ შორის გამოსახულების წარწერების შექმნისა და ლოკალიზაციის ამოცანებში.
ვიდეო შესაძლებლობების ჩართვა ასევე ხსნის გზას ვიდეოს შეჯამების, მოვლენების გამოვლენისა და მულტიმოდალური ამბის მოყოლის შემდგომი განვითარებისთვის.
Visual Salamandra-ს მეშვეობით, ენის ტექნოლოგიების ლაბორატორია აჩვენებს თავის მუდმივ ლიდერობას ინკლუზიური, მაღალეფექტური ფუნდამენტური მოდელების შექმნაში. უახლესი ვიზუალური ენკოდერების ძლიერ მრავალენოვან LLM-ებთან ჰარმონიზაციით, გუნდი საფუძველს უქმნის მომავალი თაობის AI სისტემებს, რომლებიც ხედავენ, ესმით და ურთიერთობენ – სხვადასხვა მოდალობისა და ენის ფარგლებში.
მიუხედავად იმისა, რომ Visual Salamandra აჩვენებს ძლიერ მულტიმოდალურ შესაძლებლობებს, მნიშვნელოვანია აღინიშნოს მისი შეზღუდვები:
* მას შეუძლია შექმნას დამაჯერებელი, მაგრამ არასწორი პასუხები, განსაკუთრებით მაშინ, როდესაც ვიზუალური შეყვანა ორაზროვანია.
* რთული OCR-ისა და დოკუმენტების მჭიდრო განლაგების შემთხვევაში შესრულება ჯერ კიდევ რთულია.
* მოდელი გაწვრთნილია გაფილტრული და ლიცენზირებული მონაცემთა ნაკრებებით, მაგრამ მომხმარებლებმა სიფრთხილე უნდა გამოიჩინონ პოტენციური მიკერძოებების ან უზუსტობების მიმართ, განსაკუთრებით მგრძნობიარე აპლიკაციებში გამოყენებისას. ჩვენ გირჩევთ Visual Salamandra-ს გამოყენებას იმ კონტექსტებში, სადაც შესაძლებელია ადამიანის ზედამხედველობა და თავიდან აიცილოთ მაღალი რისკის შემცველი აპლიკაციები სათანადო შეფასების გარეშე.
Visual Salamandra ვრცელდება Apache ლიცენზიის, ვერსია 2.0-ის ფარგლებში, რაც ნებას რთავს კვლევით და არაკომერციულ გამოყენებას. თვალყური ადევნეთ Visual Salamandra-ზე დაფუძნებულ მომავალ გამოშვებებსა და ხელსაწყოებს და იხილეთ მოდელის სრული დეტალები ჩვენს ნაშრომში.
ენის ტექნოლოგიების ლაბორატორიის გუნდი. ეს ნაშრომი მხარდაჭერილი და დაფინანსებულია ციფრული ტრანსფორმაციისა და საჯარო ფუნქციების სამინისტროსა (Ministerio para la Transformación Digital y de la Función Pública) და აღდგენის, ტრანსფორმაცი... გეგმის (Plan de Recuperación, Transformac) მიერ.
თეგები:
#ai
#llm
#მანქანური სწავლება
#მულტიმოდალური ai
#ocr
#vqa
#google siglip
#მრავალენოვანი ai
#visual salamandra
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები