SmolVLM-256M და SmolVLM-500M: მსოფლიოს ყველაზე პატარა ხედვის ენის მოდელები
კომპანიამ SmolVLM ოჯახის ორი ახალი წევრი, SmolVLM-256M და SmolVLM-500M, წარადგინა. 256 მილიონი პარამეტრის მქონე მოდელი მსოფლიოში ყველაზე პატარა ხედვის ენის მოდელია. ახალი მოდელები ეფუძნება SmolVLM 2B-დან მიღებულ გამოცდილებას, აქცენტი კეთდება ეფექტურობაზე, მონაცემთა ნარევებზე და დიზაინის ახალ კომპრომისებზე. ისინი ინარჩუნებენ მძლავრ მულტიმოდალურ მუშაობას გაცილებით მცირე ზომებში და მარტივად ინტეგრირდება არსებულ სისტემებში. ეს მოდელები განკუთვნილია როგორც შეზღუდული მოწყობილობებისთვის, ასევე დიდი მოც
მოხარულნი ვართ, გაცნობოთ SmolVLM ოჯახის ორი ახალი წევრის, SmolVLM-256M-ისა და SmolVLM-500M-ის შესახებ. დიახ, 256 მილიონი პარამეტრით, ის მსოფლიოში ყველაზე პატარა ხედვის ენის მოდელია! ჩვენ დავეყრდენით SmolVLM 2B-დან მიღებულ ყველა გამოცდილებას, ფოკუსირება მოვახდინეთ ეფექტურობაზე, მონაცემთა ნარევებზე და დიზაინის ახალ კომპრომისებზე. მოხარულნი ვართ, წარმოგიდგინოთ მოდელების წყვილი, რომელიც ინარჩუნებს მძლავრ მულტიმოდალურ წარმადობას გაცილებით მცირე ზომებში.
ეს გამოშვება მოიცავს ოთხ ჩექპოინტს: ორ საბაზისო მოდელს და ორ ინსტრუქციებით დატვირთულ მოდელს, რომელთა ზომებია 256M და 500M პარამეტრი. ეს მოდელები შესაძლებელია პირდაპირ ჩაიტვირთოს Transformers-ში, MLX-სა და ONNX-ში, ასევე გვაქვს დემოები Transformers-ისთვის და WebGPU-სთვის (ONNX-თან ერთად). ყველა მოდელისა და ამ გამოშვების დემო ვერსიის ნახვა შეგიძლიათ აქ. ახლა მივაღწიეთ მოდელების თანაბრობას SmolLM2 ოჯახთან (135M, 360M, 1.7B), ასე რომ, გვაქვს უფრო მცირე LLM + VLM კომბინაციების სრული ნაკრები ექსპერიმენტებისთვის.
როდესაც გამოვუშვით SmolVLM 2B, საზოგადოების გამოხმაურება ფანტასტიური იყო: მოდელი ძალიან მსუბუქი, ღია წყაროს მქონე და ადვილად ინტეგრირებადი იყო არსებულ სამუშაო პროცესებში. თუმცა, ჩვენ გვინდოდა, ეს მიდგომა კიდევ უფრო გაგვეღრმავებინა შეზღუდული მოწყობილობებით, სამომხმარებლო ლეპტოპებით ან თუნდაც ბრაუზერზე დაფუძნებული ინფერენციით მომუშავე ადამიანებისთვის. სწორედ აქ შემოდის ჩვენი ახალი 256M და 500M მოდელები. მეორე მხრივ, მათთვის, ვინც ცდილობს უზარმაზარი რაოდენობის მონაცემების დამუშავებას, ეს მოდელები 2B მოდელთან შედარებით გაცილებით ნაკლებ ხარჯზე მუშაობს.
გასულ წელს ჩვენ ვავარჯიშეთ ორი 80B VLM და შევამცირეთ 8B-მდე. შემდეგ, SmolVLM-ისთვის, ავიღეთ გამოწვევა 2B-ის შემცირების. და ის, რაც ვისწავლეთ, იყო, რომ შეგვეძლო საზღვრების კიდევ უფრო გაფართოება! მოხარულნი ვართ, ვაჩვენოთ, რომ 256M და 500M ზომებზეც კი შეგვიძლია მივაღწიოთ დიდ წარმადობას. ჩვენი ახალი 256M მოდელი არის ოდესმე გამოშვებული ყველაზე პატარა VLM, თუმცა ის აჭარბებს ჩვენი Idefics 80B მოდელის წარმადობას სულ რაღაც 17 თვის წინანდელი მონაცემებით. მხოლოდ 256 მილიონი პარამეტრით, ეს მოდელი ყველაზე პატარა VLM-ად ითვლება. მიუხედავად მცირე ზომისა, მას საოცარი ძალა აქვს. ის საკმაოდ ქმედითუნარიანია მრავალ მულტიმოდალურ დავალებაში. თუ გჭირდებათ მეტი წარმადობა მეხსიერების დაბალი მოხმარების შენარჩუნებით, SmolVLM-500M არის ჩვენი ნახევარმილიარდიანი პარამეტრის კომპრომისი. ის მნიშვნელოვნად მცირეა წინა 2B ვერსიასთან შედარებით, თუმცა ახერხებს ქულების გაზრდას ისეთ ამოცანებში, როგორიცაა DocVQA და MMMU, უფრო დიდ მოდელებთან მიახლოებით. ასევე აღმოვაჩინეთ, რომ ეს მოდელი უფრო მდგრადია prompting-ის მიმართ, რაც მას თავიდანვე უფრო შესაფერისს ხდის წარმოებისთვის. თუმცა ორივე მოდელი შესანიშნავად მუშაობს fine-tuning-ის შემდეგ. ქვემოთ მოცემულ გრაფიკზე ვიზუალიზებულია გამტარუნარიანობის ზრდა სხვადასხვა batch ზომების მიხედვით. ქვემოთ მოცემული რიცხვები არის A100-ზე გაშვებული გამტარუნარიანობის ბენჩმარკები.
**1. ხედვის ენკოდერის არჩევანი**
ადრე ვიყენებდით სტანდარტულ SigLIP 400M SO ხედვის ზურგს (vision backbone), იგივეს, რაც მრავალ VLM არქიტექტურაში გვხვდება. ამ უფრო მცირე მოდელებისთვის, ჩვენ ექსპერიმენტები ჩავატარეთ ორი სეტით: აღმოვაჩინეთ, რომ წარმადობის სხვაობა არ იყო საკმარისად დიდი იმისთვის, რომ გამართლებული ყოფილიყო უფრო მძიმე ენკოდერის გამოყენება ჩვენი 256M და 500M მოდელებისთვის. ამიტომ, გადავწყვიტეთ, ხედვის ენკოდერზეც მცირე ზომა აგვერჩია. ბონუსის სახით, უფრო მცირე ენკოდერი ამუშავებს სურათებს უფრო დიდი გარჩევადობით, რამაც (Apple-ისა და Google-ის კვლევების მიხედვით) ხშირად შეიძლება უკეთესი ვიზუალური გაგება გამოიწვიოს პარამეტრების რაოდენობის გაზრდის გარეშე.
**2. მონაცემთა ნარევის განახლება**
ჩვენი წინა გამოშვების მსგავსად, ჩვენ ვეყრდნობით The Cauldron-სა და Docmatix-ს, ამ ნარევს დაემატა MathWriting. მონაცემთა ნაკრებების პროპორციები მორგებულია დოკუმენტების გაგებაზე (41%) და სურათების აღწერაზე (14%) უფრო ძლიერი აქცენტის გასაკეთებლად, ამასთანავე შენარჩუნებულია დაბალანსებული ფოკუსირება სხვა აუცილებელ სფეროებზე, როგორიცაა ვიზუალური მსჯელობა, დიაგრამების გაგება და ზოგადი ინსტრუქციების შესრულება. ამ განახლებით, მოდელი აგებულია დოკუმენტების ძლიერი გაგების საფუძველზე და ხსნის კარს fine-tuning-ისთვის, რომელიც მოარგებს მის გაგებას კონკრეტულ ამოცანებზე.
**3. ტოკენიზაციის ოპტიმიზაცია**
ჩვენ კიდევ უფრო გავზარდეთ პიქსელების შერევა (pixel shuffle)! ჩვენი ახალი მოდელები ამუშავებენ სურათებს 4096 პიქსელი/ტოკენის სიჩქარით, 2B მოდელის 1820 პიქსელი/ტოკენთან შედარებით. ტოკენიზაციის კიდევ უფრო ოპტიმიზაციისთვის, ჩვენ დავამატეთ სპეციალური ტოკენები, რათა უფრო ეფექტურად წარმოგვედგინა ქვე-გამოსახულების გამყოფები (sub-image separators). ეს ნიშნავს, რომ ახლა -ის მსგავსი სტრიქონი 7 ტოკენის ნაცვლად, ერთ ტოკენზეა ასახული. იგივე გავაკეთეთ -მდე სტრიქონებისთვის. ამან მნიშვნელოვნად გააუმჯობესა მოდელის სტაბილურობა ვარჯიშის დროს და შედეგების ხარისხი. მეტი დეტალი დოკუმენტირებულია ამ LinkedIn პოსტში.
**4. SmolLM2-SmolVLM ოჯახის დასრულება**
SmolLM2 სამი ზომის იყო: 135M, 360M და 1.7B. დღეს გამოშვებული ორი მოდელით, ახლა გვაქვს უფრო მცირე LLM + VLM კომბინაციების სრული ნაკრები ექსპერიმენტებისთვის. ასევე აღმოვაჩინეთ, რომ საოცრად მარტივია მათი fine-tuning და ექსპერიმენტები. ColBERT-ის მსგავსი მოძიების მოდელების გუნდმა ავარჯიშა ColSmolVLM, რომელმაც უზრუნველყო SOTA (state-of-the-art) მულტიმოდალური მოძიების სიჩქარეები, წარმადობით, რომელიც 10-ჯერ აღემატება მათ ზომას. SmolVLM აჩქარებს და აიაფებს საძიებო მონაცემთა ბაზების შექმნას. ვფიქრობთ, 256M მოდელი შეიძლება გახდეს შესანიშნავი სპეციალიზებული მოდელი მრავალი ამოცანისთვის.
თეგები:
#ai
#llm
#მანქანური სწავლება
#ეფექტურობა
#ღია წყარო
#ღრმა სწავლება
#vlm
#smolvlm
#ხედვის ენის მოდელები
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი