SmolVLM2: ვიდეოს გაგება ხელმისაწვდომი ხდება ყველა მოწყობილობაზე
SmolVLM2 წარმოადგენს ფუნდამენტურ ცვლილებას ვიდეოს გაგების მიდგომაში, მოძრაობს მასიური, რესურსმომთხოვნი მოდელებიდან ეფექტურ, ნებისმიერ მოწყობილობაზე გაშვებად გადაწყვეტილებებზე. მიზანია ვიდეოს გაგება ხელმისაწვდომი გახდეს ყველა მოწყობილობისთვის, ტელეფონებიდან სერვერებამდე. გამოშვებულია სამი ზომის (2.2B, 500M და 256M) მოდელი, MLX-თან თავსებადობით (Python და Swift API-ები). ეს მოდელები, მიუხედავად მცირე ზომისა, მნიშვნელოვნად აღემატება არსებულ ანალოგებს მეხსიერების მოხმარების მხრივ და ზოგიერთ შემთხვევ
SmolVLM2 ფუნდამენტურად ცვლის ვიდეოს გაგებისადმი ჩვენს მიდგომას – მასიური, მნიშვნელოვან კომპიუტერულ რესურსებს მოითხოვადი მოდელებიდან გადავდივართ ეფექტურ მოდელებზე, რომელთა გაშვებაც ნებისმიერ ადგილას შეიძლება. ჩვენი მიზანი მარტივია: ვიდეოს გაგება ხელმისაწვდომი გავხადოთ ყველა მოწყობილობისთვის და გამოყენების შემთხვევისთვის, ტელეფონებიდან სერვერებამდე. ჩვენ ვუშვებთ მოდელებს სამი ზომის (2.2B, 500M და 256M), რომლებიც MLX-თან თავსებადია (Python და Swift API-ები) თავიდანვე.
ყველა მოდელი და დემო ხელმისაწვდომია ამ კოლექციაში. გსურთ SmolVLM2 დაუყოვნებლივ გამოსცადოთ? იხილეთ ჩვენი ინტერაქტიული ჩატის ინტერფეისი, სადაც შეგიძლიათ შეამოწმოთ SmolVLM2 2.2B-ის ვიზუალური და ვიდეო გაგების შესაძლებლობები მარტივი, ინტუიციური ინტერფეისის მეშვეობით.
წარმოგიდგენთ სამ ახალ მოდელს 256M, 500M და 2.2B პარამეტრებით. 2.2B მოდელი საუკეთესო არჩევანია ვიზუალური და ვიდეო ამოცანებისთვის, ხოლო 500M და 256M მოდელები წარმოადგენენ ყველაზე პატარა ვიდეო ენის მოდელებს, რაც კი ოდესმე გამოშვებულა. მიუხედავად მათი მცირე ზომისა, ისინი აღემატებიან ნებისმიერ არსებულ მოდელს მეხსიერების მოხმარების მხრივ. Video-MME-ზე (ვიდეოში წამყვანი სამეცნიერო ბენჩმარკი) დაკვირვებით, SmolVLM2 უერთდება მოწინავე მოდელების ოჯახებს 2B დიაპაზონში და ჩვენ ლიდერები ვართ კიდევ უფრო მცირე ზომის სივრცეში. Video-MME გამოირჩევა, როგორც ყოვლისმომცველი ბენჩმარკი, თავისი ფართო გაშუქების გამო სხვადასხვა ვიდეო ტიპებში, განსხვავებული ხანგრძლივობით (11 წამიდან 1 საათამდე), მრავალი მონაცემთა მოდალობით (მათ შორის სუბტიტრები და აუდიო) და მაღალი ხარისხის ექსპერტული ანოტაციებით, რომელიც მოიცავს 900 ვიდეოს, საერთო ჯამში 254 საათის ხანგრძლივობით. მეტი ინფორმაცია იხილეთ აქ. წინა SmolVLM ოჯახთან შედარებით, ჩვენი ახალი 2.2B მოდელი გაუმჯობესდა მათემატიკური ამოცანების სურათებით ამოხსნაში, ფოტოებში ტექსტის წაკითხვაში, რთული დიაგრამების გაგებაში და სამეცნიერო ვიზუალური კითხვების გადაჭრაში.
ეს აისახება მოდელის მუშაობაში სხვადასხვა ბენჩმარკებზე: რაც შეეხება ვიდეო ამოცანებს, 2.2B მოდელი საუკეთესო ღირებულებას გვთავაზობს. სხვადასხვა სამეცნიერო ბენჩმარკზე მისი შეფასებისას, გვინდა ხაზი გავუსვათ მის მუშაობას Video-MME-ზე, სადაც ის აღემატება ყველა არსებულ 2B მოდელს. ჩვენ შევძელით ვიდეო/გამოსახულების მუშაობის კარგი ბალანსის მიღწევა, მონაცემთა ნარევის შესწავლის წყალობით, რომელიც გამოქვეყნებულია ნაშრომში „აპოლო: ვიდეოს გაგების კვლევა დიდ მულტიმოდალურ მოდელებში“. ის იმდენად მეხსიერება-ეფექტურია, რომ მისი გაშვება უფასო Google Colab-შიც კი შეგიძლიათ. დღემდე არავის გაუბედავს ასეთი მცირე ვიდეო მოდელების გამოშვება. ჩვენს ახალ SmolVLM2-500M-Video-Instruct მოდელს აქვს ვიდეო შესაძლებლობები, რომლებიც ძალიან ახლოსაა SmolVLM 2.2B-თან, მაგრამ მისი ზომის მხოლოდ ნაწილია: ჩვენ ვიღებთ ვიდეოს გაგების იგივე შესაძლებლობებს პარამეტრების მეოთხედზე ნაკლები რაოდენობით 🤯. და შემდეგ არის ჩვენი პატარა ექსპერიმენტი, SmolVLM2-256M-Video-Instruct. იფიქრეთ მასზე, როგორც ჩვენს „რა იქნებოდა, თუ“ პროექტზე – რა იქნებოდა, თუ შეგვეძლო მცირე მოდელების საზღვრების კიდევ უფრო გაფართოება? IBM-ის მიერ ჩვენი ძირითადი SmolVLM-256M-Instruct-ით რამდენიმე კვირის წინ მიღწეული შედეგებიდან შთაგონებით, ჩვენ გვსურდა გვენახა, რამდენად შორს შეგვეძლო წავსულიყავით ვიდეოს გაგებაში. მიუხედავად იმისა, რომ ეს უფრო ექსპერიმენტული გამოცემაა, ვიმედოვნებთ, რომ ის შთააგონებს შემოქმედებით აპლიკაციებსა და სპეციალიზებულ „ფაინ-ტიუნინგის“ პროექტებს.
ჩვენი ხედვის დემონსტრირებისთვის მცირე ვიდეო მოდელებში, შევქმენით სამი პრაქტიკული აპლიკაცია, რომლებიც აჩვენებენ ამ მოდელების მრავალფეროვნებას. SmolVLM2 ხელმისაწვდომია Transformers-თან და MLX-თან გამოსაყენებლად თავიდანვე. ამ სექციაში შეგიძლიათ იპოვოთ სხვადასხვა დასკვნის (inference) ალტერნატივები და გაკვეთილები ვიდეოსა და მრავალი გამოსახულებისთვის. SmolVLM2 მოდელებთან დასკვნის გაშვების უმარტივესი გზაა კონვერსაციული API-ის მეშვეობით – ჩატის შაბლონის გამოყენება ავტომატურად ამზადებს ყველა შეყვანას. მოდელის ჩატვირთვა შეგიძლიათ შემდეგნაირად. ვიდეოების გატარება ჩატის შაბლონის მეშვეობით შეგიძლიათ {"type": "video", "path": {video_path}} მიწოდებით. სრული მაგალითი იხილეთ ქვემოთ. ვიდეოს გარდა, SmolVLM2 მხარს უჭერს მრავალგამოსახულებიან საუბრებს. შეგიძლიათ გამოიყენოთ იგივე API ჩატის შაბლონის მეშვეობით, თითოეული გამოსახულების მიწოდებით ფაილური სისტემის გზის, URL-ის ან PIL.Image ობიექტის გამოყენებით:
SmolVLM2-ის MLX-ით გასაშვებად Apple Silicon მოწყობილობებზე Python-ის გამოყენებით, შეგიძლიათ ისარგებლოთ შესანიშნავი mlx-vlm ბიბლიოთეკით. პირველ რიგში, თქვენ უნდა დააინსტალიროთ mlx-vlm ამ ფილიალიდან შემდეგი ბრძანების გამოყენებით: შემდეგ შეგიძლიათ გაუშვათ დასკვნა ერთ გამოსახულებაზე შემდეგი ერთსტრიქონიანი ბრძანებით, რომელიც იყენებს SmolVLM2-ის დაუკვანტიზებელ 500M ვერსიას: ჩვენ ასევე შევქმენით მარტივი სკრიპტი ვიდეოს გაგებისთვის. მისი გამოყენება შეგიძლიათ შემდეგნაირად: გაითვალისწინეთ, რომ სისტემური მოთხოვნა მნიშვნელოვანია მოდელის სასურველ ქცევაზე მოსახვევად. მისი გამოყენება შეგიძლიათ, მაგალითად, ყველა სცენისა და გადასვლის აღსაწერად, ან იმის ერთწინადადებიანი შეჯამებისთვის, თუ რა ხდება. Swift ენა ასევე მხარდაჭერილია mlx-swift-examples რეპოს მეშვეობით, რომელიც ჩვენ გამოვიყენეთ ჩვენი iPhone აპლიკაციის შესაქმნელად. სანამ ჩვენი მიმდინარე PR არ დასრულდება და არ გაერთიანდება, თქვენ უნდა დააკომპილიროთ პროექტი ამ "ფორკიდან" და შემდეგ შეგიძლიათ გამოიყენოთ llm-tool CLI თქვენს Mac-ზე შემდეგნაირად. გამოსახულების დასკვნისთვის: ვიდეო ანალიზიც მხარდაჭერილია, ასევე სისტემური მოთხოვნის მიწოდება. ჩვენ აღმოვაჩინეთ, რომ სისტემური მოთხოვნები განსაკუთრებით გამოსადეგია ვიდეოს გაგებისთვის, რათა მოდელი მიმართული იყოს დეტალების სასურველ დონეზე, რაც ჩვენ გვაინტერესებს. ეს არის ვიდეო დასკვნა.
თეგები:
#ტექნოლოგიები
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#ეფექტურობა
#mlx
#apple silicon
#smolvlm2
#ვიდეოს გაგება
#მცირე მოდელები
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი