ხედვა-ენობრივი მოდელების ევოლუცია: სიახლეები, ტენდენციები და მომავალი
ხედვა-ენობრივი მოდელები (VLMs) დღესდღეობით ერთ-ერთი ყველაზე განხილვადი თემაა. 2024 წლის აპრილის ბლოგ პოსტში ვრცლად ვისაუბრეთ VLMs-ზე, მათ შორის LLaVA-ზე, პირველ წარმატებულ ღია წყაროს ხედვა-ენობრივ მოდელზე. მას შემდეგ მრავალი რამ შეიცვალა: მოდელები უფრო მცირე, მაგრამ ძლიერი გახდა, გაჩნდა ახალი არქიტექტურები და შესაძლებლობები (არგუმენტაცია, მოქმედება, გრძელი ვიდეოების გაგება). პარალელურად, განვითარდა ახალი პარადიგმები, როგორიცაა მულტიმოდალური ინფორმაციის მოძიებით გაძლიერებული გენერაცია (RAG) და მუ
"ნებისმიერი-ნებისმიერთან" (any-to-any) მოდელები, როგორც სახელიდან ჩანს, არის მოდელები, რომლებსაც შეუძლიათ ნებისმიერი მოდალობის (გამოსახულება, ტექსტი, აუდიო) მიღება და ნებისმიერი მოდალობის გამომუშავება. ისინი ამას ახერხებენ მოდალობების გასწორებით, სადაც ერთი მოდალობიდან მიღებული ინფორმაცია შეიძლება გადაითარგმნოს მეორეში (მაგალითად, სიტყვა „ძაღლი“ დაუკავშირდება ძაღლის გამოსახულებას, ან სიტყვის წარმოთქმას). ამ მოდელებს აქვთ მრავალი ენკოდერი (თითო თითოეული მოდალობისთვის) და შემდეგ აერთიანებენ ემბედინგებს საერთო წარმომადგენლობითი სივრცის შესაქმნელად. დეკოდერები (მრავალი ან ერთი) იყენებენ ამ საერთო ლატენტურ სივრცეს, როგორც შეყვანას და ახდენენ დეკოდირებას არჩეულ მოდალობაში.
"ნებისმიერი-ნებისმიერთან" მოდელების შექმნის ყველაზე ადრეული მცდელობა იყო Meta-ს Chameleon, რომელსაც შეუძლია მიიღოს გამოსახულება და ტექსტი, და გამოიმუშაოს გამოსახულება და ტექსტი. Meta-მ არ გამოუშვა ამ მოდელის გამოსახულების გენერირების შესაძლებლობა, ამიტომ Alpha-VLLM-მა გამოუშვა Lumina-mGPT, რომელმაც გამოსახულების გენერაცია Chameleon-ის ბაზაზე ააგო. უახლესი და ყველაზე ქმედითი "ნებისმიერი-ნებისმიერთან" მოდელი, Qwen 2.5 Omni (იხილეთ ქვემოთ მოცემული სურათი), კარგი მაგალითია ასეთი მოდელის არქიტექტურის გასაგებად.
Qwen2.5-Omni იყენებს ნოვატორულ „მოაზროვნე-მოლაპარაკე“ (Thinker-Talker) არქიტექტურას, სადაც „მოაზროვნე“ პასუხისმგებელია ტექსტის გენერაციაზე, ხოლო „მოლაპარაკე“ აწარმოებს ბუნებრივ მეტყველების პასუხებს სტრიმინგის რეჟიმში. MiniCPM-o 2.6, 8 მილიარდი პარამეტრის მულტიმოდალური მოდელი, შეუძლია გაიგოს და შექმნას კონტენტი მხედველობის, მეტყველებისა და ენის მოდალობებში. DeepSeek AI-ის მიერ წარდგენილი Janus-Pro-7B, არის ერთიანი მულტიმოდალური მოდელი, რომელიც ბრწყინვალედ ასრულებს კონტენტის გაგებასა და გენერირებას მოდალობებში. მას აქვს გამოყოფილი ვიზუალური ენკოდირების არქიტექტურა, რომელიც აცალკევებს გაგებისა და გენერაციის პროცესებს.
ვარაუდობენ, რომ მსგავსი მოდელების რაოდენობა მომავალ წლებში გაიზრდება. ცნობილია, რომ მულტიმოდალური სწავლა ერთადერთი გზაა ღრმა წარმომადგენლობების უკეთ შესასწავლად. ჩვენ შევარჩიეთ რამდენიმე „ნებისმიერი-ნებისმიერთან“ მოდელი და დემო ამ კოლექციაში.
არგუმენტაციის მოდელები არის მოდელები, რომლებსაც შეუძლიათ რთული პრობლემების გადაჭრა. პირველად ისინი დიდ ენობრივ მოდელებში ვიხილეთ, ახლა კი ხედვა-ენობრივ მოდელებში. 2025 წლამდე არსებობდა მხოლოდ ერთი ღია წყაროს მულტიმოდალური არგუმენტაციის მოდელი, Qwen-ის QVQ-72B-preview. ეს იყო ექსპერიმენტული მოდელი, რომელიც Alibaba Qwen-ის გუნდმა შეიმუშავა და მას თან ახლდა მრავალი გაფრთხილება. წელს გამოჩნდა კიდევ ერთი მოთამაშე, Moonshot AI გუნდის Kimi-VL-A3B-Thinking. იგი შედგება MoonViT-ისგან (SigLIP-so-400M) როგორც გამოსახულების ენკოდერისგან და „ექსპერტთა ნაზავის“ (MoE) დეკოდერისგან, რომელსაც აქვს 16 მილიარდი საერთო პარამეტრი და მხოლოდ 2.8 მილიარდი აქტიური პარამეტრი. ეს მოდელი არის Kimi-VL ბაზის ხედვა-ენობრივი მოდელის გრძელი „აზროვნების ჯაჭვით“ (chain-of-thought) დახვეწილი და შემდგომ გასწორებული (განმტკიცებითი სწავლება) ვერსია. მოდელის გამოცდა შეგიძლიათ აქ. ავტორებმა ასევე გამოუშვეს ინსტრუქციებით დახვეწილი ვერსია, სახელწოდებით Kimi-VL-A3B-Instruct.
მოდელს შეუძლია მიიღოს გრძელი ვიდეოები, PDF ფაილები, ეკრანის ანაბეჭდები და სხვა. მას ასევე გააჩნია აგენტური შესაძლებლობები.
საზოგადოება ინტელექტის მასშტაბირებას ახდენდა პარამეტრების რაოდენობით, შემდეგ კი მაღალი ხარისხის სინთეზური მონაცემებით. გარკვეული წერტილის შემდეგ, ბენჩმარკები გაჯერდა და მოდელების მასშტაბირებას შემცირებული ანაზღაურება ჰქონდა. საზოგადოებამ დაიწყო დიდი მოდელების შემცირება სხვადასხვა მეთოდებით, მაგალითად, დისტილაციით. ეს აზრიანია, რადგან ამცირებს გამოთვლით ხარჯებს, ამარტივებს დანერგვას და ხსნის გამოყენების შემთხვევებს, როგორიცაა ლოკალური შესრულება, მონაცემთა კონფიდენციალურობის გაზრდა.
როდესაც ვამბობთ მცირე ხედვა-ენობრივ მოდელებს, ხშირად ვგულისხმობთ მოდელებს 2 მილიარდზე ნაკლები პარამეტრით, რომელთა გაშვებაც შესაძლებელია სამომხმარებლო GPU-ებზე. SmolVLM არის კარგი მაგალითი მცირე ხედვა-ენობრივი მოდელების ოჯახისთვის. დიდი მოდელების შემცირების ნაცვლად, ავტორებმა გადაწყვიტეს მოდელების მორგება მცირე რაოდენობის პარამეტრებში, როგორიცაა 256 მილიონი, 500 მილიონი და 2.2 მილიარდი. მაგალითად, SmolVLM2-მა ამ ზომებში ვიდეოს გაგების პრობლემის გადაჭრა სცადა და 500 მილიონი ოპტიმალურ კომპრომისად მიიჩნია. Hugging Face-ში ჩვენ შევქმენით iPhone აპლიკაცია, HuggingSnap, რათა დაგვემტკიცებინა, რომ ამ ზომის მოდელებს შეუძლიათ ვიდეოს გაგება სამომხმარებლო მოწყობილობებზე.
კიდევ ერთი გამორჩეული მოდელია Google DeepMind-ის gemma3-4b-it. ის არის პარ
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#მულტიმოდალური ai
#llava
#qwen
#ხედვა-ენობრივი მოდელები
#any-to-any მოდელები
#არგუმენტაციის მოდელები
#მცირე vlms
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი