ხილვად-ენობრივი მოდელები (VLMs) დღის წესრიგშია. წინა ბლოგპოსტში (2024 წლის აპრილიდან), ბევრი ვისაუბრეთ VLMs-ზე. მნიშვნელოვანი ნაწილი დაეთმო LLaVA-ს, პირველ წარმატებულ და ადვილად რეპროდუცირებად ღია წყაროს ხილვად-ენობრივ მოდელს, ასევე რჩევებს, თუ როგორ აღმოაჩინოთ, შეაფასოთ და დახვეწოთ ღია მოდელები. მას შემდეგ ბევრი რამ შეიცვალა. მოდელები გახდნენ უფრო პატარა, მაგრამ უფრო მძლავრი. ჩვენ ვიხილეთ ახალი არქიტექტურებისა და შესაძლებლობების (მსჯელობა, აგენტურობა, გრძელი ვიდეოების გაგება და ა.შ.) აღმავლობა. პარალელურად, ჩამოყალიბდა სრულიად ახალი პარადიგმები, როგორიცაა მულტიმოდალური ინფორმაციის მოძიებით გაძლიერებული გენერაცია (RAG) და მულტიმოდალური აგენტები. ამ ბლოგპოსტში, ჩვენ გადავხედავთ გასულ წელს ხილვად-ენობრივი მოდელების ირგვლივ მომხდარ ყველა მოვლენას. თქვენ აღმოაჩენთ საკვანძო ცვლილებებს, განვითარებად ტენდენციებსა და აღსანიშნავ მიღწევებს. მკაცრად გირჩევთ, წაიკითხოთ პირველი ბლოგპოსტი, თუ გსურთ უკეთ გაეცნოთ, თუ როგორ მუშაობს ხილვად-ენობრივი მოდელები. ამ სექციაში განვიხილავთ VLMs-ის ახალ ტიპებს. ზოგიერთი მათგანი აბსოლუტურად ახალია, ზოგი კი წინა კვლევების გაუმჯობესებული ვერსიები. 'ნებისმიერი-ნებისმიერზე' (Any-to-any) მოდელები, როგორც სახელიდან ჩანს, არის მოდელები, რომლებსაც შეუძლიათ მიიღონ ნებისმიერი მოდალობა და გამოიტანონ ნებისმიერი მოდალობა (გამოსახულება, ტექსტი, აუდიო). ისინი ამას ახორციელებენ მოდალობების გასწორებით, სადაც ერთი მოდალობიდან მიღებული შეყვანა შეიძლება გადაითარგმნოს მეორეში (მაგ., სიტყვა „ძაღლი“ დაკავშირებული იქნება ძაღლის გამოსახულებასთან, ან სიტყვის წარმოთქმასთან). ამ მოდელებს აქვთ მრავალი ენკოდერი (თითოეული მოდალობისთვის თითო) და შემდეგ აერთიანებენ ემბედინგებს საერთო წარმომადგენლობითი სივრცის შესაქმნელად. დეკოდერები (მრავალი ან ერთი) იყენებენ საერთო ლატენტურ სივრცეს შეყვანად და ახდენენ დეკოდირებას სასურველ მოდალობაში. 'ნებისმიერი-ნებისმიერზე' მოდელების აგების ყველაზე ადრეული მცდელობა არის Meta-ს Chameleon, რომელსაც შეუძლია მიიღოს გამოსახულება და ტექსტი და გამოიტანოს გამოსახულება და ტექსტი. Meta-მ არ გამოუშვა ამ მოდელში გამოსახულების გენერაციის შესაძლებლობა, ამიტომ Alpha-VLLM-მა გამოუშვა Lumina-mGPT, რომელმაც Chameleon-ის ბაზაზე გამოსახულების გენერაცია ააგო. უახლესი და ყველაზე მძლავრი 'ნებისმიერი-ნებისმიერზე' მოდელი, Qwen 2.5 Omni, კარგი მაგალითია ასეთი მოდელის არქიტექტურის გასაგებად. Qwen2.5-Omni იყენებს ნოველურ "მოაზროვნე-მოლაპარაკე" (Thinker-Talker) არქიტექტურას, სადაც "მოაზროვნე" პასუხისმგებელია ტექსტის გენერაციაზე, ხოლო "მოლაპარაკე" აწარმოებს ბუნებრივ მეტყველების პასუხებს ნაკადის რეჟიმში. MiniCPM-o 2.6, 8 მილიარდი პარამეტრის მულტიმოდალური მოდელი, შეუძლია გაიგოს და შექმნას კონტენტი ხილვადობის, მეტყველებისა და ენის მოდალობებში. DeepSeek AI-ის მიერ წარმოდგენილი Janus-Pro-7B არის ერთიანი მულტიმოდალური მოდელი, რომელიც გამოირჩევა როგორც გაგებით, ასევე კონტენტის გენერაციით სხვადასხვა მოდალობებში. მას აქვს განცალკევებული ვიზუალური კოდირების არქიტექტურა, რომელიც აცალკევებს გაგებისა და გენერაციის პროცესებს. ვვარაუდობთ, რომ ასეთი მოდელების რაოდენობა მომავალ წლებში გაიზრდება. ცნობილი ინტუიციაა, რომ მულტიმოდალური სწავლა ერთადერთი გზაა, რითაც შეგვიძლია ღრმა წარმოდგენები უკეთ ვისწავლოთ. ჩვენ ამ კოლექციაში მოვამზადეთ რამდენიმე 'ნებისმიერი-ნებისმიერზე' მოდელი და დემო ვერსია. მსჯელობის მოდელები არის მოდელები, რომლებსაც შეუძლიათ რთული პრობლემების გადაჭრა. პირველად ისინი დიდ ენობრივ მოდელებში ვიხილეთ, ახლა კი ხილვად-ენობრივ მოდელებში. 2025 წლამდე არსებობდა მხოლოდ ერთი ღია წყაროს მულტიმოდალური მსჯელობის მოდელი, Qwen-ის QVQ-72B-preview. ეს იყო ექსპერიმენტული მოდელი, რომელიც Alibaba Qwen-ის გუნდმა შეიმუშავა და მას მრავალი გაფრთხილება მოჰყვა. წელს გამოჩნდა კიდევ ერთი მოთამაშე, Moonshot AI-ის გუნდის Kimi-VL-A3B-Thinking. ის შედგება MoonViT-ისგან (SigLIP-so-400M) როგორც გამოსახულების ენკოდერი და ექსპერტთა ნარევის (MoE) დეკოდერისგან 16 მილიარდი საერთო პარამეტრით და მხოლოდ 2.8 მილიარდი აქტიური პარამეტრით. ეს მოდელი წარმოადგენს Kimi-VL ბაზისური ხილვად-ენობრივი მოდელის ხანგრძლივი აზროვნების ჯაჭვით (chain-of-thought) დახვეწილ და შემდგომ განმტკიცებითი სწავლით გასწორებულ (aligned) ვერსიას. მოდელის გამოცდა შეგიძლიათ აქ. ავტორებმა ასევე გამოუშვეს ინსტრუქციებით დახვეწილი ვერსია სახელწოდებით Kimi-VL-A3B-Instruct. მოდელს შეუძლია მიიღოს გრძელი ვიდეოები, PDF ფაილები, ეკრანის ანაბეჭდები და სხვა. მას ასევე გააჩნია აგენტური შესაძლებლობები. საზოგადოება ინტელექტს პარამეტრების რაოდენობით, შემდეგ კი მაღალი ხარისხის სინთეზური მონაცემებით აფართოებდა. გარკვეული წერტილის შემდეგ, ბენჩმარკები გაჯერდა და მოდელების მასშტაბირებას კლებადი შემოსავალი მოჰყვა. საზოგადოება გადავიდა უფრო დიდი მოდელების შემცირებაზე სხვადასხვა მეთოდით, როგორიცაა დისტილაცია. ეს აზრიანია, რადგან ამცირებს გამოთვლით ხარჯებს, ამარტივებს განლაგებას და ხსნის გამოყენების შემთხვევებს, როგორიცაა ლოკალური შესრულება, რაც აუმჯობესებს მონაცემთა კონფიდენციალურობას. როდესაც ვსაუბრობთ მცირე ზომის ხილვად-ენობრივ მოდელებზე, ხშირად ვგულისხმობთ 2 მილიარდზე ნაკლები პარამეტრის მქონე მოდელებს, რომელთა გაშვებაც შესაძლებელია სამომხმარებლო GPU-ებზე. SmolVLM კარგი მაგალითია მცირე ზომის ხილვად-ენობრივი მოდელების ოჯახისთვის. დიდი მოდელების შემცირების ნაცვლად, ავტორებმა სცადეს მოდელების მორგება მცირე რაოდენობის პარამეტრებში, როგორიცაა 256M, 500M და 2.2B. მაგალითად, SmolVLM2-მა ამ ზომებში ვიდეოს გაგების პრობლემის გადაჭრა სცადა და 500M ოპტიმალურ არჩევანად მიიჩნია. Hugging Face-ში ჩვენ შევქმენით iPhone აპლიკაცია, HuggingSnap, რათა დაგვემტკიცებინა, რომ ამ ზომის მოდელებს შეუძლიათ ვიდეოს გაგება სამომხმარებლო მოწყობილობებზე. კიდევ ერთი თვალსაჩინო მოდელი არის Google DeepMind-ის gemma3-4b-it. ის არის...