წარმოგიდგენთ vdr-2b-multi-v1-ს (🤗), მრავალენოვან ჩაშენების მოდელს, რომელიც შექმნილია ვიზუალური დოკუმენტების მოსაძიებლად მრავალ ენასა და დომენში. ეს მოდელი შექმნილია დოკუმენტის გვერდის სქრინშოტების მკვრივ, ერთვექტორულ წარმოდგენებად დასაკოდირებლად, რაც ეფექტურად იძლევა საშუალებას მოძიებულ იქნეს ვიზუალურად მდიდარი მრავალენოვანი დოკუმენტები ყოველგვარი OCR-ის (ოპტიკური სიმბოლოების ამოცნობა), მონაცემთა ამოღების კონვეიერების, ან დანაწილების საჭიროების გარეშე. vdr-2b-multi-v1 მოდელი დაფუძნებულია MrLight/dse-qwen2-2b-mrl-v1-ზე და გაწვრთნილია მრავალენოვანი მოთხოვნა-გამოსახულების წყვილების ვრცელ, თვითშექმნილ მონაცემთა ბაზაზე. ეს მოდელი შეიქმნა LlamaIndex-თან თანამშრომლობით და წარმოადგენს mcdse-2b-v1-ის შემდეგ გაუმჯობესებულ ვერსიას. ჩვენი vdr-2b-multi-v1 აფართოებს და აუმჯობესებს მის საწვრთნელად გამოყენებულ სწავლების მეთოდებს, რაც გაცილებით უფრო მძლავრ და უკეთეს მოდელს ქმნის. **გაწვრთნილია** 🇮🇹 იტალიურ, 🇪🇸 ესპანურ, 🇬🇧 ინგლისურ, 🇫🇷 ფრანგულ და 🇩🇪 გერმანულ ენებზე: ერთობლივად ისინი ქმნიან ახალ, დიდ, ღია წყაროს მრავალენოვან საწვრთნელ მონაცემთა ბაზას, რომელიც 500 ათას მაღალი ხარისხის ნიმუშს მოიცავს. **დაბალი VRAM და სწრაფი ინფერენცია:** სინთეზურ ვიზუალური დოკუმენტების მოძიების (ViDoRe) ბენჩმარკებზე, ჩვენი მხოლოდ ინგლისურენოვანი მოდელი 768 გამოსახულების პაჩით უკეთეს შედეგებს აჩვენებს, ვიდრე საბაზისო მოდელი 2560 გამოსახულების პაჩით. ეს იწვევს 3-ჯერ უფრო სწრაფ ინფერენციას და VRAM-ის გაცილებით დაბალ მოხმარებას. **ჯვარედინი ენების მოძიება:** არსებითად უკეთესია რეალურ სცენარებში. მაგალითად, შეგიძლიათ მოძებნოთ გერმანული დოკუმენტები იტალიური მოთხოვნებით. **მატრიოშკას წარმოდგენის სწავლა:** შეგიძლიათ ვექტორების ზომა 3-ჯერ შეამციროთ და მაინც შეინარჩუნოთ ჩაშენების ხარისხის 98%. ეს საშუალებას იძლევა მნიშვნელოვნად დააჩქაროს მოძიების სიჩქარე და შეამციროს შენახვის ხარჯები. 🎲 გამოსცადეთ vdr-2b-multi-v1 ახლავე, ის ხელმისაწვდომია Hugging Face Space-ზე! ჩაშენებების გენერირება vdr-2b-multi-v1-ით უფრო მარტივია, ვიდრე ოდესმე, SentenceTransformers-ისა და LlamaIndex-ის პირდაპირი ინტეგრაციების წყალობით. დასაწყებად მხოლოდ რამდენიმე ხაზი კოდია საჭირო: ვიზუალური დოკუმენტების მოსაძებნად კარგი ერთვექტორული მოდელების გაწვრთნა მაღალი ხარისხის მონაცემებს მოითხოვს, მაგრამ არსებული მულტიმოდალური, მზა მონაცემთა ნაკრებები ძალიან მწირია და არ არის მრავალენოვანი. ამიტომ, ჩვენ დიდი დრო დავხარჯეთ მის ნულიდან აშენებაზე. ნედლი მონაცემთა ბაზა შედგება 500 ათასი მრავალენოვანი მოთხოვნა-გამოსახულების ნიმუშისგან, რომლებიც შეგროვდა და გენერირდა ნულიდან საჯარო ინტერნეტ PDF-ების გამოყენებით. თითოეულ გამოსახულებასთან დაკავშირებული მოთხოვნები სინთეზურია და გენერირებულია VLM-ების გამოყენებით. შედარებისთვის, ჩვენი მონაცემთა ბაზა 10-ჯერ მეტ ნიმუშს შეიცავს, ვიდრე მულტიმოდალური ვიზუალური დოკუმენტების მოძიებისთვის არსებული ყველაზე დიდი ღია წყაროს სინთეზური მონაცემთა ბაზა, კერძოდ, ColPali-ის საწვრთნელი მონაცემთა ბაზისთვის შექმნილი ამოღებული დოკუმენტები. თითოეული ენისთვის, ჩვენ ვქმნით საძიებო მოთხოვნების გრძელ სიას, რომელიც მრავალ განსხვავებულ თემას მოიცავს, რის შემდეგაც ისინი გამოიყენება PDF-ების მოსაძებნად. ჩვენ ვიყენებთ საძიებო სისტემის ენის ფილტრაციის შესაძლებლობებს, რათა ამოვიღოთ მხოლოდ მითითებულ ენაზე არსებული დოკუმენტები. ეს „თემის მიხედვით ძიების“ ტექნიკა უზრუნველყოფს, რომ მოდელმა მრავალი მრავალფეროვანი თემა და დომენი ნახა და რომ ის კარგად მუშაობს რეალურ ცხოვრებაში. ამოღების პროცესმა დაახლოებით 50 ათასი მრავალენოვანი დოკუმენტი წარმოშვა. წინა mcdse-2b-v1 მოდელში გამოყენებული მეთოდისგან განსხვავებით, გვერდები შემთხვევითად არ იყო ამოღებული. სამაგიეროდ, ყოველი PDF-ის თითოეული გვერდი გაანალიზდა დოკუმენტის განლაგების ანალიზის მოდელის მეშვეობით, რათა დადგინდა, შეიცავდა თუ არა გვერდი უფრო მეტ ტექსტურ ან ვიზუალურ ელემენტს. შედეგი არის რიცხვი, რომელიც გვერდს კლასიფიცირებს როგორც მხოლოდ ტექსტურს, მხოლოდ ვიზუალურს ან შერეულს. ეს მარკირების ნაბიჯი შემდეგ გამოყენებულ იქნა დაახლოებით 100 ათასი გვერდის შესარჩევად, რაც უზრუნველყოფდა მათ თანაბარ განაწილებას გვერდის ტიპის მიხედვით. მოთხოვნები გენერირებულ იქნა gemini-1.5-pro-სა და Qwen2-VL-72B-ის გამოყენებით. მათ დაევალათ შეექმნათ კონკრეტული და ზოგადი შეკითხვა. მოდელის გასაწვრთნელად მხოლოდ კონკრეტული შეკითხვა გამოიყენება, მაგრამ LLM-ის იძულება განასხვავოს ეს ორი, ხშირად იწვევდა უფრო ძლიერ კონკრეტულ შეკითხვებს ინფორმაციის მოძიების ტრენინგისთვის. გენერაციის შემდეგ, დამატებითი გაწმენდის ნაბიჯი უზრუნველყოფს, რომ შეკითხვები საკმარისად კარგია ტრენინგისთვის. ეს მოიცავს: ეს გაწმენდის ეტაპი უზრუნველყოფს, რომ მოთხოვნები სინტაქსურად სწორია და იცავს მკაცრ მითითებებს. თუმცა, ეს მაინც არ უზრუნველყოფს, რომ მოთხოვნები საკმარისად კარგია ინფორმაციის მოძიებისთვის. ცუდი შეკითხვების გასაფილტრად, ჩვენ ჩავაშენეთ და დავაინდექსირეთ თითოეული ფართო მოთხოვნა voyage-3 ჩაშენების მოდელის გამოყენებით. თითოეული კონკრეტული შეკითხვისთვის, ჩვენ ვეძებთ ინდექსში. მოთხოვნა აღინიშნება, როგორც „კარგი“, თუ მასთან დაკავშირებული ფართო შეკითხვა გამოჩნდება ტოპ 100 შედეგში. ეს მეთოდი შლის დაბალი ენტროპიის, დუბლირებულ ან ძალიან მსგავს შეკითხვებს. საშუალოდ, მოთხოვნების 40% ამოღებულ იქნა თითოეული ენის მონაცემთა ბაზიდან. მძიმე ნეგატივები შემდეგ მოძიებულ იქნა voyage-3-ის გამოყენებით მხოლოდ კონკრეტულ შეკითხვებზე, ფიქსირებული ზღვრით 0.75. ექსპერიმენტები ასევე ჩატარდა დადებითი ცნობიერების ნეგატიური მოძიების გამოყენებით, როგორც აღწერილია nvidia/NV-Retriever-v1-ში, მაგრამ ამ მონაცემთა ბაზაზე ის, როგორც ჩანს, ძალიან მარტივ/შორეულ ნეგატივებს წარმოქმნის. საწვრთნელი მონაცემთა ბაზა (vdr-multilingual-train 🤗) ახლა ღია წყაროს მქონეა და პირდაპირ ხელმისაწვდომია Hugging Face-ზე. საწვრთნელი მონაცემთა ბაზა შედგება 496 167 PDF გვერდისგან, საიდანაც მხოლოდ 280 679 ასოცირდება გაფილტრულ მოთხოვნებთან (ზემოთ აღწერილი მეთოდის გამოყენებით). გამოსახულებები, რომლებიც მოთხოვნის გარეშე რჩება, კვლავ გამოიყენება როგორც რთული