SPHINX-ისა და LLaVa-NeXT-ის სტრატეგიის გათვალისწინებით, ჩვენ შესაძლებლობას ვაძლევთ მომხმარებელს, სურვილისამებრ დაყოს ქვესურათი 4 ნაწილად. Idefics2 წინასწარი წვრთნისთვის მომზადდა საჯაროდ ხელმისაწვდომი მონაცემთა შერეული ნაკრებების გამოყენებით, მათ შორის: გადაჯაჭვული ვებ-დოკუმენტები (Wikipedia, OBELICS), სურათი-აღწერის წყვილები (Public Multimodal Dataset, LAION-COCO), OCR მონაცემები (PDFA (en), IDL და Rendered-text) და სურათიდან კოდში გადამყვანი მონაცემები (WebSight). ინტერაქტიული ვიზუალიზაცია იძლევა OBELICS მონაცემთა ნაკრების შესწავლის საშუალებას. ფუნდამენტური მოდელების საზოგადოებაში მიღებული პრაქტიკის შესაბამისად, ჩვენ საბაზისო მოდელი დამატებით გავწვრთენით ამოცანებზე ორიენტირებულ მონაცემებზე. თუმცა, ეს მონაცემები ხშირად განსხვავებული ფორმატის და სხვადასხვა ადგილას გაფანტულია, რაც მათი შეგროვებას საზოგადოებისთვის ბარიერად აქცევს. ამ პრობლემის გადასაჭრელად, ჩვენ ვუშვებთ მულტიმოდალური ინსტრუქციების სახვითი წვრთნის მონაცემთა ნაკრებს, რომელზეც ვმუშაობდით: „The Cauldron“. ეს არის 50 ხელით შერჩეული მონაცემთა ნაკრების ღია კრებული, რომელიც მრავალმხრივი საუბრებისთვის არის ფორმატირებული. ჩვენ Idefics2 ინსტრუქციის სახვითი წვრთნა განვახორციელეთ „The Cauldron“-ისა და სხვადასხვა მხოლოდ ტექსტური ინსტრუქციის სახვითი წვრთნის მონაცემთა ნაკრებების გაერთიანებით. ყველა ეს გაუმჯობესება, უკეთეს წინასწარ გაწვრთნილ ბექბოუნებთან ერთად, Idefics1-თან შედარებით მნიშვნელოვან ნახტომს უზრუნველყოფს მოდელის მუშაობაში, მიუხედავად იმისა, რომ Idefics2 10-ჯერ მცირე ზომისაა. Idefics2 ხელმისაწვდომია Hugging Face Hub-ზე და მხარდაჭერილია transformers-ის უახლეს ვერსიაში. აი, კოდის ნიმუში მის გამოსაცდელად: ჩვენ ასევე გთავაზობთ სახვითი წვრთნის colab-ს, რომელიც გამოსადეგი იქნება ნებისმიერისთვის, ვისაც სურს Idefics2-ის გაუმჯობესება კონკრეტული გამოყენების შემთხვევებისთვის. თუ გსურთ უფრო ღრმად ჩაუღრმავდეთ, აქ მოცემულია Idefics2-ის ყველა რესურსის კრებული: მოდელი აგებულია ორ წინასწარ გაწვრთნილ მოდელზე: Mistral-7B-v0.1 და siglip-so400m-patch14-384. ორივე მათგანი გამოვიდა Apache-2.0 ლიცენზიით. ჩვენ ასევე ვუშვებთ Idefics2-ის წონებს Apache-2.0 ლიცენზიით. მადლობას ვუხდით Google Team-სა და Mistral AI-ს მათი მოდელების ღია კოდის AI საზოგადოებისთვის ხელმისაწვდომობისთვის! განსაკუთრებული მადლობა Chun Te Lee-ს barplot-ისთვის და Merve Noyan-ს ბლოგპოსტის განხილვისა და შემოთავაზებებისთვის. 🤗 მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის.