TII წარმოგიდგენთ მოდელების ახალ თაობას, Falcon 2-ს, რომელიც მიზნად ისახავს ღია კოდის საზოგადოებისთვის უფრო მცირე ზომის მოდელების სერიის მიწოდებას გაუმჯობესებული შესრულებით და მრავალმოდალური მხარდაჭერით. ჩვენი მიზანია შევამციროთ გამოთვლის ხარჯები და ხელი შევუწყოთ უფრო მეტი შემდგომი აპლიკაციის განვითარებას გაუმჯობესებული გამოყენებადობით. Falcon მოდელების პირველმა თაობამ, რომელიც მოიცავდა Falcon-40B-სა და Falcon-180B-ს, მნიშვნელოვანი წვლილი შეიტანა ღია კოდის საზოგადოებაში, ხელი შეუწყო გაფართოებული LLM-ების გამოშვებას თავისუფალი ლიცენზიებით. Falcon მოდელების წინა თაობის შესახებ უფრო დეტალური ინფორმაცია შეგიძლიათ იხილოთ RefinedWeb, Penedo et al., 2023 და The Falcon Series of Open Language Models, Almazrouei et al., 2023 ნაშრომებში, ასევე Falcon და Falcon-180B ბლოგის პოსტებში. მოდელების მეორე თაობა ფოკუსირებულია გაზრდილ გამოყენებადობასა და ინტეგრირებადობაზე, რაც ქმნის მრავალმოდალურ ეკოსისტემას. ამ მოგზაურობას ვიწყებთ არა მხოლოდ ძირითადი 11B LLM-ის, არამედ 11B VLM მოდელის გამოშვებითაც, რომელიც მოიცავს გამოსახულების გაგების შესაძლებლობებს. ვიზუალური-ენობრივი მოდელი, ანუ VLM, მომხმარებლებს საშუალებას მისცემს ტექსტის გამოყენებით ისაუბრონ ვიზუალურ კონტენტზე. ჩვენი წინა ნამუშევრების მსგავსად, მოდელები მხარდაჭერას ძირითადად ინგლისურ ენაზე გვთავაზობენ, თუმცა კარგ შესაძლებლობებს ფლობენ ათ სხვა ენაზეც, მათ შორის ესპანურ, ფრანგულ და გერმანულ ენებზე. Falcon2-11B გაწვრთნილია RefinedWeb-ის 5,000 GT-ზე მეტ (მილიარდი ტოკენი) მონაცემთა ბაზაზე, რომელიც არის მაღალი ხარისხის, გაფილტრული და დედუპლირებული ვებ მონაცემთა ნაკრები, გაუმჯობესებული შერჩეული კორპუსებით. მას მოჰყვა ოთხეტაპიანი სწავლების სტრატეგია. პირველი სამი ეტაპი ფოკუსირებული იყო კონტექსტის სიგრძის გაზრდაზე, 2048-დან 4096-მდე და საბოლოოდ 8192 ტოკენამდე. ბოლო ეტაპის მიზანი იყო შესრულების შემდგომი გაუმჯობესება მხოლოდ მაღალი ხარისხის მონაცემების გამოყენებით. მთლიანობაში, მონაცემთა წყაროები მოიცავდა RefinedWeb-English-ს, RefinedWeb-Europe-ს (cs, de, es, fr, it, nl, pl, pt, ro, sv), მაღალი ხარისხის ტექნიკურ მონაცემებს, კოდის მონაცემებს და საუბრის მონაცემებს, რომლებიც მოპოვებულია საჯარო წყაროებიდან. სწავლების ეტაპები შემდეგნაირად მიმდინარეობდა: მონაცემები ტოკენიზებული იყო Falcon2-11B ტოკენაიზერით, იგივე ტოკენაიზერით, რაც წინა Falcon მოდელებისთვის. შემდეგი ცხრილი აჯამებს მოდელის არქიტექტურის ზოგიერთ მნიშვნელოვან დეტალს: Falcon2-11B გაწვრთნილია 1024 A100 40GB GPU-ზე სწავლების უმეტესი ნაწილისთვის, 3D პარალელიზმის სტრატეგიის გამოყენებით (TP=8, PP=1, DP=128), ZeRO-სა და Flash-Attention 2-თან ერთად. შესრულება Open LLM Leaderboard ამოცანებზე: Hugging Face Leaderboard-ის გუნდმა წარმოადგინა ჩვენი მოდელის ოფიციალური შეფასება Open LLM Leaderboard-ის ამოცანებზე. მოდელი უკეთესად მუშაობს, ვიდრე ისეთი მოდელები, როგორიცაა Llama3-8B (სამჯერ მეტ მონაცემზე გაწვრთნილი) და Mistral-7B, და თანაბარია Gemma-7b-თან. Zero-shot შესრულება: შეფასების შედეგები აჩვენებს, რომ Falcon2-11B მსგავს შესრულებას აჩვენებს Falcon-40B-თან შედარებით, ოთხჯერ მცირე მოდელის ზომით! Multilingual LLM Leaderboard-ის გამოყენებით, ჩვენ ვადარებთ Falcon2-11B მოდელს Llama-7B-სა და Bloom-7B-ს. საცნობარო მიზნებისთვის, ჩვენ ასევე შევიტანეთ Falcon-40B (რომელიც მხარს უჭერს იმავე ენებს), Falcon-7B (რომელიც მხარს უჭერს ფრანგულს) და Mistral-7B. ორიგინალური Falcon მოდელების სულისკვეთებით, Falcon2-11B გაწვრთნილია არა მხოლოდ ინგლისურ მონაცემებზე, არამედ ათ სხვა ენაზეც. ჩვენი მრავალენოვანი შეფასების შედეგები აჩვენებს, რომ მოდელს გააჩნია კარგი შესაძლებლობები Multilingual LLM Leaderboard-ზე წარმოდგენილ ექვს ენაზე (de, es, fr, it, nl, ro) და რეალურად აჩვენებს უფრო მაღალ შესრულებას, ვიდრე Falcon-40B და რამდენიმე სხვა მრავალენოვანი მოდელი ყველა ხსენებულ ენაზე. მალე გამოვაქვეყნებთ მრავალენოვანი შესაძლებლობების უფრო ვრცელ შეფასების შედეგებს Falcon2-11B მოდელის ბარათში! ჩვენ შევამოწმეთ მოდელის შესრულება კოდის გენერირებაში BigCode Leaderboard-ის მიხედვით HumanEval ბენჩმარკზე Python ენისთვის, მივიღეთ pass@1 29.59%. და შემდეგ, თქვენ გაუშვებდით ტექსტის გენერაციას შემდეგი კოდის გამოყენებით: Falcon2-11B VLM არის ვიზუალური-ენობრივი მოდელი (VLM), რომელიც აგებულია LLM-ის თავზე, დამატებით ამუშავებს გამოსახულების შეყვანას და შეუძლია უპასუხოს კითხვებს გამოსახულებების შესახებ. ამის მისაღწევად, ჩვენ ვაინტეგრირებთ წინასწარ გაწვრთნილ CLIP ViT-L/14 ვიზუალურ ენკოდერს ჩვენს Falcon2-11B ჩატ-ფინეტირებულ მოდელთან და ვწვრთნით გამოსახულება-ტექსტის მონაცემებით. VLM-ის მიერ გამოსახულებებში მცირე ობიექტების წვრილმანი დეტალების აღქმის გასაუმჯობესებლად, ჩვენ ვიყენებთ დინამიური კოდირების მექანიზმს მაღალი რეზოლუციით გამოსახულების შეყვანისთვის, LLaVA-Next-ის მსგავსად. სწავლება ხორციელდება ორ ეტაპად: წინასწარი სწავლება (pretraining) და დამატებითი წვრთნა (finetuning). ორივე ეტაპზე, ვიზუალური ენკოდერის წონები გაყინულია. წინასწარი სწავლების ეტაპზე, LLM გაყინულია და მხოლოდ მრავალმოდალური პროჟექტორი წვრთნება 558K გამოსახულება-აღწერის წყვილზე. ეს საშუალებას აძლევს მრავალმოდალურ პროჟექტორს ისწავლოს ვიზუალურიდან ტექსტური ჩაშენების სივრცეში დამაკავშირებელი რუკა. დამატებითი წვრთნის დროს, როგორც პროჟექტორი, ასევე LLM-ის წონები წვრთნება 1.2M გამოსახულება-ტექსტური ინსტრუქციის მონაცემთა კორპუსზე საჯარო მონაცემთა ნაკრებებიდან, რომელიც ასევე მოიცავს მრავალრაუნდიან საუბრებს. Falcon 2 მოდელები ხელმისაწვდომია TII Falcon 2 ლიცენზიის ქვეშ, რომელიც არის შემამსუბუქებელი Apache 2.0-ზე დაფუძნებული პროგრამული ლიცენზია, მოიცავს მისაღები გამოყენების პოლიტიკას, რომელიც ხელს უწყობს AI-ის პასუხისმგებლიან გამოყენებას. ეს ლიცენზია