დღეს სიამაყით წარმოგიდგენთ Falcon-H1 სერიას – ღია კოდის ექვს მოდელს, რომელთა პარამეტრების რაოდენობა 0.5 მილიარდიდან 34 მილიარდამდე მერყეობს. თითოეული მოდელი ხელმისაწვდომია როგორც საბაზო, ისე ინსტრუქციებზე მორგებულ ვარიანტებში. ამ მოდელების გულში დგას ჰიბრიდული არქიტექტურა, რომელიც აერთიანებს კლასიკური ტრანსფორმერზე დაფუძნებული ყურადღების მექანიზმისა და მდგომარეობის სივრცის მოდელის (SSM) ძლიერ მხარეებს, ეს უკანასკნელი ცნობილია თავისი შეუდარებელი გრძელი კონტექსტის მეხსიერებითა და გამოთვლითი ეფექტურობით. ეს არქიტექტურული ინოვაცია კიდევ უფრო გაუმჯობესებულია სწავლების დინამიკისა და მონაცემთა გამოყენების ფუნდამენტური მიღწევებით, რაც Falcon-H1 მოდელებს საშუალებას აძლევს, მიაღწიონ შეუდარებელ წარმადობას, რომელიც კონკურენციას უწევს წამყვან ტრანსფორმერზე დაფუძნებულ მოდელებს ყველა ზომის კატეგორიაში. ამ გამოცემაში წარმოდგენილია ექვსი ღია წონის მოდელი: 0.5B, 1.5B, 1.5B-Deep, 3B, 7B და 34B, მათ ინსტრუქციულ ვერსიებთან ერთად. ჩვენი ყველა ღია კოდის მოდელი გამოცემულია შემწყნარებლური ლიცენზიით, რომელიც ეფუძნება Apache 2.0-ს. **ჰიბრიდული არქიტექტურა (ყურადღება + SSM):** ჩვენს ჰიბრიდულ მიქსერულ ბლოკში პარალელურად ვაერთიანებთ ყურადღების (attention) და Mamba-2 თავაკებს. მნიშვნელოვანია, რომ ყურადღების და Mamba თავაკების რაოდენობა შეიძლება დამოუკიდებლად დარეგულირდეს, რაც ოპტიმალური ყურადღების/SSM თანაფარდობის მიღწევის საშუალებას იძლევა. ეს ჰიბრიდული დიზაინი უზრუნველყოფს უფრო სწრაფ ინფერენციას, მეხსიერების ნაკლებ მოხმარებას და ძლიერ განზოგადებას სხვადასხვა ამოცანებში. **მოდელების ზომების ფართო დიაპაზონი:** ხელმისაწვდომია ექვსი მასშტაბით — 0.5B, 1.5B, 1.5B-deep, 3B, 7B და 34B — როგორც საბაზო, ისე ინსტრუქციებზე მორგებული ვარიანტებით, რაც მათ შესაფერისს ხდის ყველაფრისთვის, კიდის მოწყობილობებიდან დაწყებული, მსხვილმასშტაბიანი განლაგებებით დამთავრებული. **მრავალენოვანი დიზაინი:** მშობლიურად მხარს უჭერს 18 ენას, მათ შორის არაბულს (ar), ჩეხურს (cs), გერმანულს (de), ინგლისურს (en), ესპანურს (es), ფრანგულს (fr), ჰინდის (hi), იტალიურს (it), იაპონურს (ja), კორეულს (ko), ჰოლანდიურს (nl), პოლონურს (pl), პორტუგალიურს (pt), რუმინულს (ro), რუსულს (ru), შვედურს (sv), ურდუს (ur) და ჩინურს (zh) — და აქვს მასშტაბურობის პოტენციალი 100-ზე მეტ ენამდე, რაც განპირობებულია ჩვენი მრავალენოვანი ტოკენიზატორით, რომელიც გაწვრთნილია მრავალფეროვან ენობრივ მონაცემთა ნაკრებებზე. **კომპაქტური მოდელები, მაღალი წარმადობა:** Falcon-H1-0.5B უზრუნველყოფს 2024 წლის ტიპური 7B მოდელების ტოლფას წარმადობას, ხოლო Falcon-H1-1.5B-Deep კონკურენციას უწევს ბევრ მიმდინარე წამყვან 7B–10B მოდელს. თითოეული Falcon-H1 მოდელი შექმნილია იმისათვის, რომ შეესაბამებოდეს ან გადააჭარბოს მის ზომაზე მინიმუმ ორჯერ დიდ მოდელების წარმადობას, რაც მათ იდეალურს ხდის დაბალი რესურსების და კიდის მოწყობილობებზე განლაგებისთვის, შესაძლებლობების კომპრომისის გარეშე. **256K კონტექსტის მხარდაჭერა:** Falcon-H1 მოდელები მხარს უჭერენ 256K კონტექსტის სიგრძემდე, რაც საშუალებას იძლევა მათი გამოყენება გრძელი დოკუმენტების დამუშავებაში, მრავალმხრივ დიალოგებსა და გრძელვადიან მსჯელობაში. **გამორჩეული STEM შესაძლებლობები:** Falcon-H1 მოდელები აჩვენებენ ძლიერ წარმადობას მათემატიკისა და მეცნიერების სფეროებში, რაც განპირობებულია სწავლების დროს მაღალი ხარისხის STEM მონაცემებზე ფოკუსირებით. **მყარი სწავლების სტრატეგია:** იყენებს მაღალეფექტურ მონაცემთა სტრატეგიას და მორგებულ მაქსიმალური განახლების პარამეტრიზაციას (μP), რათა უზრუნველყოს სწავლების შეუფერხებელი და მასშტაბირებადი პროცესი მოდელების ყველა ზომისთვის. Falcon-H1 სერიის შემუშავებისას, ჩვენ გადავწყვიტეთ, ფუნდამენტურად გადაგვეაზრებინა სწავლების მიდგომა. მიუხედავად იმისა, რომ LLM-ის განვითარების სფეროში მრავალი დადგენილი პრაქტიკაა, რომლებიც საიმედოდ ქმნის ძლიერ მოდელებს, ეს კონვენციები ძირითადად კლასიკურ ტრანსფორმერულ არქიტექტურებზე იყო ვალიდირებული. სუფთა ყურადღების მექანიზმებიდან ჰიბრიდულ ყურადღება-SSM დიზაინზე გადასვლა წარმოადგენს მნიშვნელოვან არქიტექტურულ ცვლილებას, რის გამოც გაურკვეველი იყო, დარჩებოდა თუ არა ეს სტანდარტული პრაქტიკები ოპტიმალური. ამ გაურკვევლობის გათვალისწინებით, ჩვენ ჩავატარეთ ფართო ექსპერიმენტული ფაზა, სისტემატურად გადავხედეთ მოდელის დიზაინისა და სწავლების მეთოდოლოგიის თითქმის ყველა ასპექტს საბოლოო გაშვებამდე. მიუხედავად იმისა, რომ სრულ დეტალებს ჩვენს მომავალ ტექნიკურ ანგარიშში წარმოვადგენთ, გვინდა გაგიზიაროთ ძირითადი შეხედულებები, რომლებმაც ჩამოაყალიბა Falcon-H1 მოდელები. ჰიბრიდული ყურადღება-SSM მოდელებს აქვთ პარამეტრების უფრო დიდი კონფიგურაციული სივრცე, რომლებიც განსაზღვრავენ მოდელის არქიტექტურას. ჩვენი მიზანი იყო თითოეული ამ კონფიგურაციის პარამეტრის გამოკვლევა, რათა შეგვემოწმებინა მისი გავლენა მოდელის წარმადობასა და ეფექტურობაზე. შედეგად, ჩვენ გამოვავლინეთ მოდელის კონფიგურაციის სივრცის ის რეგიონები, სადაც გაუმჯობესებული წარმადობა მიიღწევა ეფექტურობის მცირე დანახარჯით. ჰიბრიდული მოდელის კონფიგურაციის სივრცე შეიძლება უხეშად დაიყოს შემდეგ 4 ბლოკად: ენობრივი მოდელების შესაძლებლობები, როგორც ცნობილია, ძირითადად სწავლების მონაცემებიდან მოდის, და ეს Falcon-H1 სერიისთვისაც ჭეშმარიტია. მოდელისთვის მომზადებული უმი მონაცემების გარდა, გადამწყვეტია, თუ როგორ და როდის არის ნაჩვენები ეს მონაცემები სწავლების დროს. მონაცემთა ერთ-ერთი ასეთი სტრატეგია არის ე.წ. კურიკულუმის სწავლება (curriculum learning), სადაც უფრო მარტივი მონაცემები ნაჩვენებია სწავლების დასაწყისში, ხოლო უფრო მოწინავე მსჯელობის მომთხოვნი ნიმუშები ბოლოსთვის არის დარჩენილი. გასაკვირია, რომ ჩვენთვის სრულიად საპირისპირო სტრატეგიამ იმუშავა საუკეთესოდ. ყველაზე რთული მონაცემების, მოწინავე მათემატიკური ამოცანის ან გრძელი კონტექსტის ნიმუშის, სწავლების დასაწყისიდანვე მიწოდება, როგორც ჩანს, მოდელს მეტ დროს აძლევს, რომ ისწავლოს ის მახასიათებლები, რომლებიც აუცილებელია შესაბამისი კომპლექსური ამოცანების შესასრულებლად. კიდევ ერთი საკვანძო ასპექტია მაღალი ხარისხის მონაცემების სიმწირე. დიდი მოდელების სწავლებისას ხშირი შეშფოთებაა მონაცემების უხეში ძალისმიერი დამახსოვრება, ნაცვლად