ფალკონ-ეჯის სერია: ახალი სიტყვა ენობრივ მოდელებში ბიტნეტის არქიტექტურით
ახალი Falcon-Edge სერია წარმოადგენს მძლავრ ენობრივ მოდელებს, რომლებიც BitNet არქიტექტურაზეა დაფუძნებული. ეს მოდელები ინოვაციური წინასწარი ვარჯიშის პარადიგმის წყალობით ერთდროულად აწარმოებენ არაკვანტიზებულ და კვანტიზებულ ვარიანტებს. ისინი გამოირჩევიან ეფექტურობით, „მატრიცული გამრავლების გარეშე“ დიზაინით და ხელმისაწვდომია 1 მილიარდი და 3 მილიარდი პარამეტრის ზომებში, რაც მომხმარებლებს საშუალებას აძლევს მარტივად მოარგონ ისინი საკუთარ საჭიროებებს.
ამ ბლოგპოსტში განვიხილავთ Falcon-Edge სერიის ძირითად მახასიათებლებსა და საფუძვლებს. ეს არის მძლავრი, უნივერსალური და მარტივად კონფიგურირებადი ენობრივი მოდელების კოლექცია, რომელიც ხელმისაწვდომია ტერნარულ ფორმატში და ეფუძნება BitNet არქიტექტურას.
BitNet-თან ჩვენი გამოცდილების საფუძველზე, Falcon-Edge წარმოადგენს და ამტკიცებს ახალ წინასწარი ვარჯიშის პარადიგმას, რომელიც ერთი სრული ვარჯიშის პროცესისგან უზრუნველყოფს სრულფასოვან გამომავალ შედეგს, ერთდროულად აწარმოებს რა როგორც არაკვანტიზებულ, ასევე კვანტიზებულ მოდელის ვარიანტებს. ეს ყოვლისმომცველი მიდგომა ქმნის BitNet-ის არავერსიას bfloat16 ფორმატში, მშობლიურ BitNet მოდელს და წინასწარ კვანტიზებულ BitNet ვარიანტს, რომელიც სპეციალურად არის შექმნილი მარტივი დაზუსტებისთვის (fine-tuning), რაც მომხმარებლებსა და დეველოპერებს საშუალებას აძლევს ზუსტად მოარგონ ეს მოდელები მათ სპეციფიკურ აპლიკაციებსა და საჭიროებებს. ახლა ხელმისაწვდომია ორი ზომის — 1 მილიარდი და 3 მილიარდი პარამეტრის — თითოეული ზომა გამოდის როგორც საბაზისო, ასევე ინსტრუქციებით დაზუსტებული მოდელების სახით. აღმოაჩინეთ Falcon-Edge სერია ჩვენს სპეციალურ Hugging Face კოლექციაში.
დიდი ენობრივი მოდელები (LLM-ები), თავიანთი ბუნებით, მასშტაბური და რესურსმომხმარებელია. მოთხოვნის ზრდასთან ერთად, რომ ეს მოდელები ეფექტურად განლაგდეს კიდეულ მოწყობილობებზე (edge devices), დაჩქარდა კვლევები მოდელის შეკუმშვის მიმართულებით. ბოლოდროინდელი მცდელობები, როგორიცაა DeepSeek-ისა და Llama 4-ის, იკვლევს ვარჯიშს შემცირებული სიზუსტის ფორმატებით — FP8-მდე — განლაგების მასშტაბურობის გასაუმჯობესებლად. მეორეს მხრივ, მრავალი უახლესი მეთოდი აქცენტს აკეთებს ვარჯიშის შემდგომ კვანტიზაციაზე. ამ მიდგომებისგან განსხვავებით, BitNet წარმოადგენს ფუნდამენტურად განსხვავებულ პარადიგმას: შემცირებული სიზუსტის ვარჯიშისგან, რომელიც ჯერ კიდევ მცურავ წერტილოვან ფორმატებს ეყრდნობა, და ვარჯიშის შემდგომი კვანტიზაციისგან, რომელიც წონებს სრული სიზუსტის ვარჯიშის შემდეგ ასწორებს, BitNet მუშაობს უმცირესი შესაძლო სიზუსტით — ტერნარული წონებით ({-1, 0, 1}) — უშუალოდ ვარჯიშის დროს, რაც საშუალებას იძლევა შეიქმნას ბოლომდე ულტრა-ეფექტური მოდელის დიზაინი. ეს ტერნარული წონები გზას უხსნის „მატრიცული გამრავლების გარეშე“ (matmul-free) LLM დიზაინს, რომელიც პრაქტიკაში შესამჩნევად უფრო სწრაფი და მეხსიერების თვალსაზრისით საოცრად ეფექტურია.
ამ ინოვაციური მიდგომის მთავარი გამოწვევაა BitNet მოდელების წინასწარი ვარჯიშის საჭიროება, რაც ტიპიური მომხმარებლებისთვის შეიძლება გამოთვლითად მომთხოვნი და ძვირი იყოს. ჩვენი ცენტრის წინასწარი ვარჯიშის მონაცემთა სტრატეგიებიდან მიღებული ცოდნის გამოყენებით, ჩვენს მოდელს შიდა მონაცემთა ნარევზე ვაჯერებთ დაახლოებით 1.5 ტერატოკენისთვის. წინასწარი ვარჯიშისთვის ვიყენებთ კლასიკურ WSD სწავლის სიჩქარის განრიგს. ჩვენს მოდელებს (საბაზისო და ინსტრუქციებით მართულ ვერსიებს) ვაფასებთ ყოფილი Hugging Face-ის ლიდერბორდის v2 ეტალონური ტესტის მიხედვით და ქვემოთ წარმოგიდგენთ ნორმალიზებულ შედეგებს მსგავსი ზომის სხვა მოდელებთან შედარებით:
დამატებითი შედეგები (ლიდერბორდი v1) ჩვენი ინსტრუქციებით მართული მოდელების Microsoft-ის ახალ BitNet მოდელთან შედარებისას:
Falcon-Edge აჩვენებს თანაბარ ან უკეთეს შესრულებას მსგავსი ზომის მოდელებთან შედარებით ლიდერბორდის v2 ამოცანებზე, რაც ადასტურებს, რომ შესაძლებელია მძლავრი BitNet მოდელების ვარჯიში სასურველ დომენებზე, ამავე დროს სხვა ამოცანებზე საკმარისად კონკურენტუნარიანობის შენარჩუნებით.
თუ უფრო ახლოს დავაკვირდებით BitNet-ის წრფივი ფენის ფორმულას ინფერენციისთვის (Python კოდის თვალსაზრისით):
ნორმალიზაცია `activation_norm_quant` ახდენს აქტივაციების კვანტიზაციას int8 ფორმატში, შემდეგ აქტივაცია ხელახლა გამოითვლება ნახევარი სიზუსტით მისი `x_scale`-ზე გაყოფით. ვინაიდან მოდელი გაწვრთნილია ყალბი 8-ბიტიანი აქტივაციის კვანტიზაციით, ვვარაუდობთ, რომ შესაძლებელია მისი მიახლოება:
აქედან გამომდინარე, მოდელის ვარჯიშის შემდგომი კვანტიზაციის ნაცვლად, წონის მასშტაბის ინექცია წონების კვანტიზაციის შემდეგ უნდა უზრუნველყოფდეს მოდელის არაკვანტიზებული BitNet ვერსიის საკმარისად კარგ „მიახლოებას“:
ამას ვადასტურებთ ჩვენი 1 მილიარდი და 3 მილიარდი საბაზისო მოდელების bfloat16 ვარიანტზე ბოლომდე შეფასებების ჩატარებით და ქვემოთ მოცემულია შედეგები:
მოდელების bfloat16 ეკვივალენტების ჩატვირთვა შესაძლებელია პირდაპირ Hugging Face transformers-ის მეშვეობით, `from_pretrained` ფუნქციაში `revision="bfloat16"` პარამეტრის გადაცემით:
ჩვენი ინფორმაციით, Microsoft-ის უახლესი გამოშვების გარდა, BitNet-ის წინა გამოშვებები მხოლოდ საბოლოო კვანტიზებული მოდელის გამოქვეყნებაზე იყო ორიენტირებული, რაც მას მხოლოდ ინფერენციისთვის ხდიდა გამოსადეგს. Microsoft-ის გამოშვების მსგავსად, ჩვენ ვთავაზობთ BitNet მოდელების კვლევისა და გამოყენების ხელმისაწვდომობის გაფართოებას მათი წინასწარ კვანტიზებული წონების გამოქვეყნებით. ამ გზით, მომხმარებლებს შეუძლიათ შეასრულონ დაზუსტება მათ სამიზნე დომენზე, ან განახორციელონ BitNet-ის გამშვები წერტილის უწყვეტი წინასწარი ვარჯიში, იმ პირობით, რომ `nn.Linear` ფენები ჩანაცვლდება `BitnetLinear` ფენებით და დარწმუნდებიან, რომ მოდელი ვარჯიშის შემდგომ BitNet ფორმატშია კვანტიზებული. ვინაიდან წონები შეესაბამება წინასწარ კვანტიზებულ წონებს, ტექსტის გენერაცია `nn.Linear` ფენების `BitnetLinear` ფენებით ჩანაცვლების გარეშე გამოიწვევს უაზრო გამომავალ შედეგს. წინასწარ კვანტიზებული წონების ჩამოტვირთვა შესაძლებელია Hugging Face-ის transformers ბიბლიოთეკის მეშვეობით, `revision` არგუმენტის `prequantized`-ად მითითებით:
ამ გზით, ჩვენ ხელს შევუწყობთ საზოგადოებაში პირველი მძლავრი 1-ბიტიანი დაზუსტებების გარშემო ეკოსისტემის განვითარებას. ჩვენ საზოგადოებას ვაძლევთ ინსტრუმენტებს, რათა მარტივად დაიწყონ და მოარგონ BitNet-ის მძლავრი მოდელების საკუთარი ვერსიები, საჭირო დამხმარე მეთოდების შეფუთვით ფაინ-ტუნინგის შესასრულებლად.
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი