ამ ბლოგპოსტში წარმოგიდგენთ Falcon-Edge სერიის ძირითად ასპექტებსა და არგუმენტებს – მძლავრი, უნივერსალური და ზუსტი კონფიგურაციის მქონე ენის მოდელების კოლექციას, რომელიც ხელმისაწვდომია სამმაგ ფორმატში და დაფუძნებულია BitNet არქიტექტურაზე. ჩვენს BitNet-თან მუშაობის გამოცდილებაზე დაყრდნობით, Falcon-Edge ნერგავს და ამოწმებს წინასწარი წვრთნის ახალ პარადიგმას, რომელიც უზრუნველყოფს სრულფასოვან შედეგს ერთიანი წვრთნის პროცესიდან, ერთდროულად ქმნის როგორც არაკვანტიზებულ, ასევე კვანტიზებულ მოდელის ვარიანტებს. ეს ყოვლისმომცველი მიდგომა ქმნის არაკვანტიზებულ BitNet მოდელს bfloat16 ფორმატში, მშობლიურ BitNet მოდელს და წინასწარ კვანტიზებულ BitNet ვარიანტს, რომელიც სპეციალურად შექმნილია მარტივი დაზუსტებისთვის, რაც მომხმარებლებსა და დეველოპერებს საშუალებას აძლევს ზუსტად მოარგონ ეს მოდელები მათ სპეციფიკურ აპლიკაციებსა და საჭიროებებს. ამჟამად ხელმისაწვდომია ორი ზომის – 1 მილიარდი და 3 მილიარდი პარამეტრით – თითოეული ზომა მოიცავს როგორც საბაზისო, ასევე ინსტრუქციებზე მორგებულ მოდელებს. აღმოაჩინეთ Falcon-Edge სერია ჩვენს სპეციალურ Hugging Face კოლექციაში. დიდი ენის მოდელები (LLM), თავიანთი დიზაინით, არსებითად დიდია და რესურსებს ინტენსიურად მოიხმარს. იმის გამო, რომ იზრდება მოთხოვნა ამ მოდელების ეფექტურად განთავსებაზე პერიფერიულ მოწყობილობებზე (edge devices), დაჩქარდა მოდელის შეკუმშვის კვლევები. ბოლო დროს განხორციელებული ძალისხმევა, როგორიცაა DeepSeek-ისა და Llama 4-ის, იკვლევს წვრთნას შემცირებული სიზუსტის ფორმატებით – FP8-მდე – განთავსების მასშტაბურობის გასაუმჯობესებლად. მეორეს მხრივ, მრავალი უახლესი მეთოდი ხაზს უსვამს წვრთნის შემდგომ კვანტიზაციას. ამ მიდგომებისგან განსხვავებით, BitNet შემოაქვს ფუნდამენტალურად განსხვავებულ პარადიგმას: შემცირებული სიზუსტის წვრთნისგან განსხვავებით, რომელიც კვლავ ეყრდნობა მცურავი წერტილის ფორმატებს, და წვრთნის შემდგომი კვანტიზაციისგან, რომელიც ასწორებს წონებს სრული სიზუსტით წვრთნის შემდეგ, BitNet მუშაობს უმცირესი შესაძლო სიზუსტით – სამმაგი წონებით ({-1, 0, 1}) – პირდაპირ წვრთნის დროს, რაც უზრუნველყოფს ბოლო-ბოლო ულტრა-ეფექტური მოდელის დიზაინს. ეს სამმაგი წონები გზას უხსნის „matmul-free“ LLM დიზაინს, რომელიც პრაქტიკაში შესამჩნევად სწრაფი და მეხსიერების თვალსაზრისით საოცრად ეფექტურია. ამ ინოვაციური მიდგომის მთავარი გამოწვევაა BitNet მოდელების წინასწარი წვრთნის აუცილებლობა, რაც შეიძლება იყოს გამოთვლითად მომთხოვნი და ძვირი ტიპური მომხმარებლებისთვის. ჩვენი ცენტრის წინასწარი წვრთნის მონაცემთა სტრატეგიებიდან მიღებული ცოდნის გამოყენებით, ჩვენს მოდელს წინასწარ ვწვრთნით შიდა მონაცემთა ნარევზე დაახლოებით 1.5 ტერა ტოკენის განმავლობაში. წინასწარი წვრთნისთვის ვიყენებთ კლასიკურ WSD სწავლის სიჩქარის განრიგს (scheduler). ჩვენ ვაფასებთ ჩვენს მოდელებს (საბაზისო და ინსტრუქციებზე მორგებულ ვერსიებს) ყოფილ Hugging Face ლიდერთა დაფის v2 ბენჩმარკზე და ვაქვეყნებთ ნორმალიზებულ შედეგებს ქვემოთ მსგავსი ზომის სხვა მოდელებთან შედარებით: [ცხრილის მითითება] დამატებითი შედეგები (ლიდერთა დაფა v1) ჩვენი ინსტრუქციებზე მორგებული მოდელების Microsoft-ის ახალ BitNet მოდელთან შედარებისას: [ცხრილის მითითება] Falcon-Edge აჩვენებს თანაბარ ან უკეთეს შესრულებას მსგავსი ზომის მოდელებთან შედარებით ლიდერთა დაფის v2 ამოცანებზე, რაც ადასტურებს, რომ შესაძლებელია მძლავრი BitNet მოდელების წვრთნა სასურველ დომენებზე, ამავდროულად საკმარისად კონკურენტუნარიანი იყოს სხვა ამოცანებზეც. თუ უფრო დეტალურად განვიხილავთ BitNet-ის წრფივი ფენის ფორმულას ინფერენციისთვის (Python კოდის თვალსაზრისით): [კოდის მითითება] ნორმალიზაცია `activation_norm_quant` ახდენს აქტივაციების კვანტიზაციას int8 ფორმატში, შემდეგ აქტივაცია გამოითვლება უკან ნახევარი სიზუსტით `x_scale`-ზე გაყოფით. იმის გამო, რომ მოდელი გაწვრთნილია ყალბი 8-ბიტიანი აქტივაციის კვანტიზაციით, ჩვენ ვამტკიცებთ, რომ შესაძლებელია ამის მიახლოება: [ფორმულის მითითება] ამიტომ, მოდელის წვრთნის შემდგომი კვანტიზაციის ნაცვლად, წონის მასშტაბის ინექციამ წონების კვანტიზაციის შემდეგ უნდა გამოიწვიოს მოდელის არა-BitNet ვერსიის საკმარისად კარგი „მიახლოება“: [ფორმულის მითითება] ამას ვადასტურებთ ჩვენი 1B და 3B საბაზისო მოდელების bfloat16 ვარიანტზე ბოლო-ბოლო შეფასებების ჩატარებით და ქვემოთ მოცემულია შედეგები: [ცხრილის მითითება] მოდელების bfloat16 ანალოგები შეიძლება ჩაიტვირთოს პირდაპირ Hugging Face transformers-ის მეშვეობით, `from_pretrained` ფუნქციაში `revision="bfloat16"` პარამეტრის გადაცემით: [კოდის მითითება] ჩვენი ცოდნით, Microsoft-ის უახლესი გამოშვების გარდა, წინა BitNet გამოშვებები მხოლოდ ფინალური კვანტიზებული მოდელის გამოშვებაზე იყო ორიენტირებული, რაც მას მხოლოდ ინფერენციისთვის გამოსაყენებელს ხდიდა. Microsoft-ის გამოშვების მსგავსად, ჩვენ ვთავაზობთ BitNet მოდელების კვლევისა და გამოყენების ხელმისაწვდომობის გაფართოებას მათი წინასწარ კვანტიზებული წონების გამოქვეყნებით. ამ გზით, მომხმარებლებს შეუძლიათ ან შეასრულონ დაზუსტება თავიანთ სამიზნე დომენზე, ან განაგრძონ BitNet-ის ჩექპოინტის წინასწარი წვრთნა, სანამ `nn.Linear` ფენები ჩანაცვლდება `BitnetLinear` ფენებით და დარწმუნდებიან, რომ მოდელი კვანტიზირებულია BitNet ფორმატში წვრთნის შემდგომ. ვინაიდან წონები შეესაბამება წინასწარ კვანტიზებულ წონებს, ტექსტის გენერაცია `nn.Linear` ფენების `BitnetLinear` ფენებით ჩანაცვლების გარეშე გამოიწვევს უაზრო გამომუშავებას. წინასწარ კვანტიზებული წონები შეიძლება ჩამოიტვირთოს Hugging Face-ის transformers ბიბლიოთეკის მეშვეობით, `revision` არგუმენტის `prequantized`-ად მითითებით: [კოდის მითითება] ამ გზით, ჩვენ ხელს შევუწყობთ ეკოსისტემის ჩამოყალიბებას საზოგადოების მიერ შექმნილი პირველი მძლავრი 1-ბიტიანი დაზუსტებების გარშემო. ჩვენ საზოგადოებას ვაძლევთ ინსტრუმენტებს, რომ მარტივად დაიწყონ და დააზუსტონ BitNet მოდელების საკუთარი ვერსიები, აერთიანებენ რა ყველა საჭირო დამხმარე მეთოდს დაზუსტებისთვის.