რა მოხდებოდა, ModernBERT-ის რეცეპტი მხოლოდ დეკოდერის მოდელზე რომ გამოგვეყენებინა? აღმოჩნდა, რომ შეიქმნებოდა უახლესი დეკოდერული ენის მოდელი, რომელიც Llama 3.2 1B-სა და SmolLM2-ს ჯობნის! ჩვენ წარმოგიდგენთ წვრთნის ახალ რეცეპტს, რომელიც ღია მონაცემებზეა დაფუძნებული და საშუალებას იძლევა, რეპროდუცირდეს (და რეალურად გაუმჯობესდეს!) მხოლოდ-ენკოდერის ModernBERT მოდელი. შემდეგ ზუსტად იგივე რეცეპტს ვიყენებთ მხოლოდ-დეკოდერის მოდელებზეც. პირველად გვაქვს ორი უახლესი მოდელი, რომლებიც გაწვრთნილია ერთი და იგივე კონფიგურაციით, მაგრამ ორი განსხვავებული წვრთნის მიზნით: ნიღბიანი ენის მოდელირება (MLM) და კაუზალური ენის მოდელირება (CLM). ეს ბლოგპოსტი წარმოგიდგენთ Ettin-ს, უახლესი, დაწყვილებული მხოლოდ-ენკოდერისა და მხოლოდ-დეკოდერის მოდელების პირველ სერიას (17M-1B პარამეტრი), რომლებიც გაწვრთნილია იდენტური მონაცემებით (2T ტოკენი), არქიტექტურითა და წვრთნის რეცეპტებით. Ettin შესაძლებელს ხდის არქიტექტურებს შორის ობიექტურ შედარებებს და უზრუნველყოფს უმაღლეს შესრულებას ღია მონაცემებზე დაფუძნებული მოდელებისთვის ორივე კატეგორიაში. ამასთან, ვიკვლევთ, შესაძლებელია თუ არა კონკურენტუნარიანი ენკოდერის მიღება დეკოდერიდან და პირიქით. თუ დაინტერესებული ხართ მოდელების გამოცდით, ამ ბლოგპოსტის ბოლოს ხელმისაწვდომია საწყისი კოდები! LLM (დიდი ენობრივი მოდელების) საზოგადოება ძირითადად მხოლოდ დეკოდერულ მოდელებზეა ორიენტირებული, როგორიცაა GPT, Llama და Qwen. მათი გენერაციული შესაძლებლობები შთამბეჭდავია, მაგრამ ეს ფოკუსირება ყურადღებას აკლებს სხვა კატეგორიებს, მაგალითად, მხოლოდ ენკოდერულ მოდელებს, როგორიცაა BERT. მიუხედავად ამისა, BERT-ის მსგავსი ენკოდერული მოდელები კვლავაც წარმოების სისტემების ძირითად შემსრულებლად რჩება კლასიფიკაციის, მოძიების (retrieval) და ჩაშენების (embedding) ამოცანებისთვის. ისინი უფრო სწრაფები, მეხსიერების მხრივ ეფექტურები და ხშირად უფრო ზუსტები არიან დისკრიმინაციული ამოცანებისთვის. ძირითადი განსხვავება მათ ყურადღების შაბლონებში მდგომარეობს: სანამ დეკოდერული მოდელები სწრაფად ვითარდებოდა, ენკოდერული მოდელების განვითარება სტაგნაციაში იყო — ვიდრე ცოტა ხნის წინ, ModernBERT-ის მსგავსი ინიციატივებით ისინი არ მოდერნიზდა. მაგრამ რომელი არქიტექტურაა უკეთესი? ენკოდერებსა და დეკოდერებს შორის წინა შედარებები იყენებდა განსხვავებულ მონაცემთა ბაზებს, არქიტექტურებსა და წვრთნის რეცეპტებს, ამიტომ ძნელი იყო ზუსტი დასკვნის გაკეთება. ნორვეგიული ორთავიანი გიგანტის სახელობის Ettin გვაწვდის კონტროლირებულ შედარებას ორივე არქიტექტურის იდენტურ მონაცემებზე, იდენტურ მოდელის ფორმებსა და იდენტურ წვრთნის რეცეპტებზე გაწვრთნით. ისინი მხოლოდ ყურადღების შაბლონებითა და წვრთნის მიზნებით განსხვავდებიან! ჩვენ ვაშენებთ ModernBERT-ის რეცეპტზე დაყრდნობით, რომელმაც დეკოდერული მოდელების თანამედროვე ტექნიკები ისესხა და ენკოდერის წვრთნაში შემოიტანა. ეს ქმნის მყარ საფუძველს ორივე არქიტექტურის წვრთნისთვის. ჩვენ ვწვრთნით ექვსი სხვადასხვა ზომის მოდელს, 17 მილიონიდან 1 მილიარდ პარამეტრამდე. ეს საშუალებას გვაძლევს გამოვცადოთ მასშტაბის ეფექტები და გთავაზობთ მოდელების ფართო არჩევანს გამოსაყენებლად! არ აქვს მნიშვნელობა, გჭირდებათ ელვისებურად სწრაფი მოწყობილობაზე მომუშავე მოდელი თუ მძლავრი, მაგრამ ნელი მოდელი, ჩვენ მოგივლით! შესრულების მაქსიმიზაციისთვის ვიყენებთ სამფაზიან, ყოვლისმომცველ წვრთნის მიდგომას: ფაზა 1 – წინასწარი წვრთნა (1.7 ტრილიონი ტოკენი): ვიწყებთ მაღალი ხარისხის მონაცემთა წყაროების მრავალფეროვანი ნარევით, ვწვრთნით მოკლე კონტექსტებზე (1024 ტოკენი) მყარი საბაზისო ცოდნის დასამკვიდრებლად. ფაზა 2 – კონტექსტის გაფართოება (250 მილიარდი ტოკენი): კონტექსტის სიგრძეს ვზრდით 8K ტოკენამდე უფრო მაღალი ხარისხის გაფილტრული მონაცემების გამოყენებით, რაც მოდელებს საშუალებას აძლევს, გაიგონ უფრო გრძელი დოკუმენტები და რთული ურთიერთობები. ფაზა 3 – დასკვნითი ეტაპი (100 მილიარდი ტოკენი): ვასრულებთ პრემიუმ მონაცემთა წყაროებით, მათ შორის სამეცნიერო ნაშრომებით, სახელმძღვანელოებითა და კურირებული კონტენტით, თანდათან ვამცირებთ სწავლის ტემპს. ჩვენი ენკოდერული მოდელები იღებენ ModernBERT-ის სისწრაფის ყველა უპირატესობას, რაც მათ წინა თაობის ენკოდერებთან შედარებით მნიშვნელოვნად აჩქარებს. ModernBERT-ისგან განსხვავებით, ჩვენი ყველა საწვრთნელი მონაცემი საჯარო და რეპროდუცირებადია: შეგიძლიათ გააგრძელოთ ამ მოდელების წვრთნა ახალ მონაცემებზე ან შესთავაზოთ ახალი რეცეპტი შედეგების შემდგომი გაუმჯობესებისთვის! ჩვენი ენკოდერული მოდელები აღემატება ModernBERT-ს ყველა ამოცანასა და მოდელის ზომაში, ამასთან, იყენებენ სრულიად ღია საწვრთნელ მონაცემებს. ვინაიდან ჩვენ გთავაზობთ ზომების ფართო სპექტრს, ახლა შეგიძლიათ გამოიყენოთ ModernBERT-ის სტილის მოდელები მცირე ზომებში (იდეალურია მოწყობილობაზე ან სწრაფი დასკვნისთვის) ან გაზარდოთ სიმძლავრე 1 მილიარდიანი ენკოდერით, რომელიც კონკურენციას ანადგურებს. იგივე რეცეპტის დეკოდერულ მოდელებზე გამოყენება თანაბრად შთამბეჭდავ შედეგებს იძლევა, ჩვენი მოდელები აღემატება ან უტოლდება დადგენილ საბაზისო მოდელებს, როგორიცაა Llama 3.2 და SmolLM2. გაუმჯობესება განსაკუთრებით ძლიერია ცოდნაზე ინტენსიურ ამოცანებზე, როგორიცაა SciQ, რაც ასახავს ჩვენი მაღალი ხარისხის საწვრთნელი მონაცემთა ნარევის უპირატესობებს. ეს შედეგები აჩვენებს, რომ ჩვენი წვრთნის რეცეპტი ქმნის ნამდვილად ძლიერ მოდელებს ორივე არქიტექტურულ პარადიგმაში. პირველად შეგვიძლია სამართლიანად შევადაროთ ენკოდერისა და დეკოდერის არქიტექტურები, რომლებიც გაწვრთნილია იდენტური მონაცემებითა და რეცეპტებით. შედეგები ავლენს ფუნდამენტურ არქიტექტურულ უპირატესობებს, რომლებიც შენარჩუნებულია მაშინაც კი, როცა ყველა სხვა ფაქტორი კონტროლდება: შედეგები ნათელ სურათს გვიჩვენებს: ენკოდერები დომინირებენ კლასიფიკაციასა და მოძიებაში: MNLI კლასიფიკაციაზე, 150M ენკოდერიც კი (89.2) აღემატება 400M დეკოდერს (88.2). მოძიების ამოცანებისთვის, სხვაობა მცირეა, მაგრამ მაინც შესამჩნევია – განსაკუთრებით მაშინ, როცა დეკოდერები არ არის გაწვრთნილი MNTP-ით. დეკოდერები შეუდარებლები არიან გენერაციაში: გენერაციულ ამოცანებზე, დეკოდერები ინარჩუნებენ მუდმივ უპირატესობებს.