ეს ბლოგპოსტი წარმოგიდგენთ mmBERT-ს, უახლეს, მასობრივად მრავალენოვან ენკოდერ მოდელს, რომელიც გაწვრთნილია 3 ტრილიონზე მეტი ტექსტური ტოკენის გამოყენებით 1800-ზე მეტ ენაზე. ის აჩვენებს მნიშვნელოვან წარმადობისა და სიჩქარის გაუმჯობესებას წინა მრავალენოვან მოდელებთან შედარებით, არის პირველი, რომელმაც XLM-R-ს აჯობა, ამასთანავე ავითარებს ახალ სტრატეგიებს ნაკლებად რესურსული ენების ეფექტური სწავლისთვის. mmBERT დაფუძნებულია ModernBERT-ზე ელვისებური სისწრაფის არქიტექტურისთვის და ამატებს ახალ კომპონენტებს მრავალენოვანი სწავლის ეფექტურობის უზრუნველსაყოფად. თუ დაინტერესებული ხართ მოდელების თავად გამოცდით, ამ ბლოგპოსტის ბოლოს ხელმისაწვდომია მაგალითები! mmBERT გაწვრთნილია საგულდაგულოდ შერჩეულ მრავალენოვან მონაცემთა ნაკრებზე, რომელიც მოიცავს 3 ტრილიონზე მეტ ტოკენს სამი განსხვავებული წვრთნის ფაზის განმავლობაში. ჩვენი საწვრთნელი მონაცემების საფუძველს წარმოადგენს სამი ძირითადი ღია წყაროს მქონე და მაღალი ხარისხის ვებ-კრაული, რომლებიც უზრუნველყოფენ როგორც მრავალენოვან გაშუქებას, ასევე მონაცემთა ხარისხს: DCLM და Filtered DCLM გვაწვდის უმაღლესი ხარისხის ინგლისურ კონტენტს, რაც მტკიცე ინგლისურენოვანი წარმადობის ხერხემალია (ფილტრირებული მონაცემები მოპოვებულია Dolmino-დან). ეს მონაცემთა ნაკრები წარმოადგენს ვებ-ფილტრაციის უახლეს ტექნიკას და გადამწყვეტი კომპონენტია. ამ მონაცემების მაღალი ხარისხის გამო, ჩვენ ვიყენებთ ინგლისური ენის მნიშვნელოვნად მაღალ პროპორციას, ვიდრე წინა თაობის მრავალენოვანი ენკოდერული მოდელები (18%-მდე). FineWeb2 გვაწვდის ფართო მრავალენოვან ვებ-კონტენტს, რომელიც მოიცავს 1800-ზე მეტ ენას. ეს მონაცემთა ნაკრები უზრუნველყოფს ჩვენს ფართო მრავალენოვან გაშუქებას, ამავდროულად ინარჩუნებს ხარისხის გონივრულ სტანდარტებს სხვადასხვა ენობრივი ოჯახებისა და დამწერლობისთვის. FineWeb2-HQ შედგება FineWeb2-ის ფილტრირებული ქვეჯგუფისგან, რომელიც ფოკუსირებულია 20 მაღალრესურსულ ენაზე. ეს ფილტრირებული ვერსია გვაწვდის უფრო მაღალი ხარისხის მრავალენოვან კონტენტს, რომელიც ავსებს ინგლისურენოვან ფილტრირებულ მონაცემებსა და ფართო მრავალენოვან გაშუქებას შორის არსებულ ხარვეზს. საწვრთნელი მონაცემები ასევე მოიცავს სპეციალიზებულ კორპუსებს Dolma-დან, MegaWika v2-დან, ProLong-დან და სხვა წყაროებიდან: კოდის რეპოზიტორიები (StarCoder, ProLong), აკადემიური კონტენტი (ArXiv, PeS2o), საცნობარო მასალები (Wikipedia, სახელმძღვანელოები) და საზოგადოებრივი დისკუსიები (StackExchange), ინსტრუქციულ და მათემატიკურ მონაცემთა ნაკრებებთან ერთად. ჩვენს მონაცემთა მიდგომაში მთავარი ინოვაციაა ენების პროგრესული ჩართვის სტრატეგია. ყოველ ფაზაში ჩვენ თანდათანობით ვაკეთებთ შერჩევას უფრო ბრტყელი განაწილებიდან (ანუ, უფრო ახლოს თანაბარ განაწილებასთან), ამასთანავე ვამატებთ ახალ ენებს. ეს ნიშნავს, რომ მაღალრესურსული ენები, როგორიცაა რუსული, თავდაპირველად მონაცემების მაღალი პროცენტით იწყებენ (მაგ., 9%) და შემდეგ წვრთნის ბოლო ფაზაში ამის დაახლოებით ნახევარზე ჩამოდიან. წინასაწვრთნელ ფაზაში ვიწყებთ 60 მაღალრესურსული ენით, შუალედურ ფაზაში ვფართოვდებით 110 ენამდე და ბოლოს, დეგრადაციის ფაზაში, ვრთავთ FineWeb2-ის ყველა 1,833 ენას. ეს საშუალებას გვაძლევს მაქსიმალურად გამოვიყენოთ შეზღუდული ნაკლებად რესურსული ენების მონაცემები ზედმეტი გამეორებების გარეშე და შევინარჩუნოთ მონაცემთა მაღალი საერთო ხარისხი. mmBERT დაფუძნებულია ModernBERT-ის არქიტექტურაზე, მაგრამ მრავალენოვანი სწავლისთვის რამდენიმე ძირითად ინოვაციას გვთავაზობს: ჩვენ ვიყენებთ ModernBERT-base-ის იგივე ძირითად არქიტექტურას 22 ფენით და 1152 შუალედური განზომილებით, მაგრამ გადავდივართ Gemma 2 ტოკენაიზერზე მრავალენოვანი ტექსტის უკეთ სამართავად. საბაზისო მოდელს აქვს 110 მილიონი არაჩაშენებადი პარამეტრი (ჯამში 307 მილიონი უფრო დიდი ლექსიკონის გამო), ხოლო მცირე ვარიანტს აქვს 42 მილიონი არაჩაშენებადი პარამეტრი (ჯამში 140 მილიონი). ჩვენი წვრთნა მიჰყვება საგულდაგულოდ შემუშავებულ სამფაზიან განრიგს: ნიღბის შებრუნებული თანაფარდობის განრიგი (Inverse Mask Ratio Schedule): ფიქსირებული ნიღბის სიჩქარის ნაცვლად, ჩვენ თანდათან ვამცირებთ ნიღბის თანაფარდობას 30% → 15% → 5%-მდე წვრთნის ფაზების განმავლობაში. ეს მოდელს საშუალებას აძლევს ისწავლოს ძირითადი წარმოდგენები უფრო მაღალი ნიღბით ადრეულ ეტაპზე, შემდეგ კი ფოკუსირება მოახდინოს უფრო ნიუანსურ გაგებაზე დაბალი ნიღბის სიჩქარით. ენების მორგებული სწავლა (Annealed Language Learning): ჩვენ დინამიურად ვარეგულირებთ ტემპერატურას მრავალენოვანი მონაცემების შერჩევისთვის τ=0.7 → 0.5 → 0.3-დან. ეს ქმნის პროგრესირებას მაღალრესურსული ენის მიკერძოებიდან უფრო ერთგვაროვანი შერჩევისკენ, რაც მოდელს საშუალებას აძლევს შექმნას ძლიერი მრავალენოვანი საფუძველი ნაკლებად რესურსული ენების შესწავლამდე. ენების პროგრესული დამატება (Progressive Language Addition): ყველა ენაზე ერთდროულად წვრთნის ნაცვლად, ჩვენ სტრატეგიულად ვამატებთ ენებს ყოველ ფაზაში (60 → 110 → 1,833). ეს მაქსიმალურად ზრდის სწავლის ეფექტურობას შეზღუდულ ნაკლებად რესურსულ მონაცემებზე ზედმეტი ეპოქების თავიდან აცილებით, ამავდროულად ძლიერი წარმადობის მიღწევით. მოდელების გაერთიანება (Model Merging): ჩვენ ვწვრთნით სამ განსხვავებულ ვარიანტს დეგრადაციის ფაზაში (ინგლისურზე ორიენტირებული, 110-ენოვანი და ყველა-ენოვანი) და ვიყენებთ TIES გაერთიანების მეთოდს, რათა მათი ძლიერი მხარეები საბოლოო მოდელში გავაერთიანოთ. ინგლისურენოვანი წარმადობა: ინგლისურ GLUE ბენჩმარკზე (ცხრილი 1), mmBERT base აღწევს მაღალ წარმადობას, მნიშვნელოვნად აჭარბებს სხვა მრავალენოვან მოდელებს, როგორიცაა XLM-R (მრავალენოვანი RoBERTa) base და mGTE base, ამასთანავე რჩება კონკურენტუნარიანი მხოლოდ ინგლისურენოვან მოდელებთან, მიუხედავად იმისა, რომ mmBERT-ის საწვრთნელი მონაცემების 25%-ზე ნაკლებია ინგლისურენოვანი. მრავალენოვანი წარმადობა: mmBERT აჩვენებს მნიშვნელოვან გაუმჯობესებას XTREME ბენჩმარკზე XLM-R-თან შედარებით, როგორც ეს მოცემულია ცხრილ 2-ში. აღსანიშნავი მიღწევები მოიცავს მაღალ წარმადობას XNLI კლასიფიკაციაში.