SmolLM3 ეფექტურობის ოპტიმალურ წერტილშია მოქცეული. ჩვენი 3 მილიარდპარამეტრიანი მოდელი აჭარბებს Llama-3.2-3B-სა და Qwen2.5-3B-ს, ამასთანავე, კონკურენტუნარიანია უფრო დიდი 4 მილიარდპარამეტრიანი ალტერნატივებთან (Qwen3 და Gemma3) მიმართებაში. წარმადობის მაჩვენებლების მიღმა, ჩვენ სრულად ვამხელთ, თუ როგორ შევქმენით ის საჯარო მონაცემთა ნაკრებებისა და სასწავლო ფრეიმვორკების გამოყენებით. **მოდელის მიმოხილვა: სრული რეცეპტი:** SmolLM3-ს ვაქვეყნებთ ჩვენს საინჟინრო გეგმასთან ერთად. ის მოიცავს არქიტექტურის დეტალებს, მონაცემთა ზუსტ ნარევებს, რომლებიც გვიჩვენებს, თუ როგორ გავაუმჯობესეთ წარმადობა დომენებში სამსაფეხურიანი წინასწარი ვარჯიშის მიდგომით, და ჰიბრიდული მსჯელობის მოდელის შექმნის მეთოდოლოგიას. როგორც წესი, ამ შედეგების მისაღწევად თვეებია საჭირო საპირისპირო ინჟინერიისთვის. ნაცვლად ამისა, ჩვენ გთავაზობთ სრულ მეთოდოლოგიას. მიუხედავად იმისა, თავად აშენებთ მოდელებს თუ გსურთ გაიგოთ, რა განაპირობებს ასეთი მასშტაბის წარმადობას, ეს გეგმა აჩვენებს ინჟინერულ ისტორიას კონკურენტული 3 მილიარდპარამეტრიანი მოდელის წარმადობის უკან. მოდით, გადავხედოთ წინასწარი ვარჯიშის ეტაპს. SmolLM3-მ შეცვალა როგორც არქიტექტურა, ასევე მონაცემთა ნარევი მის წინამორბედებთან შედარებით. პირველ რიგში, განვიხილოთ არქიტექტურა და ვარჯიშის კონფიგურაციები! SmolLM3 იყენებს ტრანსფორმატორული დეკოდერის არქიტექტურას, დაკავშირებული ჩაშენებებით, SmolLM2-ის მსგავსად, Llama-ს არქიტექტურაზე დაყრდნობით, მაგრამ რამდენიმე ძირითადი მოდიფიკაციით, რომლებიც ოპტიმიზებულია ეფექტურობისა და გრძელი კონტექსტის წარმადობისთვის. **დაჯგუფებული მოთხოვნის ყურადღება (GQA):** ჩვენ მრავალთავიანი ყურადღება (multi-head attention) ჩავანაცვლეთ დაჯგუფებული მოთხოვნის ყურადღებით (grouped-query attention) 4 ჯგუფის გამოყენებით. ჩვენს 3 მილიარდპარამეტრიან მოდელზე ჩატარებულმა აბლაციებმა, რომელიც FineWeb-Edu-დან 100 მილიარდი ტოკენით იყო გაწვრთნილი, აჩვენა, რომ GQA ემთხვევა მრავალთავიანი ყურადღების წარმადობას, ამასთანავე, მნიშვნელოვნად ამცირებს KV ქეშის ზომას დასკვნის (inference) დროს. **NoPE:** ჩვენ დავნერგეთ NoPE ნაშრომიდან „RoPE to NoRoPE and Back Again: A New Hybrid Attention Strategy“ (Yang et al., 2025), შერჩევითად ამოვიღეთ მბრუნავი პოზიციური ჩაშენებები (rotary position embeddings) ყოველი მე-4 ფენიდან. ეს მიდგომა აუმჯობესებს გრძელი კონტექსტის წარმადობას მოკლე კონტექსტის შესაძლებლობებზე ზემოქმედების გარეშე, რაც ჩვენმა აბლაციებმა დაადასტურა. **შიდა-დოკუმენტური მასკირება:** ნაშრომის „Analysing The Impact of Sequence Composition on Language Model Pre-Training“ მიხედვით, ვარჯიშის დროს ვიყენებთ ყურადღების მასკირებას, რათა უზრუნველვყოთ, რომ ერთი და იმავე სასწავლო მიმდევრობაში სხვადასხვა დოკუმენტის ტოკენები ერთმანეთზე არ მიაქცევენ ყურადღებას. Llama 3-ის მსგავსად, ეს ხელს უწყობს გრძელი კონტექსტის უფრო სწრაფ და სტაბილურ ვარჯიშს, მოკლე კონტექსტის წარმადობის შენარჩუნებით. **ვარჯიშის სტაბილურობა:** OLMo 2-ის მიხედვით, ჩვენ ამოვიღეთ წონის დაშლა (weight decay) ჩაშენების ფენებიდან ვარჯიშის სტაბილურობის გასაუმჯობესებლად. ამ მოდიფიკაციამ ხელი შეუწყო უფრო სტაბილურ სასწავლო დინამიკას, ჩაშენების ნორმები ბუნებრივად სტაბილიზდებოდა ჯანსაღ მნიშვნელობებზე ვარჯიშის დროს, რაც არ მოქმედებდა საერთო წარმადობაზე ჩვენს აბლაციებში. ყველა ეს ცვლილება დადასტურდა აბლაციებით იმავე 3 მილიარდპარამეტრიანი არქიტექტურის გამოყენებით, რომელიც გაწვრთნილი იყო FineWeb-Edu-დან 100 მილიარდი ტოკენით, რაც უზრუნველყოფდა, რომ ყოველი მოდიფიკაცია ან აუმჯობესებდა წარმადობას, ან ინარჩუნებდა მას სხვა სარგებლის შეთავაზებისას. **ვარჯიშის კონფიგურაცია:** ვიყენებთ 2.36 მილიონი ტოკენის გლობალურ ბეჩ ზომას (global batch size) 4096 მიმდევრობის სიგრძით, სწავლის სიჩქარეს 2e-4 და AdamW ოპტიმიზატორს (ბეტა1: 0.9, ბეტა2: 0.95) წონის დაშლით 0.1 და გრადიენტის კლიპინგით 1. ვიყენებთ WSD (Warmup-Stable-Decay) სკედულერს, 2000 გახურების საფეხურით და ხაზოვან დაშლას 0-მდე ბოლო 10% სასწავლო საფეხურებში. ვარჯიშისთვის ვიყენებთ nanotron ფრეიმვორკს, მონაცემთა დამუშავებისთვის datatrove-ს და შეფასებისთვის lighteval-ს. მოდელი გაწვრთნილი იყო 384 H100 GPU-ზე 24 დღის განმავლობაში. განაწილებული ვარჯიშის მოწყობის ხილვა შეგიძლიათ შემდეგ ფიგურაზე. არქიტექტურული ცვლილებების გარდა, ჩვენ ასევე ჩავატარეთ აბლაციები და გავაუმჯობესეთ ვარჯიშის რეცეპტი. მოდით, უფრო დეტალურად განვიხილოთ. SmolLM2-ის მრავალსაფეხურიანი მიდგომის გათვალისწინებით, SmolLM3-ს ვავარჯიშებთ 11.2 ტრილიონ ტოკენზე სამსაფეხურიანი ვარჯიშის სტრატეგიით, რომელიც აერთიანებს ვებ, მათემატიკურ და კოდის მონაცემებს ცვალებადი პროპორციებით. ჩვენ ჩავატარეთ ფართო აბლაციები 3 მილიარდპარამეტრიან მოდელებზე, რომლებიც გაწვრთნილი იყო 50 მილიარდიდან 100 მილიარდ ტოკენზე, რათა განგვესაზღვრა მონაცემთა ნარევი და თანაფარდობები. წინასწარი ვარჯიში მოიცავს ამ ეტაპებს, რომლებიც ასევე ნაჩვენებია ზემოთ მოცემულ ფიგურაში: ამ ეტაპებითა და ნარევებით ჩვენ მივაღწიეთ ძალიან კონკურენტუნარიან წარმადობას საბაზო მოდელისთვის. ამის შესახებ მეტს იხილავთ შეფასების განყოფილებაში. nanotron-ის ვარჯიშის კონფიგურაციები მონაცემთა ზუსტი წონებით შეგიძლიათ იხილოთ აქ. ასევე გაგიზიარებთ ჩვენს ვარჯიშის ჟურნალებს შუალედურ საკონტროლო წერტილებთან ერთად. ძირითადი წინასწარი ვარჯიშის შემდეგ, ჩვენ გავაუმჯობესეთ მოდელი შუა ვარჯიშის ეტაპზე გრძელი კონტექსტისა და მსჯელობისთვის. გრძელი კონტექსტის ადაპტაციასა და მსჯელობის ადაპტაციას „შუა ვარჯიშს“ ვუწოდებთ. ისინი გაცილებით მოკლეა ვიდრე ძირითადი წინასწარი ვარჯიში, მაგრამ მაინც გარკვეულწილად ზოგადი და მიზნად ისახავს მოდელის გაუმჯობესებას ამ ორ დომენში. მოდით, ჯერ გრძელი კონტექსტის ვარჯიშს გადავხედოთ. ძირითადი წინასწარი ვარჯიშის შემდეგ, ჩვენ SmolLM3 დავავარჯიშეთ დამატებით 100 მილიარდ ტოკენზე, რათა გაგვეფართოებინა მისი კონტექსტის სიგრძე. ჩვენ თანმიმდევრულად გავაფართოვეთ კონტექსტის ფანჯარა ორ ეტაპად, თითოეულზე 50 მილიარდი ტოკენით: ჯერ გადავედით 4k-დან 32k კონტექსტზე RoPE თეტას 1.5M-მდე გაზრდით, შემდეგ 32k-დან 64k კონტექსტზე RoPE თეტას 5M-მდე გაზრდით. ორივე ეტაპზე გაიზარდა მათემატიკური, კოდისა და მსჯელობის მონაცემების რაოდენობა. აბლაციების დროს აღმოვაჩინეთ, რომ კონკრეტული გრძელი კონტექსტის გაზრდა...