SmolLM3: ოპტიმალური ეფექტურობის 3B მოდელი სრული საინჟინრო პროექტით
SmolLM3-ის 3 მილიარდი პარამეტრის მოდელი აღემატება Llama-3.2-3B და Qwen2.5-3B მოდელებს, ამავდროულად ინარჩუნებს კონკურენტუნარიანობას უფრო დიდ 4B ალტერნატივებთან (Qwen3 და Gemma3). მისი უნიკალურობა მდგომარეობს იმაში, რომ დეველოპერები სრულად აქვეყნებენ მოდელის შექმნის მეთოდოლოგიას – არქიტექტურის დეტალებს, მონაცემთა შერევის მეთოდებსა და სამეტაპიან წინასწარ ვარჯიშის მიდგომას, რაც ჩვეულებრივ თვეების უკუინჟინერიას მოითხოვდა. არქიტექტურული ინოვაციები მოიცავს Grouped Query Attention (GQA), NoPE პოზიციური
SmolLM3 ოპტიმალური ეფექტურობის დიაპაზონშია. ჩვენი 3 მილიარდი პარამეტრის მოდელი აღემატება Llama-3.2-3B და Qwen2.5-3B მოდელებს, ამავდროულად რჩება კონკურენტუნარიანი უფრო დიდ 4 მილიარდი პარამეტრის ალტერნატივებთან (Qwen3 და Gemma3). შესრულების მაჩვენებლების გარდა, ჩვენ ზუსტად ვაზიარებთ, თუ როგორ შევქმენით ის საჯარო მონაცემთა ნაკრებებისა და ვარჯიშის ფრეიმვორკების გამოყენებით.
**მოდელის მიმოხილვა: სრული „რეცეპტი“:** ჩვენ ვაქვეყნებთ SmolLM3-ს ჩვენს საინჟინრო პროექტთან ერთად. ის მოიცავს არქიტექტურის დეტალებს, მონაცემთა ზუსტ ნაზავებს, რომლებიც გვიჩვენებს, თუ როგორ თანდათან ვზრდიდით შესრულებას სხვადასხვა დომენში სამეტაპიანი წინასწარი ვარჯიშის მიდგომით, და ჰიბრიდული აზროვნების მოდელის შექმნის მეთოდოლოგიას. ჩვეულებრივ, ასეთი შედეგების მისაღწევად თვეების უკუინჟინერია იქნებოდა საჭირო. ამის ნაცვლად, ჩვენ გთავაზობთ სრულ მეთოდოლოგიას.
თუ თქვენ საკუთარ მოდელებს ქმნით, ან გსურთ გაიგოთ, თუ რა განაპირობებს შესრულებას ამ მასშტაბით, ეს პროექტი გვიჩვენებს კონკურენტული 3B შესრულების მიღმა არსებულ საინჟინრო ისტორიას. მოდით, გადავხედოთ წინასწარი ვარჯიშის ეტაპს. SmolLM3-მ შეცვალა როგორც არქიტექტურა, ასევე მონაცემთა ნაზავი თავის წინამორბედებთან შედარებით. პირველ რიგში, განვიხილოთ არქიტექტურა და ვარჯიშის კონფიგურაციები!
SmolLM3 იყენებს ტრანსფორმატორულ დეკოდერულ არქიტექტურას მიბმული ემბედინგებით, SmolLM2-ის მსგავსად, რომელიც Llama-ს არქიტექტურას ეფუძნება, თუმცა რამდენიმე საკვანძო მოდიფიკაციით, ოპტიმიზებული ეფექტურობისა და გრძელი კონტექსტის მუშაობისთვის. **დაჯგუფებული მოთხოვნის ყურადღება (Grouped Query Attention – GQA):** ჩვენ მრავალთავიანი ყურადღება ჩავანაცვლეთ დაჯგუფებული მოთხოვნის ყურადღებით 4 ჯგუფის გამოყენებით. ჩვენმა აბლაციებმა 3B მოდელზე, რომელიც 100B ტოკენით იყო ავარჯიშებული FineWeb-Edu-დან, აჩვენა, რომ GQA ემთხვევა მრავალთავიანი ყურადღების შესრულებას, ამავდროულად მნიშვნელოვნად ამცირებს KV ქეშის ზომას დასკვნის (inference) დროს. **NoPE:** ჩვენ დავნერგეთ NoPE პოზიციური ემბედინგების (RoPE) შერჩევითი მოხსნით ყოველი მე-4 ფენიდან, სტატიის "RoPE to NoRoPE and Back Again: A New Hybrid Attention Strategy" (Yang et al., 2025) მიხედვით. ეს მიდგომა აუმჯობესებს გრძელი კონტექსტის შესრულებას მოკლე კონტექსტის შესაძლებლობებზე ზემოქმედების გარეშე, რაც ჩვენმა აბლაციებმა დაადასტურა. **დოკუმენტთაშორისი მასკირება (Intra-Document Masking):** „მიმდევრობის კომპოზიციის გავლენის ანალიზი ენობრივი მოდელის წინასწარ ვარჯიშზე“ მიხედვით, ვარჯიშის დროს ვიყენებთ ყურადღების მასკირებას, რათა უზრუნველყოფილი იყოს, რომ ერთი და იმავე სავარჯიშო მიმდევრობაში სხვადასხვა დოკუმენტიდან მომდინარე ტოკენებმა ერთმანეთს არ მიაქციონ ყურადღება. Llama 3-ის მსგავსად, ეს ხელს უწყობს უფრო სწრაფ და სტაბილურ გრძელკონტექსტურ ვარჯიშს, ამავდროულად ინარჩუნებს მოკლე კონტექსტის შესრულებას. **ვარჯიშის სტაბილურობა:** OLMo 2-ის მიხედვით, ჩვენ მოვხსენით წონის რღვევა (weight decay) ემბედინგის ფენებიდან ვარჯიშის სტაბილურობის გასაუმჯობესებლად. ამ მოდიფიკაციამ ხელი შეუწყო ვარჯიშის უფრო სტაბილურ დინამიკას, ემბედინგის ნორმები ბუნებრივად დასტაბილურდა ჯანსაღ მნიშვნელობებზე ვარჯიშის დროს, საერთო შესრულებაზე ზემოქმედების გარეშე ჩვენს აბლაციებში. ყველა ეს ცვლილება დადასტურდა აბლაციებით, იმავე 3B არქიტექტურის გამოყენებით, რომელიც 100B ტოკენზე იყო ავარჯიშებული FineWeb-Edu-დან, რაც უზრუნველყოფს, რომ თითოეულმა მოდიფიკაციამ ან გააუმჯობესა შესრულება, ან შეინარჩუნა ის სხვა სარგებლის შეთავაზებისას. **ვარჯიშის კონფიგურაცია:** ჩვენ ვიყენებთ გლობალურ ბეტჩის ზომას 2.36M ტოკენს 4096 მიმდევრობის სიგრძით, სწავლის სიჩქარეს 2e-4 და AdamW ოპტიმიზატორს (beta1: 0.9, beta2: 0.95) წონის რღვევით 0.1 და გრადიენტის კლიპინგით 1. ვიყენებთ WSD (Warmup-Stable-Decay) სკედულერს, 2000 „warmup“ ნაბიჯით და ხაზოვანი დაცემით 0-მდე ბოლო 10% სავარჯიშო ნაბიჯებში. ვარჯიშისთვის ვიყენებთ nanotron ფრეიმვორკს, მონაცემთა დამუშავებისთვის datatrove-ს და შეფასებისთვის lighteval-ს. მოდელი ვარჯიშობდა 384 H100 GPU-ზე 24 დღის განმავლობაში.
არქიტექტურული ცვლილებების გარდა, ჩვენ ასევე ჩავატარეთ აბლაციები და გავაუმჯობესეთ ვარჯიშის „რეცეპტი“. მოდით, უფრო ახლოს დავაკვირდეთ. SmolLM2-ის მრავალსაფეხურიანი მიდგომის გათვალისწინებით, ჩვენ ვავარჯიშებთ SmolLM3-ს 11.2T ტოკენზე სამეტაპიანი ვარჯიშის სტრატეგიის გამოყენებით, რომელიც ურევს ვებ, მათემატიკურ და კოდის მონაცემებს ცვალებადი პროპორციებით. ჩვენ ჩავატარეთ ფართო აბლაციები 3B მოდელებზე, რომლებიც 50B-დან 100B ტოკენზე იყო ავარჯიშებული, მონაცემთა ნაზავისა და თანაფარდობის დასადგენად.
წინასწარი ვარჯიში შედგება შემდეგი ეტაპებისგან: ამ ეტაპებითა და ნაზავებით ჩვენ მივაღწიეთ ძალიან კონკურენტულ შესრულებას საბაზისო მოდელისთვის. უფრო მეტი ამის შესახებ შეფასების განყოფილებაში. nanotron-ის ვარჯიშის კონფიგურაციები მონაცემთა ზუსტი წონებით შეგიძლიათ იხილოთ აქ. ჩვენ ასევე გავაზიარებთ ჩვენს სავარჯიშო ჟურნალებს შუალედურ ჩექპოინტებთან ერთად. ძირითადი წინასწარი ვარჯიშის შემდეგ, ჩვენ გავაუმჯობესეთ მოდელი შუა ვარჯიშის ეტაპზე გრძელი კონტექსტისა და აზროვნებისთვის. გრძელი კონტექსტის ადაპტაციასა და აზროვნების ადაპტაციას ვუწოდებთ „შუა ვარჯიშს“. ისინი ბევრად უფრო მოკლეა, ვიდრე ძირითადი წინასწარი ვარჯიში, მაგრამ მაინც გარკვეულწილად ზოგადია და მიზნად ისახავს მოდელის გაუმჯობესებას ამ ორ დომენში. მოდით, პირველ რიგში, გადავხედოთ გრძელი კონტექსტის ვარჯიშს.
ძირითადი წინასწარი ვარჯიშის შემდეგ, ჩვენ SmolLM3 დამატებით 100B ტოკენზე ავარჯიშეთ მისი კონტექსტის სიგრძის გასაფართოებლად. ჩვენ თანმიმდევრულად გავაფართოვეთ კონტექსტის ფანჯარა ორ ეტაპად, თითოეული 50B ტოკენისთვის: ჯერ გადავედით 4k კონტექსტიდან 32k კონტექსტზე RoPE theta-ს 1.5M-მდე გაზრდით, შემდეგ 32k-დან 64k კონტექსტზე RoPE theta-ს 5M-მდე გაზრდით. ორივე ეტაპზე მოხდა მათემატიკური, კოდის და აზროვნების მონაცემების ზედმეტი სემპლირება. აბლაციების დროს აღმოვაჩინეთ, რომ კონკრეტული გრძელი კონტექსტის
თეგები:
#ხელოვნური ინტელექტი
#llm
#მანქანური სწავლება
#ტექნოლოგია
#ტრანსფორმატორი
#smollm3
#ენობრივი მოდელი
#gqa
#nope
#წინასწარი ვარჯიში
#ღია მეთოდოლოგია
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი