Meta-მ Llama 4 მულტიმოდალური AI მოდელები გამოუშვა Hugging Face-ის ეკოსისტემისთვის
დღეს Meta-მ წარმოადგინა Llama 4-ის ახალი თაობის მძლავრი, მშობლიურად მულტიმოდალური AI მოდელები – Maverick და Scout. ეს მოდელები მნიშვნელოვან წინ გადადგმულ ნაბიჯს წარმოადგენს ხელოვნური ინტელექტის განვითარებაში, რომლებიც ინტეგრირებულია Hugging Face-ის ეკოსისტემაში. Llama 4 იყენებს ინოვაციურ ავტორეგრესიულ ექსპერტთა ნარევის (MoE) არქიტექტურას და მხარს უჭერს უზარმაზარ კონტექსტის სიგრძეებს (Scout-ისთვის 10 მილიონამდე ტოკენი), ასევე ტექსტური და გამოსახულების შეტანის დამუშავებას. მოდელები გაწვრთნილია 200
დღეს გამოშვებული ეს მძლავრი, მშობლიურად მულტიმოდალური მოდელები წარმოადგენს მნიშვნელოვან წინ გადადგმულ ნაბიჯს. ჩვენ მჭიდროდ ვითანამშრომლეთ Meta-სთან, რათა უზრუნველვყოთ მათი შეუფერხებელი ინტეგრაცია Hugging Face-ის ეკოსისტემაში, მათ შორის transformers-სა და TGI-ში პირველივე დღიდან. ეს მხოლოდ დასაწყისია ჩვენი მოგზაურობისა Llama 4-თან ერთად. მომდევნო დღეებში ჩვენ გავაგრძელებთ თანამშრომლობას საზოგადოებასთან, რათა შევქმნათ საოცარი მოდელები, მონაცემთა ნაკრებები და აპლიკაციები Maverick-თან და Scout-თან ერთად! 🔥
Meta-ს მიერ შემუშავებული Llama 4 წარმოადგენს ახალ ავტორეგრესიულ ექსპერტთა ნარევის (MoE) არქიტექტურას. ეს თაობა მოიცავს ორ მოდელს: Maverick (128 ექსპერტი) და Scout (16 ექსპერტი). ორივე მოდელი იყენებს ადრეულ შერწყმას მშობლიური მულტიმოდალურობისთვის, რაც მათ საშუალებას აძლევს დაამუშაონ ტექსტური და გამოსახულების შეტანები. Maverick და Scout გაწვრთნილია 40 ტრილიონამდე ტოკენზე, მონაცემებზე, რომელიც მოიცავს 200 ენას (სპეციფიკური დაზუსტების მხარდაჭერით 12 ენისთვის, მათ შორის არაბული, ესპანური, გერმანული და ჰინდი).
განთავსებისთვის, Llama 4 Scout შექმნილია ხელმისაწვდომობისთვის, ის ჯდება ერთ სერვერული კლასის GPU-ზე ადგილზე 4-ბიტიანი ან 8-ბიტიანი კვანტიზაციის საშუალებით, ხოლო Maverick ხელმისაწვდომია BF16 და FP8 ფორმატებში. ეს მოდელები გამოშვებულია Llama 4 საზოგადოებრივი ლიცენზიის შეთანხმების (Llama 4 Community License Agreement) ქვეშ, რომელიც ხელმისაწვდომია მოდელების საცავებში.
იმისათვის, რომ დავეხმაროთ საზოგადოებას დაუყოვნებლივ გამოიყენოს ეს უახლესი მოდელები, მოხარულნი ვართ გამოვაცხადოთ შემდეგი ინტეგრაციები:
Llama 4 მოდელები წინასწარ იყო გაწვრთნილი 256K კონტექსტის სიგრძით. Instruct მოდელები დაზუსტდა (fine-tuned), რათა მხარი დაუჭიროს გაცილებით დიდ კონტექსტის სიგრძეებს: 1M დიდ 128 ექსპერტის ვერსიაში (Maverick) და 10M (!) 16 ექსპერტის ვერსიისთვის (Scout). ეს დიდი კონტექსტის სიგრძეები რამდენიმე ძალიან საინტერესო არქიტექტურულ არჩევანს გულისხმობს. სანამ ოფიციალური ტექნიკური ანგარიში არ გამოქვეყნდება, ეს არის ის, რაც ჯერჯერობით ვიცით.
NoPE (საყვარელი სახელი, +1 ქარიზმის ქულა), რომელიც ჯერ კიდევ 2022 წელს იყო გამოკვლეული, უბრალოდ უარს ამბობს ტრადიციულ პოზიციურ კოდირების სქემებზე, როგორიცაა RoPE, რომლებიც უმეტესად გამოიყენება ტრანსფორმერების მოდელებში. Llama 4-ის შემთხვევაში, NoPE ფენები გამოიყენება ყოველ 4 ფენაში. ეს ფენები გადამწყვეტია გრძელი კონტექსტისთვის, რადგან ისინი იყენებენ სრულ კაუზალურ ნიღაბს კონტექსტზე. RoPE ფენებისთვის (ოთხიდან სამი), გამოიყენება დაყოფილ ყურადღება (chunked attention). Meta მოიხსენიებს NoPE ფენების მონაცვლეობით გამოყენებას, ტემპერატურის სკალირებასთან ერთად (როგორც ქვემოთ არის ახსნილი), როგორც iRoPE არქიტექტურას. თუ გსურთ მეტი გაიგოთ პოზიციური კოდირების შესახებ, გირჩევთ კრისის ბოლო პოსტს.
მეხსიერების მოთხოვნების შესამცირებლად, Llama 4 იყენებს დაყოფილ ყურადღებას (chunked attention) იმ ფენებში, რომლებიც მუშაობენ ტრადიციულ RoPE პოზიციურ კოდირებებთან (ოთხი დეკოდერის ფენიდან სამი). დაყოფილ ყურადღების მუშაობის საუკეთესო ვიზუალიზაცია შესაძლებელია ამ ASCII წარმოდგენის მეშვეობით, რომელიც ამოღებულია transformers-ის საწყისი კოდიდან: [აქ უნდა ყოფილიყო დიაგრამა]. ეს დიაგრამა აჩვენებს ყურადღების ნიღაბს, რომელიც გამოყენებული იქნებოდა, თუ დაყოფილ ყურადღების სიგრძე იყო 3. Llama 4-ის შემთხვევაში, დაყოფილ ყურადღების სიგრძეა 8192. ეს ნიშნავს, რომ RoPE ფენებს შეუძლიათ კონტექსტის თვალყურის დევნება მხოლოდ 8K ბლოკებში, ხოლო NoPE ფენებს აქვთ წვდომა სრულ კონტექსტზე. ეს შეიძლება განვიხილოთ, როგორც Sliding Window Attention-ის უფრო მეხსიერებითა და გამოთვლებით ეფექტური ვერსია.
გრძელ კონტექსტებზე გამოყენებულ ყურადღების ბლოკებს აქვთ პრობლემა: ყურადღების ალბათობის ქულები ნულთან უფრო ახლოს ქრება, რადგან მიმდევრობის სიგრძე იზრდება. ეს არის softmax ფუნქციის ძალიან გრძელ მიმდევრობებზე გამოყენების ცნობილი შედეგი. ამ პრობლემის გადასაჭრელად, Llama 4 იყენებს სკალირებულ softmax-ს, რასაც მოდელი ტემპერატურის რეგულირებას (temperature tuning) უწოდებს. ეს გამოიყენება NoPE ფენებში, მაგრამ არა RoPE-ში, რადგან ეს უკანასკნელნი ამუშავებენ უფრო მოკლე ქვე-მიმდევრობებს. ეს მეთოდი არის განზოგადების გაუმჯობესების გზა თვითნებური კონტექსტის სიგრძისთვის და, სავარაუდოდ, ერთ-ერთი მთავარი ფაქტორი Llama 4 Scout-ში 10M კონტექსტის სიგრძის მისაღწევად.
Llama Scout (16 ექსპერტის ვერსია) იყენებს დამატებით RMS ნორმალიზაციას Query და Key მდგომარეობებისათვის სასწავლო პარამეტრის გარეშე RoPE ფენებში, RoPE ჩანერგვის გამოყენების შემდეგ. Llama Scout არის სრული MoE, რომელიც შედგება 16 ექსპერტისგან. Llama Maverick იყენებს 128 ექსპერტს, მაგრამ MoE და მკვრივი ფენები მონაცვლეობს. ამიტომ, ექსპერტები გამოიყენება ფენების ნახევარში. Llama Maverick თანა-დისტილირებული იყო უფრო დიდი მოდელიდან, Llama Behemoth-დან, ახალი დანაკარგის ფუნქციის გამოყენებით, რომელიც დინამიურად წონის სტუდენტისა და მასწავლებლის ლოგიტს. მოდელები იყენებენ MetaP-ს, მეთოდოლოგიას, რომელიც სავარაუდოდ შთაგონებულია MuP-ით, რათა ოპტიმალურად დაარეგულირონ ჰიპერპარამეტრები სხვადასხვა განზომილებაში, მათ შორის ტრენინგის ბიუჯეტი და მოდელის ზომა.
Llama 4-თან მუშაობის დაწყება transformers-ის გამოყენებით მარტივია. დარწმუნდით, რომ დაინსტალირებული გაქვთ transformers v4.51.0 ან უფრო ახალი (pip install -U transformers huggingface_hub[hf_xet]). აქ მოცემულია სწრაფი მაგალითი ინსტრუქციებზე დაზუსტებული Maverick მოდელის გამოყენებით, რომელიც პასუხობს ორ სურათზე, ტენზორული პარალელიზმის გამოყენებით მაქსიმალური სიჩქარისთვის. თქვენ უნდა გაუშვათ ეს სკრიპტი ინსტანციაზე 8 GPU-ით, ბრძანების გამოყენებით: `torchrun –nproc-per-instance=8 script.py`.
აუცილებლად შეამოწმეთ მოდელის ბარათები საცავებში (Llama 4 Maverick (~400B) და Llama 4 Scout (~109B)) დეტალური გამოყენების ინსტრუქციებისთვის, მათ შორის მულტიმოდალური მაგალითებისთვის, კონკრეტული მოთხოვნის ფორმატებისთვის (როგორიცაა სისტემური მოთხოვნები) და კვანტიზაციის დეტალებისთვის.
თეგები:
#ai
#meta
#scout
#ტრანსფორმერები
#hugging face
#კვანტიზაცია
#მულტიმოდალური მოდელები
#llama 4
#moe
#maverick
#კონტექსტის სიგრძე
წყარო: huggingface.co
AI-ით გადამუშავებული