Meta-ს Llama 4-ის მოდელები გამოვიდა: წინ გადადგმული ნაბიჯი მულტიმოდალურ ხელოვნურ ინტელექტში MoE არქიტექტურითა და გაფართოებული კონტექსტით
Meta-ს მიერ შემუშავებული Llama 4-ის მოდელები, Maverick და Scout, დღეს გამოვიდა, რაც ხელოვნური ინტელექტის სფეროში მნიშვნელოვან წინსვლას წარმოადგენს. ეს მძლავრი, მშობლიურად მულტიმოდალური მოდელები იყენებენ ახალ ავტორეგრესიულ „ექსპერტთა ნაზავის“ (MoE) არქიტექტურას, რაც მათ საშუალებას აძლევს დაამუშაონ როგორც ტექსტური, ისე გამოსახულების შეტანა. Hugging Face-ის ეკოსისტემასთან სრულყოფილი ინტეგრაციის უზრუნველყოფით, Llama 4-ის მოდელები გაწვრთნილია 200 ენაზე (40 ტრილიონამდე ტოკენზე) და გამოირჩევა კონტექსტი
დღეს გამოშვებული ეს მძლავრი, მშობლიურად მულტიმოდალური მოდელები წარმოადგენს მნიშვნელოვან წინ გადადგმულ ნაბიჯს. ჩვენ მჭიდროდ ვითანამშრომლეთ Meta-სთან, რათა უზრუნველყოფილიყო მათი სრულყოფილი ინტეგრაცია Hugging Face-ის ეკოსისტემაში, მათ შორის transformers-სა და TGI-ში, პირველივე დღიდან. ეს მხოლოდ დასაწყისია ჩვენი მოგზაურობისა Llama 4-თან ერთად. მომდევნო დღეებში ჩვენ გავაგრძელებთ თანამშრომლობას საზოგადოებასთან, რათა Maverick-ისა და Scout-ის დახმარებით შევქმნათ საოცარი მოდელები, მონაცემთა ნაკრებები და აპლიკაციები! 🔥
Meta-ს მიერ შემუშავებული Llama 4 წარმოადგენს ახალ ავტორეგრესიულ „ექსპერტთა ნაზავის“ (MoE) არქიტექტურას. ეს თაობა მოიცავს ორ მოდელს: ორივე მოდელი იყენებს ადრეულ შერწყმას მშობლიური მულტიმოდალურობისთვის, რაც მათ საშუალებას აძლევს დაამუშაონ როგორც ტექსტური, ისე გამოსახულების შეტანა. Maverick და Scout გაწვრთნილია 40 ტრილიონამდე ტოკენზე, 200 ენის მოცვით (სპეციფიკური წვრილი დარეგულირების მხარდაჭერით 12 ენისთვის, მათ შორის არაბულისთვის, ესპანურისთვის, გერმანულისთვის და ჰინდისთვის).
გამოყენებისთვის, Llama 4 Scout შექმნილია ხელმისაწვდომობისთვის, ის თავსდება ერთ სერვერულ GPU-ზე 4-ბიტიანი ან 8-ბიტიანი კვანტიზაციის საშუალებით, ხოლო Maverick ხელმისაწვდომია BF16 და FP8 ფორმატებში. ეს მოდელები გამოქვეყნებულია Llama 4 საზოგადოების მორგებული სალიცენზიო ხელშეკრულების ფარგლებში, რომელიც ხელმისაწვდომია მოდელების საცავებში.
საზოგადოებისთვის ამ უახლესი მოდელების დაუყოვნებლივი გამოყენების ხელშეწყობის მიზნით, მოხარულნი ვართ განვაცხადოთ შემდეგი ინტეგრაციების შესახებ: Llama 4-ის მოდელები წინასწარ გაწვრთნილი იყო 256K კონტექსტის სიგრძით. Instruct მოდელები დახვეწილია გაცილებით დიდი კონტექსტის სიგრძის მხარდასაჭერად: 1M დიდი, 128 ექსპერტიანი ვერსიისთვის (Maverick) და 10M (!) 16 ექსპერტიანი ვერსიისთვის (Scout). კონტექსტის ასეთი დიდი სიგრძე რამდენიმე ძალიან საინტერესო არქიტექტურულ არჩევანს გულისხმობს. სანამ ოფიციალური ტექნიკური ანგარიში არ გამოქვეყნდება, ეს არის ის, რაც ვიცით ამ დროისთვის.
NoPE (საყვარელი სახელი, +1 ქარიზმის ქულა), რომელიც 2022 წლიდან იკვლევდა, უბრალოდ უარს ამბობს ტრადიციულ პოზიციურ კოდირების სქემებზე, როგორიცაა RoPE, რომლებიც უმეტესად გამოიყენება ტრანსფორმერების მოდელებში. Llama 4-ის შემთხვევაში, NoPE ფენები გამოიყენება ყოველ 4 ფენაში. ეს ფენები გადამწყვეტია გრძელი კონტექსტისთვის, რადგან ისინი იყენებენ სრულ მიზეზობრივ ნიღაბს კონტექსტზე. RoPE ფენებისთვის (4-დან სამი), გამოიყენება დანაწევრებული ყურადღება. Meta NoPE ფენების მონაცვლეობით გამოყენებას, ტემპერატურის სკალირებასთან ერთად (როგორც ქვემოთ არის განმარტებული), მოიხსენიებს როგორც iRoPE არქიტექტურას. თუ გსურთ მეტი გაიგოთ პოზიციური კოდირების შესახებ, გირჩევთ კრისის ბოლოდროინდელ პოსტს.
მეხსიერების მოთხოვნების შესამცირებლად, Llama 4 იყენებს დანაწევრებულ ყურადღებას იმ ფენებში, რომლებიც მუშაობენ ტრადიციულ RoPE პოზიციურ კოდირებასთან (4 დეკოდერის ფენიდან სამი). დანაწევრებული ყურადღების მუშაობის საუკეთესო ვიზუალიზაცია შესაძლებელია ამ ASCII წარმოდგენის საშუალებით, რომელიც ამოღებულია transformers-ის საწყისი კოდიდან: ეს დიაგრამა აჩვენებს ყურადღების ნიღაბს, რომელიც გამოყენებული იქნება, თუ დანაწევრებული ყურადღების სიგრძე 3 იქნებოდა. Llama 4-ის შემთხვევაში, დანაწევრებული ყურადღების სიგრძე 8192-ია. ეს ნიშნავს, რომ RoPE ფენებს შეუძლიათ კონტექსტის თვალყურის დევნება მხოლოდ 8K ბლოკებში, ხოლო NoPE ფენებს აქვთ სრულ კონტექსტზე წვდომა. ეს შეიძლება ჩაითვალოს Sliding Window Attention-ის უფრო მეხსიერების და გამოთვლითი ეფექტურობის მქონე ვერსიად.
გრძელ კონტექსტებზე გამოყენებულ ყურადღების ბლოკებს აქვთ პრობლემა: ყურადღების ალბათობის ქულები ნულთან ახლოს მცირდება თანმიმდევრობის სიგრძის მატებასთან ერთად. ეს არის softmax ფუნქციის ძალიან გრძელ თანმიმდევრობებზე გამოყენების ცნობილი შედეგი. ამ პრობლემის გადასაჭრელად, Llama 4 იყენებს სკალირებულ softmax-ს, რომელსაც მოდელი ტემპერატურის დარეგულირებას უწოდებს. ეს გამოიყენება NoPE ფენებში, მაგრამ არა RoPE ფენებში, რადგან ეს უკანასკნელი მოკლე ქვე-თანმიმდევრობებს ემსახურება. ეს მეთოდი არის თვითნებური კონტექსტის სიგრძეებისთვის განზოგადების გაუმჯობესების გზა და ალბათ ერთ-ერთი მთავარი ფაქტორი Llama 4 Scout-ში 10M კონტექსტის სიგრძის მისაღწევად.
Llama Scout (16 ექსპერტიანი ვერსია) იყენებს დამატებით RMS ნორმალიზაციას RoPE ფენებში Query და Key მდგომარეობების შესასწავლელი პარამეტრის გარეშე, RoPE ჩანერგვების გამოყენების შემდეგ. Llama Scout არის სრული MoE, რომელიც შედგება 16 ექსპერტისგან. Llama Maverick იყენებს 128 ექსპერტს, მაგრამ MoE და მკვრივი ფენები მონაცვლეობენ. ამიტომ, ექსპერტები გამოიყენება ფენების ნახევარში. Llama Maverick იყო კო-დისტილირებული უფრო დიდი მოდელისგან, Llama Behemoth-ისგან, ახალი დანაკარგის ფუნქციის გამოყენებით, რომელიც დინამიურად წონის სტუდენტისა და მასწავლებლის ლოგიტს.
მოდელები იყენებენ MetaP-ს, მეთოდოლოგიას, რომელიც სავარაუდოდ MuP-ით არის შთაგონებული, რათა ოპტიმალურად დაარეგულირონ ჰიპერპარამეტრები სხვადასხვა განზომილებაში, მათ შორის ტრენინგის ბიუჯეტსა და მოდელის ზომაში. Llama 4-თან მუშაობის დაწყება transformers-ის გამოყენებით მარტივია. დარწმუნდით, რომ დაყენებული გაქვთ transformers v4.51.0 ან უფრო ახალი ვერსია (pip install -U transformers huggingface_hub[hf_xet]). აი სწრაფი მაგალითი ინსტრუქციებზე მორგებული Maverick მოდელის გამოყენებით, რომელიც პასუხობს ორ სურათზე, მაქსიმალური სიჩქარისთვის ტენზორული პარალელიზმის გამოყენებით. თქვენ უნდა გაუშვათ ეს სკრიპტი 8 GPU-ს მქონე ინსტანციაზე, შემდეგი ბრძანების გამოყენებით: torchrun –nproc-per-instance=8 script.py. აუცილებლად შეამოწმეთ მოდელის ბარათები საცავებზე (Llama 4 Maverick (~400B) და Llama 4 Scout (~109B)) დეტალური გამოყენების ინსტრუქციებისთვის, მათ შორის მულტიმოდალური მაგალითებისთვის, კონკრეტული მოთხოვნის ფორმატებისთვის (როგორიცაა სისტემური მოთხოვნები), კვანტიზაციის დეტალებისთვის.
თეგები:
#ხელოვნური ინტელექტი
#meta
#scout
#მანქანური სწავლება
#ტრანსფორმერები
#hugging face
#კვანტიზაცია
#მულტიმოდალური მოდელები
#nope
#llama 4
#maverick
#კონტექსტის სიგრძე
#moe არქიტექტურა
#rope
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი