Mixtral-ის გამოშვება: ახალი ნახტომი ხელოვნურ ინტელექტში ექსპერტთა ნაზავი (Mixture of Experts) არქიტექტურით
სტატია წარმოგიდგენთ Mixtral-ს, ახალ დიდ ენობრივ მოდელს (LLM), რომელიც იყენებს ექსპერტთა ნაზავის (MoE) არქიტექტურას, აერთიანებს 8 „ექსპერტ“ მოდელს ერთში. ხაზგასმულია Mixtral-ის შთამბეჭდავი წარმადობა, რომელიც აჭარბებს სხვა ღია წვდომის მოდელებს და უტოლდება GPT-3.5-ს MT-Bench ბენჩმარკზე. განმარტებულია მისი რეალური პარამეტრების რაოდენობა (დაახლოებით 45B, არა 56B) და დეტალურად აღწერილია მისი გამოყენება ინფერენციისა და ფაინ-თუნინგისთვის, ასევე Hugging Face-ზე განთავსების შესაძლებლობები.
დღეს გამოშვებულ მახასიათებლებსა და ინტეგრაციებს შორის არის: Mixtral-ს Mistral 7B-ის მსგავსი არქიტექტურა აქვს, მაგრამ ერთი თავისებურებით: ის რეალურად 8 „ექსპერტ“ მოდელს აერთიანებს ერთში, „ექსპერტთა ნაზავის“ (Mixture of Experts – MoE) ტექნიკის წყალობით. ტრანსფორმერული მოდელებისთვის ეს ასე მუშაობს: ზოგიერთი Feed-Forward ფენა ჩანაცვლებულია სპარსული MoE ფენით. MoE ფენა შეიცავს როუტერის ქსელს, რომელიც ირჩევს, რომელი ექსპერტები დაამუშავებენ რომელ ტოკენებს ყველაზე ეფექტურად. Mixtral-ის შემთხვევაში, ყოველი დროის ნაბიჯისთვის ორი ექსპერტი ირჩევა, რაც მოდელს საშუალებას აძლევს, გაშიფროს მონაცემები 12B პარამეტრის მქონე მკვრივი მოდელის სიჩქარით, მიუხედავად იმისა, რომ ის შეიცავს 4-ჯერ მეტ ეფექტურ პარამეტრს!
MoE-ის შესახებ მეტი დეტალებისთვის იხილეთ ჩვენი ბლოგ პოსტი: hf.co/blog/moe.
**Mixtral-ის გამოშვება: შეჯამება (TL;DR)**
მაინც რამდენად კარგია Mixtral-ის მოდელები? გთავაზობთ საბაზისო მოდელის მიმოხილვას და მის წარმადობას სხვა ღია მოდელებთან შედარებით LLM ლიდერთა დაფაზე (უფრო მაღალი ქულები უკეთესია):
ინსტრუქციისა და ჩატის მოდელებისთვის უკეთესია შეფასება MT-Bench-ის ან AlpacaEval-ის მსგავს ბენჩმარკებზე. ქვემოთ, ჩვენ ვაჩვენებთ, თუ როგორ ასრულებს Mixtral Instruct თავის საქმეს საუკეთესო დახურულ და ღია წვდომის მოდელებთან შედარებით (უფრო მაღალი ქულები უკეთესია):
შთამბეჭდავია, რომ Mixtral Instruct აჭარბებს ყველა სხვა ღია წვდომის მოდელს MT-Bench-ზე და არის პირველი, რომელმაც მიაღწია GPT-3.5-თან შედარებად წარმადობას!
**პარამეტრების რაოდენობის განმარტება**
Mixtral MoE-ს ეწოდება Mixtral-8x7B, მაგრამ მას არ აქვს 56 მილიარდი პარამეტრი (56B). გამოშვებიდან მალევე აღმოვაჩინეთ, რომ ზოგიერთი ადამიანი შეცდომაში შევიდა, ფიქრობდა, რომ მოდელი ისევე იქცევა, როგორც 8 მოდელის ანსამბლი, თითოეული 7B პარამეტრით, მაგრამ MoE მოდელები ასე არ მუშაობს. მოდელის მხოლოდ ზოგიერთი ფენა (feed-forward ბლოკები) არის დუბლირებული; დანარჩენი პარამეტრები იგივეა, რაც 7B მოდელში. პარამეტრების საერთო რაოდენობა არ არის 56B, არამედ დაახლოებით 45B. უკეთესი სახელი იქნებოდა Mixtral-45-8e, რათა უკეთ გადმოგვეცა არქიტექტურა. იმის შესახებ, თუ როგორ მუშაობს MoE, გთხოვთ, იხილოთ ჩვენი პოსტი „ექსპერტთა ნაზავი განმარტებულია“.
**Mixtral მოდელების გამოყენება**
საბაზისო მოდელს არ აქვს მოთხოვნის ფორმატი (prompt format). სხვა საბაზისო მოდელების მსგავსად, ის შეიძლება გამოყენებულ იქნას შეტანილი თანმიმდევრობის სავარაუდო გაგრძელებისთვის ან zero-shot/few-shot ინფერენციისთვის. ის ასევე შესანიშნავი საფუძველია თქვენი საკუთარი გამოყენების შემთხვევის ფაინ-თუნინგისთვის. Instruct მოდელს აქვს ძალიან მარტივი საუბრის სტრუქტურა. ამ ფორმატის ზუსტი რეპროდუცირება აუცილებელია ეფექტური გამოყენებისთვის. მოგვიანებით ვაჩვენებთ, თუ რამდენად ადვილია instruct prompt-ის რეპროდუცირება ტრანსფორმერებში არსებული ჩატის შაბლონის გამოყენებით.
**ღია კითხვები**
Mistral 7B-ის წინა გამოშვების მსგავსად, ამ ახალი მოდელების სერიასთან დაკავშირებით რამდენიმე ღია კითხვა არსებობს. კერძოდ, ჩვენ არ გვაქვს ინფორმაცია წინასწარი ვარჯიშისთვის გამოყენებული მონაცემთა ნაკრების ზომის, მისი შემადგენლობის ან მისი წინასწარი დამუშავების მეთოდების შესახებ. ანალოგიურად, Mixtral instruct მოდელისთვის, არ არის გაზიარებული დეტალები ფაინ-თუნინგის მონაცემთა ნაკრებების ან SFT-სა და DPO-სთან დაკავშირებული ჰიპერპარამეტრების შესახებ.
**ესაუბრეთ Mixtral Instruct მოდელს**
შეგიძლიათ Mixtral Instruct მოდელთან ესაუბროთ Hugging Face Chat-ზე! შეამოწმეთ აქ: https://huggingface.co/chat/?model=mistralai/Mixtral-8x7B-Instruct-v0.1.
**ინფერენციის გაშვება Mixtral მოდელებით**
ჩვენ გთავაზობთ Mixtral მოდელებთან ინფერენციის გაშვების ორ ძირითად გზას:
თითოეული მეთოდისთვის შესაძლებელია მოდელის გაშვება ნახევრად ზუსტი ფორმატით (float16) ან კვანტიზებული წონებით. ვინაიდან Mixtral მოდელი დაახლოებით 45B პარამეტრის მქონე მკვრივი მოდელის ზომის ეკვივალენტია, შეგვიძლია შევაფასოთ საჭირო VRAM-ის მინიმალური რაოდენობა შემდეგნაირად:
* Transformers-ის 4.36 გამოშვებით, შეგიძლიათ გამოიყენოთ Mixtral და Hugging Face ეკოსისტემის ყველა ხელსაწყო.
* დარწმუნდით, რომ იყენებთ ტრანსფორმერების უახლეს ვერსიას.
შემდეგ კოდის ფრაგმენტში ვაჩვენებთ, თუ როგორ უნდა გაუშვათ ინფერენცია 🤗 Transformers-ისა და 4-ბიტიანი კვანტიზაციის გამოყენებით. მოდელის დიდი ზომის გამო, მის გასაშვებად დაგჭირდებათ მინიმუმ 30 GB ოპერატიული მეხსიერების მქონე ბარათი. ეს მოიცავს ისეთ ბარათებს, როგორიცაა A100 (80 ან 40GB ვერსიები) ან A6000 (48 GB).
**რა არის ექსპერტთა ნაზავი (Mixture of Experts)?**
[INST] ახსენით, რა არის „ექსპერტთა ნაზავი“ (Mixture of Experts) 100 სიტყვაზე ნაკლებში. [/INST] „ექსპერტთა ნაზავი“ არის ანსამბლური სწავლის მეთოდი, რომელიც აერთიანებს მრავალ მოდელს, ანუ „ექსპერტს“, უფრო ზუსტი პროგნოზების გასაკეთებლად. თითოეული ექსპერტი სპეციალიზდება მონაცემთა სხვადასხვა ქვეჯგუფში, ხოლო გამშვები ქსელი (gating network) განსაზღვრავს, რომელი ექსპერტი უნდა იქნას გამოყენებული მოცემული შეტანისთვის. ეს მიდგომა საშუალებას აძლევს მოდელს, მოერგოს მონაცემებში არსებულ რთულ, არაწრფივ ურთიერთობებს და გააუმჯობესოს საერთო წარმადობა.
**Mixtral-ის განთავსება**
Text Generation Inference არის Hugging Face-ის მიერ შემუშავებული წარმოებისთვის მზა ინფერენციის კონტეინერი, რომელიც საშუალებას აძლევს დიდი ენობრივი მოდელების მარტივად განთავსებას. მას აქვს ისეთი ფუნქციები, როგორიცაა უწყვეტი დაჯგუფება (continuous batching), ტოკენების სტრიმინგი, ტენზორული პარალელიზმი მრავალ GPU-ზე სწრაფი ინფერენციისთვის, და წარმოებისთვის მზა ლოგირება და ტრეისინგი. შეგიძლიათ Mixtral-ის განთავსება Hugging Face-ის Inference Endpoints-ზე, რომელიც Text Generation Inference-ს იყენებს როგორც ბექენდს. Mixtral მოდელის განსათავსებლად, გადადით მოდელის გვერდზე და დააწკაპუნეთ „Deploy -> Inference Endpoints“ ვიჯეტზე. შენიშვნა: შესაძლოა დაგჭირდეთ კვოტის გაზრდის მოთხოვნა ელექტრონული ფოსტით [email protected]ზე, რათა მიიღოთ A100-ებზე წვდომა. მეტი ინფორმაციის მიღება იმის შესახებ, თუ როგორ განათავსოთ LLM-ები Hugging Face Inference Endpoints-ის გამოყენებით, შეგიძლიათ ჩვენს ბლოგზე. ბლოგი შეიცავს ინფორმაციას მხარდაჭერილი ჰიპერპარამეტრების შესახებ და როგორ მოახდინოთ თქვენი პასუხის სტრიმინგი.
თეგები:
#ხელოვნური ინტელექტი
#llm
#მანქანური სწავლება
#ღრმა სწავლება
#hugging face
#mixtral
#gpt-3.5
#ექსპერტთა ნაზავი
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები