დღეს გამოშვებულ მახასიათებლებსა და ინტეგრაციებს შორის არის: SegMoE მოდელები სტეიბლ დიფუჟენის მსგავს არქიტექტურას მიჰყვებიან. Mixtral 8x7b-ის მსგავსად, SegMoE მოდელი აერთიანებს მრავალ მოდელს ერთში. ეს მიიღწევა იმით, რომ ზოგიერთი Feed-Forward შრე ჩანაცვლებულია იშვიათი MoE შრით. MoE შრე შეიცავს როუტერულ ქსელს, რომელიც ირჩევს, რომელი ექსპერტები დაამუშავებენ რომელ ტოკენებს ყველაზე ეფექტურად. თქვენ შეგიძლიათ გამოიყენოთ segmoe პაკეტი საკუთარი MoE მოდელების შესაქმნელად! პროცესს სულ რამდენიმე წუთი სჭირდება. დამატებითი ინფორმაციისთვის, ეწვიეთ GitHub-ის საცავს. segmoe-ს დიზაინის შექმნისას შთაგონება პოპულარული ბიბლიოთეკა mergekit-დან მივიღეთ. მადლობას ვუხდით mergekit-ის კონტრიბუტორებს ასეთი სასარგებლო ბიბლიოთეკისთვის. MoE-ების შესახებ მეტი დეტალებისთვის იხილეთ Hugging Face-ის პოსტი: hf.co/blog/moe. SegMoE-ის გამოშვება, მოკლედ: SegMoE-ის MoE-ებს ეწოდებათ SegMoE-AxB, სადაც A მიუთითებს ერთად გაერთიანებული ექსპერტული მოდელების რაოდენობაზე (MoE-დ), ხოლო მეორე რიცხვი მიუთითებს თითოეული სურათის გენერირებაში ჩართული ექსპერტების რაოდენობაზე. მოდელის მხოლოდ ზოგიერთი შრე (წინგადამავალი ბლოკები, ყურადღების მექანიზმები, ან ყველა) დუბლირდება კონფიგურაციის პარამეტრების მიხედვით; დანარჩენი პარამეტრები იგივეა, რაც Stable Diffusion მოდელში. MoE-ების მუშაობის შესახებ დამატებითი დეტალებისთვის, გთხოვთ, იხილოთ პოსტი „ექსპერტთა ნარევების განმარტება“. ჩვენ ჰაბზე ვუშვებთ 3 გაერთიანებას: SegMoE 4x2-ის გამოყენებით გენერირებული სურათები, SegMoE 2x1-ის გამოყენებით გენერირებული სურათები და SegMoE SD 4x2-ის გამოყენებით გენერირებული სურათები. გთხოვთ, გაუშვით შემდეგი ბრძანება segmoe პაკეტის ინსტალაციისთვის. დარწმუნდით, რომ დაყენებული გაქვთ diffusers-ისა და transformers-ის უახლესი ვერსიები. შემდეგი მოქმედება ჩატვირთავს მეორე მოდელს („SegMoE 4x2“) ზემოთ მოცემული სიიდან და მასზე განახორციელებს გენერაციას. ალტერნატიულად, შესაძლებელია ლოკალური მოდელის ჩატვირთვაც, სადაც segmoe_v0 არის ადგილობრივი SegMoE მოდელის შემცველი დირექტორიის გზა. იხილეთ „საკუთარი SegMoE-ის შექმნა“, რათა ისწავლოთ როგორ ააწყოთ თქვენი საკუთარი მოდელი! პრომპტის გაგება, როგორც ჩანს, უმჯობესდება, რაც ნაჩვენებია სურათებზე. თითოეული სურათი მარცხნიდან მარჯვნივ აჩვენებს შემდეგ მოდელებს: SegMoE-2x1-v0, SegMoE-4x2-v0, Base Model (RealVisXL_V3.0). უბრალოდ მოამზადეთ config.yaml ფაილი შემდეგი სტრუქტურით. ნებისმიერი რაოდენობის მოდელის გაერთიანებაა შესაძლებელი. კონფიგურაციის ფაილის შექმნის შესახებ დეტალური ინფორმაციისთვის, გთხოვთ, მიმართოთ GitHub-ის საცავს. შენიშვნა: მხარდაჭერილია როგორც Hugging Face-ის, ისე CivitAI-ის მოდელები. CivitAI-ის მოდელებისთვის, ჩასვით მოდელის გადმოწერის ბმული, მაგალითად: „https://civitai.com/api/download/models/239306“. შემდეგ გაუშვით შემდეგი ბრძანება. ეს შექმნის segmoe_v0 სახელწოდების საქაღალდეს შემდეგი სტრუქტურით. ალტერნატიულად, შეგიძლიათ გამოიყენოთ Python API-ც ექსპერტთა ნარევის მოდელის შესაქმნელად. მოდელის ჰაბზე ატვირთვა შესაძლებელია huggingface-cli-ის მეშვეობით. მოდელის ჰაბზე ატვირთვა ასევე შესაძლებელია უშუალოდ Python-დან. დეტალური გამოყენების ინსტრუქცია შეგიძლიათ იხილოთ აქ. ნელი სიჩქარე: თუ ტოკენზე ექსპერტების რაოდენობა 1-ზე მეტია, MoE გამოთვლებს ასრულებს რამდენიმე ექსპერტულ მოდელზე. ეს მას ერთეულ SD 1.5 ან SDXL მოდელზე ნელს ხდის. VRAM-ის მაღალი მოხმარება: MoE-ები ინფერენსს ძალიან სწრაფად ასრულებენ, მაგრამ მაინც საჭიროებენ VRAM-ის დიდ რაოდენობას (და, შესაბამისად, ძვირადღირებულ GPU-ს). ეს მათ გამოყენებას ართულებს ლოკალურ დაყენებებში, მაგრამ შესანიშნავია მრავალი GPU-ს მქონე განთავსებებისთვის. საორიენტაციო წერტილისთვის, SegMoE-4x2 მოითხოვს 24 GB VRAM-ს ნახევრად-სიზუსტეში. ჩვენ შევქმენით SegMoE, რათა საზოგადოებას მივცეთ ახალი ინსტრუმენტი, რომელსაც პოტენციურად შეუძლია უახლესი (SOTA) დიფუზიური მოდელების მარტივად შექმნა, უბრალოდ წინასწარ გაწვრთნილი მოდელების გაერთიანებით, ინფერენსის დაბალი დროის შენარჩუნებით. მოუთმენლად ველით, რას შექმნით მასთან ერთად! მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის.