Stability AI-მ Stable Diffusion 3 Medium წარადგინა: ახალი 2-მილიარდპარამეტრიანი მოდელი გაუმჯობესებული არქიტექტურითა და წარმადობით
Stability AI-მ გამოუშვა Stable Diffusion 3 Medium (SD3), 2 მილიარდი პარამეტრიანი ლატენტური დიფუზიური მოდელი, რომელიც განკუთვნილია ტექსტიდან გამოსახულების სინთეზისთვის. ის მოიცავს ინოვაციურ მულტიმოდალურ დიფუზიურ ტრანსფორმატორს (MMDiT) და სამ ტექსტის ენკოდერს, მათ შორის T5-v1.1-XXL-ს. SD3 იყენებს პირობითი ნაკადის შესატყვისობის ობიექტივს სწავლებისთვის და წარმოგიდგენთ ახალ FlowMatchEulerDiscreteScheduler-ს ინფერენსისთვის. Diffusers-ის ინტეგრაცია მოიცავს მეხსიერების ოპტიმიზაციებს, რაც მოდელს უფრო ფარ
დღეს გამოშვებული მოდელი არის Stable Diffusion 3 Medium, 2 მილიარდი პარამეტრით. ამ გამოშვების ფარგლებში წარმოგიდგენთ: SD3 არის ლატენტური დიფუზიური მოდელი, რომელიც შედგება სამი სხვადასხვა ტექსტის ენკოდერისგან (CLIP L/14, OpenCLIP bigG/14 და T5-v1.1-XXL), ახალი მულტიმოდალური დიფუზიური ტრანსფორმატორის (MMDiT) მოდელისგან და 16-არხიანი AutoEncoder მოდელისგან, რომელიც Stable Diffusion XL-ში გამოყენებულის მსგავსია.
SD3 ამუშავებს ტექსტურ შეტანებს და პიქსელურ ლატენტებს, როგორც ემბედინგების თანმიმდევრობას. პოზიციური კოდირებები ემატება ლატენტების 2x2 ზომის პაჩებს, რომლებიც შემდეგ ბრტყელდება პაჩის კოდირების თანმიმდევრობად. ეს თანმიმდევრობა, ტექსტის კოდირების თანმიმდევრობასთან ერთად, მიეწოდება MMDiT ბლოკებს, სადაც ისინი ერთიანდება საერთო განზომილებაში, ხდება მათი კონკატენაცია და გადაიცემა მოდულირებული ყურადღების მექანიზმებისა (attentions) და MLPs თანმიმდევრობის გავლით. ორ მოდალობას შორის განსხვავებების გასათვალისწინებლად, MMDiT ბლოკები იყენებენ წონების ორ ცალკეულ კომპლექტს ტექსტისა და გამოსახულების თანმიმდევრობების საერთო განზომილებაში ჩანერგვისთვის. ეს თანმიმდევრობები ერთიანდება ყურადღების ოპერაციამდე, რაც ორივე წარმოდგენას საშუალებას აძლევს იმუშაოს საკუთარ სივრცეში, ამასთანავე ყურადღების ოპერაციის დროს მეორის გათვალისწინებით. ინფორმაციის ეს ორმხრივი ნაკადი ტექსტურ და გამოსახულების მონაცემებს შორის განსხვავდება ტექსტიდან-გამოსახულების სინთეზის წინა მიდგომებისგან, სადაც ტექსტური ინფორმაცია ლატენტში ერთიანდებოდა ჯვარედინი ყურადღების (cross-attention) მეშვეობით ფიქსირებული ტექსტური წარმოდგენით.
SD3 ასევე იყენებს თავისი ორივე CLIP მოდელის გაერთიანებულ ტექსტურ ემბედინგებს, როგორც მისი დროის საფეხურის კონდიცირების ნაწილს. ეს ემბედინგები ჯერ კონკატენირდება და ემატება დროის საფეხურის ემბედინგს, სანამ MMDiT ბლოკებს გადაეცემა.
არქიტექტურული ცვლილებების გარდა, SD3 იყენებს პირობითი ნაკადის შესატყვისობის ობიექტივს მოდელის მოსამზადებლად. ამ მიდგომით, წინ მიმართული ხმაურის შექმნის პროცესი განისაზღვრება, როგორც გასწორებული ნაკადი, რომელიც მონაცემებსა და ხმაურის განაწილებებს სწორ ხაზზე აკავშირებს. გასწორებული ნაკადის შესატყვისობის შერჩევის პროცესი უფრო მარტივია და კარგად მუშაობს შერჩევის ნაბიჯების რაოდენობის შემცირებისას.
SD3-ით ინფერენსის მხარდასაჭერად, ჩვენ შემოვიღეთ ახალი შეჯდულერი (FlowMatchEulerDiscreteScheduler) გასწორებული ნაკადის შესატყვისობის ფორმულირებითა და ეილერის მეთოდის ნაბიჯებით. ის ასევე ახორციელებს დროის საფეხურის განრიგის რეზოლუციაზე დამოკიდებულ გადანაცვლებას "shift" პარამეტრის მეშვეობით. "shift" მნიშვნელობის გაზრდა უკეთ უმკლავდება ხმაურის მასშტაბირებას მაღალი რეზოლუციებისთვის. 2B მოდელისთვის რეკომენდებულია shift=3.0-ის გამოყენება.
SD3-ის სწრაფად გამოსაცდელად, იხილეთ ქვემოთ მოცემული აპლიკაცია: SD3-ის Diffusers-თან გამოსაყენებლად, დარწმუნდით, რომ განაახლეთ Diffusers-ის უახლეს ვერსიამდე. ვინაიდან მოდელი "გეითიანია" (gated), Diffusers-თან გამოყენებამდე ჯერ უნდა გადახვიდეთ Stable Diffusion 3 Medium Hugging Face გვერდზე, შეავსოთ ფორმა და მიიღოთ წვდომა (accept the gate). წვდომის მიღების შემდეგ, უნდა შეხვიდეთ სისტემაში (log in), რათა თქვენმა სისტემამ იცოდეს, რომ წვდომა მიღებული გაქვთ. შესასვლელად გამოიყენეთ ქვემოთ მოცემული ბრძანება: შემდეგი კოდის ფრაგმენტი ჩამოტვირთავს SD3-ის 2-მილიარდპარამეტრიან ვერსიას fp16 სიზუსტით. ეს არის Stability AI-ის მიერ გამოქვეყნებულ ორიგინალურ ჩექპოინტში გამოყენებული ფორმატი და რეკომენდებული გზა ინფერენსის შესასრულებლად.
SD3-ის დოკუმენტაციას შეგიძლიათ გაეცნოთ აქ. SD3 იყენებს სამ ტექსტის ენკოდერს, რომელთაგან ერთ-ერთია ძალიან დიდი T5-XXL მოდელი. ეს ართულებს მოდელის გაშვებას GPU-ებზე, რომლებსაც 24GB-ზე ნაკლები VRAM აქვთ, fp16 სიზუსტის გამოყენების შემთხვევაშიც კი. ამის გასათვალისწინებლად, Diffusers-ის ინტეგრაცია მოიცავს მეხსიერების ოპტიმიზაციებს, რომლებიც SD3-ის უფრო ფართო სპექტრის მოწყობილობებზე გაშვების საშუალებას იძლევა. Diffusers-ში ხელმისაწვდომი ყველაზე ძირითადი მეხსიერების ოპტიმიზაცია საშუალებას გაძლევთ მოდელის კომპონენტები CPU-ზე გადაიტანოთ ინფერენსის დროს, რათა დაზოგოთ მეხსიერება, თუმცა ინფერენსის შეყოვნება ოდნავ გაიზრდება. მოდელის გადმოტვირთვა (offloading) მოდელის კომპონენტს GPU-ზე მხოლოდ მაშინ გადაიტანს, როცა მისი შესრულებაა საჭირო, დანარჩენ კომპონენტებს კი CPU-ზე დატოვებს.
მეხსიერების ინტენსიური 4.7-მილიარდპარამეტრიანი T5-XXL ტექსტის ენკოდერის მოცილება ინფერენსის დროს მნიშვნელოვნად ამცირებს SD3-ის მეხსიერების მოთხოვნებს, მხოლოდ მცირედი წარმადობის დაკარგვით. შეგიძლიათ T5-XXL მოდელი 8 ბიტში ჩატვირთოთ bitsandbytes ბიბლიოთეკის გამოყენებით მეხსიერების მოთხოვნების კიდევ უფრო შესამცირებლად. სრული კოდის ფრაგმენტი შეგიძლიათ იხილოთ აქ.
ყველა ბენჩმარკინგის ტესტი ჩატარდა SD3 მოდელის 2B ვერსიის გამოყენებით A100 GPU-ზე, 80GB VRAM-ით, fp16 სიზუსტითა და PyTorch 2.3-ით. ჩვენი მეხსიერების ბენჩმარკებისთვის, ვიყენებთ პაიპლაინ ზარების 3 იტერაციას გასათბობად და ვაფიქსირებთ პაიპლაინ ზარების 10 იტერაციის საშუალო ინფერენსის დროს. ჩვენ ვიყენებთ StableDiffusion3Pipeline __call__() მეთოდის ნაგულისხმევ არგუმენტებს.
ინფერენსის შეყოვნების გასაუმჯობესებლად, შეგვიძლია გამოვიყენოთ torch.compile() vae-სა და ტრანსფორმატორის კომპონენტების ოპტიმიზებული გამოთვლითი გრაფის მისაღებად. სრული სკრიპტისთვის იხილეთ აქ. ჩვენ შევაფასეთ torch.compile()-ის წარმადობა SD3-ზე ერთ 80GB A100 მანქანაზე, fp16 სიზუსტითა და PyTorch 2.3-ის გამოყენებით. ჩვენ გავუშვით პაიპლაინ ინფერენსის ზარის 10 იტერაცია 20 დიფუზიური ნაბიჯით. აღმოვაჩინეთ, რომ მოდელების კომპილირებული ვერსიებით საშუალო ინფერენსის დრო იყო 0.585 წამი, რაც 4-ჯერ უფრო სწრაფია, ვიდრე eager execution. გარდა ამისა,
თეგები:
#ai
#მანქანური სწავლება
#გენერაციული ხელოვნური ინტელექტი
#hugging face
#pytorch
#ინფერენსი
#stable diffusion 3 medium
#ტექსტიდან გამოსახულება
#stability ai
#mmdit
#gpu ოპტიმიზაცია
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი