ღია კოდის ვიდეო გენერაციის მოდელების აღზევება: დგას თუ არა AI „Stable Diffusion-ის მომენტის“ ზღურბლზე?
ბოლო დროს შეინიშნება ღია კოდის ვიდეოს გენერაციის მოდელების, მათ შორის CogVideoX, Mochi-1, Hunyuan და LTX Video-ს სწრაფი ზრდა, რაც ბადებს კითხვას, დგას თუ არა ვიდეო საზოგადოება ხელოვნური ინტელექტის „Stable Diffusion-ის მომენტის“ ზღურბლზე. ეს სტატია მიმოიხილავს ვიდეოს გენერაციის მოდელების მიმდინარე მდგომარეობას, ხაზს უსვამს ისეთ შეზღუდვებს, როგორიცაა მოძრაობის ხარისხი, დროითი თანმიმდევრულობა და მეხსიერების მაღალი მოთხოვნები. Diffusers-ის გუნდი აქტიურად მუშაობს ამ გამოწვევების გადასაჭრელად სხვადასხ
ღია კოდის სექტორშიც შეინიშნება ვიდეოს გენერაციის მოდელების სწრაფი ზრდა, ისეთების, როგორიცაა CogVideoX, Mochi-1, Hunyuan, Allegro და LTX Video. განიცდის თუ არა ვიდეო საზოგადოება თავის „Stable Diffusion-ის მომენტს“?
ეს სტატია გთავაზობთ ვიდეოს გენერაციის მოდელების ამჟამინდელი მდგომარეობის მოკლე მიმოხილვას, თუ სად ვართ ღია ვიდეოს გენერაციის მოდელებთან მიმართებაში და როგორ გეგმავს Diffusers-ის გუნდი მათ ფართომასშტაბიან დანერგვას. კერძოდ, განვიხილავთ:
ეს არის ხელოვნური ინტელექტით გენერირებული კონტენტის შექმნისთვის დღესდღეობით ყველაზე პოპულარული ვიდეო მოდელები.
შეზღუდვები: ვიდეოებში არის რამდენიმე ფაქტორი, რომელთა დანახვა და კონტროლი გვსურს:
სურათის გენერაციის მოდელებთან დაკავშირებით, როგორც წესი, მხოლოდ პირველ სამ ასპექტზე ვზრუნავთ. თუმცა, ვიდეოს გენერაციისთვის ახლა უნდა გავითვალისწინოთ მოძრაობის ხარისხი, თანმიმდევრულობა და თანხვედრა დროთა განმავლობაში, პოტენციურად რამდენიმე სუბიექტთან ერთად. სწორი ბალანსის პოვნა კარგ მონაცემებს, სწორ ინდუქციურ პრიორებსა და წვრთნის მეთოდოლოგიებს შორის, რათა დააკმაყოფილოს ეს დამატებითი მოთხოვნები, უფრო რთული აღმოჩნდა, ვიდრე სხვა მოდალობებში.
ტექსტიდან ვიდეოს გენერაციის მოდელებს აქვთ მსგავსი კომპონენტები, როგორც მათ ტექსტიდან გამოსახულების გენერაციის ანალოგებს: ვიდეო მოდელების უახლესი თაობა იზიარებს ძირითად მახასიათებელს, სადაც ხმაურისგან გაწმენდის ქსელი (denoising network) ამუშავებს 3D ვიდეო ტოკენებს, რომლებიც აღბეჭდავენ როგორც სივრცით, ასევე დროით ინფორმაციას. ვიდეო ენკოდერ-დეკოდერ სისტემა, რომელიც პასუხისმგებელია ამ ტოკენების წარმოებასა და დეკოდირებაზე, იყენებს როგორც სივრცით, ასევე დროით კომპრესიას. მიუხედავად იმისა, რომ ლატენტების დეკოდირება, როგორც წესი, მეხსიერების ყველაზე დიდ მოცულობას მოითხოვს, ეს მოდელები გვთავაზობენ კადრ-კადრ დეკოდირების ვარიანტებს მეხსიერების გამოყენების შესამცირებლად.
ტექსტის პირობითი დამუშავება ინტეგრირებულია ან ერთობლივი ყურადღების (joint attention, დანერგილი Stable Diffusion 3-ში) ან ჯვარედინი ყურადღების (cross-attention) მეშვეობით. T5 იქცა სასურველ ტექსტის ენკოდერად უმეტეს მოდელებში, HunYuan გამონაკლისია, რადგან ის იყენებს როგორც CLIP-L-ს, ასევე LLaMa 3-ს. თავად ხმაურისგან გაწმენდის ქსელი ეფუძნება DiT არქიტექტურას, რომელიც შეიმუშავეს უილიამ პიბლსმა და საინინგ ქსიმ, PixArt-ის სხვადასხვა დიზაინის ელემენტების ინკორპორირებით.
ვიდეო მოდელებთან მუშაობისას გენერაციის სამი ფართო კატეგორიაა შესაძლებელი:
ტექსტიდან (და სხვა პირობებიდან) ვიდეოზე გადასვლა მხოლოდ რამდენიმე ხაზი კოდია. ქვემოთ ვაჩვენებთ, თუ როგორ უნდა განხორციელდეს ტექსტიდან ვიდეოს გენერაცია Lightricks-ის LTX-Video მოდელის გამოყენებით. ნებისმიერი მოდელისთვის საჭირო მეხსიერების მოთხოვნები შეიძლება გამოითვალოს შემდეგი კომპონენტების შეკრებით: წონებისთვის (weights) საჭირო მეხსიერება შეიძლება შემცირდეს კვანტიზაციის, დაბალ dtype-ებზე დაყვანის ან CPU-ზე გადმოტვირთვის გზით. აქტივაციების მდგომარეობებისთვის საჭირო მეხსიერება ასევე შეიძლება შემცირდეს, მაგრამ ეს უფრო რთული პროცესია, რომელიც ამ ბლოგის ფარგლებს სცდება. შესაძლებელია ნებისმიერი ვიდეო მოდელის გაშვება უკიდურესად დაბალი მეხსიერებით, მაგრამ ეს ინფერენსისთვის საჭირო დროის ხარჯზე ხდება. თუ ოპტიმიზაციის ტექნიკით მოთხოვნილი დრო აღემატება იმას, რასაც მომხმარებელი გონივრულად მიიჩნევს, ინფერენსის გაშვება მიზანშეწონილი არ არის. Diffusers გთავაზობთ ბევრ ასეთ ოპტიმიზაციას, რომლებიც არჩევითია და შეიძლება ერთმანეთთან დაკავშირდეს. ქვემოთ მოცემულ ცხრილში წარმოვადგენთ მეხსიერების მოთხოვნებს სამი პოპულარული ვიდეოს გენერაციის მოდელისთვის გონივრული ნაგულისხმევი პარამეტრებით:
ეს რიცხვები მიღებულ იქნა შემდეგი პარამეტრებით 80GB A100 მანქანაზე (სრული სკრიპტი აქ): ეს მოთხოვნები საკმაოდ შთამბეჭდავია და ართულებს ამ მოდელების გაშვებას სამომხმარებლო აპარატურაზე. Diffusers-ის საშუალებით, მომხმარებლებს შეუძლიათ აირჩიონ სხვადასხვა ოპტიმიზაცია მეხსიერების გამოყენების შესამცირებლად.
ქვემოთ მოცემული ცხრილი წარმოადგენს HunyuanVideo-ს მეხსიერების მოთხოვნებს სხვადასხვა ოპტიმიზაციის გააქტიურებით, რომლებიც მინიმალურ კომპრომისებს აკეთებენ ხარისხსა და ინფერენსისთვის საჭირო დროში. ამ კვლევისთვის გამოვიყენეთ HunyuanVideo, რადგან ის საკმარისად დიდი ზომისაა, რათა პროგრესულად აჩვენოს ოპტიმიზაციების უპირატესობები. *bitsandbytes-ში 8-ბიტიანი მოდელები არ შეიძლება GPU-დან CPU-ზე გადავიდეს, 4-ბიტიანებისგან განსხვავებით. ^მეხსიერების გამოყენება შემდგომში არ მცირდება, რადგან პიკური გამოყენება მოდის ყურადღების (attention) და feed-forward გამოთვლაზე. Flash Attention-ის და ოპტიმიზებული Feed-Forward-ის გამოყენებას შეუძლია ამ მოთხოვნის დაყვანა ~5 GB-მდე. ეს რიცხვები მივიღეთ ზემოთ მოცემული იგივე პარამეტრებით. ასევე გაითვალისწინეთ, რომ რიცხვითი სიზუსტის დაკარგვის გამო, კვანტიზაციამ შეიძლება გავლენა მოახდინოს შედეგების ხარისხზე, რომლის ეფექტები ვიდეოებში უფრო გამოკვეთილია, ვიდრე სურათებში. ამ ოპტიმიზაციების შესახებ დამატებით დეტალებს ქვემოთ მოცემულ სექციებში, ასევე კოდის ფრაგმენტებთან ერთად წარმოგიდგენთ. მაგრამ თუ უკვე აღფრთოვანებული ხართ, გირჩევთ გაეცნოთ ჩვენს სახელმძღვანელოს.
ვიდეოს გენერაცია შეიძლება საკმაოდ რთული იყოს რესურსებით შეზღუდულ მოწყობილობებზე და დიდ დროს მოითხოვდეს უფრო მძლავრ GPU-ებზეც კი. Diffusers გთავაზობთ ხელსაწყოების კომპლექტს, რომელიც ხელს უწყობს ამ მოდელების გაშვების დროისა და მეხსიერების მოხმარების ოპტიმიზაციას. ეს ოპტიმიზაციები მიეკუთვნება შემდეგ კატეგორიებს: ქვემოთ წარმოგიდგენთ ზოგიერთი მოწინავე ოპტიმიზაციის ტექნიკის ჩამონათვალს, რომლებიც ამჟამად მუშავდება და მალე გაერთიანდება: ქვემოთ მოცემულია HunyuanVideo-ზე 4-ბიტიანი კვანტიზაციის, VAE ტაილინგის, CPU-ზე გადმოტვირთვისა და შრეების მიხედვით კასტინგის გამოყენების მაგალითი, რათა შემცირდეს საჭირო VRAM მხოლოდ ~6.5 GB-მდე 121 x 512 x 768 რეზოლუციის ვიდეოებისთვის. ჩვენი ინფორმაციით, ეს არის ყველაზე დაბალი მეხსიერების მოთხოვნა, რაც...
თეგები:
#ai
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#ოპტიმიზაცია
#gpu
#მეხსიერება
#ღია კოდი
#stable diffusion
#diffusers
#vram
#ვიდეოს გენერაცია
#hunyuanvideo
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები