ხელოვნური ინტელექტის ვიდეო გენერაციის მოდელები: მიმდინარე მდგომარეობა და ოპტიმიზაციის გზები
ღია კოდის პროექტებში ვიდეოს გენერაციის მოდელების სწრაფი განვითარება შეინიშნება, რამაც შეიძლება გამოიწვიოს „Stable Diffusion მომენტის“ განმეორება ვიდეო საზოგადოებაში. ეს სტატია მიმოიხილავს ვიდეოს გენერაციის მოდელების მიმდინარე მდგომარეობას, მათ შეზღუდვებს (კერძოდ, მოძრაობის ხარისხს, თანმიმდევრულობასა და კონსისტენტურობას დროის განმავლობაში) და არქიტექტურულ თავისებურებებს, როგორიცაა 3D ვიდეო ტოკენების დამუშავება. ყურადღება ექცევა Diffusers-ის გუნდის მიერ შემოთავაზებულ მეხსიერების ოპტიმიზაციის ტექნი
ღია კოდის პროექტებში ასევე შეინიშნება ვიდეოს გენერაციის მოდელების ზრდა, როგორიცაა CogVideoX, Mochi-1, Hunyuan, Allegro და LTX Video. განიცდის თუ არა ვიდეო საზოგადოება თავის „Stable Diffusion მომენტს“? ეს პოსტი წარმოადგენს ვიდეოს გენერაციის მოდელების მიმდინარე მდგომარეობის მოკლე მიმოხილვას, თუ სად ვართ ღია ვიდეოს გენერაციის მოდელებთან მიმართებაში და როგორ გეგმავს Diffusers-ის გუნდი მათ ფართომასშტაბიან დანერგვას. კერძოდ, განვიხილავთ: ეს არის დღეს ხელოვნური ინტელექტის მიერ გენერირებული კონტენტის შექმნისთვის ყველაზე პოპულარული ვიდეო მოდელები. შეზღუდვები: არსებობს რამდენიმე ფაქტორი, რომელთა ნახვა და კონტროლი გვსურს ვიდეოებში:
გამოსახულების გენერაციის მოდელების შემთხვევაში, როგორც წესი, მხოლოდ პირველი სამი ასპექტი გვაინტერესებს. თუმცა, ვიდეოს გენერაციისთვის ახლა უნდა გავითვალისწინოთ მოძრაობის ხარისხი, თანმიმდევრულობა და კონსისტენტურობა დროის განმავლობაში, პოტენციურად რამდენიმე სუბიექტთან ერთად. სწორი ბალანსის პოვნა კარგ მონაცემებს, სწორ ინდუქციურ პრიორებსა და სწავლების მეთოდოლოგიებს შორის ამ დამატებითი მოთხოვნების დასაკმაყოფილებლად, უფრო რთული აღმოჩნდა, ვიდრე სხვა მოდალობებისთვის.
ტექსტიდან ვიდეოს გენერაციის მოდელებს აქვთ მსგავსი კომპონენტები, როგორც მათ ტექსტიდან გამოსახულების გენერაციის ანალოგებს: ვიდეო მოდელების უახლეს თაობას აქვს ძირითადი მახასიათებელი, სადაც დენოიზინგის ქსელი ამუშავებს 3D ვიდეო ტოკენებს, რომლებიც აღბეჭდავს როგორც სივრცულ, ასევე დროით ინფორმაციას. ვიდეო ენკოდერ-დეკოდერის სისტემა, რომელიც პასუხისმგებელია ამ ტოკენების შექმნასა და დეკოდირებაზე, იყენებს როგორც სივრცულ, ასევე დროით კომპრესიას. მიუხედავად იმისა, რომ ლატენტების დეკოდირება, როგორც წესი, ყველაზე მეტ მეხსიერებას მოითხოვს, ეს მოდელები გთავაზობთ კადრ-კადრ დეკოდირების ვარიანტებს მეხსიერების გამოყენების შესამცირებლად. ტექსტის კონდიცირება ინტეგრირებულია ერთობლივი ყურადღების (დაინერგა Stable Diffusion 3-ში) ან ჯვარედინი ყურადღების მეშვეობით. T5 იქცა სასურველ ტექსტურ ენკოდერად მოდელების უმეტესობაში, გამონაკლისს წარმოადგენს HunYuan, რომელიც იყენებს როგორც CLIP-L-ს, ასევე LLaMa 3-ს. თავად დენოიზინგის ქსელი აგებულია DiT არქიტექტურაზე, რომელიც შეიმუშავეს უილიამ პიბლსმა და საინინგ ქსიმ, PixArt-ის სხვადასხვა დიზაინის ელემენტების ინტეგრირებით. არსებობს გენერაციის სამი ფართო კატეგორია, რომელიც შესაძლებელია ვიდეო მოდელებთან მუშაობისას: ტექსტიდან (და სხვა პირობებიდან) ვიდეოზე გადასვლა მხოლოდ რამდენიმე ხაზი კოდია. ქვემოთ ვაჩვენებთ, თუ როგორ უნდა განხორციელდეს ტექსტიდან ვიდეოს გენერაცია Lightricks-ის LTX-Video მოდელის გამოყენებით.
ნებისმიერი მოდელისთვის მეხსიერების მოთხოვნები შეიძლება გამოითვალოს შემდეგის დამატებით: წონების მიერ მოთხოვნილი მეხსიერება შეიძლება შემცირდეს კვანტიზაციის, ქვედა მონაცემთა ტიპებზე დაყვანის, ან CPU-ზე გადმოტვირთვის გზით. აქტივაციის მდგომარეობებისთვის საჭირო მეხსიერება ასევე შეიძლება შემცირდეს, მაგრამ ეს უფრო რთული პროცესია, რომელიც ამ ბლოგის ფარგლებს სცდება. შესაძლებელია ნებისმიერი ვიდეო მოდელის გაშვება უკიდურესად დაბალი მეხსიერებით, მაგრამ ეს ხდება ინფერენციისთვის საჭირო დროის ხარჯზე. თუ ოპტიმიზაციის ტექნიკით მოთხოვნილი დრო აღემატება იმას, რასაც მომხმარებელი გონივრულად მიიჩნევს, ინფერენციის გაშვება მიზანშეწონილი არ არის. Diffusers გთავაზობთ მრავალ ასეთ ოპტიმიზაციას, რომლებიც ნებაყოფლობითია და შეიძლება ერთმანეთთან დაკავშირება.
ქვემოთ მოცემულ ცხრილში წარმოგიდგენთ მეხსიერების მოთხოვნებს სამი პოპულარული ვიდეოს გენერაციის მოდელისთვის გონივრული ნაგულისხმევი პარამეტრებით: ეს მაჩვენებლები მიღებულ იქნა შემდეგი პარამეტრებით 80GB A100 მანქანაზე (სრული სკრიპტი აქ): ეს მოთხოვნები საკმაოდ შთამბეჭდავია და ართულებს ამ მოდელების გაშვებას სამომხმარებლო აპარატურაზე. Diffusers-ის საშუალებით მომხმარებლებს შეუძლიათ აირჩიონ სხვადასხვა ოპტიმიზაცია მეხსიერების გამოყენების შესამცირებლად.
შემდეგი ცხრილი წარმოადგენს HunyuanVideo-ს მეხსიერების მოთხოვნებს სხვადასხვა ოპტიმიზაციით, რომლებიც მინიმალურ კომპრომისებს ახდენენ ხარისხსა და ინფერენციისთვის საჭირო დროს. ამ კვლევისთვის გამოვიყენეთ HunyuanVideo, რადგან ის საკმარისად დიდია, რათა თანდათანობით აჩვენოს ოპტიმიზაციების სარგებელი. *bitsandbytes-ში 8-ბიტიანი მოდელები არ შეიძლება გადავიდეს CPU-ზე GPU-დან, 4-ბიტიანებისგან განსხვავებით. ^მეხსიერების გამოყენება აღარ მცირდება, რადგან პიკური გამოყენება მოდის ყურადღებისა და წინსვლის გამოთვლაზე. Flash Attention-ისა და ოპტიმიზებული Feed-Forward-ის გამოყენება დაგვეხმარება ამ მოთხოვნის დაახლოებით 5 GB-მდე შემცირებაში. ეს მაჩვენებლები მივიღეთ ზემოთ მოცემული იგივე პარამეტრების გამოყენებით. ასევე გაითვალისწინეთ, რომ რიცხვითი სიზუსტის დაკარგვის გამო, კვანტიზაციამ შეიძლება გავლენა მოახდინოს გამომავალი მასალის ხარისხზე, რომლის ეფექტები ვიდეოებში უფრო გამოკვეთილია, ვიდრე სურათებში. ამ ოპტიმიზაციების შესახებ დამატებით დეტალებს ქვემოთ მოცემულ სექციებში წარმოგიდგენთ, კოდის ფრაგმენტებთან ერთად. მაგრამ თუ უკვე აღფრთოვანებული ხართ, გირჩევთ, გაეცნოთ ჩვენს სახელმძღვანელოს.
ვიდეოს გენერაცია შეიძლება საკმაოდ რთული იყოს რესურსებით შეზღუდულ მოწყობილობებზე და შრომატევადი, თუნდაც უფრო ძლიერ GPU-ებზე. Diffusers გთავაზობთ კომუნალური საშუალებების კომპლექტს, რომლებიც ხელს უწყობენ ამ მოდელების როგორც მუშაობის დროის, ასევე მეხსიერების მოხმარების ოპტიმიზაციას. ეს ოპტიმიზაციები შემდეგ კატეგორიებში შედის: ქვემოთ მოცემულია მოწინავე ოპტიმიზაციის ტექნიკების ჩამონათვალი, რომლებიც ამჟამად მუშაობის პროცესშია და მალე გაერთიანდება: ქვემოთ მოცემულია 4-ბიტიანი კვანტიზაციის, VAE tiling-ის, CPU offloading-ისა და layerwise casting-ის გამოყენების მაგალითი HunyuanVideo-ზე, რათა შემცირდეს VRAM-ის საჭიროება დაახლოებით 6.5 GB-მდე 121 x 512 x 768 რეზოლუციის ვიდეოებისთვის. ჩვენი ინფორმაციით, ეს არის ყველაზე დაბალი მეხსიერების მოთხოვნა, რაც კი მიღწეულია ამ დროისთვის.
თეგები:
#ხელოვნური ინტელექტი
#gpu
#ვიდეო გენერაცია
#ღია კოდი
#stable diffusion
#deep learning
#diffusers
#მეხსიერების ოპტიმიზაცია
#hunyuanvideo
#ltx-video
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი