ლატენტურ სივრცეში დიფუზიური მოდელებით მუშაობისას მაღალი რეზოლუციის სურათებისა და ვიდეოების სინთეზისთვის, VAE დეკოდერს შეუძლია საკმაოდ დიდი მეხსიერება მოიხმაროს. ეს მომხმარებლებს უძნელებს ამ მოდელების გაშვებას სამომხმარებლო GPU-ებზე, შეყოვნებების და სხვა მსგავსი კომპრომისების გარეშე. მაგალითად, offloading-ის დროს, მოწყობილობებს შორის გადაცემის დანახარჯია, რაც იწვევს საერთო ინფერენციის შეყოვნებას. Tiling არის კიდევ ერთი გამოსავალი, რომელიც საშუალებას გვაძლევს ვიმუშაოთ შეყვანის ე.წ. „ფილებზე“ (tiles). თუმცა, მას შეიძლება ჰქონდეს უარყოფითი გავლენა საბოლოო სურათის ხარისხზე. ამიტომ, გვსურს საზოგადოებასთან ერთად გამოვცადოთ იდეა — დეკოდირების პროცესის დელეგირება დისტანციურ ენდპოინტზე. მონაცემები არ ინახება და არ თვალყურს ადევნებენ, კოდი კი ღიაა (open source). ჩვენ შევიტანეთ ცვლილებები `huggingface-inference-toolkit`-ში და ვიყენებთ მორგებულ ჰენდლერებს (custom handlers). ეს ექსპერიმენტული ფუნქცია შემუშავებულია Diffusers 🧨-ის მიერ. **შინაარსი:** ქვემოთ განვიხილავთ სამ გამოყენების შემთხვევას, სადაც, ჩვენი აზრით, ეს დისტანციური VAE ინფერენცია მომგებიანი იქნება. **პირველი, ჩვენ შევქმენით დამხმარე მეთოდი დისტანციურ VAE-ებთან ურთიერთობისთვის. კოდის გასაშვებად დააინსტალირეთ `diffusers` `main` ფილიალიდან:** ```bash pip install git+https://github.com/huggingface/diffusers@main ``` აქ ნაჩვენებია, თუ როგორ გამოვიყენოთ დისტანციური VAE შემთხვევით ტენსორებზე. Flux-ისთვის გამოყენება ოდნავ განსხვავებულია. Flux-ის ლატენტები შეფუთულია, ამიტომ საჭიროა სიმაღლისა და სიგანის გაგზავნა. და ბოლოს, მაგალითი HunyuanVideo-სთვის. მაგრამ ჩვენ გვსურს VAE გამოვიყენოთ რეალურ პაიპლაინზე რეალური გამოსახულების მისაღებად და არა შემთხვევითი ხმაურის. ქვემოთ მოცემული მაგალითი გვიჩვენებს, თუ როგორ გავაკეთოთ ეს SD v1.5-ით. აქ არის კიდევ ერთი მაგალითი Flux-ით. აქ არის მაგალითი HunyuanVideo-თი. დისტანციური VAE-ის გამოყენების ერთ-ერთი დიდი უპირატესობა ის არის, რომ ჩვენ შეგვიძლია რამდენიმე გენერაციის მოთხოვნის რიგში ჩაყენება. სანამ მიმდინარე ლატენტი დეკოდირებისთვის მუშავდება, ჩვენ უკვე შეგვიძლია მეორის რიგში ჩაყენება. ეს ხელს უწყობს პარალელური დამუშავების გაუმჯობესებას (concurrency). ეს ცხრილები აჩვენებს VRAM-ის მოთხოვნებს სხვადასხვა GPU-ებისთვის. მეხსიერების გამოყენების პროცენტი განსაზღვრავს, დასჭირდებათ თუ არა კონკრეტული GPU-ის მომხმარებლებს offload-ის გამოყენება. offload-ის დრო იცვლება CPU-ს, RAM-ის და HDD/NVMe-ის მიხედვით. Tiled დეკოდირება ზრდის ინფერენციის დროს. თუ მოგწონთ იდეა და ფუნქცია, გთხოვთ, მოგვაწოდოთ თქვენი უკუკავშირი, თუ როგორ შეგვიძლია მისი გაუმჯობესება და რამდენად დაგაინტერესებთ ამ ტიპის ფუნქციის უფრო ნატიურად ინტეგრირება Hugging Face ეკოსისტემაში. თუ ეს საპილოტე პროექტი წარმატებით დასრულდება, ჩვენ ვგეგმავთ ოპტიმიზებული VAE ენდპოინტების შექმნას მეტი მოდელისთვის, მათ შორის ისეთებისთვის, რომლებსაც შეუძლიათ მაღალი რეზოლუციის ვიდეოების გენერირება! **მეტი სტატია ჩვენი ბლოგიდან** **კომენტარები:** **მომხმარებელი 1:** სტატია არ არის ბოლომდე ნათელი ზოგიერთ პუნქტში: არ ვარ დარწმუნებული, რატომ არის ეს გაუგებარი, მაგრამ სრულყოფილების ინტერესებიდან გამომდინარე. VAE tiling ყოველთვის ხდება? ჩვენ არასდროს გვიხსენებია, რომ ეს ხდება. რას გულისხმობთ „tiled memory“ / „tiled time“-ში? „Tiled memory“ / „time“ ნიშნავს, რომ ჩვენ ვიყენებთ tiling-ს. „time“ ნიშნავს „ინფერენციის დროს“ ან „offloading-ის დროს“ – სრულ ორმხრივ დროს. თუკი სხვა რამეს გულისხმობდა, ეს სხვების მსგავსად იქნებოდა მითითებული. გვჭირდება Pro ანგარიში ამისთვის? არა. **მომხმარებელი 2:** გამარჯობა. ძალიან კარგი იმპლემენტაციაა, უნაკლოდ მუშაობს, დეკოდირებას 2-4 წამი სჭირდება, გამოსახულების ზომის მიხედვით. მარტივი კითხვაა, არის თუ არა შესაძლებლობა, შევქმნათ ლოკალური ენდპოინტი სხვა მანქანაზე (არა HF) და გამოვიყენოთ ის, როგორც VAE-დეკოდირების მანქანა? მაგალითად, Comfy UI-ის იმპლემენტაცია. Comfy იმპლემენტაცია: https://github.com/kijai/ComfyUI-HFRemoteVae ენდპოინტის ჰოსტინგი შეგიძლიათ ადგილობრივ მანქანაზე და გამოიყენოთ ის, როგორც ნაჩვენებია ბლოგ პოსტში, თუ შეყვანის და გამომავალი სქემები ემთხვევა ერთმანეთს. **მომხმარებელი 1:** კარგი, კიდევ ერთხელ გადავიკითხავ. გმადლობთ. 📻 🎙️ **მომხმარებელი 3:** ჰეი, ამ ბლოგ პოსტზე AI პოდკასტი შევქმენი, ნახეთ! ეს პოდკასტი გენერირებულია ngxson/kokoro-podcast-generator-ის მეშვეობით, DeepSeek-R1 და Kokoro-TTS-ის გამოყენებით. ხმა არ ისმის. ძალიან კარგი ფუნქციაა. შესანიშნავი ნამუშევარი! ახლახან დავდე მოკლე ვიდეო LinkedIn-ზე ამის საჩვენებლად. ნახეთ! https://www.linkedin.com/posts/activity-7301008441123164161-rTau?utm_source=social_share_send&utm_medium=member_desktop_web&rcm=ACoAAAI2QycBC7JU4jV0Vw61G4AWBGaE_MlKUtU **მომხმარებელი 4:** შეგვიძლია თუ არა მივიღოთ Wan Video 2.1 VAE დისტანციური დეკოდირებისთვის? · დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის