AI WebTV Space-ზე გადასვლით, შეგიძლიათ ახლავე უყუროთ პირდაპირ ეთერში. მობილური მოწყობილობის გამოყენების შემთხვევაში, ნაკადის ნახვა Twitch-ის სარკედან არის შესაძლებელი. AI WebTV-ის მოტივაციაა ღია კოდის ტექსტი-ვიდეოდ გადამყვანი მოდელებით, როგორებიცაა Zeroscope და MusicGen, გენერირებული ვიდეოების დემონსტრირება სახალისო და ხელმისაწვდომი გზით. ამ ღია კოდის მოდელების მოძიება Hugging Face-ის ჰაბზეა შესაძლებელი. ცალკეული ვიდეო მიმდევრობები მიზანმიმართულად მოკლეა, რაც იმას ნიშნავს, რომ WebTV ტექნოლოგიურ დემოდ/შოურელად უნდა განიხილებოდეს და არა რეალურ შოუდ (მხატვრული მიმართულებით ან პროგრამირებით). AI WebTV მუშაობს ვიდეო კადრების მოთხოვნების (prompts) მიღებით და მათი ტექსტი-ვიდეოდ გადამყვან მოდელზე გადაცემით, რათა შეიქმნას კადრების მიმდევრობა. დამატებით, ძირითადი თემა და იდეა (ადამიანის მიერ დაწერილი) გადაეცემა დიდ ენობრივ მოდელს (LLM – ამ შემთხვევაში, ChatGPT-ს), რათა გენერირდეს მრავალფეროვანი ინდივიდუალური მოთხოვნები თითოეული ვიდეო კლიპისთვის. ქვემოთ მოცემულია AI WebTV-ის მიმდინარე არქიტექტურის დიაგრამა: WebTV განხორციელებულია NodeJS-სა და TypeScript-ში და იყენებს Hugging Face-ზე განთავსებულ სხვადასხვა სერვისს. ცენტრალური ვიდეო მოდელი არის Zeroscope V2, ModelScope-ზე დაფუძნებული მოდელი. Zeroscope შედგება ორი ნაწილისგან, რომელთა ერთმანეთთან დაკავშირება შესაძლებელია. გასათვალისწინებელია, რომ ერთი და იგივე მოთხოვნა უნდა იქნას გამოყენებული როგორც გენერაციისთვის, ასევე გაფართოებისთვის (upscaling). სწრაფი პროტოტიპის შესაქმნელად, WebTV ამუშავებს Zeroscope-ს Gradio-ს გაშვებულ ორ დუბლირებულ Hugging Face Spaces-იდან, რომლებიც გამოიძახება @gradio/client NPM პაკეტის გამოყენებით. ორიგინალური სივრცეების ნახვა აქ შეგიძლიათ: [ლინკი]. საზოგადოების მიერ განთავსებული სხვა სივრცეები ასევე შეგიძლიათ იპოვოთ Hugging Face-ის ჰაბზე Zeroscope-ის ძებნისას. მნიშვნელოვანია: საჯარო სივრცეები შესაძლოა ნებისმიერ დროს გადაიტვირთოს და შეჩერდეს. თუ აპირებთ საკუთარი სისტემის განთავსებას, გთხოვთ, დააკოპიროთ ეს სივრცეები და გაუშვათ ისინი თქვენი ანგარიშის ქვეშ. Gradio-ს გამოყენებით შექმნილ სივრცეებს შეუძლიათ REST API-ის გამოაშკარავება, რომლის გამოძახებაც შემდეგ შესაძლებელია Node-დან @gradio/client მოდულის გამოყენებით. აი, მაგალითი: [კოდის მაგალითი]. მას შემდეგ, რაც ინდივიდუალური კადრი (ვიდეო კლიპი) გაფართოვდება, ის გადაეცემა FILM-ს (Frame Interpolation for Large Motion), კადრების ინტერპოლაციის ალგორითმს. პოსტ-პროცესინგის დროს, ჩვენ ასევე ვამატებთ MusicGen-ით გენერირებულ მუსიკას. აღსანიშნავია, რომ ვიდეო ნაკადის შესაქმნელად მრავალი ხელსაწყოს გამოყენებაა შესაძლებელი. AI WebTV ამჟამად იყენებს FFmpeg-ს mp4 ვიდეო ფაილებისა და m4a აუდიო ფაილებისგან შექმნილი დასაკრავი სიის წასაკითხად. ასეთი დასაკრავი სიის შექმნის მაგალითი: [კოდის მაგალითი]. ეს გენერირებას მოახდენს შემდეგი დასაკრავი სიის კონტენტს: [დასაკრავი სიის შინაარსი]. FFmpeg შემდეგ კვლავ გამოიყენება ამ დასაკრავი სიის წასაკითხად და FLV ნაკადის RTMP სერვერზე გასაგზავნად. FLV არის ძველი ფორმატი, მაგრამ მაინც პოპულარულია რეალურ დროში სტრიმინგის სამყაროში დაბალი ლატენტურობის გამო. FFmpeg-ისთვის მრავალი განსხვავებული კონფიგურაციის ვარიანტი არსებობს, დამატებითი ინფორმაციისთვის იხილეთ ოფიციალური დოკუმენტაცია. RTMP სერვერისთვის, ღია კოდის იმპლემენტაციები შეგიძლიათ იპოვოთ GitHub-ზე, როგორიცაა NGINX-RTMP მოდული. თავად AI WebTV იყენებს node-media-server-ს. შეგახსენებთ: ასევე შეგიძლიათ პირდაპირ გაუშვათ ნაკადი Twitch-ის RTMP შესვლის წერტილებიდან. დეტალებისთვის იხილეთ Twitch-ის დოკუმენტაცია. ქვემოთ მოცემულია გენერირებული კონტენტის რამდენიმე მაგალითი. პირველი, რაც შევამჩნიეთ, არის ის, რომ Zeroscope XL-ის მეორე გაშვების გამოყენება მნიშვნელოვნად აუმჯობესებს გამოსახულების ხარისხს. კადრების ინტერპოლაციის გავლენაც აშკარად ჩანს. ტექსტი-ვიდეოდ მოდელების მართლაც მომხიბვლელი ასპექტია მათი უნარი, მოახდინონ რეალური მოვლენების ემულაცია, რომლებზეც ისინი გაწვრთნილი იყვნენ. ეს ვნახეთ დიდ ენობრივ მოდელებზე, მათი უნარით შექმნან დამაჯერებელი კონტენტი, რომელიც ადამიანის პასუხებს ბაძავს, მაგრამ ვიდეოსთან მიმართებაში ეს სრულიად ახალ განზომილებას იძენს. ვიდეო მოდელი ითვალისწინებს სცენის მომდევნო კადრებს, რაც შეიძლება მოიცავდეს მოძრავ ობიექტებს, როგორიცაა სითხეები, ადამიანები, ცხოველები ან სატრანსპორტო საშუალებები. დღეს ეს ემულაცია არ არის სრულყოფილი, მაგრამ საინტერესო იქნება მომავალი მოდელების (უფრო დიდ ან სპეციალიზებულ მონაცემთა ნაკრებებზე გაწვრთნილი, მაგალითად, ცხოველების გადაადგილება) სიზუსტის შეფასება ფიზიკური მოვლენების რეპროდუცირებისას და ასევე აგენტების ქცევის სიმულაციის უნარი. საინტერესო იქნება ამ შესაძლებლობების შემდგომი შესწავლა მომავალში, მაგალითად, ვიდეო მოდელების უფრო დიდ ვიდეო მონაცემთა ნაკრებებზე გაწვრთნით, რომლებიც მეტ მოვლენას მოიცავს. არსებობს გარკვეული შეზღუდვები და პრობლემები: * **არასწორი მიმართულება:** მოდელს ზოგჯერ უჭირს მოძრაობა და მიმართულება. მაგალითად, აქ კლიპი თითქოს უკუღმაა ნათამაშები. ასევე, მოდიფიკატორი საკვანძო სიტყვა "green" არ იქნა გათვალისწინებული. * **რენდერინგის შეცდომები რეალისტურ სცენებზე:** ზოგჯერ შეინიშნება არტეფაქტები, როგორიცაა მოძრავი ვერტიკალური ხაზები ან ტალღები. გაურკვეველია, რა იწვევს ამას, მაგრამ ეს შეიძლება იყოს გამოყენებული საკვანძო სიტყვების კომბინაციის გამო. * **ტექსტი ან ობიექტები გამოსახულებაში:** მოდელი ზოგჯერ ათავსებს სიტყვებს მოთხოვნიდან სცენაში, როგორიცაა "IMAX". მოთხოვნაში "Canon EOS"-ის ან "Drone footage"-ის ხსენებამ ასევე შეიძლება გამოიწვიოს ამ ობიექტების გამოჩენა ვიდეოში. შემდეგ მაგალითში, ვამჩნევთ, რომ სიტყვა "llama" არა მხოლოდ ლამას აჩენს, არამედ სიტყვა "llama"-ს ორ გამეორებას ცეცხლში. ქვემოთ მოცემულია რამდენიმე ადრეული რეკომენდაცია, რომელიც შეიძლება გაკეთდეს წინა დაკვირვებების საფუძველზე: შესაძლოა უკვე იცით, რომ თუ Stable Diffusion-ში გამოსახულების კონკრეტულ ასპექტს არ მიუთითებთ, ასეთი რამეები...