სურათების გენერაციის მონაცემთა ნაკრებების შექმნის ინსტრუმენტები კარგად არის ჩამოყალიბებული. img2dataset წარმოადგენს ფუნდამენტურ ინსტრუმენტს, რომელიც გამოიყენება დიდი მასშტაბის მონაცემთა ნაკრებების მოსამზადებლად და მას ავსებს საზოგადოების მიერ შექმნილი სხვადასხვა სახელმძღვანელოები, სკრიპტები და მომხმარებლის ინტერფეისები, რომლებიც მცირე მასშტაბის ინიციატივებს ფარავს. ჩვენი ამბიციაა, რომ ვიდეო გენერაციის მონაცემთა ნაკრებების ინსტრუმენტებიც ანალოგიურად ჩამოყალიბებული გახდეს. ამას მივაღწევთ ღია ვიდეო მონაცემთა ნაკრებების სკრიპტების შექმნით, რომლებიც მცირე მასშტაბისთვის არის განკუთვნილი, და video2dataset-ის გამოყენებით დიდი მასშტაბის შემთხვევებისთვის. „If I have seen further it is by standing on the shoulders of giants“ (თუკი უფრო შორს დავინახე, ეს იმიტომ, რომ გიგანტების მხრებზე ვიდექი.) ამ პოსტში ჩვენ მიმოვიხილავთ ინსტრუმენტებს, რომლებსაც ვავითარებთ, რათა საზოგადოებისთვის გაადვილდეს საკუთარი მონაცემთა ნაკრებების შექმნა ვიდეო გენერაციის მოდელების დახვეწისთვის (fine-tuning). თუ ვერ ითმენთ დაწყებას, გეპატიჟებით, გაეცნოთ კოდის ბაზას აქ. როგორც წესი, ვიდეო გენერაცია ხდება ბუნებრივი ენის ტექსტური მითითებების საფუძველზე, მაგალითად: "კატა მიდის ბალახზე, რეალისტური სტილით". ვიდეოში არსებობს კონტროლირებადობისა და ფილტრაციისთვის არაერთი ხარისხობრივი ასპექტი, მაგალითად: ვიდეო გენერაციის მოდელები იმდენად კარგია, რამდენადაც კარგია ის მონაცემები, რომლებზეც ისინი იწვრთნებიან. აქედან გამომდინარე, ეს ასპექტები გადამწყვეტი ხდება მონაცემთა ნაკრებების შედგენისას ვარჯიშისთვის/დახვეწისთვის. ჩვენი 3-ეტაპიანი კონვეიერი (pipeline) შთაგონებულია ისეთი ნაშრომებით, როგორიცაა Stable Video Diffusion, LTX-Video და მათი მონაცემთა კონვეიერები. video2dataset-ის მსგავსად, ჩვენ ვირჩევთ yt-dlp-ის გამოყენებას ვიდეოების ჩამოსატვირთად. ჩვენ ვქმნით სკრიპტს „Video to Scenes“ გრძელი ვიდეოების მოკლე კლიპებად დასაყოფად. Florence-2 (microsoft/Florence-2-large) გამოიყენება Florence-2 ამოცანების (, , და ) შესასრულებლად ამოღებულ კადრებზე. ეს უზრუნველყოფს სხვადასხვა აღწერას (captions), ობიექტის ამოცნობას და OCR-ს, რომლებიც შეიძლება გამოყენებულ იქნას ფილტრაციისთვის სხვადასხვა გზით. ამ მხრივ შეგვიძლია ნებისმიერი სხვა აღწერის ინსტრუმენტი გამოვიყენოთ. ასევე შეგვიძლია მთლიანი ვიდეოს აღწერა (მაგ. Qwen2.5-ის მსგავსი მოდელით) ინდივიდუალური კადრების აღწერის ნაცვლად. მოდელისთვის finetrainers/crush-smol-v0 მონაცემთა ნაკრებში, ჩვენ ავირჩიეთ Qwen2VL-ის აღწერები და ფილტრაცია განვახორციელეთ pwatermark < 0.1 და aesthetic > 5.5 მაჩვენებლებზე. ამ მკაცრი ფილტრაციის შედეგად 1493 ვიდეოდან მხოლოდ 47 დარჩა. მოდით, გადავხედოთ pwatermark-ის მაგალით კადრებს - ორ ტექსტიან კადრს აქვს 0.69 და 0.61 ქულა. „სათამაშო მანქანა თაგვებით“ იღებს 0.60 ქულას, შემდეგ კი 0.17-ს, როდესაც სათამაშო მანქანა დამსხვრეულია. ყველა მაგალითი კადრი გაფილტრული იყო pwatermark < 0.1 პირობით. pwatermark ეფექტურია ტექსტის/წყლის ნიშნების აღმოსაჩენად, თუმცა ქულა არ მიუთითებს, არის ეს ტექსტური გადაფარვა თუ სათამაშო მანქანის სანომრე ნიშანი. ჩვენი ფილტრაციისთვის ყველა ქულა ზღვარს ქვემოთ უნდა ყოფილიყო. კადრებზე საშუალო მაჩვენებლის გამოყენება უფრო ეფექტური სტრატეგია იქნებოდა pwatermark-ისთვის, დაახლოებით 0.2 – 0.3 ზღვრით. მოდით, გადავხედოთ ესთეტიკური ქულების მაგალით კადრებს - ვარდისფერი ციხესიმაგრე თავდაპირველად იღებს 5.5 ქულას, შემდეგ კი 4.44-ს, როდესაც ის დამსხვრეულია. მოქმედების ფიგურა უფრო დაბალ ქულას იღებს, 4.99-ს, რომელიც 4.84-მდე ეცემა დამსხვრევისას. მინის ნამსხვრევი დაბალ 4.04 ქულას იღებს. ჩვენს ფილტრაციაში მოვითხოვდით, რომ ყველა ქულა ზღვარს ქვემოთ ყოფილიყო; ამ შემთხვევაში, მხოლოდ პირველი კადრის ესთეტიკური ქულის გამოყენება უფრო ეფექტური სტრატეგია იქნებოდა. თუ გადავხედავთ finetrainers/crush-smol-ს, შევამჩნევთ, რომ მრავალი დამსხვრეული ობიექტი მრგვალი ან მართკუთხა და ფერადია, რაც მსგავსია ჩვენი აღმოჩენებისა მაგალით კადრებში. ესთეტიკური ქულები შეიძლება იყოს სასარგებლო, მაგრამ მათ აქვთ მიკერძოება, რამაც შესაძლოა კარგი მონაცემებიც გაფილტროს ექსტრემალური ზღვრების (მაგ., > 5.5) გამოყენებისას. ის შესაძლოა უფრო ეფექტური იყოს ცუდი კონტენტის გასაფილტრად, ვიდრე კარგი კონტენტის, მინიმალური ზღვრით დაახლოებით 4.25 - 4.5. აქ მოცემულია ვიზუალური მაგალითები თითოეული ფილტრისთვის, ასევე Florence-2-დან მიღებული აღწერები. ჩვენ შევქმენით სხვადასხვა მონაცემთა ნაკრებები ამ ინსტრუმენტებით, რათა შეგვექმნა მაგარი ვიდეო ეფექტები, Pika Effects-ის მსგავსად. შემდეგ ეს მონაცემთა ნაკრებები გამოვიყენეთ CogVideoX-5B მოდელის დასახვეწად finetrainers-ის გამოყენებით. ქვემოთ მოცემულია finetrainers/crush-smol-v0-ის მაგალითი გამოსავალი: ვიმედოვნებთ, რომ ეს ინსტრუმენტები დაგეხმარებათ შექმნათ მცირე და მაღალი ხარისხის ვიდეო მონაცემთა ნაკრებები თქვენი საკუთარი აპლიკაციებისთვის. ჩვენ გავაგრძელებთ უფრო სასარგებლო ფილტრების დამატებას საცავში, ასე რომ, თვალი ადევნეთ. თქვენი წვლილიც მისასალმებელია. მადლობა პედრო კუენკას პოსტის ყოვლისმომცველი განხილვისთვის.