ხელოვნური ინტელექტი ხელოვნებაში: ღია კოდის მოდელების გარდამტეხი წელი (2024-ის მიღწევები და 2025-ის მოლოდინები)
ბოლო რამდენიმე წელი, განსაკუთრებით კი 2024, გარდამტეხი აღმოჩნდა ხელოვნური ინტელექტის (AI) ღია კოდის მოდელებისა და ინსტრუმენტებისთვის ხელოვნებითი გამოყენების კუთხით. ამ მიმოხილვაში განვიხილავთ 2024 წლის მთავარ მიღწევებს, როგორიცაა DiT არქიტექტურის და Flux.1-ის გამოჩენა, პერსონალიზაციის ტექნიკების გაუმჯობესება და „ნულოვანი ოპტიმიზაციის“ მეთოდების აღმასვლა გამოსახულების გენერაციაში. სტატია ასევე მიმოიხილავს ვიდეოს გენერაციის სფეროში არსებულ გამოწვევებს და 2025 წლის მოლოდინებს, რომელიც AI და ხელოვნე
ბოლო რამდენიმე წელი გარდამტეხი აღმოჩნდა ღია კოდის მოდელებისა და ინსტრუმენტებისთვის ხელოვნებითი გამოყენების კუთხით. ხელოვნური ინტელექტის ინსტრუმენტები კრეატიული გამოხატვისთვის არასოდეს ყოფილა ასეთი ხელმისაწვდომი, და ჩვენ ჯერ მხოლოდ ზედაპირს ვფხიკავთ. შემოგვიერთდით, როდესაც უკან ვიხედებით 2024 წლის AI და ხელოვნების სფეროში მიღწეულ ძირითად ეტაპებს, ინსტრუმენტებსა და გარღვევებს, ასევე წინ ვიხედებით 2025 წელს მოსალოდნელი სიახლეებისკენ (სპოილერი 👀: ვიწყებთ ახალ ყოველთვიურ მიმოხილვას 👇).
რა იყო 2024 წლის გამორჩეული გამოშვებები კრეატიული AI ინსტრუმენტების სფეროში? ჩვენ ხაზს გავუსვამთ ძირითად გამოშვებებს კრეატიულ და ხელოვნებით სფეროებში, განსაკუთრებული აქცენტით ღია კოდის განვითარებაზე ისეთ პოპულარულ ამოცანებში, როგორიცაა გამოსახულების და ვიდეოს გენერაცია.
2 წელზე მეტი გავიდა მას შემდეგ, რაც Stable Diffusion-ის ორიგინალი ვერსია გამოვიდა და ტალღები გამოიწვია გამოსახულების გენერაციაში ღია კოდის მოდელებით. ახლა თამამად შეგვიძლია ვთქვათ, რომ ტექსტიდან გამოსახულების გენერაციის, გამოსახულების რედაქტირებისა და კონტროლირებადი გამოსახულების გენერაციის კუთხით – ღია კოდის მოდელები სერიოზულ კონკურენციას უწევენ დახურული კოდის მოდელებს.
მოკლედ: დიფუზიური მოდელები და გაუსის ნაკადის შესაბამისობა (Gaussian flow matching) ექვივალენტურია. ნაკადის შესაბამისობა გვთავაზობს ქსელის გამომავალი მონაცემების ვექტორული ველის პარამეტრიზაციას, რომელიც განსხვავდება დიფუზიურ მოდელებში ადრე გამოყენებული მეთოდებისგან. პრაქტიკას დავუბრუნდეთ: ცვლილების შესახებ პირველად Stability AI-მ განაცხადა Stable Diffusion 3-ის მეშვეობით, თუმცა სწორედ HunyuanDiT გახდა პირველი ღია კოდის მოდელი DiT არქიტექტურით. ეს ტენდენცია გაგრძელდა AuraFlow, Flux.1 და Stable Diffusion 3.5-ის გამოშვებებით.
ღია კოდის გამოსახულების გენერაციის მოდელების (არც ისე ხანგრძლივ) ისტორიაში მრავალ გარდამტეხ მომენტს შორის, თამამად შეგვიძლია ვთქვათ, რომ Flux.1-ის გამოშვება ერთ-ერთი მათგანი იყო. Flux [dev]-მა მიაღწია ახალ უმაღლეს დონეს, გადააჭარბა პოპულარულ დახურული კოდის მოდელებს, როგორიცაა Midjourney v6.0, DALL·E 3 (HD) სხვადასხვა ბენჩმარკზე.
გამოსახულების მოდელების წინსვლის დადებითი გვერდითი ეფექტი არის ტექსტიდან გამოსახულების მოდელებისთვის პერსონალიზაციის ტექნიკებისა და კონტროლირებადი გენერაციის მნიშვნელოვანი გაუმჯობესება. 2022 წლის აგვისტოში, ტრანსფორმაციულმა ნამუშევრებმა, როგორიცაა Textual Inversion და DreamBooth, გააუმჯობესა ჩვენი უნარი, გვესწავლებინა და გაგვეცნო ახალი კონცეფციები ტექსტიდან გამოსახულების მოდელებისთვის, რამაც მნიშვნელოვნად გააფართოვა მათი გამოყენების შესაძლებლობები. ამან გზა გაუხსნა გაუმჯობესებებისა და დამატებების ნაკადს, რომლებიც ამ ტექნიკებზე იყო დაფუძნებული (მაგალითად, LoRA დიფუზიური მოდელებისთვის). თუმცა, დახვეწილი მოდელების ხარისხის ზედა ზღვარი, ბუნებრივია, არის საბაზისო მოდელი, საიდანაც ის დახვეწილი იქნა. ამ თვალსაზრისით, არ შეგვიძლია უგულებელვყოთ Stable Diffusion XL, რომელიც ასევე მნიშვნელოვანი მარკერი იყო ღია კოდის გამოსახულების გენერაციის მოდელებისთვის პერსონალიზაციაში. ამის დასტურია ისიც, რომ დღესაც კი, პერსონალიზაციისა და კონტროლირებადი გენერაციის მრავალი პოპულარული ტექნიკა და მოდელი SDXL-ზეა დაფუძნებული.
SDXL-ის (და მსგავსი ხარისხის მქონე მოგვიანებით გამოშვებული მოდელების) გაუმჯობესებულ შესაძლებლობებთან ერთად დიფუზიური მოდელის არქიტექტურაში სხვადასხვა კომპონენტის სემანტიკური როლების მზარდი გაგება აჩენს კითხვას – რისი მიღწევა შეგვიძლია შემდგომი ოპტიმიზაციის გარეშე? სწორედ აქ შემოდის ნულოვანი ოპტიმიზაციის ტექნიკები – 2024 წელი ნამდვილად იყო ის წელი, როდესაც მაღალი ხარისხის პორტრეტების გენერაცია საცნობარო ფოტოებიდან, მხოლოდ ერთი საცნობარო გამოსახულებით და ყოველგვარი ოპტიმიზაციის გარეშე გახდა შესაძლებელი. ისეთი ტრენინგისგან თავისუფალი ტექნიკები, როგორიცაა IP adapter FaceID, InstantID, Photomaker და სხვა, გამოვიდა და აჩვენა კონკურენტული, თუ არა უპირატესი, შესაძლებლობები დახვეწილ მოდელებთან შედარებით.
ანალოგიურად, გამოსახულების რედაქტირებამ და კონტროლირებადმა გენერაციამ – მაგალითად, გამოსახულების გენერაციამ canny / სიღრმის / პოზის შეზღუდვებით – ასევე პროგრესი განიცადა, როგორც საბაზისო მოდელების მზარდი ხარისხის, ასევე საზოგადოების მხრიდან სხვადასხვა კომპონენტის სემანტიკური როლების გაგების გაღრმავების წყალობით (Instant Style, B-LoRA).
რა იქნება შემდეგ? DiT და ნაკადის შესაბამისობის მიზნებზე პარადიგმების გადასვლის შემდეგ, გამოვიდა დამატებითი მოდელები, რომლებიც ცდილობენ DiT-ზე დაფუძნებული მოდელების, როგორიცაა Flux და SD3.5, მსგავსი მიზნებისთვის გამოყენებას, მაგრამ ჯერჯერობით ვერ შეძლეს SDXL-ზე დაფუძნებული მოდელების ხარისხის გადალახვა, მიუხედავად ძირითადი საბაზისო მოდელის უმაღლესი ხარისხისა. ეს შეიძლება მიეწეროს DiT-ის სხვადასხვა კომპონენტის სემანტიკური როლების შედარებით ნაკლებ გაგებას Unet-თან შედარებით. 2025 წელი შესაძლოა იყოს ის წელი, როდესაც ჩვენ ამ როლებს DiT-ებშიც გამოვავლენთ, რაც გამოსახულების გენერაციის შემდეგი თაობის მოდელებისთვის მეტ შესაძლებლობას გახსნის.
გამოსახულების გენერაციისგან განსხვავებით, ვიდეოს სფეროში ჯერ კიდევ ბევრი გვაქვს გასავლელი. თუმცა, თამამად შეგვიძლია ვთქვათ, რომ ჩვენ ძალიან შორს ვართ იმ წერტილიდან, სადაც ერთი წლის წინ ვიყავით. მიუხედავად იმისა, რომ ჩვენ ღია კოდის მომხრეები ვართ, AI ვიდეო გენერაციაში მნიშვნელოვანი ნახტომის (ნაწილი) დამსახურება OpenAI-ის Sora-ს ეკუთვნის, რადგან მან რადიკალურად შეცვალა ჩვენი მოლოდინები ვიდეო მოდელების შესაძლებლობების მიმართ. და როგორც fofr-მა კარგად აღნიშნა „AI ვიდეოს აქვს თავისი Stable Diffusion მომენტი“ (რასაც გირჩევთ წაიკითხოთ 🙂) – მან ყველას გააცნობიერა, თუ რა არის შესაძლებელი. ასევე აღსანიშნავია ღია კოდის ვიდეო გენერაციის მოდელების ბოლოდროინდელი აღმავლობა, მათ შორის CogVideoX, Mochi, Allegro, LTX Video და HunyuanVideo. ვიდეოს გენერაცია თავისი არსით უფრო რთულია, ვიდრე გამოსახულების გენერაცია, რაც გამოწვეულია...
თეგები:
#ai
#ვიდეო გენერაცია
#ღია კოდი
#stable diffusion
#გამოსახულების გენერაცია
#ხელოვნება
#dit არქიტექტურა
#2024
#2025
#ტექნოლოგიური მიღწევები
წყარო: huggingface.co
AI-ით გადამუშავებული