ხელოვნური ინტელექტი და ხელოვნება: 2024 წლის საკვანძო მიღწევების მიმოხილვა და 2025 წლის მოლოდინები
ბოლო რამდენიმე წელი გადამწყვეტი აღმოჩნდა ღია კოდის მოდელებისა და ინსტრუმენტებისთვის ხელოვნების სფეროში. შემოქმედებითი გამოხატვისთვის განკუთვნილი ხელოვნური ინტელექტის ხელსაწყოები არასოდეს ყოფილა ასეთი ხელმისაწვდომი, და ეს მხოლოდ დასაწყისია. ეს სტატია მიმოიხილავს 2024 წლის ძირითად მიღწევებს ხელოვნური ინტელექტის მიერ გენერირებულ გამოსახულებებში, მათ შორის DiT არქიტექტურის, პერსონალიზაციისა და „ზერო-შოთ“ ტექნიკების წინსვლას. ხაზგასმულია, თუ როგორ ეჯიბრებიან ღია კოდის მოდელები დახურული კოდის გიგანტებ
ბოლო რამდენიმე წელი გადამწყვეტი აღმოჩნდა ღია კოდის მოდელებისა და ინსტრუმენტებისთვის ხელოვნების სფეროში. ხელოვნური ინტელექტის ხელსაწყოები შემოქმედებითი გამოხატვისთვის არასოდეს ყოფილა ასეთი ხელმისაწვდომი, და ეს მხოლოდ დასაწყისია. შემოგვიერთდით, რათა გადავხედოთ 2024 წლის ხელოვნური ინტელექტისა და ხელოვნების სფეროში მომხდარ საკვანძო ეტაპებს, ხელსაწყოებსა და გარღვევებს, ასევე განვიხილოთ 2025 წლის მოლოდინები (სპოილერი 👀: ვიწყებთ ყოველთვიურ მიმოხილვას 👇).
რა იყო 2024 წლის გამორჩეული გამოშვებები შემოქმედებითი ხელოვნური ინტელექტის ხელსაწყოების სფეროში? ჩვენ ხაზს გავუსვამთ ძირითად გამოშვებებს შემოქმედებით და ხელოვნების სფეროებში, განსაკუთრებული აქცენტით ღია კოდის განვითარებაზე ისეთ პოპულარულ ამოცანებში, როგორიცაა გამოსახულების და ვიდეოს გენერაცია.
ორი წელი გავიდა მას შემდეგ, რაც Stable Diffusion-ის ორიგინალი ვერსია გამოვიდა და ტალღები გამოიწვია გამოსახულების გენერაციის სფეროში ღია კოდის მოდელების მეშვეობით. დღეს თამამად შეგვიძლია ვთქვათ, რომ ტექსტიდან გამოსახულების გენერაციის, გამოსახულების რედაქტირებისა და კონტროლირებადი გამოსახულების გენერაციის კუთხით, ღია კოდის მოდელები სერიოზულ კონკურენციას უწევენ დახურული კოდის მოდელებს.
მოკლედ: დიფუზიური მოდელები და გაუსის ნაკადის შესაბამისობა (Gaussian flow matching) ექვივალენტურია. ნაკადის შესაბამისობა გვთავაზობს ქსელის გამოსავლის ვექტორული ველის პარამეტრიზაციას, რომელიც განსხვავდება დიფუზიურ მოდელებში ადრე გამოყენებული მეთოდებისგან. პრაქტიკაში დაბრუნება: ცვლილების შესახებ პირველად Stability AI-მ განაცხადა Stable Diffusion 3-ის გამოშვებით, თუმცა HunyuanDiT გახდა პირველი ღია კოდის მოდელი DiT არქიტექტურით. ეს ტენდენცია გაგრძელდა AuraFlow, Flux.1 და Stable Diffusion 3.5-ის გამოშვებებით.
ღია კოდის გამოსახულების გენერაციის მოდელების (არც ისე ხანგრძლივი) ისტორიის მრავალ გადამწყვეტ მომენტს შორის, თამამად შეგვიძლია ვთქვათ, რომ Flux.1-ის გამოშვება ერთ-ერთი მათგანი იყო. Flux [dev]-მა მიაღწია უახლეს დონეს, გადააჭარბა პოპულარულ დახურული კოდის მოდელებს, როგორიცაა Midjourney v6.0, DALL·E 3 (HD), სხვადასხვა ბენჩმარკზე.
გამოსახულების მოდელების განვითარების დადებითი გვერდითი ეფექტია ტექსტიდან გამოსახულების შექმნის მოდელებისთვის პერსონალიზაციის ტექნიკების და კონტროლირებადი გენერაციის მნიშვნელოვანი გაუმჯობესება. 2022 წლის აგვისტოში, ისეთმა ტრანსფორმაციულმა ნამუშევრებმა, როგორიცაა Textual Inversion და DreamBooth, გააუმჯობესა ჩვენი უნარი, გვესწავლებინა და გაგვეცნო ახალი კონცეფციები ტექსტიდან გამოსახულების შექმნის მოდელებისთვის, რამაც მკვეთრად გააფართოვა მათი შესაძლებლობები. ამან გზა გაუხსნა გაუმჯობესებებისა და დამატებების მთელ ნაკადს, რომლებიც ამ ტექნიკებზე იყო დაფუძნებული (მაგალითად, LoRA დიფუზიური მოდელებისთვის). თუმცა, წვრილად მორგებული მოდელების ხარისხის ზედა ზღვარი ბუნებრივია ის საბაზისო მოდელია, საიდანაც ის იქნა მორგებული. ამ გაგებით, არ შეგვიძლია უგულებელვყოთ Stable Diffusion XL, რომელიც ასევე მნიშვნელოვანი მაჩვენებელი იყო პერსონალიზაციის კუთხით ღია კოდის გამოსახულების გენერაციის მოდელებისთვის. ამის დასტურია ისიც, რომ დღემდე, პერსონალიზაციისა და კონტროლირებადი გენერაციის მრავალი პოპულარული ტექნიკა და მოდელი SDXL-ზეა დაფუძნებული.
SDXL-ის (და მსგავსი ხარისხის შემდგომ გამოშვებული მოდელების) გაუმჯობესებული შესაძლებლობები, დიფუზიური მოდელის არქიტექტურაში სხვადასხვა კომპონენტის სემანტიკური როლების მზარდ გაგებასთან ერთად, აჩენს კითხვას – რისი მიღწევა შეგვიძლია დამატებითი ოპტიმიზაციის გარეშე? სწორედ აქ შემოდის „ზერო-შოთ“ ტექნიკების მთელი წყება – 2024 წელი ნამდვილად ის წელი იყო, როდესაც შესაძლებელი გახდა მაღალი ხარისხის პორტრეტების გენერაცია საცნობარო ფოტოებიდან, მხოლოდ ერთი საცნობარო გამოსახულების გამოყენებით და ყოველგვარი ოპტიმიზაციის გარეშე. ისეთი სწავლისგან თავისუფალი ტექნიკები, როგორიცაა IP adapter FaceID, InstantID, Photomaker და სხვა, გამოვიდა და აჩვენა კონკურენტუნარიანი, თუ არა უპირატესი შესაძლებლობები წვრილად მორგებული მოდელების მიმართ.
ანალოგიურად, გამოსახულების რედაქტირებამ და კონტროლირებადმა გენერაციამ – მაგალითად, გამოსახულების გენერაციამ canny / სიღრმის / პოზის შეზღუდვებით – ასევე მიაღწია პროგრესს, როგორც საბაზისო მოდელების მზარდი ხარისხის, ასევე საზოგადოების მხრიდან სხვადასხვა კომპონენტის სემანტიკური როლების მზარდი გაგების წყალობით (Instant Style, B-LoRA).
მაშ, რა გველოდება შემდეგ? მას შემდეგ, რაც პარადიგმები DiT-ისა და ნაკადის შესაბამისობის ამოცანებისკენ გადაინაცვლა, დამატებითი მოდელები გამოვიდა, რომლებიც ცდილობდნენ DiT-ზე დაფუძნებული მოდელების, როგორიცაა Flux და SD3.5, მსგავსი მიზნებისთვის გამოყენებას, მაგრამ ჯერჯერობით ვერ გადააჭარბეს SDXL-ზე დაფუძნებული მოდელების ხარისხს, მიუხედავად საბაზისო მოდელის უპირატესი ხარისხისა. ეს შეიძლება მიეწეროს DiT-ის სხვადასხვა კომპონენტის სემანტიკური როლების შედარებით ნაკლებ გაგებას Unet-თან შედარებით. 2025 შეიძლება იყოს ის წელი, როდესაც DiT-ებშიც გამოვავლენთ ამ როლებს, რაც ახალ შესაძლებლობებს გახსნის გამოსახულების გენერაციის მომდევნო თაობის მოდელებისთვის.
გამოსახულების გენერაციისგან განსხვავებით, ვიდეოს სფეროში ჯერ კიდევ გვაქვს გასავლელი გზა. თუმცა, თამამად შეგვიძლია ვთქვათ, რომ ძალიან შორს ვართ იქიდან, სადაც ერთი წლის წინ ვიყავით. მიუხედავად იმისა, რომ ღია კოდის მიმდევრები ვართ, ხელოვნური ინტელექტის ვიდეოს გენერაციაში მნიშვნელოვანი ნახტომის (ნაწილობრივ) დამსახურება ეკუთვნის OpenAI-ის Sora-ს, რომელმაც რადიკალურად შეცვალა ჩვენი მოლოდინები ვიდეო მოდელების შესაძლებლობებთან დაკავშირებით. და როგორც fofr-მა ზუსტად აღნიშნა „AI ვიდეოს Stable Diffusion-ის მომენტი აქვს“ (რაც რეკომენდებულია წასაკითხად 🙂) – ამან ყველას გააცნობიერებინა, თუ რა არის შესაძლებელი.
ღია კოდის ვიდეოს გენერაციის მოდელების ბოლო დროს მომხდარი ზრდა, მათ შორის CogVideoX, Mochi, Allegro, LTX Video და HunyuanVideo, ასევე აღსანიშნავია. ვიდეოს გენერაცია არსებითად უფრო რთულია, ვიდრე გამოსახულების გენერაცია, იმის გამო, რომ საჭიროა...
თეგები:
#პერსონალიზაცია
#midjourney
#ღია კოდის ai
#stable diffusion
#გამოსახულების გენერაცია
#dit
#dall-e
#2024
#2025
#ვიდეოს გენერაცია
#შემოქმედებითი ai
#sora
წყარო: huggingface.co
AI-ით გადამუშავებული