წარმოგიდგენთ aMUSEd-ს: ეფექტურ არადიფუზიურ ტექსტიდან გამოსახულების გენერაციის მოდელს
გაეცანით aMUSEd-ს, Google-ის MUSE-ის ღია რეპროდუქციას. ეს არის სწრაფი, არადიფუზიური ტექსტიდან გამოსახულების გენერაციის მოდელი, რომელიც ეფუძნება ნიღბიანი გამოსახულების მოდელირების (MIM) მეთოდოლოგიას. მიუხედავად იმისა, რომ მისი ხარისხი არ არის უმაღლესი დონის, ის გვთავაზობს სტილის გადაცემის, გამოსახულების inpainting-ის შესაძლებლობებს და ხელს უწყობს MIM ფრეიმვორკების კვლევას. მოდელი გამოშვებულია ნებადართული ლიცენზიით, მარტივია მის დასაკონფიგურირებლად და მუშაობს დაბალი GPU VRAM მოთხოვნებით.
მოხარულნი ვართ წარმოგიდგინოთ ეფექტური, არადიფუზიური ტექსტიდან გამოსახულების გენერირების მოდელი სახელად aMUSEd. მას ასე დაერქვა, რადგან ის Google-ის MUSE-ის ღია რეპროდუქციაა. aMUSEd-ის გენერაციის ხარისხი საუკეთესო არ არის და ჩვენ მას კვლევითი წინასწარი ვერსიის სახით, ნებადართული ლიცენზიით ვაქვეყნებთ.
ფართოდ გამოყენებული ლატენტური დიფუზიური მიდგომისგან (Rombach et al. (2022)) განსხვავებით, aMUSEd იყენებს ნიღბიანი გამოსახულების მოდელის (MIM) მეთოდოლოგიას. ეს არა მხოლოდ ნაკლებ ინფერენციის ნაბიჯებს მოითხოვს, როგორც აღნიშნულია Chang et al. (2023)-ის მიერ, არამედ აუმჯობესებს მოდელის ინტერპრეტაციას. MUSE-ის მსგავსად, aMUSEd ავლენს სტილის გადაცემის გამორჩეულ შესაძლებლობას ერთი გამოსახულების გამოყენებით, ფუნქცია, რომელიც სიღრმისეულად არის შესწავლილი Sohn et al. (2023)-ის მიერ. ამ ასპექტმა შესაძლოა ახალი გზები გახსნას პერსონალიზებულ და სტილზე ორიენტირებულ გამოსახულების გენერაციაში.
ამ ბლოგპოსტში, ჩვენ გაგაცნობთ aMUSEd-ის შიდა მუშაობის პრინციპებს, გაჩვენებთ, თუ როგორ შეგიძლიათ მისი გამოყენება სხვადასხვა ამოცანისთვის, მათ შორის ტექსტიდან გამოსახულების გენერირებისთვის, და როგორ დააკონფიგურიროთ იგი. ამასთან ერთად, მოგაწვდით ყველა მნიშვნელოვან რესურსს, მათ შორის მის სავარჯიშო კოდს. დავიწყოთ! 🚀
ჩვენ შევქმენით დემო ვერსია, რათა მკითხველებმა შეძლონ aMUSEd-თან მუშაობა. შეგიძლიათ სცადოთ ის ამ Space-ში ან ქვემოთ ჩაშენებულ სათამაშო მოედანზე (აქ მოცემული იქნებოდა ვიზუალური ელემენტი).
aMUSEd დაფუძნებულია ნიღბიანი გამოსახულების მოდელირებაზე. ის საინტერესო გამოყენების შემთხვევას წარმოადგენს საზოგადოებისთვის, რათა შეისწავლონ კომპონენტები, რომლებიც ცნობილია, რომ ეფექტურად მუშაობს ენის მოდელირებაში, გამოსახულების გენერაციის კონტექსტში.
ქვემოთ მოცემული სურათი წარმოგიდგენთ aMUSEd-ის მუშაობის ვიზუალურ მიმოხილვას (აქ მოცემული იქნებოდა ვიზუალური ელემენტი).
ტრენინგის დროს:
ინფერენციის დროს:
როგორც დასაწყისში აღინიშნა, aMUSEd ბევრ მსგავსებას იღებს MUSE-ისგან. თუმცა, არსებობს რამდენიმე მნიშვნელოვანი განსხვავება:
aMUSEd-ის შესახებ მეტის გასაგებად, გირჩევთ გაეცნოთ ტექნიკურ მოხსენებას აქ.
aMUSEd სრულად არის ინტეგრირებული 🧨 diffusers-ში. მის გამოსაყენებლად, ჯერ უნდა დავაინსტალიროთ ბიბლიოთეკები (აქ მოცემული იქნებოდა კოდის მაგალითი).
დავიწყოთ ტექსტიდან გამოსახულების გენერაციით (აქ მოცემული იქნებოდა კოდის მაგალითი):
შეგვიძლია შევისწავლოთ, თუ როგორ მოქმედებს num_inference_steps გამოსახულების ხარისხზე ფიქსირებული "seed"-ის პირობებში (აქ მოცემული იქნებოდა კოდის მაგალითი).
რაც მთავარია, მისი მცირე ზომის გამო (მხოლოდ ~800M პარამეტრი, ტექსტის კოდირებისა და VQ-GAN-ის ჩათვლით), aMUSEd ძალიან სწრაფია. ქვემოთ მოცემული სურათი წარმოადგენს სხვადასხვა მოდელის, მათ შორის aMUSEd-ის, ინფერენციის ლატენტურობის შედარებით კვლევას (აქ მოცემული იქნებოდა ვიზუალური ელემენტი).
მისი წინასწარი ტრენინგის მიზნის უშუალო შედეგად, aMUSEd-ს შეუძლია გამოსახულების inpainting-ის შესრულება zero-shot რეჟიმში, SDXL-ის მსგავსი სხვა მოდელებისგან განსხვავებით.
aMUSEd არის პირველი არადიფუზიური სისტემა diffusers-ის ფარგლებში. მისი იტერაციული დაგეგმვის მიდგომა ნიღბიანი პაჩების პროგნოზირებისთვის, მას კარგ კანდიდატად აქცევს diffusers-ისთვის. მოხარულნი ვართ, რომ ვნახავთ, როგორ გამოიყენებს მას საზოგადოება.
გვინდა მოგიწვიოთ ტექნიკური მოხსენების სანახავად, რათა გაიგოთ ყველა ამოცანის შესახებ, რომლებიც aMUSEd-ით შევისწავლეთ.
ჩვენ გთავაზობთ მარტივ სავარჯიშო სკრიპტს aMUSEd-ის დასაკონფიგურირებლად საკუთარ მონაცემთა ნაკრებებზე. 8-ბიტიანი Adam ოპტიმიზატორითა და float16 სიზუსტით, შესაძლებელია aMUSEd-ის დაკონფიგურირება 11GB-ზე ნაკლები GPU VRAM-ით. LoRA-ს გამოყენებით, მეხსიერების მოთხოვნები კიდევ უფრო მცირდება 7GB-მდე.
aMUSEd მოყვება OpenRAIL ლიცენზიას, ამიტომ, ის კომერციულად გამოსადეგია ადაპტაციისთვის. დაკონფიგურირების შესახებ მეტი დეტალისთვის იხილეთ ეს დირექტორია.
aMUSEd არ წარმოადგენს უახლესი დონის გამოსახულების გენერაციას გამოსახულების ხარისხის თვალსაზრისით. ჩვენ გამოვაქვეყნეთ aMUSEd იმისათვის, რომ წავახალისოთ საზოგადოება, გამოიკვლიოს არადიფუზიური ფრეიმვორკები, როგორიცაა MIM, გამოსახულების გენერაციისთვის. ჩვენ გვჯერა, რომ MIM-ის პოტენციალი არასაკმარისად არის შესწავლილი, მისი უპირატესობების გათვალისწინებით: (აღსანიშნავია, რომ MUSE-ის ორიგინალური ნამუშევარი დახურული წყაროა) aMUSEd-ის რაოდენობრივი შეფასების დეტალური აღწერისთვის იხილეთ ტექნიკური მოხსენება.
ვიმედოვნებთ, რომ საზოგადოება სასარგებლოდ მიიჩნევს ამ რესურსებს და მოტივირებული იქნება, გააუმჯობესოს MIM-ის მდგომარეობა გამოსახულების გენერაციისთვის.
პუბლიკაციები:
კოდი + სხვა:
სურაჯი ხელმძღვანელობდა ტრენინგს. უილიამი ხელმძღვანელობდა მონაცემებს და მხარს უჭერდა ტრენინგს. პატრიკ ფონ პლატენი მხარს უჭერდა როგორც ტრენინგს, ასევე მონაცემებს და უზრუნველყოფდა ზოგად ხელმძღვანელობას. რობინ რომბახმა შეასრულა VQGAN ტრენინგი და უზრუნველყო ზოგადი ხელმძღვანელობა. ისამუ ისოზაკი დაეხმარა საინტერესო დისკუსიებით და გააკეთა კოდის კონტრიბუციები. მადლობა პატრიკ ფონ პლატენსა და პედრო კუენკას ბლოგპოსტის პროექტის განხილვისთვის.
თეგები:
#ai
#მანქანური სწავლა
#გამოსახულების გენერაცია
#ტექსტიდან გამოსახულება
#amused
#muse
#არადიფუზიური
#mim
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი