Stable Diffusion, რომელიც შემუშავებულია CompVis-ის, Stability AI-ის და LAION-ის მიერ, დიდ ინტერესს იწვევს იმის გამო, რომ შეუძლია მაღალი სიზუსტის სურათების გენერირება ტექსტური პრომპტების (text prompts) უბრალოდ შეყვანით. Stable Diffusion ძირითადად იყენებს LAION-5B მონაცემთა ნაკრების (dataset) ინგლისურ ქვეჯგუფს LAION2B-en-ს თავისი საწვრთნელი მონაცემებისთვის და შედეგად, მოითხოვს ინგლისური ტექსტური პრომპტების შეყვანას, რაც იწვევს სურათების გენერირებას, რომლებიც უფრო დასავლური კულტურისკენ არის მიმართული. rinna Co., Ltd.-მ შექმნა იაპონურ სპეციფიკური ტექსტიდან-გამოსახულების მოდელი სახელწოდებით „იაპონური Stable Diffusion“ Stable Diffusion-ის დახვეწით (fine-tuning) იაპონურენოვანი წარწერების მქონე გამოსახულებებზე. იაპონური Stable Diffusion იღებს იაპონურ ტექსტურ პრომპტებს და ქმნის სურათებს, რომლებიც ასახავს იაპონურენოვანი სამყაროს კულტურას, რაც შეიძლება რთული იყოს თარგმანის მეშვეობით გადმოცემა. ამ ბლოგში განვიხილავთ იაპონური Stable Diffusion-ის განვითარების ფონს და მის სწავლის მეთოდოლოგიას. იაპონური Stable Diffusion ხელმისაწვდომია Hugging Face-სა და GitHub-ზე. კოდი ეფუძნება 🧨 Diffusers-ს. ცოტა ხნის წინ, დიფუზიური მოდელები (diffusion models) აღინიშნა, როგორც ძალიან ეფექტური ხელოვნურ სინთეზში, გამოსახულებებისთვის GAN-ებზე (Generative Adversarial Networks) უფრო მეტადაც კი. Hugging Face განმარტავს, თუ როგორ მუშაობს დიფუზიური მოდელები შემდეგ სტატიებში: ზოგადად, ტექსტიდან-გამოსახულების მოდელი შედგება ტექსტური ენკოდერისგან (text encoder), რომელიც ტექსტს ინტერპრეტირებს, და გენერაციული მოდელისგან (generative model), რომელიც მის გამოსავალზე დაყრდნობით სურათს ქმნის. Stable Diffusion იყენებს OpenAI-ის CLIP-ს, ენისა და გამოსახულების წინასწარ საწვრთნელ მოდელს (language-image pre-training model), როგორც მის ტექსტურ ენკოდერს, და ლატენტურ დიფუზიურ მოდელს (latent diffusion model), რომელიც დიფუზიური მოდელის გაუმჯობესებული ვერსიაა, როგორც გენერაციულ მოდელს. Stable Diffusion ძირითადად გაწვრთნილი იყო LAION-5B-ის ინგლისურ ქვეჯგუფზე და შეუძლია მაღალი წარმადობის სურათების გენერირება მხოლოდ ტექსტური პრომპტების შეყვანით. მაღალი წარმადობის გარდა, Stable Diffusion ასევე მარტივი გამოსაყენებელია, რადგან მისი ინფერენსი (inference) მუშაობს დაახლოებით 10GB VRAM GPU-ს გამოთვლითი ღირებულებით. Stable Diffusion 🧨 Diffusers-ით: Stable Diffusion არის ძალიან მძლავრი ტექსტიდან-გამოსახულების მოდელი არა მხოლოდ ხარისხის, არამედ გამოთვლითი ღირებულების თვალსაზრისითაც. იმის გამო, რომ Stable Diffusion გაწვრთნილი იყო ინგლისურ მონაცემთა ნაკრებზე, საჭიროა არაინგლისური პრომპტების ჯერ ინგლისურად თარგმნა. გასაკვირია, რომ Stable Diffusion-ს ზოგჯერ შეუძლია სწორი სურათების გენერირება არაინგლისური პრომპტების გამოყენების დროსაც კი. მაშ, რატომ გვჭირდება ენობრივად სპეციფიკური Stable Diffusion? პასუხი იმაშია, რომ გვსურს ტექსტიდან-გამოსახულების მოდელი, რომელსაც შეუძლია გაიგოს იაპონური კულტურა, იდენტობა და უნიკალური გამონათქვამები, მათ შორის ჟარგონიც. მაგალითად, ერთ-ერთი ყველაზე გავრცელებული იაპონური ტერმინი, რომელიც ინგლისური სიტყვა „businessman“-ის ხელახალი ინტერპრეტაციით არის მიღებული, არის „salary man“, რომელსაც ყველაზე ხშირად კოსტიუმში გამოწყობილ მამაკაცად წარმოვიდგენთ. Stable Diffusion-ს არ შეუძლია ასეთი იაპონური უნიკალური სიტყვების სწორად გაგება, რადგან იაპონური არ არის მისი სამიზნე ენა. ორიგინალური Stable Diffusion-ის მიერ გენერირებული „salary man, oil painting“-ის გამოსახულება. სწორედ ამიტომ შევქმენით Stable Diffusion-ის ენობრივად სპეციფიკური ვერსია. იაპონური Stable Diffusion-ს შეუძლია მიაღწიოს შემდეგ პუნქტებს ორიგინალურ Stable Diffusion-თან შედარებით. ჩვენ გამოვიყენეთ დაახლოებით 100 მილიონი გამოსახულება იაპონური წარწერებით, მათ შორის LAION-5B-ის იაპონური ქვეჯგუფის ჩათვლით. გარდა ამისა, დაბალი ხარისხის ნიმუშების მოსაშორებლად, ჩვენ გამოვიყენეთ rinna Co., Ltd.-ის მიერ გამოქვეყნებული japanese-cloob-vit-b-16, როგორც წინასწარი დამუშავების ეტაპი (preprocessing step), იმ ნიმუშების მოსაშორებლად, რომელთა ქულები გარკვეულ ზღვარს ქვემოთ იყო. იაპონურ სპეციფიკური ტექსტიდან-გამოსახულების მოდელის შექმნის უდიდესი გამოწვევაა მონაცემთა ნაკრების ზომა. არაინგლისური მონაცემთა ნაკრებები გაცილებით მცირეა, ვიდრე ინგლისური მონაცემთა ნაკრებები, და ეს იწვევს წარმადობის გაუარესებას ღრმა სწავლებაზე დაფუძნებულ მოდელებში. იაპონური Stable Diffusion-ის საწვრთნელად გამოყენებული მონაცემთა ნაკრები არის Stable Diffusion-ის საწვრთნელი მონაცემთა ნაკრების ზომის 1/20. ასეთი მცირე მონაცემთა ნაკრებით კარგი მოდელის შესაქმნელად, ჩვენ დავხვეწეთ (fine-tuned) მძლავრი Stable Diffusion, რომელიც გაწვრთნილი იყო ინგლისურ მონაცემთა ნაკრებზე, ვიდრე ტექსტიდან-გამოსახულების მოდელი თავიდან გაგვეწვრთნა. კარგი ენობრივად სპეციფიკური ტექსტიდან-გამოსახულების მოდელის შესაქმნელად, ჩვენ არამხოლოდ დავხვეწეთ (fine-tune), არამედ გამოვიყენეთ სწავლის 2 ეტაპი PITI-ის იდეის მიხედვით. 1-ელ ეტაპზე, ლატენტური დიფუზიური მოდელი (latent diffusion model) დაფიქსირებულია და ჩვენ შევცვალეთ ინგლისური ტექსტური ენკოდერი (text encoder) იაპონურ სპეციფიკური ტექსტური ენკოდერით, რომელიც გაწვრთნილია. ამ დროს, ჩვენი იაპონური sentencepiece ტოკენაიზერი (tokenizer) გამოიყენება როგორც ტოკენაიზერი. თუ CLIP ტოკენაიზერი გამოიყენება ისე, როგორც არის, იაპონური ტექსტები ტოკენიზდება ბაიტებად, რაც ართულებს ტოკენის დამოკიდებულების შესწავლას და ტოკენების რაოდენობა ზედმეტად დიდი ხდება. მაგალითად, თუ ტოკენიზაციას გავუკეთებთ „サラリーマン 油絵“-ს, მივიღებთ ['ãĤ', 'µ', 'ãĥ©', 'ãĥª', 'ãĥ¼ãĥ', 'ŀ', 'ãĥ³', 'æ', '²', '¹', 'çµ', 'µ'] რაც გაუგებარი ტოკენებია. მეორე მხრივ, ჩვენი იაპონური ტოკენაიზერის გამოყენებით, პრომპტი იყოფა ინტერპრეტირებად ტოკენებად და ტოკენების რაოდენობა მცირდება. მაგალითად, „サラリーマン 油絵“ შეიძლება ტოკენიზდეს როგორც ['▁', 'サラリーマン', '▁', '油', '絵'], რაც სწორად ტოკენიზებულია იაპონურად. ეს ეტაპი მოდელს საშუალებას აძლევს გაიგოს იაპონური პრომპტები, მაგრამ ჯერ არ გამოსცემს იაპონური სტილის გამოსახულებებს, რადგან ლატენტური დიფუზიური მოდელი საერთოდ არ შეცვლილა. სხვა სიტყვებით რომ ვთქვათ,