Hugging Face-ში ჩვენი მისიაა, ხელი შევუწყოთ მანქანური სწავლების დემოკრატიზაციას, ერთობლივი მუშაობითა და ურთიერთდახმარებით შევქმნათ ღია და ეთიკური ხელოვნური ინტელექტის მომავალი. ამ მისიამ აღგვძრა შეგვექმნა 🤗 Diffusers ბიბლიოთეკა, რათა ყველას შეეძლოს ექსპერიმენტების ჩატარება, კვლევა ან უბრალოდ თამაში ტექსტი-გამოსახულებად მოდელებთან. სწორედ ამიტომ, ჩვენ შევქმენით ბიბლიოთეკა მოდულური ინსტრუმენტარიუმის სახით, რათა შესაძლებელი იყოს დიფუზიური მოდელის კომპონენტების მორგება ან მისი დაუყოვნებლივ გამოყენება. ვინაიდან 🤗 Diffusers 1 წლის ხდება, წარმოგიდგენთ იმ ყველაზე გამორჩეული ფუნქციების მიმოხილვას, რომლებიც ბიბლიოთეკას ჩვენი საზოგადოების დახმარებით დაემატა. ჩვენ ვამაყობთ და უსაზღვროდ მადლიერნი ვართ იმ აქტიური საზოგადოების წევრობისთვის, რომელიც ხელს უწყობს ხელმისაწვდომ გამოყენებას, დიფუზიურ მოდელებს ტექსტი-გამოსახულებად გენერაციის მიღმა უბიძგებს და ყოველმხრივ შთაგონებას წარმოადგენს. გენერაციული ხელოვნური ინტელექტის მოდელები ცნობილია ფოტო-რეალისტური გამოსახულებების შექმნით, თუმცა, თუ კარგად დავაკვირდებით, შეიძლება შევამჩნიოთ გარკვეული არასწორობები, მაგალითად, ხელზე ზედმეტი თითების გენერაცია. მიმდინარე წელს, DeepFloyd IF და Stability AI-ის SDXL მოდელებმა დიდი რეზონანსი გამოიწვიეს გენერირებული გამოსახულებების ხარისხის კიდევ უფრო გაუმჯობესებით, რათა ისინი უფრო ფოტო-რეალისტური გამხდარიყვნენ. DeepFloyd IF - მოდულური დიფუზიური მოდელი, რომელიც მოიცავს გამოსახულების გენერაციის სხვადასხვა პროცესს (მაგალითად, გამოსახულება 3-ჯერ იზრდება უფრო მაღალი გარჩევადობის მისაღებად). Stable Diffusion-ისგან განსხვავებით, IF მოდელი მუშაობს პირდაპირ პიქსელების დონეზე და ტექსტის კოდირებისთვის იყენებს დიდ ენობრივ მოდელს. Stable Diffusion XL (SDXL) - Stability AI-ის უახლესი Stable Diffusion მოდელი, რომელიც მის წინამორბედ Stable Diffusion 2-თან შედარებით, მნიშვნელოვნად მეტ პარამეტრს შეიცავს. ის ქმნის ჰიპერ-რეალისტურ გამოსახულებებს, იყენებს საბაზისო მოდელს მოთხოვნის ზუსტი დაცვისთვის და დამატებით, დამაზუსტებელ მოდელს წვრილმანი დეტალებისა და მაღალი სიხშირის კონტენტის სპეციალიზაციისთვის. ეწვიეთ DeepFloyd IF-ის დოკუმენტაციას და SDXL-ის დოკუმენტაციას დღესვე, რათა ისწავლოთ საკუთარი გამოსახულებების გენერირება! ტექსტი-გამოსახულებად კონვერტაციის მეთოდები შესანიშნავია, მაგრამ ტექსტი-ვიდეოდ კონვერტაცია კიდევ უფრო საინტერესოა! ამჟამად მხარს ვუჭერთ ორ ტექსტი-ვიდეოდ მეთოდს: VideoFusion-ს და Text2Video-Zero-ს. თუ უკვე იცნობთ ტექსტი-გამოსახულებად მეთოდებს, ტექსტი-ვიდეოდ მეთოდის გამოყენება ძალიან ჰგავს: ველოდებით, რომ ტექსტი-ვიდეოდ გენერაცია რევოლუციას განიცდის 🤗 Diffusers-ის მეორე წელს, და მოუთმენლად ველით, რას შექმნის საზოგადოება ამ ბაზაზე, რათა გააფართოოს ვიდეოს გენერაციის საზღვრები ენიდან! ტექსტი-ვიდეოს გარდა, ახლა უკვე გვაქვს ტექსტი-3D გენერაცია OpenAI-ის Shap-E მოდელის წყალობით. Shap-E გაწვრთნილია 3D-ტექსტის წყვილების დიდი მონაცემთა ნაკრების კოდირებით, და დიფუზიური მოდელი დაყენებულია ენკოდერის გამოსავალზე. შეგიძლიათ შექმნათ 3D აქტივები ვიდეო თამაშებისთვის, ინტერიერის დიზაინისთვის და არქიტექტურისთვის. სცადეთ დღესვე ShapEPipeline-ისა და ShapEImg2ImgPipeline-ის გამოყენებით. გამოსახულების რედაქტირება ერთ-ერთი ყველაზე პრაქტიკული გამოყენების შემთხვევაა მოდაში, მასალის დიზაინსა და ფოტოგრაფიაში. დიფუზიური მოდელების საშუალებით, გამოსახულების რედაქტირების შესაძლებლობები მუდმივად ფართოვდება. ჩვენ გვაქვს მრავალი მეთოდი 🤗 Diffusers-ში გამოსახულების რედაქტირების მხარდასაჭერად. არსებობს გამოსახულების რედაქტირების მეთოდები, რომლებიც საშუალებას გაძლევთ აღწეროთ სასურველი ცვლილება მოთხოვნის სახით, წაშალოთ კონცეფციები გამოსახულებიდან და ასევე მეთოდი, რომელიც აერთიანებს გენერაციის მრავალ მეთოდს მაღალი ხარისხის გამოსახულებების, მაგალითად, პანორამების შესაქმნელად. 🤗 Diffusers-ით, შეგიძლიათ ექსპერიმენტები ჩაატაროთ ფოტო რედაქტირების მომავალთან დაკავშირებით უკვე ახლავე! დიფუზიური მოდელები ცნობილია დროის ინტენსიური ბუნებით მათი იტერაციული ნაბიჯების გამო. OpenAI-ის Consistency Models-ის საშუალებით, გამოსახულების გენერაციის პროცესი მნიშვნელოვნად დაჩქარდა. ერთი 256x256 გარჩევადობის გამოსახულების გენერაციას თანამედროვე CPU-ზე მხოლოდ 3/4 წამი სჭირდება! შეგიძლიათ ეს გამოსცადოთ 🤗 Diffusers-ში ConsistencyModelPipeline-ის გამოყენებით. დიფუზიური მოდელების დაჩქარების გარდა, ჩვენ ასევე გთავაზობთ მრავალ ოპტიმიზაციის ტექნიკას უფრო სწრაფი ინფერენციისთვის, როგორიცაა PyTorch 2.0-ის scaled_dot_product_attention() (SDPA) და torch.compile(), დაყოფილი ყურადღება (sliced attention), feed-forward chunking, VAE tiling, CPU და მოდელის გადატვირთვა (offloading) და სხვა. ეს ოპტიმიზაციები ზოგავს მეხსიერებას, რაც ნიშნავს უფრო სწრაფ გენერაციას და საშუალებას გაძლევთ გაუშვათ ინფერენცია მომხმარებლის GPU-ებზე. როდესაც მოდელს ავრცელებთ 🤗 Diffusers-ის საშუალებით, ყველა ეს ოპტიმიზაცია დაუყოვნებლივ მხარდაჭერილია! გარდა ამისა, ჩვენ ასევე მხარს ვუჭერთ კონკრეტულ აპარატურასა და ფორმატებს, როგორიცაა ONNX, mps PyTorch მოწყობილობა Apple Silicon კომპიუტერებისთვის, Core ML და სხვა. იმის გასაგებად, თუ როგორ ვახდენთ ინფერენციის ოპტიმიზაციას 🤗 Diffusers-ით, გაეცანით დოკუმენტაციას! გენერაციული მოდელები შესანიშნავია, მაგრამ მათ ასევე შეუძლიათ შექმნან მავნე და არასათანადო (NSFW) კონტენტი. მომხმარებლებისთვის ამ მოდელებთან პასუხისმგებლობითა და ეთიკურად ურთიერთობისთვის, ჩვენ დავამატეთ safety_checker კომპონენტი, რომელიც აფიქსირებს ინფერენციის დროს გენერირებულ არასათანადო კონტენტს. მოდელების შემქმნელებს შეუძლიათ სურვილის შემთხვევაში ამ კომპონენტის ინტეგრირება საკუთარ მოდელებში. გარდა ამისა, გენერაციული მოდელები შეიძლება გამოყენებულ იქნას დეზინფორმაციის შესაქმნელად. ამ წლის დასაწყისში, „ბალენსიაგას პაპის“ გამოსახულება ვირუსული გახდა იმის გამო, თუ რამდენად რეალისტური იყო ის, მიუხედავად მისი სიყალბისა. ეს ხაზს უსვამს გენერირებულ და ადამიანის მიერ შექმნილ კონტენტს შორის განსხვავების მექანიზმის მნიშვნელობასა და საჭიროებას. სწორედ ამიტომ, ჩვენ დავამატეთ უხილავი წყლის ნიშა