Hugging Face Diffusers-ის 1 წელი: რევოლუცია AI გენერაციულ მოდელებში
Hugging Face-ის მიზანია კარგი მანქანური სწავლების დემოკრატიზაცია ღია და ეთიკური ხელოვნური ინტელექტის მომავლის შესაქმნელად. ამ მიზნით შეიქმნა 🤗 Diffusers ბიბლიოთეკა, რომელიც ყველას საშუალებას აძლევს, ექსპერიმენტი ჩაატაროს „ტექსტიდან გამოსახულებამდე“ მოდელებით. როგორც მოდულური ხელსაწყოების ყუთი, Diffusers 1 წლის გახდა და ამ პერიოდში, საზოგადოების დახმარებით, მას მრავალი მნიშვნელოვანი ფუნქცია დაემატა. მათ შორისაა გამოსახულების ხარისხის გაუმჯობესება DeepFloyd IF-ისა და Stability AI SDXL-ის მოდელებით
Hugging Face-ში ჩვენი მისიაა კარგი მანქანური სწავლების დემოკრატიზაცია, თანამშრომლობითა და ერთმანეთის დახმარებით ღია და ეთიკური ხელოვნური ინტელექტის მომავლის შესაქმნელად. ამ მისიამ მოგვცა მოტივაცია, შეგვექმნა 🤗 Diffusers ბიბლიოთეკა, რათა ყველას შეეძლოს ექსპერიმენტების ჩატარება, კვლევა, ან უბრალოდ თამაში „ტექსტიდან გამოსახულებამდე“ მოდელებით. სწორედ ამიტომ შევქმენით ბიბლიოთეკა, როგორც მოდულური ხელსაწყოების ყუთი, რათა თქვენ შეძლოთ დიფუზიური მოდელის კომპონენტების მორგება ან მისი დაუყოვნებლივ გამოყენება. მას შემდეგ, რაც 🤗 Diffusers 1 წლის გახდა, წარმოგიდგენთ ზოგიერთი ყველაზე მნიშვნელოვანი ფუნქციის მიმოხილვას, რომელიც ჩვენი საზოგადოების დახმარებით დავამატეთ ბიბლიოთეკას. ჩვენ ვამაყობთ და უზომოდ მადლიერნი ვართ იმ აქტიური საზოგადოების ნაწილით, რომელიც ხელს უწყობს ხელმისაწვდომ გამოყენებას, დიფუზიური მოდელების გამოყენებას „ტექსტიდან გამოსახულების გენერაციის“ მიღმა და ზოგადად შთაგონების წყაროა.
**სარჩევი**
გენერაციული AI მოდელები ცნობილია ფოტორეალისტური გამოსახულებების შექმნით, მაგრამ თუ კარგად დააკვირდებით, შეიძლება შეამჩნიოთ გარკვეული რამ, რაც სწორად არ გამოიყურება, მაგალითად, ხელზე ზედმეტი თითების გენერაცია. წელს, DeepFloyd IF-მა და Stability AI SDXL-ის მოდელებმა დიდი რეზონანსი გამოიწვიეს, გამოსახულების ხარისხის კიდევ უფრო ფოტორეალისტური გახდომით.
**DeepFloyd IF** - მოდულური დიფუზიური მოდელი, რომელიც მოიცავს სხვადასხვა პროცესებს გამოსახულების გენერაციისთვის (მაგალითად, გამოსახულება გაიზარდა 3-ჯერ მაღალი რეზოლუციის მისაღებად). Stable Diffusion-ისგან განსხვავებით, IF მოდელი მუშაობს პირდაპირ პიქსელის დონეზე და ტექსტის კოდირებისთვის იყენებს დიდ ენობრივ მოდელს.
**Stable Diffusion XL (SDXL)** - Stability AI-ის უახლესი Stable Diffusion მოდელი, რომელსაც გაცილებით მეტი პარამეტრი აქვს, ვიდრე მის წინამორბედ Stable Diffusion 2-ს. ის აგენერირებს ჰიპერრეალისტურ გამოსახულებებს, იყენებს საბაზისო მოდელს მოთხოვნის ზუსტი დაცვისთვის, და დახვეწის მოდელს, რომელიც სპეციალიზებულია წვრილმან დეტალებსა და მაღალი სიხშირის კონტენტზე. ეწვიეთ DeepFloyd IF-ის დოკუმენტაციას და SDXL-ის დოკუმენტაციას დღეს, რათა გაიგოთ, როგორ დაიწყოთ საკუთარი გამოსახულებების გენერაცია!
„ტექსტიდან გამოსახულებამდე“ მილსადენები მაგარია, მაგრამ „ტექსტიდან ვიდეომდე“ კიდევ უფრო მაგარია! ამჟამად ჩვენ მხარს ვუჭერთ ორ „ტექსტიდან ვიდეომდე“ მილსადენს: VideoFusion-ს და Text2Video-Zero-ს. თუ უკვე იცნობთ „ტექსტიდან გამოსახულებამდე“ მილსადენებს, „ტექსტიდან ვიდეომდე“ მილსადენის გამოყენება ძალიან ჰგავს: ველოდებით, რომ „ტექსტიდან ვიდეომდე“ მიმართულება რევოლუციას განიცდის 🤗 Diffusers-ის მეორე წელს, და აღფრთოვანებულნი ვართ იმით, თუ რას ააშენებს საზოგადოება ამ მოდელებზე ენიდან ვიდეოს გენერაციის საზღვრების გადასაწევად!
„ტექსტიდან ვიდეოს“ გარდა, ახლა უკვე გვაქვს „ტექსტიდან 3D გენერაცია“ OpenAI-ის Shap-E მოდელის წყალობით. Shap-E გაწვრთნილია 3D ტექსტური წყვილების დიდი მონაცემთა ნაკრების კოდირებით, ხოლო დიფუზიური მოდელი დაფუძნებულია ენკოდერის გამოსავალზე. თქვენ შეგიძლიათ შექმნათ 3D აქტივები ვიდეო თამაშებისთვის, ინტერიერის დიზაინისთვის და არქიტექტურისთვის. სცადეთ დღეს ShapEPipeline-ით და ShapEImg2ImgPipeline-ით.
გამოსახულების რედაქტირება ერთ-ერთი ყველაზე პრაქტიკული გამოყენების შემთხვევაა მოდაში, მასალის დიზაინში და ფოტოგრაფიაში. დიფუზიური მოდელების საშუალებით, გამოსახულების რედაქტირების შესაძლებლობები კვლავ ფართოვდება. 🤗 Diffusers-ში ბევრი მილსადენი გვაქვს გამოსახულების რედაქტირების მხარდასაჭერად. არსებობს გამოსახულების რედაქტირების მილსადენები, რომლებიც საშუალებას გაძლევთ აღწეროთ თქვენი სასურველი რედაქტირება, როგორც მოთხოვნა, წაშალოთ კონცეფციები გამოსახულებიდან და თუნდაც მილსადენი, რომელიც აერთიანებს მრავალ გენერაციის მეთოდს მაღალი ხარისხის გამოსახულებების შესაქმნელად, როგორიცაა პანორამები. 🤗 Diffusers-ით, შეგიძლიათ ექსპერიმენტები ჩაატაროთ ფოტო რედაქტირების მომავალთან ახლავე!
დიფუზიური მოდელები ცნობილია იმით, რომ დროის ინტენსიურია მათი განმეორებითი ნაბიჯების გამო. OpenAI-ის Consistency Models-ის საშუალებით, გამოსახულების გენერაციის პროცესი მნიშვნელოვნად დაჩქარებულია. ერთი 256x256 რეზოლუციის გამოსახულების გენერაციას თანამედროვე CPU-ზე მხოლოდ 3/4 წამი სჭირდება! შეგიძლიათ ეს სცადოთ 🤗 Diffusers-ში ConsistencyModelPipeline-ით. დაჩქარებული დიფუზიური მოდელების გარდა, ჩვენ ასევე გთავაზობთ ბევრ ოპტიმიზაციის ტექნიკას უფრო სწრაფი ინფერენციისთვის, როგორიცაა PyTorch 2.0-ის scaled_dot_product_attention() (SDPA) და torch.compile(), sliced attention, feed-forward chunking, VAE tiling, CPU და მოდელის გადმოტვირთვა (offloading) და სხვა. ეს ოპტიმიზაციები ზოგავს მეხსიერებას, რაც ნიშნავს უფრო სწრაფ გენერაციას და საშუალებას გაძლევთ გაუშვათ ინფერენცია მომხმარებლის GPU-ებზე. როდესაც თქვენ ავრცელებთ მოდელს 🤗 Diffusers-ით, ყველა ეს ოპტიმიზაცია დაუყოვნებლივ არის მხარდაჭერილი! გარდა ამისა, ჩვენ ასევე მხარს ვუჭერთ სპეციფიკურ აპარატურას და ფორმატებს, როგორიცაა ONNX, mps PyTorch მოწყობილობა Apple Silicon კომპიუტერებისთვის, Core ML და სხვა. იმის გასაგებად, თუ როგორ ვახდენთ ინფერენციის ოპტიმიზაციას 🤗 Diffusers-ით, შეამოწმეთ დოკუმენტაცია!
გენერაციული მოდელები მაგარია, მაგრამ მათ ასევე შეუძლიათ მავნე და შეუსაბამო (NSFW) კონტენტის შექმნა. მომხმარებლებისთვის ამ მოდელებთან პასუხისმგებლობითა და ეთიკურად ურთიერთქმედების დასახმარებლად, ჩვენ დავამატეთ safety_checker კომპონენტი, რომელიც აფიქსირებს შეუსაბამო კონტენტს ინფერენციის დროს. მოდელის შემქმნელებს შეუძლიათ აირჩიონ ამ კომპონენტის ჩართვა თავიანთ მოდელებში, თუ მათ სურთ. გარდა ამისა, გენერაციული მოდელები ასევე შეიძლება გამოყენებულ იქნას დეზინფორმაციის შესაქმნელად. მიმდინარე წლის დასაწყისში Balenciaga-ს პაპი ვირუსულად გავრცელდა იმის გამო, თუ რამდენად რეალისტური იყო გამოსახულება, მიუხედავად იმისა, რომ ის ყალბი იყო. ეს ხაზს უსვამს მექანიზმის მნიშვნელობასა და საჭიროებას, რომლითაც შესაძლებელი იქნება გენერირებულ და ადამიანის მიერ შექმნილ კონტენტს შორის განსხვავების დადგენა. სწორედ ამიტომ დავამატეთ უხილავი წყლის ნიშანი...
თეგები:
#ai
#ხელოვნური ინტელექტი
#ინოვაცია
#მანქანური სწავლება
#ღია წყარო
#hugging face
#stable diffusion
#diffusers
#გენერაციული მოდელები
#sdxl
#deepfloyd if
#shap-e
#ტექსტიდან გამოსახულებამდე
#ტექსტიდან ვიდეომდე
#ტექსტიდან 3d-მდე
#consistency models
წყარო: huggingface.co
AI-ით გადამუშავებული