მოკლედ? ყველა შედეგის ნახვა შესაძლებელია Hugging Face Hub-ის ამ კოლექციაში, ხოლო წინასწარი და შემდგომი დამუშავების კოდი განთავსებულია ამ GitHub საცავში. რაც მთავარია, არსებობს მზა უპირატესობის მონაცემთა ნაკრები და flux-dev-lora-finetune. თუ გსურთ მხარდაჭერის გამოხატვა, გთხოვთ, მოიწონოთ, გამოიწეროთ და თვალი გვადევნოთ, სანამ კითხვას გააგრძელებთ. „მონაცემები ერთად უკეთესია“ (Data is Better Together) არის 🤗 Hugging Face-სა და ღია კოდის ხელოვნური ინტელექტის (AI) საზოგადოების თანამშრომლობა. ჩვენი მიზანია, გავაძლიეროთ ღია კოდის საზოგადოება, რათა ერთობლივად შექმნან ეფექტური მონაცემთა ნაკრებები. შეგიძლიათ თვალი ადევნოთ ორგანიზაციას, რათა იყოთ ინფორმირებული უახლესი მონაცემთა ნაკრებების, მოდელებისა და საზოგადოებრივი სფრინტების შესახებ. არსებობდა რამდენიმე მცდელობა ღია გამოსახულების უპირატესობის მონაცემთა ნაკრების შესაქმნელად, მაგრამ ჩვენი მცდელობა უნიკალურია მოთხოვნების (პრომპტების) ცვალებადი სირთულისა და კატეგორიების, ასევე მონაცემთა ნაკრებისა და მისი შექმნის კოდის ღიაობის გამო. ქვემოთ მოცემულია ზოგიერთი ასეთი მცდელობა: ამ სფრინტისთვის სათანადო შეყვანის მონაცემთა ნაკრების მისაღებად, ჩვენ დავიწყეთ საბაზისო პრომპტებით, რომლებიც გავწმინდეთ, გავფილტრეთ ტოქსიკურობაზე და შევავსეთ კატეგორიებითა და სირთულეებით სინთეზური მონაცემების გენერაციის გზით, distilabel-ის გამოყენებით. საბოლოოდ, გამოსახულებების გენერირებისთვის გამოვიყენეთ Flux და Stable Diffusion მოდელები. ამან გამოიწვია `open-image-preferences-v1`-ის შექმნა. Imgsys არის გენერაციული გამოსახულების მოდელების ასპარეზი, რომელსაც fal.ai მასპინძლობს, სადაც ადამიანები აწვდიან პრომპტებს და ირჩევენ ორ მოდელის მიერ გენერირებულ შედეგს შორის სასურველს. სამწუხაროდ, გენერირებული გამოსახულებები საჯაროდ არ ქვეყნდება, თუმცა, მასთან დაკავშირებული პრომპტები განთავსებულია Hugging Face-ზე. ეს პრომპტები წარმოადგენს გამოსახულების გენერაციის რეალურ გამოყენებას, რომელიც შეიცავს კარგ მაგალითებს ყოველდღიური გენერაციისთვის, მაგრამ ამ რეალურმა გამოყენებამ ასევე ნიშნავდა, რომ ის შეიცავდა დუბლიკატ და ტოქსიკურ პრომპტებს, ამიტომ ჩვენ მოგვიწია მონაცემების შემოწმება და გაფილტვრა. ჩვენი მიზანი იყო, საზოგადოების დაწყებამდე მონაცემთა ნაკრებიდან ამოგვეღო ყველა NSFW (არასასურველი შინაარსის) პრომპტი და გამოსახულება. ჩვენ ავირჩიეთ მრავალმოდელური მიდგომა, სადაც ფილტრებად გამოვიყენეთ ორი ტექსტზე დაფუძნებული და ორი გამოსახულებაზე დაფუძნებული კლასიფიკატორი. გაფილტვრის შემდეგ, გადავწყვიტეთ თითოეული გამოსახულების ხელით შემოწმება, რათა დაგვრწმუნებოდით, რომ ტოქსიკური შინაარსი არ დარჩენილა; საბედნიეროდ, ჩვენმა მიდგომამ იმუშავა. ჩვენ გამოვიყენეთ შემდეგი კონვეიერი: მონაცემთა მრავალფეროვნება მნიშვნელოვანია მონაცემთა ხარისხისთვის, რის გამოც გადავწყვიტეთ ჩვენი მონაცემთა ნაკრების გაუმჯობესება პრომპტების სინთეზური გადაწერით, სხვადასხვა კატეგორიებისა და სირთულეების საფუძველზე. ეს განხორციელდა distilabel კონვეიერის გამოყენებით. InstructGPT აღწერს ფუნდამენტურ დავალების კატეგორიებს ტექსტიდან ტექსტის გენერაციისთვის, მაგრამ არ არსებობს მისი მკაფიო ეკვივალენტი ტექსტიდან გამოსახულების გენერაციისთვის. ამის შესამსუბუქებლად, ჩვენ გამოვიყენეთ ორი ძირითადი წყარო, როგორც შეყვანა ჩვენი კატეგორიებისთვის: google/sdxl და Microsoft. ამან გამოიწვია შემდეგი ძირითადი კატეგორიები: ["კინემატოგრაფიული", "ფოტოგრაფიული", "ანიმე", "მანგა", "ციფრული ხელოვნება", "პიქსელური ხელოვნება", "ფენტეზი ხელოვნება", "ნეონპანკი", "3D მოდელი", "ფერწერა", "ანიმაცია", "ილუსტრაცია"]. ამის გარდა, ჩვენ ასევე ავირჩიეთ ურთიერთგამომრიცხავი, ქვეკატეგორიები, რათა კიდევ უფრო გაგვემრავალფეროვნებინა პრომპტები. ეს კატეგორიები და ქვეკატეგორიები შემთხვევითი შერჩევის შედეგად არის მიღებული და ამიტომ დაახლოებით თანაბრად არის განაწილებული მონაცემთა ნაკრებში. Deita-ს ნაშრომმა დაამტკიცა, რომ პრომპტების მზარდი სირთულე და მრავალფეროვნება იწვევს მოდელების უკეთეს გენერაციას და დაზუსტებულ მოდელებს, თუმცა, ადამიანებს ყოველთვის არ აქვთ დრო ვრცელი პრომპტების დასაწერად. ამიტომ ჩვენ გადავწყვიტეთ, ერთი და იგივე პრომპტი გამოგვეყენებინა რთული და გამარტივებული ფორმატით, როგორც ორი მონაცემთა წერტილი სხვადასხვა უპირატესობის გენერაციისთვის. ArtificialAnalysis/Text-to-Image-Leaderboard აჩვენებს საუკეთესო მოქმედი გამოსახულების მოდელების მიმოხილვას. ჩვენ ავირჩიეთ ორი საუკეთესო მოქმედი მოდელი მათი ლიცენზიისა და Hub-ზე ხელმისაწვდომობის საფუძველზე. გარდა ამისა, ჩვენ დავრწმუნდით, რომ მოდელი სხვადასხვა მოდელების ოჯახს მიეკუთვნებოდა, რათა სხვადასხვა კატეგორიებში გენერაცია არ გაესვა ხაზი. ამიტომ, ჩვენ ავირჩიეთ stabilityai/stable-diffusion-3.5-large და black-forest-labs/FLUX.1-dev. შემდეგ თითოეული ეს მოდელი გამოიყენეს გამოსახულების გენერირებისთვის როგორც გამარტივებული, ასევე რთული პრომპტისთვის იმავე სტილისტურ კატეგორიებში. ანოტირებული მონაცემების ნედლი ექსპორტი შეიცავს პასუხებს მრავალჯერად არჩევანზე, სადაც თითოეულმა ანოტატორმა აირჩია, იყო თუ არა რომელიმე მოდელი უკეთესი, ორივე მოდელი კარგად მუშაობდა თუ ორივე მოდელი ცუდად მუშაობდა. ამის საფუძველზე ჩვენ შევძელით ანოტატორების შეთანხმების, მოდელის შესრულების შეფასება კატეგორიების მიხედვით და მოდელის დაზუსტებაც კი, რომლითაც უკვე შეგიძლიათ ითამაშოთ Hub-ზე! შემდეგი გვიჩვენებს ანოტირებულ მონაცემთა ნაკრებს: ანოტატორების შეთანხმება არის დავალების ვალიდობის შემოწმების საშუალება. როდესაც დავალება ძალიან რთულია, ანოტატორები შესაძლოა არ შეთანხმდნენ, ხოლო როდესაც დავალება ძალიან მარტივია, ისინი შესაძლოა ზედმეტად შეთანხმდნენ. ბალანსის მიღწევა იშვიათია, მაგრამ ჩვენ მოვახერხეთ ზუსტი შედეგის მიღწევა ამ სფრინტის განმავლობაში. ეს ანალიზი ჩვენ ჩავატარეთ Hugging Face datasets SQL კონსოლის გამოყენებით. საერთო ჯამში, SD3.5-XL ოდნავ უფრო სავარაუდო იყო, რომ მოიგებდა ჩვენს სატესტო მოწყობაში. ანოტატორების შეთანხმების გათვალისწინებით, ორივე მოდელმა აჩვენა უკეთესი შესრულება საკუთარი უფლებებით.