ტექსტიდან გამოსახულების (TTI) გენერაცია ამჟამად უაღრესად პოპულარულია და ათასობით TTI მოდელი იტვირთება Hugging Face Hub-ზე. თითოეული მოდალობა პოტენციურად მგრძნობიარეა მიკერძოების სხვადასხვა წყაროს მიმართ, რაც ბადებს კითხვას: როგორ აღმოვაჩინოთ მიკერძოება ამ მოდელებში? ამ ბლოგპოსტში ჩვენ ვუზიარებთ ჩვენს მოსაზრებებს TTI სისტემებში მიკერძოების წყაროების შესახებ, ასევე ინსტრუმენტებსა და პოტენციურ გადაწყვეტილებებს მათ მოსაგვარებლად, წარმოვადგენთ როგორც ჩვენს საკუთარ პროექტებს, ისე ფართო საზოგადოების წევრთა ნამუშევრებს. მიკერძოებასა და ღირებულებებს შორის ძალიან მჭიდრო კავშირია, განსაკუთრებით მაშინ, როდესაც ისინი ჩაშენებულია ენაში ან გამოსახულებებში, რომლებიც გამოიყენება ტექსტიდან გამოსახულების მოდელის საწვრთნელად და შეკითხვების დასასმელად; ეს ფენომენი მნიშვნელოვნად მოქმედებს გენერირებულ სურათებში მიღებულ შედეგებზე. მიუხედავად იმისა, რომ ეს კავშირი ცნობილია ხელოვნური ინტელექტის კვლევის ფართო სფეროში და მიმდინარეობს მნიშვნელოვანი ძალისხმევა მის მოსაგვარებლად, ცალკეულ მოდელში მოცემული მოსახლეობის ღირებულებების განვითარებადი ბუნების ასახვის სირთულე კვლავ რჩება. ეს წარმოადგენს მუდმივ ეთიკურ გამოწვევას, რომელიც მოითხოვს ადეკვატურ გამოვლენასა და მოგვარებას. მაგალითად, თუ საწვრთნელი მონაცემები ძირითადად ინგლისურ ენაზეა, ისინი, სავარაუდოდ, დასავლურ ღირებულებებს ასახავს. შედეგად ვიღებთ განსხვავებული ან შორეული კულტურების სტერეოტიპულ წარმოდგენებს. ეს ფენომენი შესამჩნევია, როდესაც ვადარებთ ERNIE ViLG-ის და Stable Diffusion v 2.1-ის შედეგებს (მაგალითად, მოთხოვნაზე „სახლი პეკინში“). ბოლო წლებში ჩატარდა მრავალი მნიშვნელოვანი კვლევა ხელოვნური ინტელექტის სისტემებში მიკერძოების აღმოსაჩენად ერთი მოდალობის ფარგლებში, როგორც ბუნებრივი ენის დამუშავებაში (Abid et al., 2021), ასევე კომპიუტერულ ხედვაში (Buolamwini and Gebru, 2018). რამდენადაც მანქანური სწავლების (ML) მოდელები ადამიანების მიერ იქმნება, მიკერძოება ყველა ML მოდელში (და, ზოგადად, ტექნოლოგიაში) არსებობს. ეს შეიძლება გამოვლინდეს გამოსახულებებში გარკვეული ვიზუალური მახასიათებლების ზედმეტი ან არასაკმარისი წარმოდგენით (მაგალითად, საოფისე მუშაკების ყველა გამოსახულება ჰალსტუხით), ან კულტურული და გეოგრაფიული სტერეოტიპების არსებობით (მაგალითად, პატარძლების ყველა გამოსახულება თეთრი კაბებითა და ფატებით, იმის ნაცვლად, რომ უფრო მეტად იყოს წარმოდგენილი პატარძლების მრავალფეროვანი გამოსახულებები მთელი მსოფლიოდან, მაგალითად, პატარძლები წითელი სარებით). იმის გათვალისწინებით, რომ ხელოვნური ინტელექტის სისტემები განლაგებულია სოციოტექნიკურ კონტექსტებში და ფართოდ ინერგება სხვადასხვა სექტორსა და ინსტრუმენტებში (მაგ., Firefly, Shutterstock), ისინი განსაკუთრებით მიდრეკილნი არიან გააძლიერონ არსებული საზოგადოებრივი მიკერძოებები და უთანასწორობა. ქვემოთ მოცემულია მიკერძოების წყაროების არაამომწურავი სია: **მიკერძოება საწვრთნელ მონაცემებში:** პოპულარულ მულტიმოდალურ მონაცემთა ნაკრებებში, როგორიცაა LAION-5B ტექსტიდან გამოსახულებისთვის, MS-COCO გამოსახულების წარწერებისთვის და VQA v2.0 ვიზუალური კითხვა-პასუხისთვის, აღმოჩენილია მრავალი მიკერძოება და მავნე ასოციაცია (Zhao et al 2017, Prabhu and Birhane, 2021, Hirota et al, 2022), რომლებიც შეიძლება გადავიდეს ამ მონაცემთა ნაკრებებზე გაწვრთნილ მოდელებში. მაგალითად, Hugging Face Stable Bias პროექტის საწყისი შედეგები აჩვენებს მრავალფეროვნების ნაკლებობას გამოსახულების გენერაციებში, ასევე კულტურებისა და იდენტობის ჯგუფების გავრცელებული სტერეოტიპების განმტკიცებას. Dall-E 2-ის მიერ გენერირებული აღმასრულებელი დირექტორებისა (CEO) და მენეჯერების გამოსახულებების შედარებისას ჩანს, რომ ორივე ნაკლებად მრავალფეროვანია. **მიკერძოება საწვრთნელი მონაცემების წინასწარ გაფილტვრაში:** ხშირად ხდება მონაცემთა ნაკრებების გარკვეული ფორმით გაფილტვრა მოდელების საწვრთნელად გამოყენებამდე; ეს სხვადასხვა სახის მიკერძოებას იწვევს. მაგალითად, Dall-E 2-ის შემქმნელებმა თავიანთ ბლოგპოსტში აღნიშნეს, რომ საწვრთნელი მონაცემების გაფილტვრამ შესაძლოა რეალურად გააძლიეროს მიკერძოება – ისინი ვარაუდობენ, რომ ეს შეიძლება გამოწვეული იყოს მონაცემთა არსებული მიკერძოებით, რომელიც ქალებს უფრო სექსუალიზებულ კონტექსტში წარმოაჩენს, ან მათ მიერ გამოყენებული ფილტრაციის მიდგომების თანდაყოლილი მიკერძოებებით. **მიკერძოება დასკვნის ეტაპზე (Inference):** CLIP მოდელს, რომელიც გამოიყენება ტექსტიდან გამოსახულების მოდელების, როგორიცაა Stable Diffusion და Dall-E 2, წვრთნისა და დასკვნის პროცესის გასაკონტტროლებლად, აქვს ასაკთან, სქესთან და რასასთან ან ეთნიკურ წარმომავლობასთან დაკავშირებული არაერთი კარგად დოკუმენტირებული მიკერძოება, მაგალითად, ნაგულისხმევად თვლის იმ გამოსახულებებს, რომლებიც თეთრ, საშუალო ასაკის მამაკაცებად იყო ეტიკეტირებული. ამან შეიძლება გავლენა მოახდინოს მოდელების გენერაციაზე, რომლებიც მას მოთხოვნის კოდირებისთვის იყენებენ, მაგალითად, დაუზუსტებელი ან არასაკმარისად დაზუსტებული სქესის და იდენტობის ჯგუფების ინტერპრეტაციით, როგორც თეთრი და მამრობითი სქესის. **მიკერძოება მოდელების ლატენტურ სივრცეში:** შესრულებულია საწყისი სამუშაო მოდელის ლატენტური სივრცის შესასწავლად და გამოსახულების გენერაციის სხვადასხვა ღერძის გასწვრივ, მაგალითად, სქესის მიხედვით, უფრო წარმომადგენლობითი გენერაციების შესაქმნელად. თუმცა, საჭიროა მეტი მუშაობა, რათა უკეთ გავიგოთ დიფუზიური მოდელების სხვადასხვა ტიპის ლატენტური სივრცის სტრუქტურა და ის ფაქტორები, რომლებმაც შეიძლება გავლენა მოახდინოს გენერირებულ გამოსახულებებში ასახულ მიკერძოებაზე. **მიკერძოება შემდგომ გაფილტვრაში (Post-hoc filtering):** გამოსახულების გენერაციის მრავალ მოდელს გააჩნია ჩაშენებული უსაფრთხოების ფილტრები, რომლებიც პრობლემური შინაარსის იდენტიფიცირებას ისახავს მიზნად. თუმცა, ჯერ კიდევ დასადგენია, რამდენად ეფექტურია ეს ფილტრები და რამდენად მედეგია ისინი სხვადასხვა სახის შინაარსის მიმართ – მაგალითად, Stable Diffusion-ის უსაფრთხოების ფილტრის „წითელი გუნდის“ (red-team) ტესტირებამ აჩვენა, რომ ის ძირითადად სექსუალურ შინაარსს ამოიცნობს და ვერ ახდენს სხვა სახის ძალადობრივი, შემზარავი ან შემაშფოთებელი შინაარსის იდენტიფიცირებას.