როგორ ვებრძოლოთ მიკერძოებას ტექსტიდან გამოსახულების გენერაციის სისტემებში?
ტექსტიდან გამოსახულების გენერაციის (TTI) მოდელები სულ უფრო პოპულარული ხდება, თუმცა მათში ჩაშენებული მიკერძოებები მნიშვნელოვან ეთიკურ გამოწვევას წარმოადგენს. ეს ბლოგპოსტი იკვლევს მიკერძოების წყაროებს TTI სისტემებში, მათ შორის საწვრთნელ მონაცემებში, ფილტრაციის პროცესებში, ინფერენციასა და მოდელის ლატენტურ სივრცეში არსებულ პრობლემებს, ასევე განიხილავს მათ გადასაჭრელ ინსტრუმენტებსა და პოტენციურ გადაწყვეტებს.
ტექსტიდან გამოსახულების გენერაცია (TTI) ამჟამად ძალიან პოპულარულია და ათასობით TTI მოდელი იტვირთება Hugging Face Hub-ზე. თითოეული მოდალობა პოტენციურად მგრძნობიარეა მიკერძოების ცალკეული წყაროების მიმართ, რაც აჩენს კითხვას: როგორ გამოვავლინოთ მიკერძოებები ამ მოდელებში? ამჟამინდელ ბლოგპოსტში, ჩვენ ვიზიარებთ ჩვენს მოსაზრებებს TTI სისტემებში მიკერძოების წყაროების, ასევე მათი გადასაჭრელი ხელსაწყოებისა და პოტენციური გადაწყვეტილებების შესახებ, წარმოვადგენთ როგორც ჩვენს, ასევე ფართო საზოგადოების პროექტებს. მიკერძოებასა და ღირებულებებს შორის ძალიან მჭიდრო კავშირია, განსაკუთრებით მაშინ, როდესაც ისინი ჩაშენებულია ენაში ან გამოსახულებებში, რომლებიც გამოიყენება ტექსტიდან გამოსახულების კონკრეტული მოდელის გასაწვრთნელად და გამოსაკითხად; ეს ფენომენი მნიშვნელოვნად მოქმედებს გენერირებულ გამოსახულებებში ნანახ შედეგებზე. მიუხედავად იმისა, რომ ეს ურთიერთობა ცნობილია ხელოვნური ინტელექტის კვლევის ფართო სფეროში და მისი გადასაჭრელად მნიშვნელოვანი ძალისხმევა მიმდინარეობს, მოცემული მოსახლეობის ღირებულებების განვითარებადი ბუნების ერთ მოდელში წარმოდგენის სირთულე კვლავ რჩება. ეს წარმოადგენს ეთიკურ გამოწვევას, რომელიც მოითხოვს გამოვლენასა და ადეკვატურ გადაჭრას. მაგალითად, თუ საწვრთნელი მონაცემები ძირითადად ინგლისურ ენაზეა, ისინი, ალბათ, უფრო დასავლურ ღირებულებებს გადმოსცემენ. შედეგად ვიღებთ განსხვავებული ან შორეული კულტურების სტერეოტიპულ წარმოდგენებს. ეს ფენომენი შესამჩნევი ხდება, როდესაც ვადარებთ ERNIE ViLG-ის (მარცხნივ) და Stable Diffusion v 2.1-ის (მარჯვნივ) შედეგებს იგივე მოთხოვნისთვის: "სახლი პეკინში":
ბოლო წლებში მნიშვნელოვანი კვლევები ჩატარდა ხელოვნური ინტელექტის სისტემებში მიკერძოების გამოვლენის შესახებ, ერთმოდალურ სისტემებში, როგორც ბუნებრივი ენის დამუშავებაში (აბიდი და სხვ., 2021), ასევე კომპიუტერულ ხედვაში (ბუოლამვინი და გებრუ, 2018). რამდენადაც მანქანური სწავლების (ML) მოდელები ადამიანების მიერაა შექმნილი, მიკერძოებები არსებობს ყველა ML მოდელში (და, მართლაც, ტექნოლოგიაში ზოგადად). ეს შეიძლება გამოვლინდეს გამოსახულებებში გარკვეული ვიზუალური მახასიათებლების გადაჭარბებული ან არასაკმარისი წარმოდგენით (მაგალითად, საოფისე მუშაკების ყველა გამოსახულებას ჰქონდეს ჰალსტუხი), ან კულტურული და გეოგრაფიული სტერეოტიპების არსებობით (მაგალითად, პატარძლების ყველა გამოსახულებაზე იყოს თეთრი კაბა და ფატა, განსხვავებით მსოფლიოს სხვადასხვა კუთხის პატარძლების უფრო წარმომადგენლობითი გამოსახულებებისაგან, როგორიცაა პატარძლები წითელი სარებით). იმის გათვალისწინებით, რომ ხელოვნური ინტელექტის სისტემები განლაგებულია სოციოტექნიკურ კონტექსტებში, რომლებიც ფართოდ გამოიყენება სხვადასხვა სექტორსა და ინსტრუმენტში (მაგალითად, Firefly, Shutterstock), ისინი განსაკუთრებით სავარაუდოა, რომ გაამძაფრონ არსებული საზოგადოებრივი მიკერძოებები და უთანასწორობა. ქვემოთ გთავაზობთ მიკერძოების წყაროების არასრულ სიას:
**მიკერძოებები საწვრთნელ მონაცემებში:** პოპულარული მულტიმოდალური მონაცემთა ნაკრებები, როგორიცაა LAION-5B ტექსტიდან გამოსახულებისთვის, MS-COCO გამოსახულების წარწერებისთვის და VQA v2.0 ვიზუალური შეკითხვა-პასუხისთვის, აღმოჩნდა, რომ შეიცავენ მრავალრიცხოვან მიკერძოებას და მავნე ასოციაციებს (ჟაო და სხვ. 2017, პრაბჰუ და ბირჰანე, 2021, ჰიროტა და სხვ., 2022), რომლებიც შეიძლება გავრცელდეს ამ მონაცემთა ნაკრებებზე გაწვრთნილ მოდელებში. მაგალითად, Hugging Face Stable Bias პროექტის საწყისი შედეგები აჩვენებს მრავალფეროვნების ნაკლებობას გამოსახულების გენერაციებში, ასევე კულტურებისა და იდენტობის ჯგუფების გავრცელებული სტერეოტიპების განმტკიცებას. Dall-E 2-ის მიერ გენერირებული აღმასრულებელი დირექტორების (მარჯვნივ) და მენეჯერების (მარცხნივ) შედარებისას, ვხედავთ, რომ ორივეს აკლია მრავალფეროვნება:
**მიკერძოებები წინასაწვრთნელი მონაცემების ფილტრაციაში:** ხშირად მონაცემთა ნაკრებებზე ტარდება გარკვეული სახის ფილტრაცია, სანამ მათ მოდელების გასაწვრთნელად გამოიყენებენ; ეს შემოაქვს სხვადასხვა მიკერძოებას. მაგალითად, თავიანთ ბლოგპოსტში, Dall-E 2-ის შემქმნელებმა აღმოაჩინეს, რომ საწვრთნელი მონაცემების ფილტრაციამ შეიძლება რეალურად გაამძაფროს მიკერძოებები – ისინი ვარაუდობენ, რომ ეს შეიძლება გამოწვეული იყოს მონაცემთა ნაკრების არსებული მიკერძოებით ქალების უფრო სექსუალიზებულ კონტექსტებში წარმოსადგენად, ან მათ მიერ გამოყენებული ფილტრაციის მიდგომების თანდაყოლილი მიკერძოებებით.
**მიკერძოებები ინფერენციაში:** CLIP მოდელს, რომელიც გამოიყენება ტექსტიდან გამოსახულების მოდელების, როგორიცაა Stable Diffusion და Dall-E 2, წვრთნისა და ინფერენციის სამართავად, აქვს კარგად დოკუმენტირებული მიკერძოებები ასაკის, გენდერისა და რასის ან ეთნიკურობის ირგვლივ, მაგალითად, გამოსახულებებს, რომლებიც თეთრკანიან, საშუალო ასაკის მამაკაცებად იყო ეტიკეტირებული, ნაგულისხმევად მიიჩნევს. ამან შეიძლება გავლენა მოახდინოს მოდელების გენერაციაზე, რომლებიც მას იყენებენ მოთხოვნის (prompt) კოდირებისთვის, მაგალითად, დაუზუსტებელი ან არასრულყოფილად დაზუსტებული გენდერული და იდენტობის ჯგუფების თეთრკანიან და მამრობით სქესად ინტერპრეტირებით.
**მიკერძოებები მოდელების ლატენტურ სივრცეში:** საწყისი სამუშაოები ჩატარდა მოდელის ლატენტური სივრცის შესწავლისა და გამოსახულების გენერირების სხვადასხვა ღერძის გასწვრივ, როგორიცაა გენდერი, უფრო წარმომადგენლობითი გენერაციების შესაქმნელად (იხილეთ ქვემოთ მოცემული გამოსახულებები). თუმცა, საჭიროა მეტი სამუშაო დიფუზიის მოდელების სხვადასხვა ტიპის ლატენტური სივრცის სტრუქტურისა და გენერირებულ გამოსახულებებში ასახული მიკერძოების გამომწვევი ფაქტორების უკეთ გასაგებად.
**მიკერძოებები შემდგომ ფილტრაციაში (post-hoc filtering):** ბევრი გამოსახულების გენერაციის მოდელი აღჭურვილია ჩაშენებული უსაფრთხოების ფილტრებით, რომლებიც მიზნად ისახავს პრობლემური შინაარსის იდენტიფიცირებას. თუმცა, ჯერ კიდევ დასადგენია, თუ რამდენად ეფექტურია ეს ფილტრები და რამდენად მდგრადია ისინი სხვადასხვა სახის შინაარსის მიმართ – მაგალითად, Stable Diffusion-ის უსაფრთხოების ფილტრის "წითელი გუნდის" ტესტირებამ აჩვენა, რომ ის ძირითადად სექსუალურ შინაარსს ამოიცნობს და ვერ ახდენს სხვა ტიპის ძალადობრივი, შემზარავი ან შემაშფოთებელი შინაარსის იდენტიფიცირებას.
თეგები:
#ხელოვნური ინტელექტი
#მონაცემები
#მიკერძოება
#stable diffusion
#clip
#ai ეთიკა
#გენერაციული ხელოვნება
#მოდელები
#dall-e 2
#ტექსტი-გამოსახულება
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი