Hugging Face-ის ბიბლიოთეკაში ენის მოდელების მიკერძოების შეფასების ახალი მეტრიკები დაემატა
Hugging Face-მა თავის 🤗 Evaluate ბიბლიოთეკას დაამატა ახალი მეტრიკები და საზომები, რომლებიც მიმართულია ენის მოდელებში (როგორიცაა GPT-2 და BLOOM) არსებული მიკერძოებების შესასწავლად. ეს ხელსაწყოები საშუალებას იძლევა შეფასდეს ტოქსიკურობა, პოლარობა და მტკივნეულობა (hurtfulness), რითაც ხელს უწყობს ენის მოდელებში დაშიფრული სოციალური საკითხების უკეთ გაგებას და მათთან ბრძოლას. სტატია დეტალურად განიხილავს ამ ხელსაწყოების გამოყენებას სხვადასხვა ამოცანებში.
საზოგადოების დასახმარებლად ამგვარი მიკერძოებების შესწავლასა და ენის მოდელების მიერ დაშიფრული სოციალური საკითხების გაგების გასაღრმავებლად, ჩვენ ვმუშაობდით 🤗 Evaluate ბიბლიოთეკაში მიკერძოების მეტრიკებისა და საზომების დამატებაზე. ამ ბლოგპოსტში, ჩვენ წარმოგიდგენთ ახალი დამატებების რამდენიმე მაგალითს და მათი გამოყენების წესს. ყურადღებას გავამახვილებთ მიზეზობრივი ენის მოდელების (CLMs), როგორიცაა GPT-2 და BLOOM, შეფასებაზე, მათი შესაძლებლობის გამოყენებით, შექმნან თავისუფალი ტექსტი მოცემული მითითებების საფუძველზე. თუ გსურთ იხილოთ სამუშაო მოქმედებაში, გაეცანით ჩვენს მიერ შექმნილ Jupyter ნოუთბუქს! სამუშაო პროცესი ორ ძირითად საფეხურს მოიცავს: მოდით, განვიხილოთ მიკერძოების შეფასება 3 მითითებაზე დაფუძნებულ ამოცანაში, რომლებიც ფოკუსირებულია მავნე ენაზე: ტოქსიკურობა, პოლარობა და მტკივნეულობა. ჩვენს მიერ აქ წარმოდგენილი ნაშრომი ემსახურება იმის დემონსტრირებას, თუ როგორ გამოვიყენოთ Hugging Face-ის ბიბლიოთეკები მიკერძოების ანალიზისთვის და არ არის დამოკიდებული კონკრეტულ მითითებაზე დაფუძნებულ მონაცემთა ნაკრებზე. მნიშვნელოვანია გვახსოვდეს, რომ მიკერძოებების შეფასებისთვის ახლახან შემოღებული მონაცემთა ნაკრებები საწყისი ნაბიჯებია, რომლებიც არ მოიცავს მიკერძოებების ფართო სპექტრს, რომლებიც შესაძლოა მოდელებმა წარმოქმნან (დამატებითი დეტალებისთვის იხილეთ ქვემოთ მოცემული დისკუსიის განყოფილება).
CLMs-ის რეალურ სამყაროში გამოყენებისას, მნიშვნელოვანია შეფასდეს, რამდენად სავარაუდოა, რომ მათ პრობლემური შინაარსი, მაგალითად, სიძულვილის ენა წარმოქმნან. ქვემოთ მოცემულ მაგალითში, ჩვენ ვიყენებთ WinoBias-დან აღებულ მითითებების ნიმუშს და მათ ვუყენებთ GPT-2-ს. შემდეგ ვაფასებთ მოდელის მიერ გენერირებული ტექსტის ტოქსიკურობას 🤗 Evaluate-ის ტოქსიკურობის ქულით, რომელიც იყენებს R4 Target მოდელს, სიძულვილის ენის დეტექციის მოდელს, როგორც სიძულვილის ენის კლასიფიკატორს. ჩვენ ვხედავთ, რომ ნაცვალსახელში უბრალო ცვლილება (ის/ის, მამრობითი/მდედრობითი) სრულიად განსხვავებულ მოდელის დასრულებებს იწვევს. მიუხედავად იმისა, რომ ამ მითითებებს პირდაპირ განვსაზღვრავთ მაგალითისთვის, მეტის ამოღება შესაძლებელია უშუალოდ WinoBias მონაცემთა ნაკრებიდან Hugging Face-ის მონაცემთა ნაკრების ბიბლიოთეკის load_dataset ფუნქციის გამოყენებით; დამატებითი დეტალებისთვის იხილეთ მოცემული კოდი Jupyter ნოუთბუქში. GPT-2-ის გამოყენებით დასრულებების მისაღებად, ვიღებთ შემდეგ შედეგებს: კვლავ, მაგალითისთვის, დასრულებების ნაკრებს პირდაპირ ვანიჭებთ ცვლადებს; ამის GPT-2-დან გენერირების კოდისთვის იხილეთ ნოუთბუქის „მოდელის მითითება“ (Prompting the Model) განყოფილება. შემდეგ ამ დასრულებების გადაცემა შესაძლებელია ტოქსიკურობის შეფასების მოდულში:
როგორც ზემოთ ხედავთ, ნაცვალსახელში უბრალო სხვაობამ შეიძლება გამოიწვიოს ტოქსიკურობის უფრო მაღალი თანაფარდობა ქალური მოდელის დასრულებებისთვის მამრობით დასრულებებთან შედარებით. ასევე შეგიძლიათ გამოტოვოთ aggregation="ratio" კონფიგურაცია, რათა მიიღოთ თითოეული დასრულების ნედლეული ტოქსიკურობის ქულა. მიუხედავად იმისა, რომ პირველს აქვს 0.0002 ქულა, მეორეს აქვს 0.85 ქულა – რაც უფრო მაღალია ქულა, მით უფრო ტოქსიკურად იწინასწარმეტყველება დასრულება. ტოქსიკურობის საზომი შეიძლება გამოყენებულ იქნას ნებისმიერი სახის ტექსტის შესაფასებლად, იქნება ეს მანქანით გენერირებული თუ ადამიანის მიერ დაწერილი ტექსტი ინტერნეტიდან, რათა უკეთ გაიგოთ მისი ტოქსიკურობის დონე. ასევე შეგიძლიათ გამოიყენოთ იგი სხვადასხვა ტექსტის რანჟირებისთვის, რათა დაადგინოთ, რომელ მათგანს აქვს ყველაზე მაღალი ტოქსიკურობა. შენიშვნა: გაითვალისწინეთ, რომ მაღალი ტოქსიკურობის მქონე ტექსტებმა შეიძლება შეიცავდეს ტერმინებს, რომლებიც დაკავშირებულია ძალადობასთან და/ან სიძულვილის ენასთან.
მოდელის ქცევის გაგების კიდევ ერთი მნიშვნელოვანი ასპექტია იმის შეფასება, აქვს თუ არა მას განსხვავებული ენობრივი პოლარობა სხვადასხვა დემოგრაფიული ჯგუფების მიმართ. ამის შესაფასებლად, ჩვენ შეგვიძლია გამოვიყენოთ BOLD მონაცემთა ნაკრების ნიმუშები, რომელიც Alexa AI-მ შექმნა ინგლისურ ენაზე ღია ტიპის ენის გენერაციაში სამართლიანობის შესაფასებლად. ჩვენ ვიყენებთ ამ მონაცემთა ნაკრების ქვეჯგუფებს, რომლებიც ეხება სხვადასხვა ჯგუფებს (მაგ., სქესი, რასა, პროფესია) ჩვენი მოდელის მითითებისთვის. ამ მაგალითში, ჩვენ ვიყენებთ რამდენიმე პროფესიულ მითითებას BOLD-დან სატვირთო მანქანის მძღოლისა და აღმასრულებელი დირექტორისთვის: და როგორც ადრე, ჩვენ ვიყენებთ GPT-2-ს დასრულებების გენერირებისთვის: მოდელის დასრულებების შესაფასებლად, ახლა შეგვიძლია გამოვიყენოთ Regard საზომი, რომელიც აბრუნებს ენის სავარაუდო პოლარობას არჩეული იდენტობის მახასიათებ(ებ)ის მიხედვით (ამ მაგალითში, პროფესია): ზემოთ მოცემული Regard ქულების საფუძველზე, პროფესია 1-ისთვის (სატვირთო მანქანის მძღოლები) დასრულებებს უფრო ნეიტრალური Regard აქვთ, ხოლო პროფესია 2-ისთვის (აღმასრულებელი დირექტორები) დასრულებებს უფრო პოზიტიური Regard აქვთ. ჩვენ შეგვიძლია შევაფასოთ თითოეული მოდელის დასრულება ინდივიდუალურად, რათა დავადგინოთ, რომელია განსაკუთრებით პოლარიზებული. ჯგუფებს შორის პოლარობის სხვაობის გამოთვლა საშუალებას გვაძლევს დავინახოთ, რამდენად მიკერძოებულია მოდელი სხვადასხვა პროფესიის მიმართ, რაც ადასტურებს, რომ მოდელი ზოგიერთ პროფესიას სხვებზე უფრო პოზიტიურად მიიჩნევს – მაგალითად, აღმასრულებელი დირექტორის მითითებების დასრულებები უფრო პოზიტიურია, ვიდრე სატვირთო მანქანის მძღოლის მითითებების დასრულებები.
მიკერძოების შეფასების უახლესი მეტრიკა, რომელიც ჩვენ დავამატეთ 🤗 Evaluate-ს, არის HONEST, რომელიც შეიძლება გამოყენებულ იქნას გენდერული სტერეოტიპული მიკერძოების შესაფასებლად. როგორც ზემოთ მოცემულ მაგალითებში, HONEST ქულები გამოითვლება მოდელის დასრულებებიდან მითითებების ნაკრებისთვის, რომლებიც ხელმისაწვდომია რამდენიმე ენაზე; აქ, ჩვენ ვაფასებთ ინგლისური (“en”) შაბლონებით LGBTQAI+ პირებისთვის: მოცემული მითითებებით, ჩვენ მივიღებთ შემდეგ დასრულებებს: აქედან, ჩვენ ვადგენთ ინტერესის ჯგუფებს HONEST მეტრიკისთვის და ვიანგარიშებთ ქულას თითოეული ჯგუფისთვის. HONEST-ის უფრო მაღალი ქულები ნიშნავს უფრო მტკივნეულ დასრულებებს. ზემოთ მოცემული მოდელის დასრულებების საფუძველზე, ჩვენ გვაქვს შეფას...
თეგები:
#მიკერძოება
#ენის მოდელები
#hugging face
#nlp
#ai ეთიკა
#მოდელის შეფასება
#gpt-2
#ტოქსიკურობა
#პოლარობა
#მტკივნეულობა
#bloom
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი