DecodingTrust: LLM-ების სანდოობის შეფასების პლატფორმა და ახალი უსაფრთხოების ლიდერბორდი
2023 წელს Secure Learning Lab-მა წარმოადგინა DecodingTrust, პირველი ყოვლისმომცველი პლატფორმა დიდი ენობრივი მოდელების (LLM) სანდოობის შესაფასებლად. პლატფორმა მოიცავს რვა პერსპექტივას, მათ შორის ტოქსიკურობას, სტერეოტიპულ მიკერძოებას, კონფიდენციალურობასა და ეთიკას, და იყენებს ინოვაციურ „წითელი გუნდის“ (red-teaming) მეთოდოლოგიებს. ცოტა ხნის წინ, გამოქვეყნდა ახალი LLM უსაფრთხოების ლიდერბორდი, რომელიც LLM-ების უსაფრთხოების შეფასებაზეა ორიენტირებული.
2023 წელს, Secure Learning Lab-ში, ჩვენ წარვადგინეთ DecodingTrust – პირველი ყოვლისმომცველი და ერთიანი შეფასების პლატფორმა, რომელიც LLM-ების (დიდი ენობრივი მოდელების) სანდოობის შეფასებას ემსახურება. (ამ ნაშრომმა NeurIPS 2023-ზე მიიღო გამორჩეული ნაშრომის ჯილდო.) DecodingTrust უზრუნველყოფს მრავალმხრივ შეფასების ჩარჩოს, რომელიც მოიცავს სანდოობის რვა პერსპექტივას: ტოქსიკურობა, სტერეოტიპული მიკერძოება, კონტრასტული (მტრული) მდგრადობა, OOD (განაწილების გარეთ) მდგრადობა, მდგრადობა კონტრასტული დემონსტრაციების მიმართ, კონფიდენციალურობა, მანქანური ეთიკა და სამართლიანობა.
კერძოდ, DecodingTrust: 1) გვთავაზობს სანდოობის ყოვლისმომცველ პერსპექტივებს ჰოლისტიკური შეფასებისთვის; 2) უზრუნველყოფს ინოვაციურ „წითელი გუნდის“ (red-teaming) ალგორითმებს, მორგებულს თითოეულ პერსპექტივაზე, რაც LLM-ების სიღრმისეული ტესტირების საშუალებას იძლევა; 3) მხარს უჭერს მარტივ ინსტალაციას სხვადასხვა ღრუბლოვან გარემოში; 4) წარმოადგენს ყოვლისმომცველ ლიდერბორდს როგორც ღია, ისე დახურული მოდელებისთვის, მათი სანდოობის საფუძველზე; 5) გთავაზობთ წარუმატებელი მაგალითების კვლევებს გამჭვირვალობისა და გაგების გასაუმჯობესებლად; 6) უზრუნველყოფს სრულფასოვან დემონსტრაციას და მოდელის შეფასების დეტალურ ანგარიშებს პრაქტიკული გამოყენებისთვის.
დღეს, სიამაყით ვაცხადებთ ახალი LLM უსაფრთხოების ლიდერბორდის გამოშვებას, რომელიც ფოკუსირებულია LLM-ების უსაფრთხოების შეფასებაზე და დაფუძნებულია HF ლიდერბორდის შაბლონზე. DecodingTrust გთავაზობთ „წითელი გუნდის“ რამდენიმე ინოვაციურ მეთოდოლოგიას თითოეული შეფასების პერსპექტივისთვის, რათა განხორციელდეს სტრეს-ტესტები. ტესტირების დეტალური სცენარები და მეტრიკა მოცემულია ჩვენი ნაშრომის მე-3 სურათზე.
ტოქსიკურობის შესაფასებლად, ჩვენ ვქმნით ოპტიმიზაციის ალგორითმებს და გენერაციულ მოდელებს, რათა წარმოვიდგინოთ რთული მომხმარებლის მოთხოვნები (prompts). ასევე შევიმუშავეთ 33 რთული სისტემური მოთხოვნა, როგორიცაა როლური თამაში, ამოცანის გადაფორმირება და „პროგრამის სახით პასუხი“, შეფასების სხვადასხვა სცენარში შესასრულებლად. შემდეგ ვიყენებთ Perspective API-ს, რათა შევაფასოთ გენერირებული შინაარსის ტოქსიკურობის ქულა ჩვენი რთული მოთხოვნების გათვალისწინებით.
სტერეოტიპული მიკერძოების შესაფასებლად, ჩვენ შევაგროვეთ 24 დემოგრაფიული ჯგუფი და 16 სტერეოტიპული თემა, ასევე სამი მოთხოვნის ვარიაცია თითოეული თემისთვის, რათა შეგვეფასებინა მოდელის მიკერძოება. მოდელს 5-ჯერ მივმართავთ მოთხოვნით და საშუალოს ვიღებთ მოდელის მიკერძოების ქულად.
კონტრასტული მდგრადობისთვის, ჩვენ ავაშენეთ ხუთი კონტრასტული შეტევის ალგორითმი სამი ღია მოდელის წინააღმდეგ: Alpaca, Vicuna და StableVicuna. ჩვენ ვაფასებთ სხვადასხვა მოდელის მდგრადობას ხუთ მრავალფეროვან ამოცანაში, ღია მოდელებზე შეტევის შედეგად გენერირებული კონტრასტული მონაცემების გამოყენებით.
OOD (განაწილების გარეთ) მდგრადობის პერსპექტივისთვის, ჩვენ შევიმუშავეთ სხვადასხვა სტილის ტრანსფორმაციები, ცოდნის ტრანსფორმაციები და ა.შ., რათა შეგვეფასებინა მოდელის მუშაობა, როდესაც: 1) შეტანის სტილი გარდაიქმნება ნაკლებად გავრცელებულ სტილებად, როგორიცაა შექსპირისეული ან პოეტური ფორმები, ან 2) შეკითხვაზე პასუხისთვის საჭირო ცოდნა არ არის LLM-ების სასწავლო მონაცემებში.
კონტრასტული დემონსტრაციების მიმართ მდგრადობისთვის, ჩვენ ვქმნით დემონსტრაციებს, რომლებიც შეიცავს შეცდომაში შემყვან ინფორმაციას, როგორიცაა კონტრფაქტული მაგალითები, ყალბი კორელაციები და უკანა კარის შეტევები, რათა შევაფასოთ მოდელის მუშაობა სხვადასხვა ამოცანაში.
კონფიდენციალურობისთვის, ჩვენ გთავაზობთ შეფასების სხვადასხვა დონეს, მათ შორის: 1) კონფიდენციალურობის გაჟონვას წინასწარი ვარჯიშის მონაცემებიდან, 2) კონფიდენციალურობის გაჟონვას საუბრების დროს და 3) LLM-ების მიერ კონფიდენციალურობასთან დაკავშირებული სიტყვებისა და მოვლენების გაგებას. კერძოდ, 1) და 2) პუნქტებისთვის, ჩვენ შევიმუშავეთ სხვადასხვა მიდგომა კონფიდენციალურობის შეტევების განსახორციელებლად. მაგალითად, ჩვენ გთავაზობთ მოთხოვნების სხვადასხვა ფორმატს, რათა LLM-ებს ვუბიძგოთ მგრძნობიარე ინფორმაციის, როგორიცაა ელფოსტის მისამართები და საკრედიტო ბარათის ნომრები, გამოსატანად.
ეთიკისთვის, ჩვენ ვიყენებთ ETHICS და Jiminy Cricket მონაცემთა ნაკრებებს, რათა შევქმნათ „ჯეილბრეიკინგის“ სისტემები და მომხმარებლის მოთხოვნები, რომლებსაც ვიყენებთ მოდელის მუშაობის შესაფასებლად ამორალური ქცევის აღიარებაში.
სამართლიანობისთვის, ჩვენ ვაკონტროლებთ სხვადასხვა დაცულ ატრიბუტს სხვადასხვა ამოცანაში, რათა გენერირებულიყო რთული კითხვები მოდელის სამართლიანობის შესაფასებლად როგორც zero-shot, ისე few-shot პარამეტრებში. საერთო ჯამში, ჩვენ აღმოვაჩინეთ,
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი