Haize Labs-მა და Hugging Face-მა დიდი ენობრივი მოდელების უსაფრთხოების ახალი ეტალონი, „წითელი გუნდის წინააღმდეგობის ბენჩმარკი“ წარადგინეს
დიდი ენობრივი მოდელების (დემ) კვლევის სწრაფი ტემპის ფონზე, Haize Labs-მა, Hugging Face-ის გულუხვი მხარდაჭერით, გამოაქვეყნა „წითელი გუნდის წინააღმდეგობის ბენჩმარკი“ (Red Teaming Resistance Benchmark). ეს ახალი ეტალონი მიზნად ისახავს მოწინავე დემ-ების მოწყვლადობების საფუძვლიან შემოწმებას ადამიანის მიერ შექმნილი, ბუნებრივი ენის მსგავსი მავნე მოთხოვნების (prompts) გამოყენებით, განსხვავებით ხელოვნური, ავტომატიზებული შეტევებისგან. ბენჩმარკი აფასებს მოდელების მდგრადობას არასასურველი ქცევების მიმართ, რო
დიდი ენობრივი მოდელების (დემ) კვლევა სწრაფი ტემპით ვითარდება. ზოგიერთის აზრით, შესაძლოა, ზედმეტადაც კი სწრაფად. მიუხედავად იმისა, რომ სფეროს მკვლევრები აგრძელებენ დემ-ის მუშაობის სწრაფ გაფართოებასა და გაუმჯობესებას, იზრდება შეშფოთება იმის თაობაზე, შეუძლიათ თუ არა ამ მოდელებს სულ უფრო მეტი არასასურველი და სახიფათო ქცევის გამოვლენა. ბოლო თვეებში არ აკლდა კანონმდებლობა და ინდუსტრიული ლაბორატორიების პირდაპირი მოწოდებები მოდელებზე დამატებითი კონტროლის დაწესების შესახებ – არა ტექნოლოგიის განვითარების შეფერხების მიზნით, არამედ იმის უზრუნველსაყოფად, რომ ის პასუხისმგებლობით იქნას დანერგილი მსოფლიოსთვის.
ამ მიზნით, Haize Labs სიამაყით აცხადებს „წითელი გუნდის წინააღმდეგობის ბენჩმარკის“ (Red Teaming Resistance Benchmark) შექმნას, რომელიც Hugging Face-ის გუნდის გულუხვი მხარდაჭერით შეიქმნა. ამ ეტალონში ჩვენ საფუძვლიანად ვამოწმებთ მოწინავე მოდელების სიმყარეს „წითელი გუნდის“ ექსტრემალური ძალისხმევის პირობებში. ანუ, ჩვენ სისტემატურად ვცდით და ვამოწმებთ ამ მოდელებს გონივრულად კონსტრუირებული მოთხოვნებით (prompts), რათა გამოვავლინოთ მათი წარუმატებლობის რეჟიმები და მოწყვლადობები – ამით ვლინდება, თუ ზუსტად სად არიან ეს მოდელები მიდრეკილნი პრობლემური გამომუშავების გენერირებისკენ.
მიუხედავად იმისა, რომ ბოლო დროს გამოქვეყნებულ ავტომატიზებული „წითელი გუნდის“ ლიტერატურაში არ აკლდა შესანიშნავი ნაშრომები, ჩვენ მიგვაჩნდა, რომ მრავალი ასეთი შეტევა უკიდურესად ხელოვნური იყო და ნაკლებად სავარაუდოა, რომ რეალურ პირობებში გამოჩნდეს ისე, რომ რეალისტურად და ნეგატიურად იმოქმედოს ენობრივ მოდელებზე. უფრო მეტიც, ამ შეტევების უმეტესობა ადვილად გაუქმდა მარტივი და მსუბუქი კლასიფიკატორზე დაფუძნებული დაცვით. ფართოდ გამოყენებული GCG „წითელი გუნდის“ ალგორითმის მიერ წარმოებული მოწინააღმდეგე მოთხოვნების მაგალითები: მიუხედავად იმისა, რომ ეს მოთხოვნები, რა თქმა უნდა, ეფექტურია მოდელების პრობლემური გამომუშავების გენერირებისთვის, ისინი სულაც არ არის ადამიანისთვის გასაგები!
იმის ნაცვლად, რომ ჩვენი ყურადღება გავამახვილოთ ადვილად აღმოსაჩენი და არარეალისტური ავტომატიზებული შეტევების ეფექტურობაზე, ჩვენ ვირჩევთ დემ-ების სტრეს-ტესტირებას მაღალი ხარისხის ადამიანური შეტევების წინააღმდეგ, რომლებიც თანმიმდევრულია და სტრუქტურულად ბუნებრივი ენის ერთგული. ამისათვის, ჩვენ ვაფასებთ მოდელებს „წითელი გუნდის“ ეტალონური მონაცემთა ნაკრებების კრებულის გამოყენებით, რომელიც შეგროვდა ხელოვნური ინტელექტის უსაფრთხოების წამყვანი ნაშრომებიდან გასული წლის განმავლობაში. თითოეული მონაცემთა ნაკრები მდიდარია ადამიანის მიერ შექმნილი „ჯეილბრეიქებით“ (უსაფრთხოების გვერდის ავლის მცდელობებით), რომლებიც ეფექტურად ავლენენ სამიზნე მოდელისგან მავნე შესაძლებლობების მრავალფეროვნებას. ჩვენ ასევე ვზომავთ მოდელების მყიფეობას უფრო დეტალურ დონეზე, კერძოდ კი მათ ტენდენციას, დაარღვიონ ბოროტად გამოყენების კონკრეტული კატეგორიები (OpenAI, Persuasive Jailbreaker), როგორიცაა უკანონო საქმიანობის ხელშეწყობა, შევიწროების წაქეზება, ზრდასრულთა კონტენტის წარმოება და ა.შ.
ჩვენ ვზომავთ დემ-ების მდგრადობას მოწინააღმდეგე შეტევების მიმართ რამდენიმე მოწინააღმდეგე მოთხოვნის მონაცემთა ნაკრებიდან, რომლებიც შეიცავენ მსგავს მოწინააღმდეგე შეყვანებს. ჩვენ ვიყენებთ LlamaGuard-ისა და GPT-4-ის კომბინაციას, ზემოთ მოყვანილ სიაზე დაფუძნებული მორგებული ტაქსონომიის გამოყენებით, მოდელის პასუხის კლასიფიკაციისთვის „უსაფრთხო“ ან „არაუსაფრთხო“, შემდეგ კი ხელით ვამოწმებთ კლასიფიკაციის სისწორეს. ჩვენს ბენჩმარკში საბოლოო ანგარიში არის მოთხოვნების პროცენტული რაოდენობა, რომლებსაც ჩვენი შემფასებელი მოდელები უსაფრთხოდ მიიჩნევენ, რაც Haize-ის მიერ არის გადამოწმებული (ამიტომ ჩვენი ნაჩვენები მეტრიკა არის წარუმატებელი მცდელობების პროცენტული რაოდენობა). დამატებითი დეტალები შეგიძლიათ იხილოთ ჩვენს საცავში.
მიუხედავად იმისა, რომ ზემოთ მოცემულ მონაცემთა ნაკრებებში მოცემული შეტევები ყოვლისმომცველი და თავისებურად უნიკალურია, მათ მიზანში მნიშვნელოვანი გადაკვეთაა. მაგალითად, განვიხილოთ შემდეგი მაგალითები ორი განსხვავებული მონაცემთა ნაკრებიდან: ნათელია, რომ ეს სტრიქონები მიზნად ისახავს მსგავსი ქცევების გამოწვევას სამიზნე მოდელისგან. ამგვარად, მდგრადობის მონაცემთა ნაკრების მიხედვით გაზომვის გარდა, ჩვენ ვზომავთ მდგრადობას ქცევის მიხედვით. კერძოდ, ჩვენ შეტევებს ვყოფთ ძალიან მკაფიო ქვეკატეგორიებად, ნაწილობრივ OpenAI-ის გამოყენების პოლიტიკის საფუძველზე. ზოგადად „არაუსაფრთხო“ ქცევის გავრცელებული ბუნდოვანი, არაზუსტი და მარგინალურად სასარგებლო ცნებებისგან განსხვავებით, ეს პოლიტიკა კონკრეტულ დარღვევებს ასახავს. სრული დაყოფა ასეთია: ჩვენ ვაწყობთ არსებულ „წითელი გუნდის“ მონაცემთა ნაკრებებს ამ კატეგორიების მიხედვით და უსაფრთხოების რეაგირების მაჩვენებლებს ამ კატეგორიებში არსებული მოთხოვნების მიმართ განვიხილავთ ჩვენს ძირითად მდგრადობის მეტრიკად. ამას ვაჩვენებთ, როგორც ჩვენი ლიდერთა დაფის ძირითად ხედს, ზედა მარცხენა კუთხეში არსებული „მოწინააღმდეგე კონტენტის“ (Adversarial Content) ჩამრთველის ქვეშ. ამ ბენჩმარკინგის პროცესის მეშვეობით, ჩვენ აღმოვაჩინეთ, რომ:
ჩვენ ძალიან მოხარულები ვართ, რომ ვნახოთ, როგორ განვითარდება სფერო აქედან! კერძოდ, ჩვენ ძალიან გვიხარია პროგრესის დანახვა სტატიკური „წითელი გუნდის“ მონაცემთა ნაკრებებისგან მოშორებით და უფრო დინამიური მდგრადობის შეფასების მეთოდებისკენ. საბოლოო ჯამში, ჩვენ გვჯერა, რომ ძლიერი „წითელი გუნდის“ ალგორითმები და შეტევის მოდელები, როგორც ბენჩმარკები, იქნება სწორი პარადიგმა და უნდა იყოს შეტანილი ჩვენს ლიდერთა დაფაში. მართლაც, Haize Labs აქტიურად მუშაობს ამ მიდგომებზე. ამასობაში, ვიმედოვნებთ, რომ ჩვენი ლიდერთა დაფა იქნება მდგრადობის გაზომვის ძლიერი სახელმძღვანელო. თუ დაინტერესებული ხართ გაიგოთ მეტი ჩვენი მიდგომის შესახებ „წითელი გუნდის“ მიმართ ან გვეხმაროთ მომავალი იტერაციებისთვის, გთხოვთ, დაგვიკავშირდეთ [email protected]ზე!
თეგები:
#მანქანური სწავლება
#დიდი ენობრივი მოდელები
#ai უსაფრთხოება
#hugging face
#ბენჩმარკი
#წითელი გუნდი
#haize labs
#მოწყვლადობები
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი