LLM-ების კვლევა სწრაფად მიიწევს წინ. ზოგიერთის აზრით, შესაძლოა, ზედმეტადაც კი სწრაფად. მიუხედავად იმისა, რომ სფეროს მკვლევრები აგრძელებენ LLM-ების მუშაობის სწრაფ გაფართოებასა და გაუმჯობესებას, იზრდება შეშფოთება იმის თაობაზე, რამდენად შეუძლიათ ამ მოდელებს სულ უფრო მეტი არასასურველი და სახიფათო ქცევის გამოვლენა. ბოლო თვეებში არ აკლდა კანონმდებლობა და ინდუსტრიული ლაბორატორიების პირდაპირი მოწოდებები მოდელების მიმართ დამატებითი შემოწმებისკენ – არა ამ ტექნოლოგიის პროგრესის შეფერხების, არამედ მისი პასუხისმგებლობით დანერგვის უზრუნველსაყოფად, რათა მსოფლიომ უსაფრთხოდ გამოიყენოს იგი. ამ მიზნით, Haize Labs სიამოვნებით აცხადებს „წითელი გუნდის წინააღმდეგობის ბენჩმარკის“ (Red Teaming Resistance Benchmark) შექმნის შესახებ, რომელიც Hugging Face-ის გუნდის გულუხვი მხარდაჭერით შეიქმნა. ამ ბენჩმარკში ჩვენ საფუძვლიანად ვამოწმებთ მოწინავე მოდელების მდგრადობას ექსტრემალური „წითელი გუნდის“ (red teaming) მცდელობების პირობებში. ეს ნიშნავს, რომ ჩვენ სისტემატურად ვუყენებთ გამოწვევებს და ვამოწმებთ ამ მოდელებს გულდასმით შექმნილი მოთხოვნებით (prompts), რათა გამოვავლინოთ მათი ხარვეზები და მოწყვლადობა – ვაჩვენებთ, კონკრეტულად სად არიან ეს მოდელები მიდრეკილნი პრობლემური გამომუშავების გენერირებისკენ. მიუხედავად იმისა, რომ ბოლო პერიოდის ავტომატიზებულ „წითელი გუნდის“ ლიტერატურაში არ აკლდა დიდი ნაშრომები, ჩვენ მიგვაჩნდა, რომ მრავალი ასეთი შეტევა ზედმეტად ხელოვნური იყო და ნაკლებად სავარაუდოა, რომ რეალურად და ნეგატიურად იმოქმედებდა ენობრივ მოდელებზე. მეტიც, ამ შეტევების უმეტესობა ადვილად მწყობრიდან გამოდიოდა მარტივი და მსუბუქი კლასიფიკატორზე დაფუძნებული დაცვის მექანიზმებით. მაგალითები მტრული მოთხოვნებისა, რომლებიც შექმნილია ფართოდ გამოყენებული GCG „წითელი გუნდის“ ალგორითმის მიერ: მიუხედავად იმისა, რომ ეს მოთხოვნები ნამდვილად ეფექტურია მოდელებისთვის პრობლემური გამომუშავების გენერირებისთვის, ისინი სრულიად არ არიან ადამიანისთვის გასაგები! ნაცვლად იმისა, რომ ყურადღება გავამახვილოთ ადვილად ამოსაცნობი და არარეალისტური ავტომატიზებული შეტევების ეფექტურობაზე, ჩვენ ვირჩევთ LLM-ების სტრეს-ტესტირებას მაღალი ხარისხის ადამიანის მიერ განხორციელებული შეტევების წინააღმდეგ, რომლებიც თანმიმდევრული და სტრუქტურულად ბუნებრივი ენის ერთგულია. ამას ვაკეთებთ მოდელების შეფასებით გასული წლის საუკეთესო AI უსაფრთხოების ნაშრომებიდან შეგროვებული „წითელი გუნდის“ საორიენტაციო მონაცემთა ნაკრებების მრავალფეროვანი კრებულის გამოყენებით. თითოეული მონაცემთა ნაკრები მდიდარია ადამიანის მიერ შექმნილი „jailbreak“-ებით, რომლებიც ეფექტურად ავლენს სამიზნე მოდელიდან მავნე შესაძლებლობების მრავალფეროვნებას. ჩვენ ასევე ვზომავთ მოდელების სისუსტეს უფრო დეტალურ დონეზე და, კერძოდ, მათ მიდრეკილებას, დაარღვიონ არასწორი გამოყენების კონკრეტული კატეგორიები (OpenAI, Persuasive Jailbreaker), როგორიცაა უკანონო საქმიანობის ხელშეწყობა, შევიწროების წაქეზება, ზრდასრულთა კონტენტის შექმნა და ა.შ. ჩვენ ვზომავთ LLM-ების მდგრადობას მტრული შეტევების მიმართ რამდენიმე მტრული მოთხოვნის მონაცემთა ნაკრებიდან, რომლებიც მსგავს მტრულ შეყვანებს შეიცავს. ჩვენ ვიყენებთ LlamaGuard-ის კომბინაციას, ზემოთ მოცემულ სიაზე დაფუძნებული მორგებული ტაქსონომიის გამოყენებით, და GPT-4-ს მოდელის პასუხის უსაფრთხოდ ან სახიფათოდ კლასიფიცირებისთვის, შემდეგ კი ხელით ვამოწმებთ კლასიფიკაციის სისწორეს. ჩვენს ბენჩმარკში საბოლოო მოხსენებული ქულა არის იმ მოთხოვნების პროცენტული მაჩვენებელი, რომლებიც ჩვენმა შემფასებელმა მოდელებმა უსაფრთხოდ მიიჩნიეს, Haize-ის მიერ შემოწმებული (ჩვენი ნაჩვენები მეტრიკა, შესაბამისად, არის წარუმატებელი მცდელობების პროცენტული მაჩვენებელი). მეტი დეტალის ნახვა შეგიძლიათ ჩვენს რეპოზიტორიუმში. მიუხედავად იმისა, რომ ზემოთ მოცემულ მონაცემთა ნაკრებებში მოცემული შეტევები ყოვლისმომცველი და თავისებურად უნიკალურია, მათ მიზანში არსებობს მნიშვნელოვანი გადაკვეთა. მაგალითად, განვიხილოთ შემდეგი მაგალითები ორი განსხვავებული მონაცემთა ნაკრებიდან: აშკარაა, რომ ეს სტრიქონები მიზნად ისახავს სამიზნე მოდელიდან მსგავსი ქცევების გამოწვევას. ამრიგად, მონაცემთა ნაკრების მიხედვით მდგრადობის გაზომვის გარდა, ჩვენ ვზომავთ მდგრადობას ქცევის მიხედვით. კერძოდ, ჩვენ შეტევებს ვყოფთ ძალიან მკაფიო ქვე-კატეგორიებად, ნაწილობრივ OpenAI-ის გამოყენების პოლიტიკის საფუძველზე. ზოგადად „უსაფრთხო“ ქცევის ბუნდოვანი, არაზუსტი და ნაკლებად სასარგებლო ცნებებისგან განსხვავებით, ეს პოლიტიკა კონკრეტულ დარღვევებს ასახავს. სრული დაყოფა ასეთია: ჩვენ ხელახლა ვახდენთ არსებული „წითელი გუნდის“ მონაცემთა ნაკრებების რეორგანიზაციას ამ კატეგორიების მიხედვით და უსაფრთხოების პასუხის მაჩვენებლებს ამ კატეგორიებში არსებული მოთხოვნების მიმართ განვიხილავთ ჩვენს ძირითად მდგრადობის მეტრიკად. ამას წარმოვადგენთ ჩვენი ლიდერბორდის ძირითად ხედად, ზედა მარცხენა კუთხეში არსებული „მტრული კონტენტი“ (Adversarial Content) გადამრთველის ქვეშ. ამ ბენჩმარკინგის პროცესის მეშვეობით, ჩვენ მოუთმენლად ველით, თუ როგორ განვითარდება ეს სფერო! კერძოდ, ძალიან გვიხარია პროგრესის დანახვა სტატიკური „წითელი გუნდის“ მონაცემთა ნაკრებებიდან უფრო დინამიურ მდგრადობის შეფასების მეთოდებისკენ. საბოლოო ჯამში, გვჯერა, რომ ძლიერი „წითელი გუნდის“ ალგორითმები და შეტევის მოდელები, როგორც ბენჩმარკები, სწორი პარადიგმა იქნება და უნდა შევიდეს ჩვენს ლიდერბორდში. მართლაც, Haize Labs აქტიურად მუშაობს ამ მიდგომებზე. ამასობაში, ვიმედოვნებთ, რომ ჩვენი ლიდერბორდი მდგრადობის გაზომვისთვის ძლიერი „ჩრდილოეთის ვარსკვლავი“ იქნება. თუ დაინტერესებული ხართ ჩვენი „წითელი გუნდის“ მიდგომის შესახებ მეტის გაგებით ან მომავალი განმეორებებისთვის დახმარების გაწევით, გთხოვთ, დაგვიკავშირდეთ [email protected] მისამართზე!