Hugging Face-ის ჰაბზე 500 000-ზე მეტი მოდელია განთავსებული, თუმცა მომხმარებლებისთვის ყოველთვის ცხადი არ არის, თუ როგორ აირჩიონ საუკეთესო მოდელი, განსაკუთრებით უსაფრთხოების ასპექტების გათვალისწინებით. დეველოპერებმა შეიძლება იპოვონ მოდელი, რომელიც იდეალურად ერგება მათ გამოყენების სცენარს, მაგრამ არ აქვთ სისტემატური მეთოდი მისი უსაფრთხოების მდგომარეობის, კონფიდენციალურობის შედეგების ან პოტენციური უკმარისობის რეჟიმების შესაფასებლად. რადგანაც მოდელები უფრო ძლიერი ხდება და მათი გამოყენებაც სწრაფად იზრდება, ჩვენ გვჭირდება ხელოვნური ინტელექტის უვნებლობისა და უსაფრთხოების ანგარიშგების თანაბრად სწრაფი პროგრესი. ამიტომ, სიხარულით ვაცხადებთ RiskRubric.ai-ს შექმნას, ახალ ინიციატივას, რომელსაც ხელმძღვანელობენ Cloud Security Alliance და Noma Security, Haize Labs-ისა და Harmonic Security-ის წვლილით, AI მოდელების ეკოსისტემაში რისკების სტანდარტიზებული და გამჭვირვალე შეფასებისთვის. RiskRubric.ai უზრუნველყოფს თანმიმდევრულ, შედარებად რისკების ქულებს მოდელების მთელ სპექტრში, მოდელების შეფასებით ექვსი ძირითადი სვეტის მიხედვით: გამჭვირვალობა, სანდოობა, უსაფრთხოება, კონფიდენციალურობა, უვნებლობა და რეპუტაცია. პლატფორმის მიდგომა სრულყოფილად შეესაბამება ღია კოდის ღირებულებებს: ის არის მკაცრი, გამჭვირვალე და რეპროდუცირებადი. Noma Security-ის შესაძლებლობების გამოყენებით პროცესის ავტომატიზაციისთვის, თითოეული მოდელი გადის შეფასებას, რომელიც იძლევა 0-დან 100-მდე ქულებს რისკის თითოეული სვეტისთვის, რაც საბოლოოდ გარდაიქმნება A-დან F-მდე მკაფიო ასო-ნიშნებად. თითოეული შეფასება ასევე მოიცავს აღმოჩენილ კონკრეტულ დაუცველობებს, რეკომენდებულ შერბილების მეთოდებსა და გაუმჯობესების წინადადებებს. RiskRubric ასევე მოიცავს ფილტრებს, რომლებიც დეველოპერებსა და ორგანიზაციებს ეხმარება განლაგების შესახებ გადაწყვეტილებების მიღებაში, იმის მიხედვით, თუ რა არის მათთვის მნიშვნელოვანი. გჭირდებათ მოდელი ძლიერი კონფიდენციალურობის გარანტიებით ჯანდაცვის აპლიკაციებისთვის? გაფილტრეთ კონფიდენციალურობის ქულების მიხედვით. ქმნით მომხმარებელზე ორიენტირებულ აპლიკაციას, რომელიც მოითხოვს თანმიმდევრულ შედეგებს? პრიორიტეტი მიანიჭეთ სანდოობის რეიტინგებს. როგორც ღია, ასევე დახურული მოდელების ზუსტად იგივე სტანდარტებით შეფასებამ საინტერესო შედეგები გამოავლინა: მრავალი ღია მოდელი რეალურად აჭარბებს თავის დახურულ ანალოგებს რისკის კონკრეტულ განზომილებებში (განსაკუთრებით გამჭვირვალობაში, სადაც ღია განვითარების პრაქტიკა ბრწყინავს). მოდით განვიხილოთ ზოგადი ტენდენციები: **რისკის განაწილება პოლარიზებულია – უმეტესი მოდელი ძლიერია, მაგრამ საშუალო დონის ქულები გაზრდილ რისკს აჩვენებს** საერთო რისკის ქულები მერყეობს 47-დან 94-მდე, მედიანით 81 (100 ქულიანი სისტემიდან). მოდელების უმეტესობა „უსაფრთხო“ დიაპაზონშია დაჯგუფებული (54% არის A ან B დონის), მაგრამ სუსტი მოდელების გრძელი „კუდი“ საშუალო მაჩვენებელს ამცირებს. ეს დაყოფა პოლარიზაციას აჩვენებს: მოდელები მიდრეკილნი არიან იყვნენ ან კარგად დაცულები, ან საშუალო ქულების დიაპაზონში, ნაკლებია შუალედური მოდელები. მოდელები, რომლებიც კონცენტრირებულია 50–67 ქულიან ზოლში (C/D დიაპაზონი), არ არის სრულიად გაუმართავი, მაგრამ ისინი უზრუნველყოფენ მხოლოდ საშუალო ან დაბალ საერთო დაცვას. ეს ზოლი წარმოადგენს შეშფოთების ყველაზე პრაქტიკულ სფეროს, სადაც უსაფრთხოების ხარვეზები საკმარისად არსებითია, რათა პრიორიტეტული გახდეს. რას ნიშნავს ეს: ნუ იფიქრებთ, რომ „საშუალო“ მოდელი უსაფრთხოა. სუსტი შემსრულებლების „კუდი“ რეალურია – და სწორედ იქ გაამახვილებენ ყურადღებას თავდამსხმელები. გუნდებს შეუძლიათ გამოიყენონ კომპოზიტური ქულები მინიმალური ზღვრის დასადგენად (მაგ. 75) შესყიდვის ან განლაგების მიზნით, რათა უზრუნველყონ, რომ გადახრები არ მოხვდეს წარმოებაში. **უვნებლობის რისკი არის „გადამწყვეტი ფაქტორი“ – მაგრამ ის მჭიდროდ არის დაკავშირებული უსაფრთხოების მდგომარეობასთან** უვნებლობისა და სოციალური ასპექტის სვეტი (მაგ., მავნე გამომავალი ინფორმაციის პრევენცია) მოდელებს შორის ყველაზე ფართო ვარიაციას აჩვენებს. რაც მნიშვნელოვანია, მოდელები, რომლებიც ინვესტირებას ახდენენ უსაფრთხოების გამკაცრებაში (მოთხოვნის ინექციისგან დაცვა, პოლიტიკის აღსრულება), თითქმის ყოველთვის უკეთეს ქულებს იღებენ უვნებლობის თვალსაზრისითაც. რას ნიშნავს ეს: ძირითადი უსაფრთხოების კონტროლის გაძლიერება სცილდება jailbreak-ის პრევენციას, არამედ პირდაპირ ამცირებს შემდგომ ზიანს! უვნებლობა, როგორც ჩანს, უსაფრთხოების მყარი მდგომარეობის გვერდითი პროდუქტია. **დამცავმა მექანიზმებმა შეიძლება შეამციროს გამჭვირვალობა – თუკი ამას სპეციალურად არ დააპროექტებთ** უფრო მკაცრი დაცვა ხშირად მოდელებს ნაკლებად გამჭვირვალეს ხდის საბოლოო მომხმარებლებისთვის (მაგ., უარის თქმა განმარტებების გარეშე, ფარული საზღვრები). ამან შეიძლება შექმნას ნდობის ხარვეზი: მომხმარებლებმა შეიძლება სისტემა „გაუმჭვირვალედ“ აღიქვან, მაშინაც კი, როდესაც ის უსაფრთხოა. რას ნიშნავს ეს: უსაფრთხოება არ უნდა მოდიოდეს ნდობის ხარჯზე. ორივეს დასაბალანსებლად, ძლიერი დაცვა შეუთავსეთ განმარტებით უარყოფებს, წარმოშობის სიგნალებსა და აუდიტის შესაძლებლობას. ეს ინარჩუნებს გამჭვირვალობას დაცვის შესუსტების გარეშე. განახლებადი შედეგების ცხრილზე წვდომა შესაძლებელია აქ. როდესაც რისკების შეფასებები საჯარო და სტანდარტიზებულია, მთელ საზოგადოებას შეუძლია ერთად იმუშაოს მოდელების უვნებლობის გასაუმჯობესებლად. დეველოპერებს შეუძლიათ ზუსტად დაინახონ, სად სჭირდებათ მათ მოდელებს გაძლიერება, და საზოგადოებას შეუძლია შეიტანოს შესწორებები, პატჩები და უფრო უსაფრთხო, დახვეწილი ვარიანტები. ეს ქმნის გამჭვირვალე გაუმჯობესების დადებით ციკლს, რაც შეუძლებელია დახურული სისტემებით. ის ასევე ეხმარება ფართო საზოგადოებას გაიგოს, თუ რა მუშაობს და რა არა უვნებლობის თვალსაზრისით, საუკეთესო მოდელების შესწავლით. თუ გსურთ ამ ინიციატივაში მონაწილეობა, შეგიძლიათ წარადგინოთ თქვენი მოდელი შეფასებისთვის (ან შესთავაზოთ არსებული მოდელები!) რისკის პროფილის გასაგებად! ჩვენ ასევე მივესალმებით ნებისმიერ უკუკავშირს შეფასების მეთოდოლოგიასა და შეფასების სისტემაზე. „მართლაც გამჭვირვალე და სიღრმისეული ანალიზია, გალ, RiskRubric-ის მიერ შემოტანილი სიღრმისა და გამჭვირვალობის დონე შთამბეჭდავია, განსაკუთრებით იმის გათვალისწინებით, თუ რამდენად სწრაფად იზრდება ღია მოდელების ეკოსისტემა. Openforge.io-ზე ჩვენ ვმუშაობდით გუნდებთან, რომლებიც ჯანდაცვისა და ფინანსების შესაბამისობას უზრუნველყოფდნენ, და კონფი[...]“