Llama Guard 4 და Prompt Guard 2: ხელოვნური ინტელექტის უსაფრთხოების ახალი მულტიმოდალური მოდელები
წარმოგიდგენთ Llama Guard 4-ს, მულტიმოდალურ მოდელს, რომელიც შექმნილია გამოსახულებებსა და ტექსტში სახიფათო კონტენტის აღმოსაჩენად, მათ შორის „jailbreak“-ის თავიდან ასაცილებლად. მასთან ერთად, Llama Prompt Guard 2 აძლიერებს დაცვას „prompt injection“-ებისა და სხვა მავნე შეტევებისგან, რაც უზრუნველყოფს ხელოვნური ინტელექტის უსაფრთხო და მოქნილ მოდერაციას. ეს მოდელები მნიშვნელოვნად აუმჯობესებენ AI სისტემების დაცვას საწარმოო გარემოში.
საწარმოო გარემოში განლაგებული ვიზუალური და დიდი ენობრივი მოდელები (LLM) შესაძლოა გამოყენებულ იქნეს სახიფათო გამოსავლების გენერირებისთვის, „jailbreak“ ტიპის გამოსახულების ან ტექსტის მოთხოვნების საშუალებით. საწარმოო გარემოში სახიფათო კონტენტი შეიძლება მოიცავდეს მავნე ან შეუსაბამო მასალას, კონფიდენციალურობის ან ინტელექტუალური საკუთრების დარღვევას. ახალი დამცავი მოდელები ამ პრობლემას აგვარებენ გამოსახულებისა და ტექსტის, ასევე თავად მოდელის მიერ გენერირებული კონტენტის შეფასებით. მომხმარებლის მიერ სახიფათოდ კლასიფიცირებული შეტყობინებები არ გადაეცემა ვიზუალურ და დიდ ენობრივ მოდელებს, ხოლო ასისტენტის სახიფათო პასუხები შეიძლება გაფილტრული იქნას საწარმოო სერვისების მიერ.
Llama Guard 4 არის ახალი მულტიმოდალური მოდელი, რომელიც შექმნილია გამოსახულებებსა და ტექსტში შეუსაბამო კონტენტის აღმოსაჩენად, მიუხედავად იმისა, გამოიყენება თუ არა ის შეტანად მონაცემად, თუ მოდელის მიერ გენერირებულ გამოსავლად. ეს არის მკვრივი 12 მილიარდი პარამეტრის მქონე მოდელი, რომელიც Llama 4 Scout მოდელიდან იქნა გამოყოფილი და მას შეუძლია ერთ GPU-ზე მუშაობა (24 GB VRAM). მას შეუძლია შეაფასოს როგორც მხოლოდ ტექსტური, ასევე გამოსახულება+ტექსტური შეტანები, რაც მას შესაფერისს ხდის დიდი ენობრივი მოდელების როგორც შეტანების, ასევე გამოსავლების გასაფილტრად. ეს უზრუნველყოფს მოდერაციის მოქნილ სისტემებს, სადაც მოთხოვნები გაანალიზებულია მოდელამდე მისვლამდე, ხოლო გენერირებული პასუხები მოწმდება უსაფრთხოებაზე მოგვიანებით. მას ასევე შეუძლია მრავალი ენის გაგება.
მოდელს შეუძლია კლასიფიკაცია გაუკეთოს MLCommons-ის საფრთხეების ტაქსონომიაში განსაზღვრულ 14 ტიპის საფრთხეს, ასევე კოდის ინტერპრეტატორის ბოროტად გამოყენებას. მოდელის მიერ აღმოჩენილი კატეგორიების სია შეიძლება კონფიგურირებული იყოს მომხმარებლის მიერ ინფერენციისას. Llama Guard 4 იყენებს მკვრივ feedforward early-fusion არქიტექტურას, განსხვავებით Llama 4 Scout-ისგან, რომელიც იყენებს Mixture-of-Experts (MoE) ფენებს ერთი საერთო მკვრივი ექსპერტით და თექვსმეტი მიმართული ექსპერტით თითოეულ ფენაში. Llama 4 Scout-ის წინასწარი ვარჯიშის გამოსაყენებლად, არქიტექტურა გარდაიქმნა მკვრივ მოდელად ყველა მიმართული ექსპერტისა და მარშრუტიზატორის ფენების მოხსნით, მხოლოდ საერთო ექსპერტის შენარჩუნებით. ეს იწვევს მკვრივი feedforward მოდელის მიღებას, რომელიც ინიციალიზებულია წინასწარ გაწვრთნილი საერთო ექსპერტის წონებით. Llama Guard 4-ზე დამატებითი წინასწარი ვარჯიში არ ხორციელდება. ვარჯიშის შემდგომი მონაცემები მოიცავს მრავალ გამოსახულებიან სავარჯიშო მონაცემებს (5-მდე გამოსახულება) და ადამიანის მიერ ანოტირებულ მრავალენოვან მონაცემებს, რომლებიც ადრე გამოიყენებოდა Llama Guard 3 მოდელების სავარჯიშოდ. სავარჯიშო მონაცემები შედგება 3:1 თანაფარდობით მხოლოდ ტექსტური მონაცემების მულტიმოდალურ მონაცემებთან.
Llama Guard 4-ის მუშაობა, უსაფრთხოების მოდელის წინა ვერსიასთან, Llama Guard 3-თან შედარებით, გაუმჯობესებულია. Llama Prompt Guard 2 სერია წარმოადგენს ორ ახალ კლასიფიკატორს 86 მილიონი და 22 მილიონი პარამეტრით, რომლებიც ფოკუსირებულია მოთხოვნების ინექციების (prompt injections) და „jailbreak“-ების აღმოჩენაზე. მის წინამორბედთან, Llama Prompt Guard 1-თან შედარებით, ეს ახალი ვერსია გვთავაზობს გაუმჯობესებულ მუშაობას, უფრო სწრაფ და კომპაქტურ 22 მილიონი პარამეტრის მოდელს, ტოკენიზაციას, რომელიც მდგრადია მტრული შეტევების მიმართ, და გამარტივებულ ბინარულ კლასიფიკაციას (კეთილთვისებიანი vs. მავნე).
Llama Guard 4-ისა და Prompt Guard 2-ის გამოსაყენებლად, დარწმუნდით, რომ დაყენებული გაქვთ hf_xet და transformers-ის საცდელი ვერსია Llama Guard-ისთვის. თუ თქვენს აპლიკაციას არ სჭირდება მოდერაცია ზოგიერთ მხარდაჭერილ კატეგორიაზე, შეგიძლიათ უგულებელყოთ ის, რაც თქვენთვის უინტერესოა. ზოგჯერ არა მხოლოდ მომხმარებლის შეტანები, არამედ თავად მოდელის მიერ გენერირებული შინაარსიც შეიძლება შეიცავდეს მავნე კონტენტს. ჩვენ შეგვიძლია მოდელის გენერაციის მოდერაციაც! ეს მუშაობს იმიტომ, რომ ჩატის შაბლონი ქმნის სისტემურ მოთხოვნას, რომელიც არ ახსენებს გამორიცხულ კატეგორიებს, როგორც იმ კატეგორიების სიის ნაწილს, რომლებსაც უნდა დააკვირდნენ. Llama Prompt Guard 2 შეგიძლიათ გამოიყენოთ უშუალოდ pipeline API-ის საშუალებით, ან ალტერნატიულად, მისი გამოყენება ასევე შესაძლებელია AutoTokenizer + AutoModel API-ის საშუალებით.
მეტი სტატია ჩვენი ბლოგიდან. დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის.
თეგები:
#ხელოვნური ინტელექტი
#llm
#ai უსაფრთხოება
#მულტიმოდალური მოდელები
#prompt injection
#llama guard 4
#llama prompt guard 2
#კონტენტის მოდერაცია
#jailbreak
წყარო: huggingface.co
AI-ით გადამუშავებული