LLM-ების კონფიდენციალურობისა და ინტელექტუალური საკუთრების დაცვა: Zama-ს გადაწყვეტა ჰომომორფული დაშიფვრით
დიდი ენობრივი მოდელების (LLM) ფართო გამოყენების მიუხედავად, მომხმარებლის მონაცემთა კონფიდენციალურობის საკითხი კვლავ გადაუჭრელ პრობლემად რჩება, რადგან არსებობს სენსიტიური ინფორმაციის LLM სერვისის მიმწოდებელთან გაჟონვის რისკი. Zama გვთავაზობს ინოვაციურ გადაწყვეტას სრულად ჰომომორფული დაშიფვრის (FHE) გამოყენებით, რომელიც საშუალებას აძლევს LLM-ებს, იმუშაონ დაშიფრულ მონაცემებზე. ეს მეთოდი იცავს როგორც მომხმარებლის კონფიდენციალურობას, ასევე მოდელის ინტელექტუალურ საკუთრებას, პროგნოზების ხარისხის შენარჩუ
დიდი ენობრივი მოდელების (LLM) მიმზიდველობის მიუხედავად, მომხმარებლის შეკითხვებთან დაკავშირებული კონფიდენციალურობის პრობლემები კვლავ აქტუალურია, რადგან ეს შეკითხვები ამ მოდელების მიერ მუშავდება. ერთის მხრივ, LLM-ების ძალის გამოყენება სასურველია, მაგრამ მეორეს მხრივ, არსებობს სენსიტიური ინფორმაციის LLM სერვისის მიმწოდებელთან გაჟონვის რისკი. ზოგიერთ სფეროში, როგორიცაა ჯანდაცვა, ფინანსები ან სამართალი, ეს კონფიდენციალურობის რისკი გადაულახავი დაბრკოლებაა. ამ პრობლემის ერთ-ერთი შესაძლო გადაწყვეტა არის ლოკალური განთავსება (on-premise deployment), სადაც LLM-ის მფლობელი თავის მოდელს კლიენტის მანქანაზე განათავსებს. თუმცა, ეს არ არის ოპტიმალური გადაწყვეტა, რადგან LLM-ის აგება შესაძლოა მილიონობით დოლარი დაჯდეს (GPT3-ისთვის 4.6 მილიონი დოლარი), ხოლო ლოკალური განთავსება მოდელის ინტელექტუალური საკუთრების (IP) გაჟონვის რისკს ქმნის. Zama მიიჩნევს, რომ შესაძლებელია ორივე უპირატესობის შერწყმა: ჩვენი ამბიციაა დავიცვათ როგორც მომხმარებლის კონფიდენციალურობა, ასევე მოდელის IP. ამ ბლოგში ნახავთ, თუ როგორ უნდა გამოიყენოთ Hugging Face-ის ტრანსფორმატორების ბიბლიოთეკა და როგორ ამუშაოთ ამ მოდელების ნაწილები დაშიფრულ მონაცემებზე. სრული კოდი შეგიძლიათ იხილოთ ამ გამოყენების შემთხვევის მაგალითში.
LLM-ის განთავსების გამოწვევების გადასაჭრელად Zama-ს გადაწყვეტა არის სრულად ჰომომორფული დაშიფვრის (FHE) გამოყენება, რომელიც საშუალებას იძლევა ფუნქციების შესრულება დაშიფრულ მონაცემებზე. შესაძლებელია მოდელის მფლობელის IP-ის დაცვის მიზნის მიღწევა მომხმარებლის მონაცემთა კონფიდენციალურობის შენარჩუნების პარალელურად. ეს დემო გვიჩვენებს, რომ FHE-ში იმპლემენტირებული LLM მოდელი ინარჩუნებს ორიგინალური მოდელის პროგნოზების ხარისხს. ამისათვის საჭიროა Hugging Face-ის ტრანსფორმატორების ბიბლიოთეკიდან GPT2-ის იმპლემენტაციის ადაპტირება, ინფერენციის ნაწილების გადამუშავება Concrete-Python-ის გამოყენებით, რაც საშუალებას იძლევა Python ფუნქციების FHE ეკვივალენტებად გარდაქმნას.
სურათი 1 გვიჩვენებს GPT2-ის არქიტექტურას, რომელსაც აქვს განმეორებადი სტრუქტურა: მრავალთავიანი ყურადღების (MHA) ფენების თანმიმდევრული გამოყენება. თითოეული MHA ფენა ასახავს შემავალ მონაცემებს მოდელის წონების გამოყენებით, ითვლის ყურადღების მექანიზმს და ხელახლა ასახავს ყურადღების გამოსავალს ახალ ტენზორში. TFHE-ში, მოდელის წონები და აქტივაციები წარმოდგენილია მთელი რიცხვებით. არაწრფივი ფუნქციები უნდა იყოს იმპლემენტირებული პროგრამირებადი bootstrapping (PBS) ოპერაციით. PBS ახორციელებს ცხრილის ძიების (TLU) ოპერაციას დაშიფრულ მონაცემებზე, ასევე განაახლებს შიფრტექსტებს ნებისმიერი გამოთვლის დასაშვებად. უარყოფითი მხარეა ის, რომ PBS-ის გამოთვლის დრო აჭარბებს წრფივი ოპერაციების დროს. ამ ორი ტიპის ოპერაციის გამოყენებით, შეგიძლიათ FHE-ში გამოხატოთ LLM გამოთვლის ნებისმიერი ქვენაწილი, ან თუნდაც სრული გამოთვლა. შემდეგ ნახავთ, თუ როგორ უნდა დაშიფროთ მრავალთავიანი ყურადღების (MHA) ბლოკის ერთი ყურადღების თავი. ასევე შეგიძლიათ იპოვოთ სრული MHA ბლოკის მაგალითი ამ გამოყენების შემთხვევის მაგალითში.
სურათი 2 გვიჩვენებს საბაზისო იმპლემენტაციის გამარტივებულ მიმოხილვას. კლიენტი იწყებს ინფერენციას ლოკალურად პირველ ფენამდე, რომელიც ამოღებულია გაზიარებული მოდელიდან. მომხმარებელი შიფრავს შუალედურ ოპერაციებს და უგზავნის სერვერს. სერვერი იყენებს ყურადღების მექანიზმის ნაწილს და შედეგები უბრუნდება კლიენტს, რომელსაც შეუძლია მათი გაშიფვრა და ლოკალური ინფერენციის გაგრძელება. პირველ რიგში, მოდელის ინფერენციის დაშიფრულ მნიშვნელობებზე შესასრულებლად, მოდელის წონები და აქტივაციები უნდა იყოს კვანტიზებული და გადაყვანილი მთელ რიცხვებში. იდეალურია ვარჯიშის შემდგომი კვანტიზაციის გამოყენება, რომელიც არ საჭიროებს მოდელის ხელახლა ვარჯიშს. პროცესი მოიცავს FHE-თან თავსებადი ყურადღების მექანიზმის იმპლემენტაციას, მთელი რიცხვებისა და PBS-ის გამოყენებას და შემდეგ LLM-ის სიზუსტეზე ზემოქმედების შემოწმებას. კვანტიზაციის ზემოქმედების შესაფასებლად, გაუშვით სრული GPT2 მოდელი ერთი LLM Head-ით, რომელიც მუშაობს დაშიფრულ მონაცემებზე. შემდეგ, შეაფასეთ მიღებული სიზუსტე, როდესაც იცვლება კვანტიზაციის ბიტების რაოდენობა როგორც წონებისთვის, ასევე აქტივაციებისთვის.
ეს გრაფიკი გვიჩვენებს, რომ 4-ბიტიანი კვანტიზაცია ინარჩუნებს ორიგინალური სიზუსტის 96%-ს. ექსპერიმენტი ჩატარებულია დაახლოებით 80 წინადადებისგან შემდგარი მონაცემთა ნაკრების გამოყენებით. მეტრიკა გამოითვლება ორიგინალური მოდელის ლოგიტების პროგნოზის შედარებით კვანტიზებული თავის მქონე მოდელთან. Hugging Face-ის ტრანსფორმატორების ბიბლიოთეკაზე დაყრდნობით, გადაწერეთ იმ მოდულების forward pass, რომელთა დაშიფვრაც გსურთ, რათა ჩართოთ კვანტიზებული ოპერატორები. შექმენით SingleHeadQGPT2Model ინსტანცია, ჯერ GPT2LMHeadModel-ის ჩატვირთვით და შემდეგ ხელით შეცვალეთ პირველი მრავალთავიანი ყურადღების მოდული შემდეგნაირად QGPT2SingleHeadAttention მოდულის გამოყენებით. სრული იმპლემენტაცია შეგიძლიათ იხილოთ აქ. შემდეგ forward pass გადაიწერება ისე, რომ მრავალთავიანი ყურადღების მექანიზმის პირველი თავი, კვერის, ქეისების და მნიშვნელობის მატრიცების შესაქმნელად გაკეთებული პროექციების ჩათვლით, სრულდება FHE-მეგობრული ოპერატორებით. შემდეგი QGPT2 მოდული შეგიძლიათ იხილოთ აქ. მოდელში სხვა გამოთვლები რჩება მცურავ წერტილში, არა-დაშიფრული და მოსალოდნელია, რომ შესრულდება კლიენტის მიერ ლოკალურად. ამ გზით შეცვლილ GPT2 მოდელში წინასწარ გაწვრთნილი წონების ჩატვირთვით, შეგიძლიათ გამოიძახოთ generate მეთოდი: მაგალითად, შეგიძლიათ სთხოვოთ კვანტიზებულ მოდელს შეავსოს ფრაზა „კრიპტოგრაფია არის“. FHE-ში მოდელის გაშვებისას საკმარისი კვანტიზაციის სიზუსტით, გამოსავალი
თეგები:
#ხელოვნური ინტელექტი
#llm
#ინტელექტუალური საკუთრება
#კონფიდენციალურობა
#hugging face
#კვანტიზაცია
#gpt2
#zama
#fhe
#დაშიფვრა
წყარო: huggingface.co
AI-ით გადამუშავებული