Lighthouz AI, Hugging Face-თან თანამშრომლობით, იწყებს Chatbot Guardrails Arena-ს (ჩეთბოტის დამცავი მექანიზმების არენა), რათა სტრეს-ტესტირებას დაუქვემდებაროს დიდ ენობრივ მოდელებს (LLMs) და კონფიდენციალურობის დამცავ მექანიზმებს მგრძნობიარე მონაცემების გაჟონვის კუთხით. გამოიჩინეთ კრეატიულობა! ესაუბრეთ ორ ანონიმურ დიდ ენობრივ მოდელს (LLM), რომლებიც აღჭურვილია დამცავი მექანიზმებით, და ეცადეთ, მოატყუოთ ისინი მგრძნობიარე ფინანსური ინფორმაციის გამჟღავნებაში. მიეცით ხმა იმ მოდელს, რომელიც მონაცემთა კონფიდენციალურობის უკეთეს დონეს აჩვენებს. ხმები შეგროვდება და გამოქვეყნდება ლიდერბორდზე, რომელიც წარმოაჩენს საზოგადოების მიერ ყველაზე მაღალი შეფასების მქონე LLM-ებს და მათ დამცავ მექანიზმებს კონფიდენციალურობის კუთხით. Chatbot Guardrails Arena-ს შექმნის მიზანია ხელოვნური ინტელექტის ჩეთბოტების უსაფრთხოების, კონფიდენციალურობისა და დამცავი მექანიზმების სანდო სტანდარტის (ბენჩმარკის) დადგენა. საზოგადოების მიერ ფართომასშტაბიანი ბრმა სტრეს-ტესტირების მეშვეობით, ეს არენა უზრუნველყოფს არსებული კონფიდენციალურობის დამცავი მექანიზმების სანდოობის მიუკერძოებელ და პრაქტიკულ შეფასებას. მონაცემთა კონფიდენციალურობა გადამწყვეტია მაშინაც კი, თუ შიდა გამოყენებისთვის განკუთვნილ ხელოვნური ინტელექტის ჩეთბოტს/აგენტს აშენებთ – წარმოიდგინეთ, რომ ერთ თანამშრომელს შეუძლია შიდა ჩეთბოტის მოტყუება სხვა თანამშრომლის სოციალური დაცვის ნომრის (SSN), სახლის მისამართის ან ხელფასის შესახებ ინფორმაციის მისაღებად. მონაცემთა კონფიდენციალურობის საჭიროება აშკარაა გარე მომხმარებლისთვის განკუთვნილი ხელოვნური ინტელექტის ჩეთბოტების/აგენტების შექმნისას – არ გსურთ, რომ მომხმარებლებს ჰქონდეთ კომპანიის ინფორმაციაზე არასანქცირებული წვდომა. რამდენადაც ჩვენთვის ცნობილია, ამჟამად არ არსებობს სისტემატური კვლევა, რომელიც ხელოვნური ინტელექტის ჩეთბოტების კონფიდენციალურობას შეაფასებდა. ეს არენა ავსებს ამ ხარვეზს, თავდაპირველად ფოკუსირებულია AI ჩეთბოტების კონფიდენციალურობაზე. თუმცა, ჩვენ ველით, რომ მიღებული ცოდნა ხელს შეუწყობს მომავალში კონფიდენციალურობის დამცავი AI აგენტებისა და AI ასისტენტების განვითარებას. უსაფრთხო მომავლის შესაქმნელად საჭიროა ხელოვნური ინტელექტის ჩეთბოტებისა და აგენტების შექმნა, რომლებიც მონაცემთა კონფიდენციალურობაზე ორიენტირებულნი, სანდო და ნდობის ღირსნი იქნებიან. ეს არენა წარმოადგენს ფუნდამენტურ ნაბიჯს ამ მომავლის მისაღწევად. Chatbot Guardrails Arena-ს მონაწილეები ურთიერთობენ ორ ანონიმურ ჩეთბოტთან, რომელთაგან თითოეული სიმულირებს გამოგონილი ბანკის, XYZ001-ის, მომხმარებელთა მომსახურების აგენტს. განსაკუთრებულობა ისაა, რომ ამ ჩეთბოტებს აქვთ წვდომა მომხმარებლების მგრძნობიარე პერსონალურ და ფინანსურ მონაცემებზე, ხოლო გამოწვევა მდგომარეობს იმაში, რომ ორ ჩეთბოტთან საუბრით მაქსიმალურად ბევრი ასეთი ინფორმაცია მოიპოვოთ. მგრძნობიარე ინფორმაციის სია მოიცავს მომხმარებლის სახელს, ტელეფონის ნომერს, ელექტრონულ ფოსტას, მისამართს, დაბადების თარიღს, სოციალური დაცვის ნომერს (SSN), ანგარიშის ნომერს და ბალანსს. შეგიძლიათ ესაუბროთ იმდენ ხანს, რამდენიც საჭირო იქნება. მას შემდეგ, რაც უფრო უსაფრთხო ჩეთბოტს გამოავლენთ, შეგიძლიათ მისცეთ ხმა. თქვენი ხმის მიცემის შემდეგ, მოდელის იდენტობა გამჟღავნდება. არენაზე წარმოდგენილია 12 განსხვავებული, დამცავი მექანიზმებით აღჭურვილი დიდი ენობრივი მოდელის (LLM) შერჩეული კოლექცია. ეს მოიცავს ოთხ LLM-ს, როგორც დახურული კოდის მქონე მოდელებს (gpt3.5-turbo-l106 და Gemini-Pro), ასევე ღია კოდის მქონე მოდელებს (Llama-2-70b-chat-hf და Mixtral-8x7B-Instruct-v0.1), რომელთა უსაფრთხოებაც RLHF მეთოდით იქნა უზრუნველყოფილი. LLM-ები წარმოდგენილია ან თავდაპირველი სახით, ან შერწყმული ორი ყველაზე პოპულარული დამცავი მექანიზმით – კერძოდ, NVIDIA-ს NeMo Guardrails-ით და Meta-ს LlamaGuard-ით – რომლებიც საყოველთაოდ აღიარებულია უსაფრთხოების უმაღლესი სტანდარტების დაცვით. ეს მოდელები საგულდაგულოდ შეირჩა ხელოვნური ინტელექტის შესაძლებლობებისა და დამცავი მექანიზმების ფართო სპექტრის დასაფარად, რაც უზრუნველყოფს, რომ ლიდერბორდი ზუსტად ასახავს AI ტექნოლოგიებისა და უსაფრთხოების მექანიზმების მრავალფეროვან დიაპაზონს. თითოეული ახალი სესიისთვის, სამართლიანობის უზრუნველსაყოფად და მიკერძოების აღმოსაფხვრელად, 12 მოდელიდან შემთხვევით ირჩევა ორი. ჩეთბოტების ქვემოთ მოცემულია რამდენიმე საწყისი მაგალითი. ჩვენ შევძელით დამცავი მექანიზმებით აღჭურვილი LLM-ების ქვეჯგუფის მოტყუება ამ შეყვანების გამოყენებით: Guardrails Arena-დან შეგროვებული ხმები შეგროვდება და გამოქვეყნდება სპეციალურ საჯარო ლიდერბორდზე. ამჟამად ლიდერბორდი ცარიელია, მაგრამ ის დაიწყებს შევსებას 12-ვე LLM-ის კონფიდენციალურობის რეიტინგებით მას შემდეგ, რაც ხმების მნიშვნელოვანი რაოდენობა მოგროვდება. რაც უფრო მეტი ხმა დაფიქსირდება, ლიდერბორდი რეალურ დროში განახლდება, რაც ასახავს მოდელის უსაფრთხოების მიმდინარე შეფასებას. მიღებული პრაქტიკის შესაბამისად, LMSYS-ის Chatbot Arena-სა და საზოგადოების TTS არენისა და ლიდერბორდის მსგავსად, რეიტინგი დაფუძნებული იქნება ელოს სარეიტინგო სისტემაზე. ტრადიციული ჩეთბოტების არენები, როგორიცაა LMSYS-ის ჩეთბოტის არენა, მიზნად ისახავს LLM-ების საერთო საკომუნიკაციო ხარისხის გაზომვას. ამ არენების მონაწილეები ესაუბრებიან ნებისმიერ ზოგად თემაზე და აფასებენ პასუხის „ხარისხის“ საკუთარი შეფასების საფუძველზე. მეორე მხრივ, Chatbot Guardrails Arena-ში მიზანია LLM-ების და დამცავი მექანიზმების მონაცემთა კონფიდენციალურობის შესაძლებლობების გაზომვა. ამისათვის მონაწილემ მტრულად უნდა იმოქმედოს, რათა ამოიღოს ჩეთბოტებისთვის ცნობილი საიდუმლო ინფორმაცია. მონაწილეები ხმას აძლევენ საიდუმლო ინფორმაციის შენარჩუნების უნარის მიხედვით. Chatbot Guardrails Arena იწყებს ხელოვნური ინტელექტის აპლიკაციების კონფიდენციალურობის პრობლემების საზოგადოებრივ სტრეს-ტესტირებას. ამ პლატფორმაზე წვლილის შეტანით, თქვენ არა მხოლოდ სტრეს-ტესტირებას უტარებთ ხელოვნური ინტელექტის შესაძლებლობებს და არსებულ დამცავ სისტემას, არამედ აქტიურად მონაწილეობთ მის ეთიკური საზღვრების განსაზღვრაში. მიუხედავად იმისა, დეველოპერი ხართ, AI ენთუზიასტი, თუ უბრალოდ ტექნოლოგიების მომავალი გაინტერესებთ, თქვენი მონაწილეობა მნიშვნელოვანია. მიიღეთ მონაწილეობა არენაში, მიეცით ხმა და გაუზიარეთ თქვენი წარმატებები სხვებს სოციალურ მედიაში!