ჩვენ გამოვავლინეთ მონაცემთა ნაკრებების ორი ტიპი, რომლებიც შეიცავენ პერსონალურ საიდენტიფიკაციო ინფორმაციას (PII). PII-ის არსებობა მანქანური სწავლების (ML) მონაცემთა ნაკრებებში შეიძლება რამდენიმე გამოწვევას ქმნიდეს სპეციალისტებისთვის. უპირველეს ყოვლისა, ეს იწვევს კონფიდენციალურობის შეშფოთებას და შესაძლოა გამოყენებულ იქნას ინდივიდების შესახებ მგრძნობიარე ინფორმაციის გამოსავლენად. გარდა ამისა, PII-მ შეიძლება გავლენა მოახდინოს ML მოდელების მუშაობაზე, თუ ის სათანადოდ არ იქნება დამუშავებული. მაგალითად, თუ მოდელი გაწვრთნილია PII-ის შემცველ მონაცემთა ნაკრებზე, მან შეიძლება ისწავლოს გარკვეული PII-ის დაკავშირება კონკრეტულ შედეგებთან, რაც გამოიწვევს მიკერძოებულ პროგნოზებს ან სასწავლო ნაკრებიდან PII-ის გენერირებას. ამ გამოწვევების გადასაჭრელად, Hugging Face Dataset Hub-ზე ახალ ფუნქციას ცდის, რომელიც Presidio-ს იყენებს. Presidio არის ღია კოდის უახლესი PII გამოვლენის ინსტრუმენტი, რომელიც ეფუძნება გამოვლენის ნიმუშებსა და მანქანური სწავლების მოდელებს PII-ის იდენტიფიცირებისთვის. ამ ახალი ფუნქციით, მომხმარებლები შეძლებენ იხილონ ანგარიში, რომელიც აფასებს PII-ის არსებობას მონაცემთა ნაკრებში. ეს ინფორმაცია ღირებულია ML სპეციალისტებისთვის, რადგან ეხმარება მათ მიიღონ ინფორმირებული გადაწყვეტილებები მოდელის გაწვრთნამდე. მაგალითად, თუ ანგარიში მიუთითებს, რომ მონაცემთა ნაკრები შეიცავს მგრძნობიარე PII-ს, სპეციალისტებს შეუძლიათ მონაცემთა ნაკრების შემდგომი გაფილტვრა Presidio-ს მსგავსი ხელსაწყოების გამოყენებით. მონაცემთა ნაკრებების მფლობელებს ასევე შეუძლიათ ისარგებლონ ამ ფუნქციით, ანგარიშების გამოყენებით PII-ის გაფილტვრის პროცესების შესამოწმებლად მონაცემთა ნაკრების გამოქვეყნებამდე. მოდით განვიხილოთ Presidio-ს ანგარიშის მაგალითი წინასწარი ვარჯიშის მონაცემთა ნაკრებისთვის: ამ შემთხვევაში, Presidio-მ მონაცემთა ნაკრებში ელ.ფოსტის მცირე რაოდენობა და მგრძნობიარე PII აღმოაჩინა. PII-ის არსებობა ML მონაცემთა ნაკრებებში არის მუდმივად განვითარებადი გამოწვევა ML საზოგადოებისთვის. Hugging Face-ში ჩვენ ვართ გამჭვირვალობის მომხრეები და ვეხმარებით სპეციალისტებს ამ გამოწვევების დაძლევაში. Dataset Hub-ზე ისეთი ახალი ფუნქციების ექსპერიმენტებით, როგორიცაა Presidio-ს ანგარიშები, ვიმედოვნებთ, რომ მომხმარებლებს მივცემთ საშუალებას მიიღონ ინფორმირებული გადაწყვეტილებები და შექმნან უფრო მყარი და ეთიკური ML მოდელები. ასევე, მადლობას ვუხდით CNIL-ს GDPR-თან შესაბამისობის დაცვაში გაწეული დახმარებისთვის. მათი რჩევები ფასდაუდებელი იყო ხელოვნური ინტელექტისა და პერსონალური მონაცემების საკითხებთან დაკავშირებული სირთულეების დაძლევაში. გაეცანით მათ განახლებულ ხელოვნური ინტელექტის სახელმძღვანელო მასალებს აქ. თვალყური ადევნეთ ამ საინტერესო განვითარებების შესახებ შემდგომ განახლებებს!