Renumics Spotlight საშუალებას გაძლევთ შექმნათ ინტერაქტიული ვიზუალიზაციები თქვენს მონაცემებში კრიტიკული კლასტერების იდენტიფიცირებისთვის. ვინაიდან Spotlight-ს ესმის მონაცემთა სემანტიკა Hugging Face-ის მონაცემთა ნაკრებებში, მისი გამოყენება შეგიძლიათ კოდის მხოლოდ ერთი სტრიქონით: Spotlight საშუალებას გაძლევთ გამოიყენოთ მოდელის შედეგები, როგორიცაა პროგნოზები და ემბედინგები, რათა ღრმად გაიაზროთ მონაცემთა სეგმენტები და მოდელის შეცდომების რეჟიმები: მონაცემთა შემოწმება ძალიან მნიშვნელოვანი ამოცანაა თითქმის ყველა ML განვითარების ეტაპზე, მაგრამ ის ასევე შეიძლება იყოს ძალიან შრომატევადი. „მონაცემთა ხელით შემოწმებას, ალბათ, აქვს ყველაზე მაღალი ღირებულება-პრესტიჟის თანაფარდობა მანქანურ სწავლებაში ნებისმიერ სხვა აქტივობასთან შედარებით.“ – გრეგ ბროკმანი. Spotlight გეხმარებათ მონაცემთა ინსპექცია უფრო მასშტაბირებადი გახადოთ ორი განზომილებით: მორგებული მონაცემთა ინსპექციის სამუშაო პროცესების შექმნა და შენარჩუნება, ასევე შესაბამისი მონაცემთა ნიმუშებისა და კლასტერების მოძიება შესამოწმებლად. მომდევნო სექციებში ჩვენ ვაჩვენებთ რამდენიმე მაგალითს Hugging Face-ის მონაცემთა ნაკრებებზე დაყრდნობით. „Datasets“ ბიბლიოთეკას აქვს რამდენიმე ფუნქცია, რაც მას ML მონაცემთა ნაკრებებთან მუშაობის იდეალურ ინსტრუმენტად აქცევს: ის ინახავს ცხრილურ მონაცემებს (მაგ., მეტამონაცემები, ლეიბლები) არასტრუქტურირებულ მონაცემებთან (მაგ., სურათები, აუდიო) ერთად საერთო Arrows ცხრილში. Datasets ასევე აღწერს მონაცემთა მნიშვნელოვან სემანტიკას ფუნქციების (მაგ., სურათები, აუდიო) და დამატებითი ამოცანების სპეციფიკური მეტამონაცემების მეშვეობით. Spotlight პირდაპირ მუშაობს datasets ბიბლიოთეკაზე. ეს ნიშნავს, რომ მონაცემთა ვიზუალიზაციისა და ინსპექციისთვის არ არის საჭირო მონაცემთა ნაკრების კოპირება ან წინასწარ დამუშავება. Spotlight იტვირთება ცხრილურ მონაცემებს მეხსიერებაში, რათა უზრუნველყოს ეფექტური, კლიენტურ მხარეს მონაცემთა ანალიტიკა. მეხსიერების ინტენსიური არასტრუქტურირებული მონაცემთა ნიმუშები (მაგ., აუდიო, სურათები, ვიდეო) იტვირთება მოთხოვნისამებრ ზარმაცად (lazily). უმეტეს შემთხვევაში, მონაცემთა ტიპები და ლეიბლების ასახვა (label mappings) პირდაპირ მონაცემთა ნაკრებიდან ხდება. აქ, ჩვენ ვიზუალურად წარმოვაჩენთ CIFAR-100 მონაცემთა ნაკრებს კოდის ერთი სტრიქონით: იმ შემთხვევებში, როდესაც მონაცემთა ტიპები ორაზროვანია ან არ არის მითითებული, Spotlight API იძლევა მათი ხელით მინიჭების საშუალებას. ნედლეული არასტრუქტურირებული მონაცემთა ნაკრებების შესწავლა ხშირად მცირე ინფორმაციას იძლევა. მოდელის შედეგების, როგორიცაა პროგნოზები ან ემბედინგები, გამოყენება ხელს უწყობს კრიტიკული მონაცემთა ნიმუშებისა და კლასტერების აღმოჩენას. Spotlight-ს აქვს ვიზუალიზაციის რამდენიმე ვარიანტი (მაგ., მსგავსების რუკა, შეცდომის მატრიცა), რომლებიც სპეციალურად იყენებენ მოდელის შედეგებს. გირჩევთ, შეინახოთ თქვენი პროგნოზის შედეგები პირდაპირ Hugging Face-ის მონაცემთა ნაკრებში. ეს საშუალებას გაძლევთ არა მხოლოდ ისარგებლოთ datasets ბიბლიოთეკის პაკეტური დამუშავების შესაძლებლობებით, არამედ შეინარჩუნოთ ლეიბლების ასახვა. ჩვენ შეგვიძლია გამოვიყენოთ transformers ბიბლიოთეკა CIFAR-100 გამოსახულების კლასიფიკაციის პრობლემაზე ემბედინგების და პროგნოზების გამოსათვლელად. ბიბლიოთეკებს ვამონტაჟებთ pip-ის საშუალებით: ახლა ჩვენ შეგვიძლია გამოვთვალოთ გამდიდრება: თუ არ გსურთ ინფერენსის სრული გაშვება, შეგიძლიათ ალტერნატიულად ჩამოტვირთოთ წინასწარ გამოთვლილი მოდელის შედეგები CIFAR-100-ისთვის ამ გაკვეთილის გასაგრძელებლად: ახლა ჩვენ შეგვიძლია გამოვიყენოთ შედეგები Spotlight-ში შესაბამისი მონაცემთა ნიმუშებისა და კლასტერების ინტერაქტიული შესასწავლად. ვიზუალიზაციის განლაგების ინტერაქტიულად შეცვლა, შენახვა და ჩატვირთვა შესაძლებელია გრაფიკულ მომხმარებლის ინტერფეისში (GUI): შეგიძლიათ აირჩიოთ ვიჯეტის სხვადასხვა ტიპები და კონფიგურაციები. ინსპექტორის ვიჯეტი საშუალებას იძლევა მულტიმოდალური მონაცემთა ნიმუშების წარმოდგენა, მათ შორის ტექსტი, სურათი, აუდიო, ვიდეო და დროითი სერიების მონაცემები. ასევე შეგიძლიათ განსაზღვროთ განლაგება Python API-ის მეშვეობით. ეს ვარიანტი განსაკუთრებით სასარგებლოა მონაცემთა ინსპექციისა და კურაციის მორგებული სამუშაო პროცესების შესაქმნელად, მათ შორის EDA, მოდელის გამართვა და მოდელის მონიტორინგის ამოცანები. მონაცემთა პრობლემების ვიჯეტთან ერთად, Python API გთავაზობთ შესანიშნავ საშუალებას არსებული სკრიპტების შედეგების (მაგ., მონაცემთა ხარისხის შემოწმება ან მოდელის მონიტორინგი) მასშტაბირებად მონაცემთა ინსპექციის სამუშაო პროცესში ინტეგრირებისთვის. შეგიძლიათ გამოიყენოთ Spotlight პირდაპირ თქვენს ლოკალურ NLP, აუდიო, CV ან მულტიმოდალურ მონაცემთა ნაკრებზე. თუ გსურთ თქვენი მონაცემთა ნაკრების ან მოდელის შედეგების ჩვენება Hugging Face ჰაბზე, შეგიძლიათ გამოიყენოთ Hugging Face Spaces მისთვის Spotlight ვიზუალიზაციის გასაშვებად. ჩვენ უკვე მოვამზადეთ მაგალითი spaces მრავალი პოპულარული NLP, აუდიო და CV მონაცემთა ნაკრებისთვის ჰაბზე. შეგიძლიათ უბრალოდ გაამრავლოთ ერთ-ერთი ასეთი სივრცე და მიუთითოთ თქვენი მონაცემთა ნაკრები HF_DATASET ცვლადში. სურვილისამებრ, შეგიძლიათ აირჩიოთ მონაცემთა ნაკრები, რომელიც შეიცავს მოდელის შედეგებს და სხვა კონფიგურაციის პარამეტრებს, როგორიცაა გაყოფა (splits), ქვეჯგუფი (subsets) ან მონაცემთა ნაკრების რევიზიები. Spotlight-ის საშუალებით შეგიძლიათ შექმნათ ინტერაქტიული ვიზუალიზაციები და გამოიყენოთ მონაცემთა გამდიდრება, რათა იდენტიფიციროთ კრიტიკული კლასტერები თქვენს Hugging Face-ის მონაცემთა ნაკრებებში. ამ ბლოგში ჩვენ განვიხილეთ როგორც აუდიო ML, ასევე კომპიუტერული ხედვის მაგალითი. შეგიძლიათ გამოიყენოთ Spotlight პირდაპირ თქვენი NLP, აუდიო, CV ან მულტიმოდალური მონაცემთა ნაკრების შესასწავლად და კურაციისთვის.