Hugging Face Hub იქცა ცენტრალურ რეპოზიტორიუმად, სადაც საზოგადოება მანქანური სწავლების მოდელებს, მონაცემთა ნაკრებებსა და აპლიკაციებს აზიარებს. მონაცემთა ნაკრებების რაოდენობის ზრდასთან ერთად, მეტამონაცემები სულ უფრო მნიშვნელოვანი ინსტრუმენტი ხდება თქვენი კონკრეტული ამოცანისთვის შესაბამისი რესურსის მოსაძებნად. ამ ბლოგპოსტში წარმოდგენილია ადრეული ექსპერიმენტები, რომლებიც მიზნად ისახავს მანქანური სწავლების გამოყენებას Hugging Face Hub-ზე განთავსებული მონაცემთა ნაკრებების მეტამონაცემების გასაუმჯობესებლად. ამჟამად Hugging Face Hub-ზე დაახლოებით 50 000 საჯარო მონაცემთა ნაკრებია. მონაცემთა ნაკრებში გამოყენებული ენის შესახებ მეტამონაცემები შეიძლება მიეთითოს YAML ველის გამოყენებით მონაცემთა ნაკრების ბარათის ზედა ნაწილში. ყველა საჯარო მონაცემთა ნაკრები თავის მეტამონაცემებში ენის ტეგის მეშვეობით 1 716 უნიკალურ ენას აკონკრეტებს. აღსანიშნავია, რომ ზოგიერთი მათგანი სხვადასხვა გზით მითითებული ენების შედეგი იქნება, მაგალითად, „en“ „eng“-ის წინააღმდეგ, „english“-ის წინააღმდეგ, „English“-ის წინააღმდეგ. მაგალითად, IMDB მონაცემთა ნაკრები YAML მეტამონაცემებში მიუთითებს „en“-ს (რაც ინგლისურს ნიშნავს). წარმოდგენილია IMDB მონაცემთა ნაკრების YAML მეტამონაცემების ნაწილი. ალბათ გასაკვირი არ არის, რომ ინგლისური Hub-ზე არსებული მონაცემთა ნაკრებებისთვის ყველაზე გავრცელებული ენაა, Hub-ზე არსებული ნაკრებების დაახლოებით 19% თავის ენად მიუთითებს „en“-ს (ეს არ მოიცავს „en“-ის არცერთ ვარიაციას, ასე რომ რეალური პროცენტული მაჩვენებელი სავარაუდოდ გაცილებით მაღალია). გამოქვეყნებული გრაფიკი ასახავს ენების გავრცელების სიხშირესა და პროცენტულ მაჩვენებელს Hugging Face Hub-ზე. როგორ გამოიყურება ენების განაწილება ინგლისურის გამოკლებით? ვხედავთ, რომ არსებობს რამდენიმე დომინანტური ენის დაჯგუფება და ამის შემდეგ ენების გამოჩენის სიხშირეები საკმაოდ თანაბრად მცირდება. წარმოდგენილია Hub-ზე არსებული მონაცემთა ნაკრებებისთვის ენის ტეგების განაწილება ინგლისურის გამოკლებით. თუმცა, ამას ერთი მნიშვნელოვანი გაფრთხილება ახლავს თან. მონაცემთა ნაკრებების უმეტესობა (დაახლოებით 87%) არ აკონკრეტებს გამოყენებულ ენას; მონაცემთა ნაკრებების მხოლოდ დაახლოებით 13% შეიცავს ენის ინფორმაციას თავის მეტამონაცემებში. ეს მონაცემები ასახავს მონაცემთა ნაკრებების პროცენტულ მაჩვენებელს, რომლებსაც აქვთ ენის მეტამონაცემები. „True“ ნიშნავს, რომ ენის მეტამონაცემები მითითებულია, „False“ ნიშნავს, რომ ენის მონაცემები არ არის მითითებული. „No card data“ ნიშნავს, რომ არ არის არცერთი მეტამონაცემი ან მისი ჩატვირთვა ვერ მოხერხდა `huggingface_hub` Python ბიბლიოთეკის მიერ. ენის მეტამონაცემები შეიძლება იყოს სასიცოცხლოდ მნიშვნელოვანი ინსტრუმენტი შესაბამისი მონაცემთა ნაკრებების მოსაძებნად. Hugging Face Hub საშუალებას გაძლევთ გაფილტროთ მონაცემთა ნაკრებები ენის მიხედვით. მაგალითად, თუ გვსურს ნიდერლანდურ ენაზე არსებული მონაცემთა ნაკრებების პოვნა, Hub-ზე შეგვიძლია გამოვიყენოთ ფილტრი, რათა ჩავრთოთ მხოლოდ ნიდერლანდური მონაცემების მქონე ნაკრებები. ამჟამად ეს ფილტრი 184 მონაცემთა ნაკრებს აბრუნებს. თუმცა, Hub-ზე არსებობს მონაცემთა ნაკრებები, რომლებიც შეიცავს ნიდერლანდურ მონაცემებს, მაგრამ ამას მეტამონაცემებში არ აკონკრეტებენ. ამგვარი ნაკრებების მოძიება უფრო რთული ხდება, განსაკუთრებით მაშინ, როდესაც Hub-ზე მონაცემთა ნაკრებების რაოდენობა იზრდება. ბევრ ადამიანს სურს კონკრეტული ენის მონაცემთა ნაკრებების მოძიება. ერთ-ერთი მთავარი ბარიერი მაღალი ხარისხის ღია კოდის დიდი ენობრივი მოდელების (LLM) ვარჯიშისთვის კონკრეტულ ენაზე არის მაღალი ხარისხის სატრენინგო მონაცემების ნაკლებობა. თუ გადავალთ შესაბამისი მანქანური სწავლების მოდელების მოძიების ამოცანაზე, იმის ცოდნა, თუ რომელი ენები იყო ჩართული მოდელის სატრენინგო მონაცემებში, დაგვეხმარება იმ ენის მოდელების პოვნაში, რომელიც გვაინტერესებს. ეს ეყრდნობა მონაცემთა ნაკრების მიერ ამ ინფორმაციის მითითებას. და ბოლოს, იმის ცოდნა, თუ რომელი ენებია წარმოდგენილი Hub-ზე (და რომელი არა), გვეხმარება Hub-ის ენობრივი მიკერძოებების გაგებაში და ხელს უწყობს საზოგადოების ძალისხმევას, შეავსოს ხარვეზები კონკრეტულ ენებში. უკვე ვიხილეთ, რომ Hugging Face Hub-ზე არსებული მრავალი მონაცემთა ნაკრები არ შეიცავდა მეტამონაცემებს გამოყენებული ენისთვის. თუმცა, ვინაიდან ეს მონაცემთა ნაკრებები უკვე ღიად არის გაზიარებული, შესაძლოა, ჩვენ შეგვიძლია განვიხილოთ მონაცემთა ნაკრები და ვეცადოთ ენის იდენტიფიცირება მანქანური სწავლების გამოყენებით. მონაცემთა ნაკრებიდან ზოგიერთი მაგალითის წვდომის ერთ-ერთი გზა არის „datasets“ ბიბლიოთეკის გამოყენება მონაცემთა ნაკრებების ჩამოსატვირთად. თუმცა, Hub-ზე არსებული ზოგიერთი მონაცემთა ნაკრებისთვის, შესაძლოა, არ გვსურდეს მთელი ნაკრების ჩამოტვირთვა. ამის ნაცვლად, შეგვეძლო ვცადოთ მონაცემთა ნაკრების ნიმუშის ჩატვირთვა. თუმცა, იმის მიხედვით, თუ როგორ შეიქმნა მონაცემთა ნაკრები, შესაძლოა, მაინც ჩამოვტვირთოთ იმაზე მეტი მონაცემი, ვიდრე გვჭირდება ჩვენს სამუშაო მანქანაზე. საბედნიეროდ, Hub-ზე არსებული მრავალი მონაცემთა ნაკრები ხელმისაწვდომია მონაცემთა ნაკრების დამთვალიერებლის API-ის მეშვეობით. ის საშუალებას გვაძლევს წვდომა მივიღოთ Hub-ზე განთავსებულ მონაცემთა ნაკრებებზე, ადგილობრივად მათი ჩამოტვირთვის გარეშე. API უზრუნველყოფს მონაცემთა ნაკრების დამთვალიერებელს, რომელსაც Hub-ზე განთავსებული მრავალი ნაკრებისთვის იხილავთ. მონაცემთა ნაკრებებისთვის ენის პროგნოზირების ამ პირველი ექსპერიმენტისთვის, ჩვენ განვსაზღვრავთ სვეტების სახელების და მონაცემთა ტიპების ჩამონათვალს, რომლებიც სავარაუდოდ შეიცავენ ტექსტურ კონტენტს, მაგალითად, ტექსტის ან „prompt“ სვეტების სახელები და სტრიქონული მახასიათებლები სავარაუდოდ აქტუალურია, სურათი — არა. ეს ნიშნავს, რომ შეგვიძლია თავიდან ავიცილოთ ენის პროგნოზირება იმ მონაცემთა ნაკრებებისთვის, სადაც ენობრივი ინფორმაცია ნაკლებად აქტუალურია, მაგალითად, გამოსახულების კლასიფიკაციის მონაცემთა ნაკრებებისთვის. ჩვენ ვიყენებთ მონაცემთა ნაკრების დამთვალიერებლის API-ს, რათა მივიღოთ 20 სტრიქონი ტექსტური მონაცემი, რომელიც გადაეცემა მანქანური სწავლების მოდელს (შეგვიძლია ეს შევცვალოთ, რათა მონაცემთა ნაკრებიდან მეტი ან ნაკლები მაგალითი ავიღოთ). ეს მიდგომა ნიშნავს, რომ Hub-ზე არსებული მონაცემთა ნაკრებების უმეტესობისთვის ჩვენ...