Hugging Face მონაცემთა ნაკრებების ძებნის ოთხ ახალ ფუნქციას წარმოგიდგენთ
Hugging Face განაგრძობს Dataset Hub-ის გაუმჯობესებას და Dataset Search-ისთვის ოთხ ახალ ფუნქციას აცხადებს. ეს სიახლეები მოიცავს მონაცემთა მოდალობის (ტიპის) მიხედვით ფილტრაციას, სტრიქონების რაოდენობის მიხედვით ძებნას, მონაცემთა ფორმატების ფილტრაციას და ბიბლიოთეკებთან თავსებადობის მიხედვით ძებნას, რაც მომხმარებლებს საშუალებას მისცემს, უფრო ეფექტურად იპოვონ სასურველი ღია მონაცემთა ნაკრებები.
Hugging Face-ში ჩვენ ვქმნით Dataset Hub-ს, როგორც ადგილს, სადაც საზოგადოებას შეუძლია ღია მონაცემთა ნაკრებებზე თანამშრომლობა. ამ მიზნით, ჩვენ შევქმენით ისეთი ხელსაწყოები, როგორიცაა Dataset Search და Dataset Viewer, ასევე ხელსაწყოების მდიდარი ღია კოდის ეკოსისტემა.
დღეს ჩვენ ვაცხადებთ ოთხ ახალ ფუნქციას, რომელიც Dataset Search-ს Hub-ზე ახალ დონეზე აიყვანს. მონაცემთა ნაკრების მოდალობა შეესაბამება მონაცემთა ნაკრებში არსებულ მონაცემთა ტიპს. მაგალითად, Hugging Face-ზე მონაცემთა ყველაზე გავრცელებული ტიპებია ტექსტი, სურათი, აუდიო და ტაბულური მონაცემები. ჩვენ გამოვაქვეყნეთ ფილტრების ნაკრები, რომელიც საშუალებას გაძლევთ გაფილტროთ მონაცემთა ნაკრებები, რომლებსაც აქვთ ერთი ან რამდენიმე მოდალობა ამ სიიდან. მაგალითად, შესაძლებელია მოძებნოთ მონაცემთა ნაკრებები, რომლებიც შეიცავს როგორც ტექსტს, ასევე სურათის მონაცემებს. თითოეული მონაცემთა ნაკრების მოდალობები ავტომატურად განისაზღვრება ფაილის შიგთავსისა და გაფართოებების საფუძველზე.
ჩვენ ახლახან გამოვაქვეყნეთ ახალი ფუნქცია ინტერფეისში, რათა ვაჩვენოთ თითოეული მონაცემთა ნაკრების სტრიქონების რაოდენობა. ამის შემდეგ, ახლა შესაძლებელია მონაცემთა ნაკრებების ძებნა სტრიქონების რაოდენობის მიხედვით, მინიმალური და მაქსიმალური სტრიქონების რაოდენობის მითითებით. ეს საშუალებას მოგცემთ მოძებნოთ როგორც მცირე ზომის მონაცემთა ნაკრებები, ასევე ყველაზე დიდი არსებული მონაცემთა ნაკრებები (მაგალითად, ისეთები, რომლებიც გამოიყენება LLM-ების წინასწარი ვარჯიშისთვის). ინფორმაცია სტრიქონების რაოდენობის შესახებ ხელმისაწვდომია ყველა მონაცემთა ნაკრებისთვის მხარდაჭერილ ფორმატებში. ყველაზე დიდი მონაცემთა ნაკრებებისთვისაც კი, რომლებშიც სტრიქონების რაოდენობა არ არის შეტანილი მეტამონაცემებში, სტრიქონების საერთო რაოდენობა ზუსტად ფასდება პირველი 5GB-ის შიგთავსის საფუძველზე. მაგალითად, თუ თქვენ ეძებთ მონაცემთა ნაკრებებს Hugging Face-ზე სტრიქონების უდიდესი რაოდენობით, შეგიძლიათ მოძებნოთ მონაცემთა ნაკრებები 10 მილიარდზე (10^10) მეტი სტრიქონით.
ერთი და იგივე მონაცემთა ნაკრები შეიძლება ინახებოდეს მრავალ სხვადასხვა ფორმატში. მაგალითად, ტექსტური მონაცემთა ნაკრებები ხშირად არის Parquet ან JSON Lines ფორმატში, მაგრამ ისინი შეიძლება იყოს ტექსტურ ფაილებში, ხოლო სურათების მონაცემთა ნაკრებები ხშირად არის სურათების ერთი დირექტორია, მაგრამ ისინი შეიძლება იყოს WebDataset ფორმატში (TAR არქივებზე დაფუძნებული ფორმატი). თითოეულ ფორმატს აქვს თავისი დადებითი და უარყოფითი მხარეები. მაგალითად, Parquet გთავაზობთ ჩაშენებული მონაცემების მხარდაჭერას, CSV-სგან განსხვავებით, ეფექტურ ფილტრაციას/ანალიტიკას და კარგ შეკუმშვის კოეფიციენტს, მაგრამ ერთი კონკრეტული სტრიქონის წვდომისთვის საჭიროა მთელი სტრიქონის ჯგუფის დეკოდირება. კიდევ ერთი მაგალითია WebDataset, რომელიც უზრუნველყოფს მონაცემთა სტრიმინგის უმაღლეს სიჩქარეს, მაგრამ მას აკლია გარკვეული მეტამონაცემები, მაგალითად, სტრიქონების რაოდენობა თითო ფაილზე, რაც ხშირად საჭიროა მონაცემების ეფექტურად განაწილებისთვის მრავალკვანძოვან (multi-node) სატრენინგო სისტემებში. მონაცემთა ნაკრების ფორმატი, შესაბამისად, მიუთითებს, თუ რომელი გამოყენების შემთხვევებია სასურველი და დაგჭირდებათ თუ არა მონაცემების გადაფორმატირება თქვენი საჭიროებების შესაბამისად. აქ შეგიძლიათ ნახოთ WebDataset ფორმატის მონაცემთა ნაკრებები.
არსებობს მრავალი კარგი ბიბლიოთეკა და ინსტრუმენტი მონაცემთა ნაკრებების ჩასატვირთად და ვარჯიშისთვის მოსამზადებლად, როგორიცაა Pandas, Dask ან 🤗 Datasets ბიბლიოთეკა. Hub გაძლევთ საშუალებას გამოიყენოთ თქვენი საყვარელი ხელსაწყოები და გაფილტროთ ნებისმიერ ბიბლიოთეკასთან თავსებადი მონაცემთა ნაკრებები, მაგალითად, შეგიძლიათ მოძებნოთ Pandas-თან თავსებადი მონაცემთა ნაკრებები. მონაცემთა ნაკრების თავსებადობა ეფუძნება მონაცემთა ნაკრების ფორმატსა და ზომას (მაგალითად, Dask-ს შეუძლია დიდი JSON Lines მონაცემთა ნაკრებების ჩატვირთვა, განსხვავებით Pandas-ისგან, რომელიც მოითხოვს მთელი მონაცემთა ნაკრების მეხსიერებაში ჩატვირთვას). გარდა ამისა, ჩვენ ასევე გთავაზობთ კოდის ნიმუშს ნებისმიერი მონაცემთა ნაკრების თქვენს საყვარელ ხელსაწყოში ჩასატვირთად.
თუ გსურთ, რომ თქვენი ბიბლიოთეკა გამოჩნდეს მხარდაჭერილი ბიბლიოთეკების სიაში, თავისუფლად გახსენით დისკუსია huggingface.js-ზე! ეს ოთხი ახალი Dataset Search ინსტრუმენტი შეიძლება გამოყენებულ იქნას ერთად და სხვა არსებულ ფილტრებთან, როგორიცაა ენა, ამოცანები და ლიცენზიები. ამ ფილტრების ტექსტური ძიების ზოლთან კომბინირებით შეგიძლიათ მოძებნოთ კონკრეტული მონაცემთა ნაკრები, რომელსაც ეძებთ.
მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#hugging face
#მონაცემთა ნაკრებები
#dataset search
#ახალი ფუნქციები
#ღია მონაცემები
წყარო: huggingface.co
AI-ით გადამუშავებული