Hugging Face Hub: მანქანური სწავლების შესაძლებლობები GLAM სექტორისთვის
Hugging Face მიზნად ისახავს უმაღლესი ხარისხის მანქანური სწავლების საყოველთაო ხელმისაწვდომობას. ამის მისაღწევად კომპანია აწვდის ღია კოდის ბიბლიოთეკებს, უფასო კურსებს და Hugging Face Hub-ს – ცენტრალურ საცავს 190,000-ზე მეტი მოდელით, 33,000 მონაცემთა ნაკრებით და 100,000-ზე მეტი აპლიკაციით. ეს სტატია განკუთვნილია GLAM სექტორში (გალერეები, ბიბლიოთეკები, არქივები, მუზეუმები) მომუშავე პირებისთვის, რათა გაიგონ, როგორ გამოიყენონ და როგორ შეიტანონ წვლილი Hub-ში. მაგალითად, NER მოდელის გამოყენება ციფრული დ
Hugging Face მიზნად ისახავს უმაღლესი ხარისხის მანქანური სწავლების ყველასთვის ხელმისაწვდომობის უზრუნველყოფას. ამ მიზანს კომპანია სხვადასხვა გზით აღწევს, მათ შორის ღია კოდის ბიბლიოთეკების შემუშავებით, როგორიცაა ფართოდ გამოყენებული Transformers ბიბლიოთეკა, უფასო კურსების შეთავაზებით და Hugging Face Hub-ის მიწოდებით.
Hugging Face Hub არის ცენტრალური საცავი, სადაც ადამიანებს შეუძლიათ მანქანური სწავლების მოდელების, მონაცემთა ნაკრებებისა და დემოების გაზიარება და წვდომა. Hub-ი 190,000-ზე მეტ მანქანური სწავლების მოდელს, 33,000 მონაცემთა ნაკრებს და 100,000-ზე მეტ მანქანური სწავლების აპლიკაციასა და დემოს მასპინძლობს. ეს მოდელები მოიცავს ამოცანების ფართო სპექტრს, დაწყებული წინასწარ გაწვრთნილი ენის მოდელებით, ტექსტის, გამოსახულების და აუდიოს კლასიფიკაციის მოდელებით, ობიექტების ამოცნობის მოდელებით და გენერაციული მოდელების მრავალფეროვნებით.
Hub-ზე განთავსებული მოდელები, მონაცემთა ნაკრებები და დემოები მოიცავს დომენებისა და ენების ფართო სპექტრს, რასაც საზოგადოების მუდმივი ძალისხმევა უწყობს ხელს Hub-ის მეშვეობით ხელმისაწვდომი მასალების გაფართოების კუთხით. ეს ბლოგპოსტი მიზნად ისახავს GLAM სექტორში (გალერეები, ბიბლიოთეკები, არქივები და მუზეუმები) მომუშავე ან ამ სექტორთან თანამშრომელ ადამიანებს გააცნოს, თუ როგორ შეუძლიათ გამოიყენონ — და წვლილი შეიტანონ — Hugging Face Hub-ში. შეგიძლიათ წაიკითხოთ სრული პოსტი ან გადახვიდეთ ყველაზე რელევანტურ სექციებზე!
Hugging Face Hub უზრუნველყოფს წვდომას მანქანური სწავლების მოდელებზე, რომლებიც მოიცავს სხვადასხვა ამოცანებსა და დომენებს. ბევრ მანქანური სწავლების ბიბლიოთეკას აქვს ინტეგრაცია Hugging Face Hub-თან, რაც საშუალებას გაძლევთ პირდაპირ გამოიყენოთ ან გააზიაროთ მოდელები Hub-ში ამ ბიბლიოთეკების მეშვეობით.
Hugging Face Hub 30,000-ზე მეტ მონაცემთა ნაკრებს მასპინძლობს. ეს მონაცემთა ნაკრებები მოიცავს სხვადასხვა დომენებსა და მოდალობებს, მათ შორის ტექსტის, გამოსახულების, აუდიოს და მულტიმოდალურ მონაცემთა ნაკრებებს. ეს მონაცემთა ნაკრებები ღირებულია მანქანური სწავლების მოდელების გაწვრთნისა და შეფასებისთვის.
Hugging Face Spaces არის პლატფორმა, რომელიც საშუალებას გაძლევთ უმასპინძლოთ მანქანური სწავლების დემოებსა და აპლიკაციებს. ეს Spaces-ები მერყეობს მარტივი დემოებიდან, რომლებიც საშუალებას გაძლევთ შეისწავლოთ მანქანური სწავლების მოდელის მიერ გაკეთებული პროგნოზები, უფრო კომპლექსურ აპლიკაციებამდე.
Spaces მნიშვნელოვნად ამარტივებს თქვენი აპლიკაციის მასპინძლობას და სხვებისთვის ხელმისაწვდომობას. შეგიძლიათ გამოიყენოთ Spaces Gradio და Streamlit აპლიკაციების განსათავსებლად, ან შეგიძლიათ გამოიყენოთ Spaces მორგებული Docker სურათებისთვის. Gradio-სა და Spaces-ის კომბინირებული გამოყენება ხშირად ნიშნავს, რომ აპლიკაციის შექმნა, განთავსება და სხვებისთვის ხელმისაწვდომობა რამდენიმე წუთშია შესაძლებელი. შეგიძლიათ გამოიყენოთ Spaces Docker სურათის განსათავსებლად, თუ გსურთ სრული კონტროლი თქვენს აპლიკაციაზე. ასევე არსებობს Docker-ის შაბლონები, რომლებიც სწრაფ წვდომას გაძლევთ მრავალი პოპულარული ინსტრუმენტის, მათ შორის Argailla-სა და Label Studio-ის ანოტაციის ხელსაწყოების, მასპინძლობის ვერსიაზე.
GLAM სექტორში მანქანური სწავლების მოდელების გამოყენების მრავალი პოტენციური შემთხვევა არსებობს. მიუხედავად იმისა, რომ ზოგიერთ ინსტიტუტს შესაძლოა ჰქონდეს მანქანური სწავლების მოდელების ნულიდან გაწვრთნისთვის საჭირო რესურსები, Hub-ის გამოყენებით შეგიძლიათ იპოვოთ ღიად გაზიარებული მოდელები, რომლებიც ან უკვე აკეთებენ იმას, რაც თქვენ გსურთ, ან ძალიან ახლოს არიან თქვენს მიზანთან. მაგალითად, თუ თქვენ მუშაობთ ციფრული ნორვეგიული დოკუმენტების კოლექციაზე მინიმალური მეტამონაცემებით. კოლექციაში არსებული ინფორმაციის უკეთ გასაგებად ერთ-ერთი გზაა Named Entity Recognition (NER) მოდელის გამოყენება. ეს მოდელი ტექსტიდან ამოიღებს ერთეულებს, მაგალითად, ამოიცნობს ტექსტში ნახსენებ ლოკაციებს. იმის ცოდნა, თუ რომელი ერთეულებია მოცემული ტექსტში, შეიძლება ღირებული გზა იყოს დოკუმენტის შინაარსის უკეთ გასაგებად.
NER მოდელების მოძიება Hub-ზე შეგვიძლია ამოცანის მიხედვით მოდელების გაფილტვრით. ამ შემთხვევაში, ჩვენ ვირჩევთ ტოკენების კლასიფიკაციას (token-classification), რომელიც მოიცავს დასახელებული ერთეულების ამოცნობის მოდელებს. ეს ფილტრი აბრუნებს მოდელებს, რომლებიც ტოკენების კლასიფიკაციას ახდენენ. რადგან ნორვეგიულ დოკუმენტებთან ვმუშაობთ, შესაძლოა ენის მიხედვითაც დაგვჭირდეს გაფილტვრა; ეს შეამცირებს მოდელების რაოდენობას, რომელთა შესწავლაც გვინდა. ამ მოდელების უმეტესობა ასევე შეიცავს მოდელის ვიჯეტს, რაც საშუალებას გვაძლევს გამოვცადოთ მოდელი.
მოდელის ვიჯეტს შეუძლია სწრაფად გვიჩვენოს, თუ რამდენად კარგად იმუშავებს მოდელი ჩვენს მონაცემებზე. მას შემდეგ, რაც იპოვით თქვენთვის საინტერესო მოდელს, Hub გთავაზობთ ამ ხელსაწყოს გამოყენების სხვადასხვა გზას. თუ უკვე იცნობთ Transformers ბიბლიოთეკას, შეგიძლიათ დააწკაპუნოთ ღილაკზე „გამოყენება Transformers-ში“ (use in Transformers), რათა გამოვიდეს ფანჯარა, რომელიც გიჩვენებთ, თუ როგორ უნდა ჩატვირთოთ მოდელი Transformers-ში.
თუ გირჩევნიათ მოდელის გამოყენება API-ის საშუალებით, მოდელის საცავში (repository) „განთავსების“ (deploy) ღილაკზე დაწკაპუნებით მიიღებთ მოდელის API-ის უკან განთავსების სხვადასხვა ვარიანტს. ეს განსაკუთრებით სასარგებლოა, თუ გსურთ მოდელის გამოცდა დიდი რაოდენობის მონაცემებზე, მაგრამ არ გაქვთ ინფრასტრუქტურა მოდელების ლოკალურად გასაშვებად. მსგავსი მიდგომა შეიძლება გამოყენებულ იქნას რელევანტური მოდელებისა და მონაცემთა ნაკრებების მოსაძიებლად Hugging Face Hub-ზე.
ჩვენ შეგვიძლია მონაცემთა ნაკრებები ხელმისაწვდომი გავხადოთ Hugging Face Hub-ის მეშვეობით სხვადასხვა გზით. წარმოგიდგენთ CSV მონაცემთა ნაკრების Hugging Face Hub-ში დამატების მაგალითს. მონაცემთა ნაკრების Hub-ზე ბრაუზერის ინტერფეისის მეშვეობით ატვირთვის პროცესის მიმოხილვა: ჩვენს მაგალითში, ვიმუშავებთ „On the Books Training Set“-ის Hub-ის მეშვეობით ხელმისაწვდომობის უზრუნველყოფაზე. ეს მონაცემთა ნაკრები მოიცავს CSV ფაილს, რომელიც შეიცავს ტექსტის კლასიფიკაციის მოდელის გასაწვრთნელად გამოსაყენებელ მონაცემებს. რადგან CSV ფორმატი Hugging Face-ზე მონაცემების ატვირთვის ერთ-ერთი მხარდაჭერილი ფორმატია...
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#hugging face
#ღია კოდი
#transformers
#მონაცემთა ნაკრებები
#მოდელები
#ner
#glam სექტორი
#ციფრული არქივები
#კულტურული მემკვიდრეობა
წყარო: huggingface.co
AI-ით გადამუშავებული