მომხმარებლის საჭიროებების გაგება Auto ML-ით: HuggingFace AutoTrain-ისა და Kili-ის ინტეგრაცია
სტატია განიხილავს, თუ როგორ შეიძლება ავტომატური მანქანური სწავლის (Auto ML) გამოყენება, კერძოდ HuggingFace AutoTrain-ისა და Kili პლატფორმის მეშვეობით, მომხმარებელთა საჭიროებების ეფექტურად გასაგებად. წარმოდგენილია ტექსტის კლასიფიკაციისა და სენტიმენტური ანალიზის აქტიური სწავლის პაიპლაინის აგება, Medium-ის მომხმარებლის მიმოხილვების მაგალითზე Google Play Store-იდან. ეს მეთოდი ამცირებს ხარჯებს და აჩქარებს მონაცემთა ეტიკეტირებისა და მოდელის ვარჯიშის პროცესს.
მომხმარებლის საჭიროებების გაგება გადამწყვეტია ნებისმიერ მომხმარებელთან დაკავშირებულ ბიზნესში. თუმცა, ის ასევე მოითხოვს დიდ შრომასა და ანალიზს, რაც საკმაოდ ძვირია. მაშინ, რატომ არ გამოვიყენოთ მანქანური სწავლება? ბევრად ნაკლები კოდირებით Auto ML-ის გამოყენებით. ამ სტატიაში ჩვენ გამოვიყენებთ HuggingFace AutoTrain-სა და Kili-ს, რათა ავაგოთ აქტიური სწავლის პაიპლაინი ტექსტის კლასიფიკაციისთვის. Kili არის პლატფორმა, რომელიც აძლიერებს მონაცემებზე ორიენტირებულ მიდგომას მანქანურ სწავლებაში, ხარისხიანი სავარჯიშო მონაცემების შექმნის გზით. ის უზრუნველყოფს მონაცემთა ანოტაციის კოლაბორაციულ ინსტრუმენტებსა და API-ებს, რაც შესაძლებელს ხდის სწრაფ იტერაციებს სანდო მონაცემთა ნაკრების შექმნასა და მოდელის ვარჯიშს შორის. აქტიური სწავლა არის პროცესი, რომლის დროსაც მონაცემთა ნაკრებს ემატება ეტიკეტირებული მონაცემები და შემდეგ მოდელი იტერაციულად ხელახლა იწვრთნება. აქედან გამომდინარე, ის უსასრულოა და მოითხოვს ადამიანის ჩარევას მონაცემების ეტიკეტირებისთვის. ამ სტატიისთვის კონკრეტული გამოყენების შემთხვევის მაგალითად, ჩვენ ავაგებთ ჩვენს პაიპლაინს Medium-ის მომხმარებლის მიმოხილვების გამოყენებით Google Play Store-იდან. ამის შემდეგ, ჩვენ დავაკლასიფიცირებთ მიმოხილვებს ჩვენს მიერ აგებული პაიპლაინის მეშვეობით. და ბოლოს, ჩვენ გამოვიყენებთ სენტიმენტურ ანალიზს კლასიფიცირებულ მიმოხილვებზე. შემდეგ კი შედეგებს გავაანალიზებთ, რაც მომხმარებლის საჭიროებებისა და კმაყოფილების გაგებას ბევრად გააადვილებს. ავტომატიზებული მანქანური სწავლება არის ტერმინი მანქანური სწავლების პაიპლაინის ავტომატიზაციისთვის. ის ასევე მოიცავს მონაცემთა გასუფთავებას, მოდელის შერჩევას და ჰიპერ-პარამეტრების ოპტიმიზაციას. ჩვენ შეგვიძლია გამოვიყენოთ 🤗 ტრანსფორმატორები ავტომატიზებული ჰიპერ-პარამეტრების მოსაძებნად. ჰიპერ-პარამეტრების ოპტიმიზაცია რთული და შრომატევადი პროცესია. მიუხედავად იმისა, რომ ჩვენ შეგვიძლია ავაგოთ ჩვენი პაიპლაინი ტრანსფორმატორებისა და სხვა მძლავრი API-ების გამოყენებით, შესაძლებელია ამის სრულად ავტომატიზაცია AutoTrain-ით. AutoTrain აგებულია მრავალ მძლავრ API-ზე, როგორიცაა ტრანსფორმატორები (transformers), მონაცემთა ნაკრებები (datasets) და დასკვნის (inference-api) API. მონაცემების გასუფთავება, მოდელის შერჩევა და ჰიპერ-პარამეტრების ოპტიმიზაციის ნაბიჯები სრულად ავტომატიზებულია AutoTrain-ში. ამ ფრეიმვორკის სრულად გამოყენება შესაძლებელია კონკრეტული ამოცანისთვის საწარმოო მზა SOTA ტრანსფორმატორული მოდელების ასაგებად. ამჟამად, AutoTrain მხარს უჭერს ბინარულ და მრავალ-ეტიკეტიან ტექსტის კლასიფიკაციას, ტოკენის კლასიფიკაციას, ექსტრაქციულ შეკითხვა-პასუხს, ტექსტის შეჯამებას და ტექსტის შეფასებას. ის ასევე მხარს უჭერს მრავალ ენას, როგორიცაა ინგლისური, გერმანული, ფრანგული, ესპანური, ფინური, შვედური, ჰინდი, ჰოლანდიური და სხვა. თუ თქვენი ენა არ არის მხარდაჭერილი AutoTrain-ის მიერ, შესაძლებელია მორგებული მოდელების გამოყენება მორგებულ ტოკენაიზერებთან ერთად. Kili არის ბოლომდე AI ვარჯიშის პლატფორმა მონაცემებზე ორიენტირებული ბიზნესებისთვის. Kili უზრუნველყოფს ოპტიმიზებულ ეტიკეტირების ფუნქციებს და ხარისხის მართვის ინსტრუმენტებს თქვენი მონაცემების სამართავად. თქვენ შეგიძლიათ სწრაფად მოახდინოთ გამოსახულების, ვიდეოს, ტექსტის, PDF-ისა და ხმოვანი მონაცემების ანოტაცია, მონაცემთა ნაკრების ხარისხის კონტროლით. მას ასევე აქვს მძლავრი API-ები GraphQL-ისა და Python-ისთვის, რაც მნიშვნელოვნად ამარტივებს მონაცემთა მართვას. ის ხელმისაწვდომია როგორც ონლაინ, ასევე ლოკალურ სერვერზე (on-premise) და იძლევა თანამედროვე მანქანური სწავლების ტექნიკის გამოყენების საშუალებას კომპიუტერულ ხედვაში, NLP-სა და OCR-ში. ის მხარს უჭერს ტექსტის კლასიფიკაციას, დასახელებული ერთეულების ამოცნობას (NER), ურთიერთობების ამოღებას და სხვა NLP/OCR ამოცანებს. ის ასევე მხარს უჭერს კომპიუტერული ხედვის ამოცანებს, როგორიცაა ობიექტის ამოცნობა, გამოსახულების ტრანსკრიფცია, ვიდეოს კლასიფიკაცია, სემანტიკური სეგმენტაცია და მრავალი სხვა! Kili არის კომერციული ინსტრუმენტი, მაგრამ თქვენ ასევე შეგიძლიათ შექმნათ უფასო დეველოპერის ანგარიში Kili-ის ინსტრუმენტების საცდელად. დამატებითი ინფორმაციის მიღება შეგიძლიათ ფასების გვერდზე. ჩვენ ვიმუშავებთ მიმოხილვების კლასიფიკაციის მაგალითზე, სენტიმენტურ ანალიზთან ერთად, რათა მივიღოთ ინფორმაცია მობილური აპლიკაციის შესახებ. ჩვენ ამოვიღეთ დაახლოებით 40 ათასი Medium-ის მიმოხილვა Google Play Store-იდან. ჩვენ ეტაპობრივად მოვახდენთ ამ მონაცემთა ნაკრებში არსებული მიმოხილვის ტექსტების ანოტაციას. შემდეგ კი ავაგებთ პაიპლაინს მიმოხილვის კლასიფიკაციისთვის. მოდელირებისას, პირველი მოდელი მომზადდება AutoTrain-ით. შემდეგ ასევე ავაგებთ მოდელს AutoTrain-ის გამოყენების გარეშე. მთელი კოდი და მონაცემთა ნაკრები შეგიძლიათ იპოვოთ პროექტის GitHub რეპოზიტორიუმში. დავიწყოთ ნედლი მონაცემთა ნაკრების დათვალიერებით. ამ მონაცემთა ნაკრებში არის 10 სვეტი და 40130 ნიმუში. ერთადერთი სვეტი, რომელიც ჩვენ გვჭირდება, არის 'content', რომელიც წარმოადგენს მომხმარებლის მიმოხილვას. დაწყებამდე, ჩვენ უნდა განვსაზღვროთ რამდენიმე კატეგორია. ჩვენ განვსაზღვრეთ 4 კატეგორია. ეტიკეტირების ნაწილისთვის, პირველ რიგში, უნდა შევქმნათ პროექტი Kili-ის პლატფორმაზე. შეგვიძლია გამოვიყენოთ პლატფორმის ვებ ინტერფეისი ან API-ები. ვნახოთ ორივე. ვებ ინტერფეისიდან: პროექტების სიის გვერდიდან, ჩვენ ვქმნით მრავალკლასიანი ტექსტის კლასიფიკაციის პროექტს. ამის შემდეგ, პროექტის გვერდზე, შეგიძლიათ დაამატოთ თქვენი მონაცემები ღილაკზე 'Add assets' დაწკაპუნებით. ამჟამად, შეგიძლიათ დაამატოთ მაქსიმუმ 25000 ნიმუში, მაგრამ ამ ლიმიტის გაზრდა შესაძლებელია Kili-ის გაყიდვების გუნდთან დაკავშირებით. პროექტის შექმნის შემდეგ, საჭიროა სამუშაოების (jobs) დამატება. ჩვენ შეგვიძლია მოვამზადოთ ეტიკეტირების ინტერფეისი პარამეტრების (Settings) გვერდიდან. მიუხედავად იმისა, რომ ჩვენ განვსაზღვრეთ 4 კატეგორია, გარდაუვალია ისეთი მიმოხილვების აღმოჩენა, რომლებსაც უნდა ჰქონდეთ მრავალი კატეგორია ან სრულიად უცნაურია. მე დავამატებ კიდევ ორ ეტიკეტს (რომლებიც არ იქნება გამოყენებული მოდელირებაში) ამ შემთხვევების დასაჭერად. ჩვენს მაგალითში, ჩვენ დავამატეთ კიდევ ორი ეტიკეტი ('სხვა', 'მრავალ-ეტიკეტი'). ჩვენ ასევე დავამატეთ დასახელებული ერთეულების ამოცნობის (NER) სამუშაო, რათა დაგვეზუსტებინა, თუ როგორ მივიღეთ გადაწყვეტილება ეტიკეტის შესახებ.
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#nlp
#huggingface
#autotrain
#kili
#ტექსტის კლასიფიკაცია
#auto ml
#აქტიური სწავლა
#სენტიმენტური ანალიზი
#მონაცემთა ანოტაცია
#google play store
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი