მომხმარებლის საჭიროებების გაგება გადამწყვეტია ნებისმიერ მომხმარებელთან დაკავშირებულ ბიზნესში. თუმცა, ის ასევე მოითხოვს დიდ შრომასა და ანალიზს, რაც საკმაოდ ძვირია. მაშ, რატომ არ გამოვიყენოთ მანქანური სწავლება? გაცილებით ნაკლები კოდირებით Auto ML-ის გამოყენებით. ამ სტატიაში ჩვენ გამოვიყენებთ HuggingFace AutoTrain-სა და Kili-ის აქტიური სწავლების მილსადენის შესაქმნელად ტექსტის კლასიფიკაციისთვის. Kili არის პლატფორმა, რომელიც ხელს უწყობს მონაცემებზე ორიენტირებულ მიდგომას მანქანურ სწავლებაში ხარისხიანი სავარჯიშო მონაცემების შექმნის გზით. ის უზრუნველყოფს მონაცემთა კოლაბორაციული ანოტირების ხელსაწყოებსა და API-ებს, რაც შესაძლებელს ხდის სწრაფ იტერაციებს სანდო მონაცემთა ნაკრების შექმნასა და მოდელის ვარჯიშს შორის. აქტიური სწავლება არის პროცესი, რომლის დროსაც მარკირებულ მონაცემებს ამატებთ მონაცემთა ნაკრებს და შემდეგ მოდელს იტერაციულად ავარჯიშებთ. შესაბამისად, ის უსასრულოა და მოითხოვს ადამიანის ჩარევას მონაცემების მარკირებისთვის. ამ სტატიის კონკრეტული მაგალითისთვის, ჩვენ შევქმნით ჩვენს მილსადენს Google Play Store-დან Medium-ის მომხმარებლის მიმოხილვების გამოყენებით. ამის შემდეგ, ჩვენ მიერ აგებული მილსადენით მოვახდენთ მიმოხილვების კატეგორიზაციას. საბოლოოდ, კლასიფიცირებულ მიმოხილვებზე გამოვიყენებთ სენტიმენტების ანალიზს. შედეგების ანალიზის შემდეგ, მომხმარებელთა საჭიროებებისა და კმაყოფილების გაგება ბევრად მარტივი გახდება. ავტომატიზებული მანქანური სწავლება არის ტერმინი მანქანური სწავლების მილსადენის ავტომატიზაციისთვის. ის ასევე მოიცავს მონაცემთა გაწმენდას, მოდელის შერჩევას და ჰიპერ-პარამეტრების ოპტიმიზაციას. ჩვენ შეგვიძლია გამოვიყენოთ 🤗 ტრანსფორმერები ავტომატიზებული ჰიპერ-პარამეტრების მოსაძიებლად. ჰიპერ-პარამეტრების ოპტიმიზაცია რთული და შრომატევადი პროცესია. მიუხედავად იმისა, რომ ჩვენ შეგვიძლია ავაგოთ ჩვენი მილსადენი ტრანსფორმერებისა და სხვა მძლავრი API-ების გამოყენებით, ასევე შესაძლებელია ამის სრულად ავტომატიზაცია AutoTrain-ით. AutoTrain აგებულია მრავალ მძლავრ API-ზე, როგორიცაა ტრანსფორმერები, მონაცემთა ნაკრებები (datasets) და დასკვნის API (inference-api). მონაცემთა გაწმენდის, მოდელის შერჩევისა და ჰიპერ-პარამეტრების ოპტიმიზაციის ნაბიჯები სრულად ავტომატიზირებულია AutoTrain-ში. ამ ფრეიმვორკის სრულად გამოყენება შესაძლებელია კონკრეტული ამოცანისთვის წარმოებისთვის მზა SOTA (State-of-the-Art) ტრანსფორმერული მოდელების შესაქმნელად. ამჟამად, AutoTrain მხარს უჭერს ბინარულ და მრავალლეიბლიან ტექსტის კლასიფიკაციას, ტოკენების კლასიფიკაციას, ამომწურავ კითხვა-პასუხს, ტექსტის შეჯამებას და ტექსტის შეფასებას. ის ასევე მხარს უჭერს მრავალ ენას, როგორიცაა ინგლისური, გერმანული, ფრანგული, ესპანური, ფინური, შვედური, ჰინდი, ჰოლანდიური და სხვა. თუ თქვენი ენა არ არის მხარდაჭერილი AutoTrain-ის მიერ, შესაძლებელია მორგებული მოდელების გამოყენება მორგებული ტოკენაიზერებით. Kili არის სრული AI ვარჯიშის პლატფორმა მონაცემებზე ორიენტირებული ბიზნესებისთვის. Kili უზრუნველყოფს ოპტიმიზებულ მარკირების ფუნქციებსა და ხარისხის მართვის ხელსაწყოებს თქვენი მონაცემების სამართავად. თქვენ შეგიძლიათ სწრაფად მოახდინოთ გამოსახულების, ვიდეოს, ტექსტის, PDF-ის და ხმოვანი მონაცემების ანოტირება, ამავდროულად აკონტროლოთ მონაცემთა ნაკრების ხარისხი. მას ასევე აქვს მძლავრი API-ები GraphQL-ისა და Python-ისთვის, რაც მნიშვნელოვნად ამარტივებს მონაცემთა მართვას. ის ხელმისაწვდომია როგორც ონლაინ, ასევე ადგილზე (on-premise) და იძლევა საშუალებას, გამოიყენოთ თანამედროვე მანქანური სწავლების ტექნიკები, იქნება ეს კომპიუტერული ხედვა, ბუნებრივი ენის დამუშავება (NLP) თუ ოპტიკური სიმბოლოების ამოცნობა (OCR). ის მხარს უჭერს ტექსტის კლასიფიკაციას, სახელობითი ერთეულების ამოცნობას (NER), ურთიერთობების ამოღებას და სხვა NLP/OCR ამოცანებს. ის ასევე მხარს უჭერს კომპიუტერული ხედვის ამოცანებს, როგორიცაა ობიექტების ამოცნობა, სურათის ტრანსკრიფცია, ვიდეოს კლასიფიკაცია, სემანტიკური სეგმენტაცია და მრავალი სხვა! Kili კომერციული ინსტრუმენტია, მაგრამ თქვენ ასევე შეგიძლიათ შექმნათ უფასო დეველოპერის ანგარიში Kili-ის ხელსაწყოების გამოსაცდელად. მეტი ინფორმაციის მიღება შეგიძლიათ ფასების გვერდიდან. ჩვენ ვიმუშავებთ მიმოხილვების კლასიფიკაციის მაგალითზე, სენტიმენტების ანალიზთან ერთად, რათა მივიღოთ შეხედულებები მობილური აპლიკაციის შესახებ. ჩვენ ამოვიღეთ Medium-ის დაახლოებით 40 ათასი მიმოხილვა Google Play Store-დან. ამ მონაცემთა ნაკრებში მიმოხილვის ტექსტებს ეტაპობრივად მოვახდენთ ანოტირებას. შემდეგ კი ავაგებთ მილსადენს მიმოხილვების კლასიფიკაციისთვის. მოდელირებისას, პირველი მოდელი მომზადდება AutoTrain-ით. შემდეგ ასევე ავაგებთ მოდელს AutoTrain-ის გამოყენების გარეშე. მთელი კოდი და მონაცემთა ნაკრები შეგიძლიათ იხილოთ პროექტის GitHub რეპოზიტორიუმში. დავიწყოთ ნედლი მონაცემთა ნაკრების დათვალიერებით. ამ მონაცემთა ნაკრებში არის 10 სვეტი და 40130 ნიმუში. ერთადერთი სვეტი, რომელიც გვჭირდება, არის "content", რაც მომხმარებლის მიმოხილვაა. დაწყებამდე, ჩვენ უნდა განვსაზღვროთ რამდენიმე კატეგორია. ჩვენ განვსაზღვრეთ 4 კატეგორია. მარკირების ნაწილისთვის, პირველ რიგში, უნდა შევქმნათ პროექტი Kili-ის პლატფორმაზე. ჩვენ შეგვიძლია გამოვიყენოთ პლატფორმის ვებ ინტერფეისი ან API-ები. ვნახოთ ორივე. ვებ ინტერფეისიდან: პროექტების სიის გვერდიდან, ჩვენ ვქმნით მრავალკლასოვან ტექსტის კლასიფიკაციის პროექტს. ამის შემდეგ, პროექტის გვერდზე, შეგიძლიათ დაამატოთ თქვენი მონაცემები ღილაკზე „აქტივების დამატება“ (Add assets) დაჭერით. ამჟამად, შეგიძლიათ დაამატოთ მაქსიმუმ 25000 ნიმუში, მაგრამ შეგიძლიათ გაზარდოთ ეს ლიმიტი, თუ დაუკავშირდებით Kili-ის გაყიდვების გუნდს. მას შემდეგ, რაც შევქმნით ჩვენს პროექტს, საჭიროა დავალებების დამატება. მარკირების ინტერფეისის მომზადება შეგვიძლია პარამეტრების გვერდიდან. მიუხედავად იმისა, რომ ჩვენ განვსაზღვრეთ 4 კატეგორია, გარდაუვალია შეგვხვდეს მიმოხილვები, რომლებსაც უნდა ჰქონდეთ მრავალი კატეგორია ან სრულიად უჩვეულო შინაარსი. მე დავამატებ კიდევ ორ ლეიბლს (რომლებიც არ გამოიყენება მოდელირებაში) ამ შემთხვევების დასაფიქსირებლად. ჩვენს მაგალითში, ჩვენ დავამატეთ კიდევ ორი ლეიბლი ("სხვა", "მრავალლეიბლიანი"). ასევე დავამატეთ სახელობითი ერთეულების ამოცნობის (NER) დავალება, რათა განგვესაზღვრა, თუ როგორ მივიღეთ გადაწყვეტილება ლეიბლის შესახებ.