Wav2Vec2 და XLS-R: გარღვევა მეტყველების ავტომატური ამოცნობის ტექნოლოგიაში
2020 წელს გამოშვებული Wav2Vec2 მოდელიდან დაწყებული, Facebook AI-ის მრავალენოვანი XLSR ვერსიის გავლით, 2021 წლის ნოემბერში წარმოდგენილი XLS-R წარმოადგენს მნიშვნელოვან მიღწევას მეტყველების ავტომატური ამოცნობის (ASR) სფეროში. XLS-R, რომელიც გაწვრთნილია 128 ენაზე ნახევარ მილიონ საათამდე აუდიო მონაცემზე, უზრუნველყოფს კონტექსტუალიზებულ მეტყველების წარმოდგენებს და აჩვენებს შთამბეჭდავ გაუმჯობესებას მეტყველების ამოცნობის, თარგმანისა და ენის იდენტიფიკაციის ამოცანებში. სტატია დეტალურად განმარტავს ამ მოდელე
Wav2Vec2 არის წინასწარ გაწვრთნილი მოდელი მეტყველების ავტომატური ამოცნობისთვის (ASR) და გამოვიდა 2020 წლის სექტემბერში ალექსეი ბაევსკის, მაიკლ აულის და ალექს კონოს მიერ. Wav2Vec2-ის გამორჩეული შესრულების დემონსტრირების შემდეგ ASR-ისთვის ერთ-ერთ ყველაზე პოპულარულ ინგლისურ მონაცემთა ნაკრებზე, LibriSpeech-ზე, Facebook AI-მ წარმოადგინა Wav2Vec2-ის მრავალენოვანი ვერსია, სახელად XLSR. XLSR ნიშნავს ჯვარედინი ენობრივი მეტყველების წარმოდგენებს (cross-lingual speech representations) და გულისხმობს მოდელის უნარს, ისწავლოს მეტყველების წარმოდგენები, რომლებიც გამოსადეგია მრავალ ენაზე. XLSR-ის მემკვიდრე, უბრალოდ სახელწოდებით XLS-R (რომელიც გულისხმობს „XLM-R მეტყველებისთვის“), გამოვიდა 2021 წლის ნოემბერში არუნ ბაბუს, ჩანგჰან ვანგის, ანდროს ტიანდრას და სხვების მიერ. XLS-R-მა გამოიყენა თითქმის ნახევარი მილიონი საათის აუდიო მონაცემები 128 ენაზე თვითკონტროლირებადი წინასწარი ვარჯიშისთვის და წარმოდგენილია ზომებში 300 მილიონიდან ორ მილიარდ პარამეტრამდე.
წინასწარ გაწვრთნილი გამშვები წერტილების პოვნა შეგიძლიათ 🤗 Hub-ზე: BERT-ის ნიღბიანი ენის მოდელირების მიზნის მსგავსად, XLS-R სწავლობს კონტექსტუალიზებულ მეტყველების წარმოდგენებს შემთხვევითი შერჩევის (masking) გზით, სანამ მათ ტრანსფორმატორ ქსელში გადასცემს თვითკონტროლირებადი წინასწარი ვარჯიშის დროს (იხ. დიაგრამა ქვემოთ, მარცხნივ). დაზუსტებისთვის (fine-tuning), წინასწარ გაწვრთნილი ქსელის თავზე ემატება ერთი ხაზოვანი ფენა, რათა მოდელი გაწვრთნას მარკირებულ აუდიო მონაცემებზე შემდგომი ამოცანებისთვის, როგორიცაა მეტყველების ამოცნობა, მეტყველების თარგმანი და აუდიო კლასიფიკაცია (იხ. დიაგრამა ქვემოთ, მარჯვნივ).
XLS-R აჩვენებს შთამბეჭდავ გაუმჯობესებას წინა თანამედროვე შედეგებთან შედარებით როგორც მეტყველების ამოცნობის, ასევე მეტყველების თარგმანისა და მოსაუბრის/ენის იდენტიფიკაციის კუთხით, იხ. ოფიციალური სტატიის ცხრილები 3-6, 7-10 და 11-12 შესაბამისად. ამ ბლოგში დეტალურად განვმარტავთ, თუ როგორ შეიძლება XLS-R – უფრო კონკრეტულად, წინასწარ გაწვრთნილი გამშვები წერტილი Wav2Vec2-XLS-R-300M – დაზუსტდეს ASR-ისთვის. დემონსტრაციის მიზნით, მოდელს დავაზუსტებთ Common Voice-ის დაბალი რესურსების ASR მონაცემთა ნაკრებზე, რომელიც შეიცავს მხოლოდ დაახლოებით 4 საათის ვალიდირებულ სავარჯიშო მონაცემს. XLS-R დაზუსტებულია Connectionist Temporal Classification (CTC) გამოყენებით, რომელიც არის ალგორითმი, გამოიყენება ნერვული ქსელების სავარჯიშოდ მიმდევრობა-მიმდევრობაზე პრობლემებისთვის, როგორიცაა ASR და ხელნაწერი ტექსტის ამოცნობა. მკაცრად გირჩევთ წაიკითხოთ კარგად დაწერილი ბლოგ-პოსტი „Sequence Modeling with CTC (2017)“ Awni Hannun-ის მიერ.
სანამ დავიწყებთ, დავაინსტალიროთ datasets და transformers. ასევე, გვჭირდება torchaudio აუდიო ფაილების ჩასატვირთად და jiwer ჩვენი დაზუსტებული მოდელის შესაფასებლად სიტყვების შეცდომის მაჩვენებლის (WER) გამოყენებით. მკაცრად გირჩევთ, რომ ვარჯიშის დროს თქვენი სავარჯიშო გამშვები წერტილები პირდაპირ ატვირთოთ Hugging Face Hub-ზე. Hugging Face Hub-ს აქვს ინტეგრირებული ვერსიის კონტროლი, ასე რომ დარწმუნებული იქნებით, რომ ვარჯიშის დროს არც ერთი მოდელის გამშვები წერტილი არ დაიკარგება. ამის გასაკეთებლად, თქვენ უნდა შეინახოთ თქვენი ავთენტიფიკაციის ტოკენი Hugging Face-ის ვებსაიტიდან (დარეგისტრირდით აქ, თუ ჯერ არ გაქვთ გაკეთებული!).
შემდეგ, თქვენ უნდა დააინსტალიროთ Git-LFS თქვენი მოდელის გამშვები წერტილების ასატვირთად. სტატიაში მოდელი შეფასებული იყო ფონემატური შეცდომის მაჩვენებლის (PER) გამოყენებით, მაგრამ ASR-ში ყველაზე გავრცელებული მეტრიკა არის სიტყვების შეცდომის მაჩვენებელი (WER). იმისათვის, რომ ეს ნოუთბუქი მაქსიმალურად ზოგადი ყოფილიყო, ჩვენ გადავწყვიტეთ მოდელის შეფასება WER-ის გამოყენებით. ASR მოდელები მეტყველებას ტექსტად გარდაქმნიან, რაც ნიშნავს, რომ ჩვენ გვჭირდება როგორც ფუნქციების ამომღები (feature extractor), რომელიც მეტყველების სიგნალს ამუშავებს მოდელის შეტანის ფორმატად, მაგ., ფუნქციების ვექტორად, ასევე ტოკენიზატორი, რომელიც მოდელის გამოსვლის ფორმატს ტექსტად ამუშავებს.
🤗 Transformers-ში, XLS-R მოდელს თან ახლავს როგორც ტოკენიზატორი, სახელად Wav2Vec2CTCTokenizer, ასევე ფუნქციების ამომღები, სახელად Wav2Vec2FeatureExtractor. დავიწყოთ ტოკენიზატორის შექმნით, რათა გაშიფროთ პროგნოზირებული გამომავალი კლასები გამომავალ ტრანსკრიფციად. წინასწარ გაწვრთნილი XLS-R მოდელი მეტყველების სიგნალს ასახავს კონტექსტური წარმოდგენების მიმდევრობად, როგორც ეს ზემოთ მოცემულ ფიგურაზეა ნაჩვენები. თუმცა, მეტყველების ამოცნობისთვის მოდელმა ეს კონტექსტური წარმოდგენების მიმდევრობა უნდა ასახოს შესაბამის ტრანსკრიფციად, რაც იმას ნიშნავს, რომ ტრანსფორმატორის ბლოკის თავზე (ნაჩვენებია ყვითლად ზემოთ მოცემულ დიაგრამაზე) უნდა დაემატოს ხაზოვანი ფენა. ეს ხაზოვანი ფენა გამოიყენება თითოეული კონტექსტური წარმოდგენის ტოკენის კლასად კლასიფიკაციისთვის, იმის ანალოგიურად, თუ როგორ ემატება ხაზოვანი ფენა BERT-ის ემბედინგებს შემდგომი კლასიფიკაციისთვის წინასწარი ვარჯიშის შემდეგ (იხ. ამ ბლოგ-პოსტის „BERT“ სექცია). ამ ფენის გამოსვლის ზომა შეესაბამება ლექსიკონში ტოკენების რაოდენობას, რაც არ არის დამოკიდებული XLS-R-ის წინასწარი ვარჯიშის ამოცანაზე, არამედ მხოლოდ დაზუსტებისთვის გამოყენებულ მარკირებულ მონაცემთა ნაკრებზე.
ასე რომ, პირველ ეტაპზე, განვიხილავთ Common Voice-ის არჩეულ მონაცემთა ნაკრებს და განვსაზღვრავთ ლექსიკონს ტრანსკრიფციების საფუძველზე. პირველ რიგში, გადავიდეთ Common Voice-ის ოფიციალურ ვებსაიტზე და ავირჩიოთ ენა, რომელზეც დავაზუსტებთ XLS-R-ს. ამ ნოუთბუქისთვის გამოვიყენებთ თურქულს. თითოეული კონკრეტული ენის მონაცემთა ნაკრებისთვის შეგიძლიათ იპოვოთ ენის კოდი, რომელიც შეესაბამება თქვენს არჩეულ ენას.
თეგები:
#ტექნოლოგიები
#მანქანური სწავლება
#ღრმა სწავლება
#hugging face
#მეტყველების ამოცნობა
#asr
#wav2vec2
#xls-r
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი