OpenAI-ის „Whisper“: რევოლუცია მეტყველების ავტომატურ ამოცნობაში
OpenAI-ის Whisper, 2022 წლის სექტემბერში გამოქვეყნებული ავტომატური მეტყველების ამოცნობის (ამოკრ.) მოდელი, რევოლუციას ახდენს დარგში. წინამორბედებისგან განსხვავებით, ის გაწვრთნილია უპრეცედენტო მოცულობის, 680,000 საათის ეტიკეტირებულ აუდიო-ტრანსკრიფციის მონაცემებზე, მათ შორის 117,000 საათის მულტილინგვურ მონაცემებზე, რაც 96-ზე მეტი ენის მხარდაჭერას უზრუნველყოფს. ზედამხედველობითი წინასწარი გაწვრთნა საშუალებას აძლევს მას პირდაპირ ისწავლოს მეტყველებიდან ტექსტზე გადასვლა, რაც მინიმალურ დახვეწას მოითხოვს
„Whisper“ არის ავტომატური მეტყველების ამოცნობისთვის (ამოკრ.) განკუთვნილი წინასწარ გაწვრთნილი მოდელი, რომელიც 2022 წლის სექტემბერში OpenAI-ის ავტორებმა, ალეკ რედფორდმა და სხვებმა გამოაქვეყნეს. მისი მრავალი წინამორბედისგან, მაგალითად Wav2Vec 2.0-ისგან განსხვავებით, რომლებიც არაეტიკეტირებულ აუდიო მონაცემებზე არის გაწვრთნილი, Whisper გაწვრთნილია ეტიკეტირებული აუდიო-ტრანსკრიფციის უზარმაზარ რაოდენობაზე — ზუსტად 680,000 საათზე. ეს ათჯერ მეტი მონაცემია, ვიდრე Wav2Vec 2.0-ის გაწვრთნისთვის გამოყენებული არაეტიკეტირებული აუდიო მონაცემები (60,000 საათი). გარდა ამისა, ამ წინასწარი გაწვრთნის მონაცემების 117,000 საათი არის მულტილინგვური ამოკრ. მონაცემები. ეს იძლევა საცნობარო წერტილებს (checkpoints), რომელთა გამოყენება შესაძლებელია 96-ზე მეტ ენაზე, რომელთაგან ბევრი დაბალი რესურსების ენად ითვლება. ეტიკეტირებული მონაცემების ეს რაოდენობა Whisper-ს საშუალებას აძლევს, პირდაპირ გაიაროს წინასწარი გაწვრთნა მეტყველების ამოცნობის ზედამხედველობით ამოცანაზე, ისწავლოს მეტყველებიდან ტექსტზე გადასვლა ეტიკეტირებული აუდიო-ტრანსკრიფციის წინასწარი გაწვრთნის მონაცემებიდან 1{}^11. შედეგად, Whisper-ს მცირე დამატებითი დახვეწა სჭირდება მაღალეფექტური ამოკრ. მოდელის მისაღებად.
ეს განსხვავდება Wav2Vec 2.0-ისგან, რომელიც გაწვრთნილია ნიღბიანი პროგნოზირების ზედამხედველობის გარეშე ამოცანაზე. ამ შემთხვევაში, მოდელი გაწვრთნილია ისწავლოს შუალედური გადასვლა მეტყველებიდან ფარულ მდგომარეობებზე მხოლოდ არაეტიკეტირებული აუდიო მონაცემებიდან. მიუხედავად იმისა, რომ ზედამხედველობის გარეშე წინასწარი გაწვრთნა მეტყველების მაღალი ხარისხის წარმოდგენებს იძლევა, ის არ სწავლობს მეტყველებიდან ტექსტზე გადასვლას. ეს გადასვლა მხოლოდ დახვეწის დროს ისწავლება, რაც კონკურენტუნარიანი წარმადობის მისაღწევად უფრო მეტ დახვეწას მოითხოვს. 680,000 საათის ეტიკეტირებულ წინასწარი გაწვრთნის მონაცემებზე მასშტაბირებისას, Whisper-ის მოდელები აჩვენებენ ძლიერ უნარს, განზოგადდეს მრავალ მონაცემთა ნაკრებსა და დომენზე. წინასწარ გაწვრთნილი საცნობარო წერტილები აღწევს კონკურენტუნარიან შედეგებს უახლეს ამოკრ. სისტემებთან შედარებით, სიტყვების შეცდომის თითქმის 3%-იანი მაჩვენებლით (სშმ) LibriSpeech ამოკრ.-ის „test-clean“ ქვენაკრებზე და ახალ უახლეს შედეგს TED-LIUM-ზე 4.7% სშმ-ით (იხ. Whisper-ის ნაშრომის ცხრილი 8). Whisper-ის მიერ წინასწარი გაწვრთნის დროს შეძენილი მულტილინგვური ამოკრ. ფართო ცოდნა შეიძლება გამოყენებულ იქნას სხვა დაბალი რესურსების ენებისთვის; დახვეწის საშუალებით, წინასწარ გაწვრთნილი საცნობარო წერტილები შეიძლება ადაპტირდეს კონკრეტული მონაცემთა ნაკრებებისა და ენებისთვის, რათა კიდევ უფრო გაუმჯობესდეს ეს შედეგები.
Whisper არის ტრანსფორმერზე დაფუძნებული კოდერ-დეკოდერის მოდელი, რომელიც ასევე მოიხსენიება როგორც მიმდევრობა-მიმდევრობის მოდელი. ის აუდიო სპექტროგრამის მახასიათებლების მიმდევრობას გარდაქმნის ტექსტის ტოკენების მიმდევრობად. პირველ რიგში, ნედლი აუდიო შეტანის მონაცემები გარდაიქმნება ლოგ-მელ სპექტროგრამად მახასიათებლების ამომღების მეშვეობით. შემდეგ ტრანსფორმერის კოდერი სპექტროგრამას კოდირებს, რათა შექმნას კოდერის ფარული მდგომარეობების მიმდევრობა. და ბოლოს, დეკოდერი ავტორეგრესიულად პროგნოზირებს ტექსტის ტოკენებს, როგორც წინა ტოკენებზე, ასევე კოდერის ფარულ მდგომარეობებზე დაყრდნობით. მიმდევრობა-მიმდევრობის მოდელში კოდერი აუდიო შეტანის მონაცემებს გარდაქმნის ფარული მდგომარეობების წარმოდგენების ერთობლიობად, რაც ამოიღებს მნიშვნელოვან მახასიათებლებს ნათქვამი მეტყველებიდან. დეკოდერი ასრულებს ენობრივი მოდელის როლს, ამუშავებს ფარული მდგომარეობების წარმოდგენებს და წარმოქმნის შესაბამის ტექსტურ ტრანსკრიფციებს. ენობრივი მოდელის სისტემის არქიტექტურაში შიდა ინტეგრაციას „ღრმა შერწყმა“ ეწოდება. ეს განსხვავდება „ზედაპირული შერწყმისგან“, სადაც ენობრივი მოდელი გარედან არის შერწყმული კოდერთან, მაგალითად CTC + nnn-გრამთან (იხ. Internal Language Model Estimation). ღრმა შერწყმით, მთელი სისტემა შეიძლება გაწვრთნას დასასრულიდან-დასასრულამდე ერთი და იგივე სავარჯიშო მონაცემებითა და დანაკარგის ფუნქციით, რაც იძლევა უფრო მეტ მოქნილობას და ზოგადად უპირატეს წარმადობას (იხ. ESB Benchmark).
Whisper წინასწარ გაწვრთნილი და დახვეწილია ჯვარედინი ენტროპიის მიზნობრივი ფუნქციის გამოყენებით, რაც სტანდარტული მიზნობრივი ფუნქციაა მიმდევრობა-მიმდევრობის სისტემების კლასიფიკაციის ამოცანებზე გაწვრთნისთვის. ამ შემთხვევაში, სისტემა გაწვრთნილია მიზნობრივი ტექსტის ტოკენის სწორად კლასიფიკაციისთვის ტექსტის ტოკენების წინასწარ განსაზღვრული ლექსიკონიდან. Whisper-ის საცნობარო წერტილები წარმოდგენილია ხუთ კონფიგურაციაში, სხვადასხვა მოდელის ზომით. ოთხი ყველაზე პატარა გაწვრთნილია მხოლოდ ინგლისურ ან მულტილინგვურ მონაცემებზე. ყველაზე დიდი საცნობარო წერტილები მხოლოდ მულტილინგვურია. ყველა 11 წინასწარ გაწვრთნილი საცნობარო წერტილი ხელმისაწვდომია Hugging Face Hub-ზე. დემონსტრაციის მიზნით, ჩვენ დავხვეწავთ პატარა საცნობარო წერტილის მულტილინგვურ ვერსიას 244 მილიონი პარამეტრით (დაახლოებით 1 გბ). რაც შეეხება ჩვენს მონაცემებს, ჩვენ გავწვრთნით და შევაფასებთ ჩვენს სისტემას დაბალი რესურსების ენაზე, რომელიც აღებულია Common Voice მონაცემთა ნაკრებიდან. ჩვენ ვაჩვენებთ, რომ სულ რაღაც 8 საათის დახვეწის მონაცემებით, ჩვენ შეგვიძლია მივაღწიოთ ძლიერ წარმადობას ამ ენაზე. 1{}^11 სახელი Whisper მომდინარეობს აბრევიატურა „WSPSR“-დან, რაც ნიშნავს „მეტყველების ამოცნობისთვის მასშტაბურ ზედამხედველობით წინასწარ გაწვრთნას“ (Web-scale Supervised Pre-training for Speech Recognition). Whisper მოდელის დასახვეწად ჩვენ გამოვიყენებთ რამდენიმე პოპულარულ Python პაკეტს. ჩვენ გამოვიყენებთ `datasets[audio]`-ს ჩვენი სავარჯიშო მონაცემების ჩამოსატვირთად და მოსამზადებლად, `transformers`-ს და `accelerate`-ს ჩვენი Whisper მოდელის ჩასატვირთად და გასაწვრთნელად. ჩვენ ასევე დაგვჭირდება `soundfile` პაკეტი აუდიო ფაილების წინასწარი დამუშავებისთვის, `evaluate` და `jiwer` ჩვენი მოდელის მუშაობის შესაფასებლად.
თეგები:
#ხელოვნური ინტელექტი
#openai
#მანქანური სწავლება
#ღრმა სწავლება
#ბუნებრივი ენის დამუშავება
#დახვეწა
#მეტყველების ამოცნობა
#ტრანსფორმერი
#whisper
#asr
#მულტილინგვური
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები / ხელოვნური ინტელექტი
როგორ ავაშენოთ გამოსახულების მსგავსების სისტემა: ღრმა სწავლისა და ეფექტური ძიების გზები
AI
AI-ს გავლენა SaaS-ის ბიზნეს მოდელზე: „SaaSpocalypse“ თუ ახალი ერა?
ხელოვნური ინტელექტი