OpenAI-ის „Whisper“: გარღვევა მეტყველების ამოცნობის ტექნოლოგიაში
OpenAI-ის მიერ 2022 წლის სექტემბერში გამოქვეყნებული „Whisper“ არის წინასწარ გაწვრთნილი მოდელი მეტყველების ავტომატური ამოცნობისთვის (МАА). ის იყენებს 680,000 საათის უზარმაზარ მარკირებულ აუდიო-ტრანსკრიფციის მონაცემთა ნაკრებს, მათ შორის მრავალენოვან მონაცემებს, რათა მიაღწიოს მოწინავე შედეგებს მეტყველება-ტექსტის კონვერტაციაში 96-ზე მეტ ენაზე, მინიმალური დამატებითი დაზუსტებით.
„Whisper“ არის მეტყველების ავტომატური ამოცნობის (МАА) წინასწარ გაწვრთნილი მოდელი, რომელიც 2022 წლის სექტემბერში გამოქვეყნდა OpenAI-ის მკვლევრების, ალეკ რედფორდის და სხვების მიერ. მისი მრავალი წინამორბედისგან განსხვავებით, როგორიცაა Wav2Vec 2.0, რომლებიც წინასწარ გაწვრთნილია არა მარკირებულ აუდიო მონაცემებზე, Whisper-ი გაწვრთნილია მარკირებული აუდიო-ტრანსკრიფციის უზარმაზარ რაოდენობაზე — ზუსტად 680,000 საათზე. ეს მონაცემთა რაოდენობა რიგითობით აღემატება Wav2Vec 2.0-ის გაწვრთნისთვის გამოყენებულ არა მარკირებულ აუდიო მონაცემებს (60,000 საათი). უფრო მეტიც, ამ წინასწარი გაწვრთნის მონაცემების 117,000 საათი არის მრავალენოვანი МАА მონაცემები. ეს შესაძლებელს ხდის მოდელის გამოყენებას 96-ზე მეტი ენისთვის, რომელთაგან ბევრი დაბალრესურსულად ითვლება. მარკირებული მონაცემების ასეთი მოცულობა Whisper-ს საშუალებას აძლევს, პირდაპირ გაწვრთნას მეტყველების ამოცნობის ზედამხედველობითი ამოცანა, ისწავლოს მეტყველება-ტექსტის რუკირება მარკირებული აუდიო-ტრანსკრიფციის წინასწარი გაწვრთნის მონაცემებიდან 1{}^11. შედეგად, Whisper-ს სჭირდება მინიმალური დამატებითი დაზუსტება მაღალეფექტური МАА მოდელის მისაღებად. ეს განსხვავდება Wav2Vec 2.0-ისგან, რომელიც წინასწარ გაწვრთნილია ნიღბიანი პროგნოზირების ზედამხედველობის გარეშე ამოცანაზე. ამ შემთხვევაში, მოდელი გაწვრთნილია, რათა ისწავლოს შუალედური რუკირება მეტყველებიდან ფარულ მდგომარეობებამდე მხოლოდ არა მარკირებული აუდიო მონაცემებიდან. მიუხედავად იმისა, რომ ზედამხედველობის გარეშე წინასწარი გაწვრთნა მეტყველების მაღალი ხარისხის წარმოდგენას იძლევა, ის არ სწავლობს მეტყველება-ტექსტის რუკირებას. ეს რუკირება მხოლოდ დაზუსტების (ფაინ-ტიუნინგის) დროს ისწავლება, რაც კონკურენტუნარიანი შესრულების მისაღებად მეტ დაზუსტებას მოითხოვს. 680,000 საათამდე მარკირებული წინასწარი გაწვრთნის მონაცემებით სკალირებისას, Whisper მოდელები აჩვენებენ ძლიერ უნარს, მოახდინონ განზოგადება მრავალ მონაცემთა ნაკრებსა და დომენზე. წინასწარ გაწვრთნილი შენახული მდგომარეობები კონკურენტუნარიან შედეგებს აღწევს უახლეს МАА სისტემებთან შედარებით, სიტყვების შეცდომის თითქმის 3%-იანი მაჩვენებლით (WER) LibriSpeech ASR-ის „test-clean“ ქვეჯგუფზე და ახალ მოწინავე შედეგს TED-LIUM-ზე 4.7% WER-ით (იხ. Whisper-ის ნაშრომის ცხრილი 8). მრავალენოვანი МАА-ს ვრცელი ცოდნა, რომელიც Whisper-მა წინასწარი გაწვრთნის დროს შეიძინა, შეიძლება გამოყენებულ იქნას სხვა დაბალრესურსული ენებისთვისაც; დაზუსტების მეშვეობით, წინასწარ გაწვრთნილი შენახული მდგომარეობები შეიძლება ადაპტირდეს კონკრეტული მონაცემთა ნაკრებებისა და ენებისთვის, რათა კიდევ უფრო გაუმჯობესდეს მიღებული შედეგები. Whisper არის ტრანსფორმერზე დაფუძნებული ენკოდერ-დეკოდერი მოდელი, რომელსაც ასევე მიმდევრობა-მიმდევრობის მოდელს უწოდებენ. ის აუდიო სპექტროგრამის მახასიათებლების მიმდევრობას გარდაქმნის ტექსტური ტოკენების მიმდევრობად. პირველ რიგში, ნედლი აუდიო შეტანა გარდაიქმნება ლოგ-მელ სპექტროგრამად მახასიათებლების ამომღების მეშვეობით. შემდეგ ტრანსფორმერის ენკოდერი ახდენს სპექტროგრამის კოდირებას, რათა შექმნას ენკოდერის ფარული მდგომარეობების მიმდევრობა. საბოლოოდ, დეკოდერი ავტორეგრესიულად პროგნოზირებს ტექსტურ ტოკენებს, წინა ტოკენებისა და ენკოდერის ფარული მდგომარეობების გათვალისწინებით. სურათი 1 აჯამებს Whisper მოდელს. მიმდევრობა-მიმდევრობის მოდელში ენკოდერი აუდიო შეტანას გარდაქმნის ფარული მდგომარეობების წარმოდგენების ერთობლიობად, რითაც ამოიღებს მნიშვნელოვან მახასიათებლებს წარმოთქმული მეტყველებიდან. დეკოდერი ენობრივი მოდელის როლს ასრულებს, ამუშავებს ფარული მდგომარეობების წარმოდგენებს და ქმნის შესაბამის ტექსტურ ტრანსკრიფციებს. ენობრივი მოდელის სისტემის არქიტექტურაში შიდა ინტეგრაციას ღრმა შერწყმა ეწოდება. ეს განსხვავდება ზედაპირული შერწყმისგან, სადაც ენობრივი მოდელი ენკოდერთან გარედან არის დაკავშირებული, მაგალითად, CTC + nnn-გრამის გამოყენებით (იხ. შიდა ენობრივი მოდელის შეფასება). ღრმა შერწყმისას, მთელი სისტემა შეიძლება გაწვრთნას დასასრულიდან-დასასრულამდე, ერთი და იგივე გაწვრთნის მონაცემებითა და დანაკარგის ფუნქციით, რაც იძლევა მეტ მოქნილობას და ზოგადად, უკეთეს შესრულებას (იხ. ESB ბენჩმარკი). Whisper წინასწარ გაწვრთნილია და დაზუსტებულია ჯვარედინი ენტროპიის მიზნობრივი ფუნქციის გამოყენებით, რაც სტანდარტული მიზნობრივი ფუნქციაა მიმდევრობა-მიმდევრობის სისტემების კლასიფიკაციის ამოცანებზე გაწვრთნისთვის. ამ შემთხვევაში, სისტემა გაწვრთნილია, რათა სწორად მოახდინოს სამიზნე ტექსტური ტოკენის კლასიფიკაცია ტექსტური ტოკენების წინასწარ განსაზღვრული ლექსიკონიდან. Whisper-ის შენახული მდგომარეობები ხელმისაწვდომია ხუთ კონფიგურაციაში, სხვადასხვა მოდელის ზომის მიხედვით. ოთხი ყველაზე პატარა გაწვრთნილია მხოლოდ ინგლისურენოვან ან მრავალენოვან მონაცემებზე. ყველაზე დიდი შენახული მდგომარეობები მხოლოდ მრავალენოვანია. ყველა 11 წინასწარ გაწვრთნილი შენახული მდგომარეობა ხელმისაწვდომია Hugging Face-ის ჰაბზე. შენახული მდგომარეობები შეჯამებულია შემდეგ ცხრილში, მოდელების ბმულებით ჰაბზე: დემონსტრაციის მიზნით, ჩვენ დავაზუსტებთ მცირე ზომის შენახული მდგომარეობის მრავალენოვან ვერსიას 244 მილიონი პარამეტრით (დაახლოებით 1 გბ). რაც შეეხება ჩვენს მონაცემებს, ჩვენ გავწვრთნით და შევაფასებთ ჩვენს სისტემას დაბალრესურსულ ენაზე, რომელიც აღებულია Common Voice მონაცემთა ნაკრებიდან. ჩვენ ვაჩვენებთ, რომ სულ რაღაც 8 საათიანი დაზუსტების მონაცემებითაც კი, ჩვენ შეგვიძლია მივაღწიოთ ძლიერ შესრულებას ამ ენაზე. 1{}^11 სახელი „Whisper“ მომდინარეობს აკრონიმიდან „WSPSR“, რაც ნიშნავს „Web-scale Supervised Pre-training for Speech Recognition“ (ვებ-მასშტაბიანი ზედამხედველობითი წინასწარი გაწვრთნა მეტყველების ამოცნობისთვის). Whisper მოდელის დაზუსტებისთვის ჩვენ გამოვიყენებთ რამდენიმე პოპულარულ Python პაკეტს. ჩვენ გამოვიყენებთ datasets[audio]-ს ჩვენი გაწვრთნის მონაცემების ჩამოსატვირთად და მოსამზადებლად, transformers-სა და accelerate-ს ჩვენი Whisper მოდელის ჩასატვირთად და გასაწვრთნელად. ასევე დაგვჭირდება soundfile პაკეტი აუდიო ფაილების წინასწარი დამუშავებისთვის, evaluate და jiwer ჩვენი მოდელის მუშაობის შესაფასებლად.
თეგები:
#ხელოვნური ინტელექტი
#openai
#მანქანური სწავლება
#ტექნოლოგია
#მრავალენოვანი
#მეტყველების ამოცნობა
#ტრანსფორმერი
#whisper
#маа
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგია და ხელოვნური ინტელექტი
კონტენტის პოლიტიკის განახლება: ხელოვნური ინტელექტი, თანხმობა და თანამშრომლობა
ტექნოლოგია და ხელოვნური ინტელექტი
MetaAI-ის Wav2Vec2-BERT: გაუმჯობესებული მეტყველების ამოცნობა დაბალრესურსიან ენებზე
ტექნოლოგია და ხელოვნური ინტელექტი