Hugging Face აძლიერებს ხელოვნური ინტელექტის მოდელების გაშვებას Whisper-ის დახმარებით: საზოგადოება და ეფექტურობა ცენტრში
Hugging Face-ი თავის Inference Endpoints-ს უფრო საზოგადოებაზე ორიენტირებულს ხდის, რაც ნებისმიერს აძლევს საშუალებას, წვლილი შეიტანოს ხელოვნური ინტელექტის მოდელების ეფექტურ განლაგებაში. განსაკუთრებული ყურადღება ექცევა Whisper მოდელებს, რომელთა გაშვებაც ოპტიმიზებულია vLLM-ის, CUDA-ს გრაფიკების და დინამიური კვანტიზაციის გამოყენებით, რის შედეგადაც Whisper Large V3-ისთვის შესრულების სიჩქარე (RTFx) თითქმის 8-ჯერ იზრდება. პლატფორმა უზრუნველყოფს მარტივ განლაგებას და რეალურ დროში ტრანსკრიფციის აპლიკაციები
ამ გამოშვებით, გვსურს, რომ Inference Endpoints უფრო საზოგადოებაზე ორიენტირებული გავხადოთ და ნებისმიერ მსურველს მივცეთ საშუალება, წვლილი შეიტანოს Hugging Face-ის პლატფორმაზე ხელოვნური ინტელექტის (AI) მოდელების უპრეცედენტო განლაგებაში. საზოგადოებასთან ერთად, ჩვენ გვსურს შემოგთავაზოთ ოპტიმიზებული განლაგება ამოცანების ფართო სპექტრისთვის საოცარი და ხელმისაწვდომი ღია კოდის ტექნოლოგიების გამოყენებით. Hugging Face-ის უნიკალური პოზიცია, რომელიც ღია კოდის ხელოვნური ინტელექტის საზოგადოების გულშია და მჭიდროდ თანამშრომლობს ინდივიდებთან, ინსტიტუტებთან და ინდუსტრიულ პარტნიორებთან, მას ყველაზე მრავალფეროვან პლატფორმად აქცევს AI მოდელების სხვადასხვა აპარატურაზე და პროგრამულ უზრუნველყოფაზე დასკვნის მისაღებად განლაგებისას.
Whisper-ის ახალი საბოლოო წერტილი ეფუძნება საოცარ ღია კოდის საზოგადოებრივ პროექტებს. დასკვნა ხორციელდება vLLM პროექტის მეშვეობით, რომელიც უზრუნველყოფს AI მოდელების ეფექტურად გაშვების საშუალებებს სხვადასხვა აპარატურულ ოჯახებზე – განსაკუთრებით, მაგრამ არა მხოლოდ, NVIDIA GPU-ებზე. ჩვენ ვიყენებთ OpenAI-ის Whisper მოდელის vLLM იმპლემენტაციას, რაც საშუალებას გვაძლევს, პროგრამული უზრუნველყოფის სტეკში კიდევ უფრო დაბალი დონის ოპტიმიზაცია ჩავრთოთ.
ამ საწყის გამოშვებაში ჩვენ ვუმიზნებთ NVIDIA GPU-ებს გამოთვლითი შესაძლებლობებით 8.9 ან უკეთესი (Ada Lovelace), როგორიცაა L4 და L40s, რაც ხსნის პროგრამული ოპტიმიზაციების ფართო სპექტრს: CUDA გრაფიკები აღრიცხავენ თანმიმდევრული ოპერაციების, ანუ ქერნელების, მიმდინარეობას GPU-ზე და ცდილობენ მათ დაჯგუფებას უფრო დიდ სამუშაო ერთეულებად GPU-ზე შესასრულებლად. ეს დაჯგუფების ოპერაცია ამცირებს მონაცემთა გადაადგილებას, სინქრონიზაციას და GPU-ს დაგეგმვის ზედმეტ დატვირთვას ერთი, გაცილებით დიდი სამუშაო ერთეულის შესრულებით, ნაცვლად მრავალი პატარის. და ბოლოს, ჩვენ დინამიურად ვახორციელებთ აქტივაციების კვანტიზაციას KV ქეშის(ების) მიერ გამოწვეული მეხსიერების მოთხოვნების შესამცირებლად. გამოთვლები ხდება ნახევრად სიზუსტით, ამ შემთხვევაში bfloat16-ით, ხოლო გამოსავალი ინახება შემცირებული სიზუსტით (1 ბაიტი float8-ისთვის 2 ბაიტის ნაცვლად bfloat16-ისთვის), რაც საშუალებას გვაძლევს, მეტი ელემენტი შევინახოთ KV ქეშში, რითაც იზრდება ქეშის მოხვედრის მაჩვენებელი. არსებობს მრავალი გზა ამის გასაგრძელებლად და ჩვენ მზად ვართ, საზოგადოებასთან ერთად ვიმუშაოთ მის გასაუმჯობესებლად!
Whisper Large V3 აჩვენებს თითქმის 8-ჯერ გაუმჯობესებას RTFx-ში, რაც მნიშვნელოვნად აჩქარებს დასკვნას ტრანსკრიფციის ხარისხის დაკარგვის გარეშე. ჩვენ შევაფასეთ რამდენიმე Whisper-ზე დაფუძნებული მოდელის — Whisper Large V3, Whisper Large V3-Turbo და Distil-Whisper Large V3.5 — ტრანსკრიფციის ხარისხი და გაშვების ეფექტურობა და შევადარეთ ისინი Transformers ბიბლიოთეკაზე მათ იმპლემენტაციებს, რათა შეგვეფასებინა სიზუსტე და დეკოდირების სიჩქარე იდენტურ პირობებში. ჩვენ გამოვთვალეთ სიტყვების შეცდომის მაჩვენებელი (WER) 8 სტანდარტულ მონაცემთა ნაკრებზე Open ASR Leaderboard-დან, მათ შორის AMI, GigaSpeech, LibriSpeech (Clean and Other), SPGISpeech, Tedlium, VoxPopuli და Earnings22. ეს მონაცემთა ნაკრებები მოიცავს მრავალფეროვან დომენებსა და ჩაწერის პირობებს, რაც უზრუნველყოფს განზოგადებისა და რეალური სამყაროს ტრანსკრიფციის ხარისხის მყარ შეფასებას. WER ზომავს ტრანსკრიფციის სიზუსტეს არასწორად ნაწინასწარმეტყველები სიტყვების პროცენტის გამოთვლით (ჩანართების, წაშლის ან ჩანაცვლების მეშვეობით); დაბალი WER უკეთეს შესრულებას მიუთითებს. სამივე Whisper ვარიანტი ინარჩუნებს WER შესრულებას, რომელიც შედარებადია მათ Transformer-ის ბაზისურ მოდელებთან.
დასკვნის ეფექტურობის შესაფასებლად, ჩვენ ავიღეთ ნიმუშები rev16 გრძელვადიანი მონაცემთა ნაკრებიდან, რომელიც შეიცავს 45 წუთზე მეტი ხანგრძლივობის აუდიო სეგმენტებს – რეალური ტრანსკრიფციის სამუშაო დატვირთვების წარმომადგენელი, როგორიცაა შეხვედრები, პოდკასტები ან ინტერვიუები. ჩვენ გავზომეთ რეალურ დროში ფაქტორი (RTFx), რომელიც განისაზღვრება როგორც აუდიოს ხანგრძლივობის შეფარდება ტრანსკრიფციის დროსთან, და დავათვალიერეთ იგი ნიმუშებზე. ყველა მოდელი შეფასდა bfloat16-ში ერთ L4 GPU-ზე, თანმიმდევრული დეკოდირების პარამეტრების გამოყენებით (ენა, სხივის ზომა და პარტიის ზომა). თქვენ შეგიძლიათ განალაგოთ თქვენი საკუთარი ASR დასკვნის კონვეიერი Hugging Face Endpoints-ის მეშვეობით. Endpoints საშუალებას აძლევს ნებისმიერ მსურველს, განალაგოს AI მოდელები პროდუქციისთვის მზა გარემოში, მხოლოდ რამდენიმე პარამეტრის შევსებით. ის ასევე გთავაზობთ ბაზარზე არსებული AI აპარატურის ყველაზე სრულყოფილ ნაკრებს, რათა დააკმაყოფილოს თქვენი მოთხოვნები ღირებულებისა და შესრულების თვალსაზრისით. ყოველივე ეს პირდაპირ იმ ადგილიდან, სადაც AI საზოგადოება შენდება.
დასაწყებად არაფერია მარტივი, უბრალოდ აირჩიეთ მოდელი, რომლის განლაგებაც გსურთ: განლაგებული მოდელის საბოლოო წერტილზე დასკვნის გაშვება შესაძლებელია Python-ში სულ რამდენიმე ხაზის კოდით, ასევე შეგიძლიათ გამოიყენოთ იგივე სტრუქტურა Javascript-ში ან ნებისმიერ სხვა ენაში, რომელშიც თავს კომფორტულად გრძნობთ. აქ არის მცირე ამონარიდი განლაგებული „ჩექპოინტის“ სწრაფად შესამოწმებლად. ამ უსწრაფესი საბოლოო წერტილის მეშვეობით, შესაძლებელია რეალურ დროში ტრანსკრიფციის აპლიკაციების შექმნა. სცადეთ ეს მაგალითი, რომელიც აშენებულია FastRTC-ით. უბრალოდ ისაუბრეთ მიკროფონში და იხილეთ თქვენი მეტყველება რეალურ დროში ტრანსკრიფცირებული! Spaces-ის მარტივად დუბლირება შესაძლებელია, ასე რომ თავისუფლად გააკეთეთ დუბლირება. ყოველივე ზემოთქმული ხელმისაწვდომია საზოგადოებრივი გამოყენებისთვის Hugging Face Hub-ზე ჩვენს სპეციალურ HF Endpoints ორგანიზაციაში. გახსენით საკითხები, შემოგვთავაზეთ გამოყენების შემთხვევები და შეიტანეთ წვლილი აქ: hfendpoints-images (Inference Endpoints Images).
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#gpu
#nvidia
#hugging face
#ღია კოდი
#whisper
#vllm
#დასკვნის საბოლოო წერტილები
#ტრანსკრიფცია
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგია / ხელოვნური ინტელექტი
TAPEX: რევოლუციური მიდგომა ცხრილის წინასწარი ვარჯიშისთვის ნერვული SQL შემსრულებლის მეშვეობით
AI
AI-ს გავლენა SaaS-ის ბიზნეს მოდელზე: „SaaSpocalypse“ თუ ახალი ერა?
ხელოვნური ინტელექტი