ამ გამოშვებით, გვსურს, რომ ინფერენსის საბოლოო წერტილები (Inference Endpoints) უფრო მეტად საზოგადოებაზე ორიენტირებული გავხადოთ და ყველას მივცეთ შესაძლებლობა, წვლილი შეიტანოს Hugging Face პლატფორმაზე წარმოუდგენელი ინფერენსის განთავსებაში. საზოგადოებასთან ერთად, ჩვენ ვთავაზობთ ოპტიმიზებულ განთავსებას ამოცანების ფართო სპექტრისთვის, საოცარი და ხელმისაწვდომი ღია კოდის ტექნოლოგიების გამოყენებით. Hugging Face-ის უნიკალური პოზიცია, როგორც ღია კოდის ხელოვნური ინტელექტის საზოგადოების გული, ინდივიდებთან, ინსტიტუტებთან და ინდუსტრიულ პარტნიორებთან მჭიდრო თანამშრომლობით, მას ყველაზე ჰეტეროგენულ პლატფორმად აქცევს, როდესაც საქმე ეხება ხელოვნური ინტელექტის მოდელების განთავსებას ინფერენსისთვის სხვადასხვა აპარატურასა და პროგრამულ უზრუნველყოფაზე. Whisper-ის ახალი საბოლოო წერტილი საოცარ ღია კოდის საზოგადოებრივ პროექტებს იყენებს. ინფერენსი განხორციელებულია vLLM პროექტის მეშვეობით, რომელიც გთავაზობთ AI მოდელების ეფექტურ მუშაობას სხვადასხვა აპარატურულ ოჯახებზე – განსაკუთრებით, მაგრამ არა მხოლოდ, NVIDIA-ს GPU-ებზე. ჩვენ ვიყენებთ OpenAI-ის Whisper მოდელის vLLM-ის იმპლემენტაციას, რაც საშუალებას გვაძლევს, პროგრამული უზრუნველყოფის სტეკის დაბალ დონეზე შემდგომი ოპტიმიზაციები განვახორციელოთ. ამ საწყის გამოშვებაში, ჩვენ ვართ მიზანში NVIDIA GPU-ები გამოთვლითი შესაძლებლობებით 8.9 ან უკეთესი (Ada Lovelace), როგორიცაა L4 და L40s, რაც ხსნის პროგრამული უზრუნველყოფის ოპტიმიზაციების ფართო სპექტრს: CUDA გრაფები აღრიცხავს თანმიმდევრული ოპერაციების, ანუ ქერნელების, ნაკადს, რომელიც ხდება GPU-ზე და ცდილობს მათ დაჯგუფებას, როგორც სამუშაო ერთეულების უფრო დიდ ნაწილებს GPU-ზე შესასრულებლად. ეს დაჯგუფების ოპერაცია ამცირებს მონაცემთა გადაადგილებას, სინქრონიზაციას და GPU-ს დაგეგმვის ზედმეტ დანახარჯებს ერთი, ბევრად უფრო დიდი სამუშაო ერთეულის შესრულებით, მრავალი პატარის ნაცვლად. დაბოლოს, ჩვენ დინამიურად ვახდენთ აქტივაციების კვანტიზაციას, რათა შევამციროთ მეხსიერების მოთხოვნები, რაც გამოწვეულია KV ქეშ(ებ)ით. გამოთვლები ხდება ნახევარ სიზუსტით, ამ შემთხვევაში bfloat16-ით, ხოლო გამომავალი მონაცემები ინახება შემცირებული სიზუსტით (1 ბაიტი float8-ისთვის 2 ბაიტის ნაცვლად bfloat16-ისთვის), რაც საშუალებას გვაძლევს, მეტი ელემენტი შევინახოთ KV ქეშში, რითაც იზრდება ქეშის მოხვედრის სიხშირე. ამ მიმართულებით წინსვლის მრავალი გზა არსებობს და ჩვენ მზად ვართ, საზოგადოებასთან ერთად ვიმუშაოთ მის გასაუმჯობესებლად! Whisper Large V3 აჩვენებს თითქმის 8-ჯერ გაუმჯობესებას RTFx-ში, რაც მნიშვნელოვნად აჩქარებს ინფერენსს ტრანსკრიფციის ხარისხის დაკარგვის გარეშე. ჩვენ შევაფასეთ ტრანსკრიფციის ხარისხი და გაშვების დროის ეფექტურობა რამდენიმე Whisper-ზე დაფუძნებული მოდელისთვის — Whisper Large V3, Whisper Large V3-Turbo და Distil-Whisper Large V3.5 — და შევადარეთ ისინი Transformers ბიბლიოთეკაზე მათ იმპლემენტაციას, რათა შეგვეფასებინა როგორც სიზუსტე, ასევე დეკოდირების სიჩქარე იდენტურ პირობებში. ჩვენ გამოვთვალეთ სიტყვების შეცდომის მაჩვენებელი (WER) Open ASR Leaderboard-ის 8 სტანდარტულ მონაცემთა ნაკრებზე, მათ შორის AMI, GigaSpeech, LibriSpeech (Clean და Other), SPGISpeech, Tedlium, VoxPopuli და Earnings22. ეს მონაცემთა ნაკრებები მოიცავს მრავალფეროვან დომენებსა და ჩაწერის პირობებს, რაც უზრუნველყოფს განზოგადებისა და რეალურ სამყაროში ტრანსკრიფციის ხარისხის მყარ შეფასებას. WER ზომავს ტრანსკრიფციის სიზუსტეს არასწორად პროგნოზირებული სიტყვების პროცენტული მაჩვენებლის გამოთვლით (ჩასმა, წაშლა ან ჩანაცვლება); დაბალი WER უკეთეს შესრულებას ნიშნავს. სამივე Whisper ვარიანტი ინარჩუნებს WER-ის შესრულებას, რომელიც შედარებადია მათ Transformer-ის საბაზისო ვერსიებთან. ინფერენსის ეფექტურობის შესაფასებლად, ჩვენ ავიღეთ ნიმუშები rev16 გრძელვადიანი მონაცემთა ნაკრებიდან, რომელიც შეიცავს 45 წუთზე მეტი ხანგრძლივობის აუდიო სეგმენტებს — რაც წარმოადგენს რეალური ტრანსკრიფციის სამუშაო დატვირთვას, როგორიცაა შეხვედრები, პოდკასტები ან ინტერვიუები. ჩვენ გავზომეთ რეალურ დროში ფაქტორი (RTFx), რომელიც განისაზღვრება როგორც აუდიოს ხანგრძლივობის თანაფარდობა ტრანსკრიფციის დროსთან, და საშუალო მაჩვენებელი გამოვთვალეთ ნიმუშების მიხედვით. ყველა მოდელი შეფასდა bfloat16-ში ერთ L4 GPU-ზე, თანმიმდევრული დეკოდირების პარამეტრების გამოყენებით (ენა, სხივის ზომა და პარტიის ზომა). თქვენ შეგიძლიათ განათავსოთ თქვენი საკუთარი ASR ინფერენსის კონვეიერი Hugging Face Endpoints-ის მეშვეობით. Endpoints საშუალებას აძლევს ყველას, ვისაც სურს AI მოდელების პროდუქტიულ გარემოში განთავსება, ეს გააკეთოს რამდენიმე პარამეტრის შევსებით. ის ასევე გამოირჩევა AI აპარატურის ყველაზე სრულყოფილი ფლოტით ბაზარზე, რათა დააკმაყოფილოს თქვენი მოთხოვნები ღირებულებისა და შესრულების თვალსაზრისით. ეს ყველაფერი პირდაპირ იმ ადგილიდან, სადაც AI საზოგადოება შენდება. დასაწყებად, არაფერია უფრო ადვილი, უბრალოდ აირჩიეთ მოდელი, რომლის განთავსებაც გსურთ: განთავსებული მოდელის საბოლოო წერტილზე ინფერენსის გაშვება შესაძლებელია Python-ში სულ რამდენიმე სტრიქონი კოდით, ასევე შეგიძლიათ გამოიყენოთ იგივე სტრუქტურა Javascript-ში ან ნებისმიერ სხვა ენაში, რომელშიც კომფორტულად გრძნობთ თავს. ამ ელვისებურად სწრაფი საბოლოო წერტილით, შესაძლებელია რეალურ დროში ტრანსკრიფციის აპლიკაციების შექმნა. სცადეთ ეს მაგალითი, რომელიც FastRTC-ით არის აგებული. უბრალოდ ისაუბრეთ თქვენს მიკროფონში და იხილეთ თქვენი საუბარი რეალურ დროში ტრანსკრიბირებული! Spaces-ის ადვილად დუბლირება შესაძლებელია, ასე რომ თავისუფლად შეგიძლიათ დუბლირება. ყოველივე ზემოთ აღნიშნული ხელმისაწვდომია საზოგადოების გამოსაყენებლად Hugging Face Hub-ზე ჩვენს სპეციალურ HF Endpoints ორგანიზაციაში. გახსენით საკითხები, შემოგვთავაზეთ გამოყენების შემთხვევები და წვლილი შეიტანეთ აქ: hfendpoints-images (ინფერენსის საბოლოო წერტილების სურათები).