ტრანსფორმერული მოდელები წარმოებაში: გამოწვევები და Optimum-ის გადაწყვეტა
ტრანსფორმერული მოდელები, რომლებიც თანამედროვე ხელოვნური ინტელექტის განუყოფელი ნაწილია, ფართოდ გამოიყენება ტექნოლოგიური გიგანტების მიერ ისეთ სფეროებში, როგორიცაა ავტოპილოტი, ენის დამუშავება და ვიზუალური ამოცნობა. თუმცა, ამ მასიური მოდელების ეფექტურად წარმოებაში დანერგვა სერიოზულ გამოწვევებს აწყდება, განსაკუთრებით იმ გუნდებისთვის, რომლებსაც არ გააჩნიათ შეუზღუდავი რესურსები. Hugging Face-ის ახალი ღია კოდის ბიბლიოთეკა Optimum, Intel® Neural Compressor-თან თანამშრომლობით, მიზნად ისახავს ამ პროცესის გ
რა აქვთ საერთო Tesla-ს, Google-ს, Microsoft-სა და Facebook-ს? მრავალი რამ, მაგრამ ერთ-ერთი მათგანია ის, რომ ისინი ყოველდღიურად მილიარდობით ტრანსფორმერული მოდელის პროგნოზს ამუშავებენ. ტრანსფორმერები გამოიყენება AutoPilot-ში Tesla-ს მართვისთვის (გილოცავთ!), Gmail-ში წინადადებების დასასრულებლად, Facebook-ში პოსტების მყისიერად თარგმნისთვის, Bing-ში კი ბუნებრივი ენის შეკითხვებზე პასუხის გასაცემად. ტრანსფორმერებმა მნიშვნელოვნად გააუმჯობესეს მანქანური სწავლების მოდელების სიზუსტე, დაიპყრეს ბუნებრივი ენის დამუშავების (NLP) სფერო და ახლა ფართოვდებიან სხვა მოდალობებზეც, დაწყებული მეტყველებითა და ხედვით.
მაგრამ ამ მასიური მოდელების წარმოებაში გაშვება და მათი სწრაფი მუშაობის უზრუნველყოფა ფართო მასშტაბით უზარმაზარი გამოწვევაა ნებისმიერი მანქანური სწავლების საინჟინრო გუნდისთვის. რა მოხდება, თუ თქვენ არ გყავთ ასობით მაღალკვალიფიციური მანქანური სწავლების ინჟინერი ხელფასზე, როგორც ზემოთ ჩამოთვლილ კომპანიებს?
ჩვენი ახალი ღია კოდის ბიბლიოთეკა Optimum-ის საშუალებით, მიზნად ვისახავთ შევქმნათ საბოლოო ინსტრუმენტარიუმი ტრანსფორმერების წარმოების ეფექტურობისთვის და უზრუნველვყოთ მაქსიმალური ეფექტურობა მოდელების სპეციფიკურ აპარატურაზე გაწვრთნისა და გაშვებისთვის. მოდელების ოპტიმალური მუშაობის, გაწვრთნისა და მომსახურების მისაღწევად, მოდელის აჩქარების ტექნიკა კონკრეტულად უნდა იყოს თავსებადი მიზნობრივ აპარატურასთან. თითოეული აპარატურული პლატფორმა გვთავაზობს სპეციფიკურ პროგრამულ ინსტრუმენტებს, ფუნქციებსა და პარამეტრებს, რომლებსაც უზარმაზარი გავლენა შეიძლება ჰქონდეთ შესრულებაზე. ანალოგიურად, მოდელის აჩქარების მოწინავე ტექნიკის, როგორიცაა სიჩოხჩოხე (sparsity) და კვანტიზაცია (quantization), გამოსაყენებლად, ოპტიმიზებული ბირთვები (kernels) უნდა იყოს თავსებადი სილიკონის ოპერატორებთან და სპეციფიკური იყოს ნერვული ქსელის გრაფისთვის, რომელიც მოდელის არქიტექტურიდან გამომდინარეობს. ამ სამგანზომილებიან თავსებადობის მატრიცაში ჩაღრმავება და მოდელის აჩქარების ბიბლიოთეკების გამოყენება შრომატევადი სამუშაოა, რისი გამოცდილებაც მანქანური სწავლების მხოლოდ რამდენიმე ინჟინერს აქვს. Optimum მიზნად ისახავს ამ სამუშაოს გამარტივებას, უზრუნველყოფს შესრულების ოპტიმიზაციის ინსტრუმენტებს, რომლებიც მიზნად ისახავს ეფექტურ AI აპარატურას, შექმნილია ჩვენს აპარატურულ პარტნიორებთან თანამშრომლობით და მანქანური სწავლების ინჟინრებს ML ოპტიმიზაციის ოსტატებად აქცევს.
Transformers ბიბლიოთეკის საშუალებით, ჩვენ გავუადვილეთ მკვლევრებსა და ინჟინრებს უახლესი მოდელების გამოყენება, რაც აბსტრაქტულს ხდიდა ჩარჩოების, არქიტექტურებისა და კონვეიერების სირთულეს. Optimum ბიბლიოთეკის საშუალებით, ჩვენ ვუადვილებთ ინჟინრებს მათ ხელთ არსებული აპარატურული მახასიათებლების სრულად გამოყენებას, რაც აბსტრაქტულს ხდის მოდელის აჩქარების სირთულეს აპარატურულ პლატფორმებზე.
წინასწარ გაწვრთნილმა ენობრივმა მოდელებმა, როგორიცაა BERT, მიაღწიეს უახლეს შედეგებს ბუნებრივი ენის დამუშავების (NLP) ამოცანების ფართო სპექტრზე. სხვა ტრანსფორმერზე დაფუძნებულმა მოდელებმა, როგორიცაა ViT და Speech2Text, მიაღწიეს უახლეს შედეგებს შესაბამისად კომპიუტერული ხედვისა და მეტყველების ამოცანებზე: ტრანსფორმერები ყველგანაა მანქანური სწავლების სამყაროში და აქ დარჩებიან. თუმცა, ტრანსფორმერზე დაფუძნებული მოდელების წარმოებაში გაშვება შეიძლება რთული და ძვირი იყოს, რადგან მათ ბევრი გამოთვლითი სიმძლავრე სჭირდებათ სამუშაოდ. ამ პრობლემის გადასაჭრელად მრავალი ტექნიკა არსებობს, რომელთაგან ყველაზე პოპულარულია კვანტიზაცია. სამწუხაროდ, უმეტეს შემთხვევაში მოდელის კვანტიზაცია დიდ შრომას მოითხოვს, მრავალი მიზეზის გამო:
ეს ნაწილი შეიძლება იყოს ძალიან შრომატევადი, რადგან ისეთი ჩარჩოები, როგორიცაა PyTorch, მუშაობს „eager“ რეჟიმში, რაც ნიშნავს, რომ ზემოთ ხსენებული ცვლილებები თავად მოდელის იმპლემენტაციას უნდა დაემატოს. PyTorch ახლა გვთავაზობს ინსტრუმენტს სახელწოდებით torch.fx, რომელიც საშუალებას გაძლევთ თვალყური ადევნოთ და გარდაქმნათ თქვენი მოდელი მისი იმპლემენტაციის რეალურად შეცვლის გარეშე, მაგრამ მისი გამოყენება რთულია, როდესაც თვალყურის დევნება თავდაპირველად არ არის მხარდაჭერილი თქვენი მოდელისთვის. რეალური რედაქტირების გარდა, ასევე აუცილებელია იმის გარკვევა, თუ მოდელის რომელი ნაწილები საჭიროებს რედაქტირებას, რომელ ოპერაციებს აქვთ ხელმისაწვდომი კვანტიზებული ბირთვული ეკვივალენტი და რომელ ოპერაციებს – არა და ა.შ. მოდელის რედაქტირების შემდეგ, მრავალი პარამეტრია გამოსაყენებელი საუკეთესო კვანტიზაციის პარამეტრების მოსაძებნად: დააბალანსეთ კომპრომისი კვანტიზაციასა და სიზუსტის მისაღებ დანაკარგს შორის. ექსპორტირება გაუკეთეთ კვანტიზებულ მოდელს მიზნობრივი მოწყობილობისთვის. მიუხედავად იმისა, რომ PyTorch-მა და TensorFlow-მა დიდი პროგრესი განიცადეს კვანტიზაციის გამარტივებაში, ტრანსფორმერზე დაფუძნებული მოდელების სირთულეები ართულებს მოწოდებული ხელსაწყოების თავდაპირველად გამოყენებას და ისეთი რამის მუშაობას, რაც დიდ ძალისხმევას არ მოითხოვს.
Intel® Neural Compressor (ადრე მოხსენიებული, როგორც დაბალი სიზუსტის ოპტიმიზაციის ინსტრუმენტი ან LPOT) არის ღია კოდის Python ბიბლიოთეკა, რომელიც შექმნილია მომხმარებლების დასახმარებლად დაბალი სიზუსტის ინფერენციის გადაწყვეტილებების დანერგვაში. ეს უკანასკნელი იყენებს დაბალი სიზუსტის რეცეპტებს ღრმა სწავლების მოდელებისთვის, რათა მიაღწიოს პროდუქტის ოპტიმალურ მიზნებს, როგორიცაა ინფერენციის შესრულება და მეხსიერების გამოყენება, მოსალოდნელი შესრულების კრიტერიუმებით. Neural Compressor მხარს უჭერს ვარჯიშის შემდგომ კვანტიზაციას, კვანტიზაციის გათვალისწინებით ვარჯიშსა და დინამიურ კვანტიზაციას. კვანტიზაციის მიდგომის, მიზნისა და შესრულების კრიტერიუმების დასაზუსტებლად, მომხმარებელმა უნდა მიაწოდოს კონფიგურაციის YAML ფაილი, რომელიც აზუსტებს მორგების პარამეტრებს. კონფიგურაციის ფაილი შეიძლება განთავსდეს Hugging Face-ის Model Hub-ზე, ან მისი მითითება შესაძლებელია ლოკალური დირექტორიის გზის მეშვეობით. Optimum ფოკუსირებული იქნება ოპტიმალური წარმოების შესრულების მიღწევაზე სპეციალიზებულ აპარატურაზე, სადაც პროგრამული უზრუნველყოფა და აპარატურული აჩქარება
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#პროდუქტიულობა
#ოპტიმიზაცია
#ტრანსფორმერები
#ღრმა სწავლება
#აპარატურა
#კვანტიზაცია
#optimum
#neural compressor
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები