Hugging Face Infinity: ტრანსფორმერული მოდელების ოპტიმალური განთავსება Intel Xeon CPU-ებზე
Hugging Face Infinity არის კონტეინერიზებული გადაწყვეტა, რომელიც საშუალებას აძლევს კომპანიებს ეფექტურად განათავსონ ტრანსფორმერული მოდელები წარმოებაში დაბალი ლატენტურობითა და მაღალი გამტარუნარიანობით. ეს ბლოგ პოსტი წარმოადგენს დეტალურ წარმადობის შედეგებს Infinity-ის უახლესი თაობის Intel Xeon CPU-ებზე გაშვებისას (კერძოდ, Ice Lake-ზე დაფუძნებული EC2 C6i ინსტანსებზე), რაც უზრუნველყოფს ოპტიმალურ ღირებულებას, ეფექტურობასა და ლატენტურობას თქვენი Transformer-ის განთავსებისთვის.
ჩვენი ღია კოდის ოპტიმიზაციის ბიბლიოთეკები, 🤗 Optimum Intel და 🤗 Optimum ONNX Runtime, უზრუნველყოფენ მაქსიმალურ ეფექტურობას მოდელების გაწვრთნისა და ინფერენსისთვის გაშვებისას. Hugging Face Expert Acceleration Program არის კომერციული სერვისი, რომელიც საშუალებას აძლევს Hugging Face-ის ექსპერტებს, იმუშაონ უშუალოდ თქვენს გუნდთან, რათა დააჩქარონ თქვენი მანქანური სწავლების განვითარების გეგმა და მოდელები.
ტრანსფერულმა სწავლებამ შეცვალა მანქანური სწავლება, მიაღწია სიზუსტის ახალ დონეებს ბუნებრივი ენის დამუშავებიდან (NLP) აუდიო და კომპიუტერული ხედვის ამოცანებამდე. Hugging Face-ში ჩვენ ვმუშაობთ იმაზე, რომ ეს ახალი, რთული მოდელები და დიდი ჩექპოინტები მაქსიმალურად ხელმისაწვდომი და გამოსაყენებელი გავხადოთ. თუმცა, მიუხედავად იმისა, რომ მკვლევრები და მონაცემთა მეცნიერები გადავიდნენ ტრანსფორმერების ახალ სამყაროზე, ცოტა კომპანიამ მოახერხა ამ დიდი, რთული მოდელების ფართომასშტაბიანი წარმოებაში განთავსება. მთავარი შეფერხება არის პროგნოზირების ლატენტურობა, რამაც შეიძლება დიდი განთავსებები ძვირი გახადოს და რეალურ დროში გამოყენების შემთხვევები არაპრაქტიკული. ამ პრობლემის გადაჭრა რთული საინჟინრო გამოწვევაა ნებისმიერი მანქანური სწავლების საინჟინრო გუნდისთვის და მოითხოვს მოწინავე ტექნიკის გამოყენებას მოდელების აპარატურულ დონეზე ოპტიმიზაციისთვის.
Hugging Face Infinity-ით, ჩვენ გთავაზობთ კონტეინერიზებულ გადაწყვეტას, რომელიც ამარტივებს დაბალი ლატენტურობის, მაღალი გამტარუნარიანობის, აპარატურულად აჩქარებული ინფერენსის კონვეიერების განთავსებას ყველაზე პოპულარული ტრანსფორმერული მოდელებისთვის. კომპანიებს შეუძლიათ მიიღონ როგორც ტრანსფორმერების სიზუსტე, ასევე ეფექტურობა, რომელიც საჭიროა დიდი მოცულობის განთავსებებისთვის, ყველაფერი მარტივად გამოსაყენებელ პაკეტში. ამ ბლოგ პოსტში გვინდა გაგიზიაროთ Infinity-ის წარმადობის დეტალური შედეგები, რომელიც გაშვებულია Intel Xeon CPU-ების უახლეს თაობაზე, რათა მივაღწიოთ ოპტიმალურ ღირებულებას, ეფექტურობასა და ლატენტურობას თქვენი ტრანსფორმერული განთავსებებისთვის.
Hugging Face Infinity არის კონტეინერიზებული გადაწყვეტა მომხმარებლებისთვის, რათა განათავსონ სრულიად ოპტიმიზებული ინფერენსის კონვეიერები უახლესი ტრანსფორმერული მოდელებისთვის, ნებისმიერ ინფრასტრუქტურაზე. Hugging Face Infinity შედგება 2 ძირითადი სერვისისგან: Infinity Container სპეციალურად შექმნილია სამიზნე აპარატურულ არქიტექტურაზე გასაშვებად და აჩვენებს HTTP /predict ენდპოინტს ინფერენსის შესასრულებლად. Infinity Container შექმნილია 1 მოდელისა და 1 ამოცანის მოსამსახურებლად. ამოცანა შეესაბამება მანქანური სწავლების ამოცანებს, როგორც ეს განსაზღვრულია Transformers Pipelines-ის დოკუმენტაციაში. ამ ბლოგ პოსტის დაწერის მომენტისთვის, მხარდაჭერილი ამოცანები მოიცავს მახასიათებლების ამოღებას/დოკუმენტის ჩაშენებას, რანჟირებას, მიმდევრობის კლასიფიკაციას და ტოკენის კლასიფიკაციას. დამატებითი ინფორმაცია Hugging Face Infinity-ის შესახებ შეგიძლიათ იხილოთ hf.co/infinity-ზე, ხოლო თუ გსურთ მისი საკუთარი ხელით გამოცდა, შეგიძლიათ დარეგისტრირდეთ უფასო საცდელ ვერსიაზე hf.co/infinity-trial.
ინფერენსის წარმადობის ბენჩმარკები ხშირად მხოლოდ მოდელის შესრულებას ზომავს. ამ ბლოგ პოსტში, და Infinity-ის წარმადობის განხილვისას, ჩვენ ყოველთვის ვზომავთ სრულ კონვეიერს, მათ შორის წინასწარ დამუშავებას, პროგნოზირებას და შემდგომ დამუშავებას. გთხოვთ, გაითვალისწინოთ ეს შედეგების სხვა ლატენტურობის გაზომვებთან შედარებისას. როგორც ბენჩმარკის გარემო, ჩვენ გამოვიყენებთ Amazon EC2 C6i ინსტანსებს, რომლებიც წარმოადგენს გამოთვლით ოპტიმიზებულ ინსტანსებს, რომლებიც მუშაობენ Intel Xeon Scalable პროცესორების მე-3 თაობაზე. ეს ახალი Intel-ზე დაფუძნებული ინსტანსები იყენებენ Ice-lake პროცესის ტექნოლოგიას და მხარს უჭერენ Intel AVX-512, Intel Turbo Boost და Intel Deep Learning Boost-ს. მანქანური სწავლების დატვირთვებისთვის უმაღლესი წარმადობის გარდა, Intel Ice Lake C6i ინსტანსები გვთავაზობენ დიდ ღირებულება-წარმადობას და ჩვენი რეკომენდაციაა Infinity-ის Amazon Web Services-ზე განთავსებისთვის. დამატებითი ინფორმაციისთვის ეწვიეთ EC2 C6i ინსტანსის გვერდს.
BERT-ის მსგავსი მოდელების ბენჩმარკინგისას, ორი მეტრიკა ყველაზე მეტად არის მიღებული: ეს ორი მეტრიკა გამოყენებული იქნება Hugging Face Infinity-ის სხვადასხვა კონფიგურაციაში შესაფასებლად, რათა ამ ბლოგ პოსტში გავიგოთ უპირატესობები და კომპრომისები. ბენჩმარკის გასაშვებად, ჩვენ შევქმენით Infinity კონტეინერი EC2 C6i ინსტანსისთვის (Ice-lake) და ოპტიმიზაცია გავუკეთეთ DistilBERT მოდელს მიმდევრობის კლასიფიკაციისთვის Infinity Multiverse-ის გამოყენებით. ამ Ice-lake-ზე ოპტიმიზებულ Infinity Container-ს შეუძლია მიაღწიოს 34%-მდე უკეთეს ლატენტურობასა და გამტარუნარიანობას არსებულ Cascade-lake-ზე დაფუძნებულ ინსტანსებთან შედარებით, და 800%-მდე უკეთეს ლატენტურობასა და გამტარუნარიანობას Ice-lake-ზე გაშვებულ ვანილის ტრანსფორმერებთან შედარებით. ჩვენს მიერ შექმნილი ბენჩმარკი შედგება 192 სხვადასხვა ექსპერიმენტისა და კონფიგურაციისგან. ჩვენ ჩავატარეთ ექსპერიმენტები: თითოეულ ექსპერიმენტში, ჩვენ ვაგროვებთ მონაცემებს: ბენჩმარკის სრული მონაცემები შეგიძლიათ იხილოთ Google-ის ცხრილში: 🤗 Infinity: CPU Ice-Lake Benchmark.
ამ ბლოგ პოსტში, ჩვენ გამოვყოფთ ბენჩმარკის რამდენიმე შედეგს, მათ შორის საუკეთესო ლატენტურობისა და გამტარუნარიანობის კონფიგურაციებს. გარდა ამისა, ჩვენ განვათავსეთ DistilBERT მოდელი, რომელიც გამოვიყენეთ ბენჩმარკისთვის, როგორც API ენდპოინტი 2 ფიზიკურ ბირთვზე. თქვენ შეგიძლიათ გამოსცადოთ ის და მიიღოთ წარმოდგენა Infinity-ის წარმადობაზე. ქვემოთ ნახავთ curl ბრძანებას, თუ როგორ უნდა გააგზავნოთ მოთხოვნა ჰოსტირებულ ენდპოინტზე. API აბრუნებს x-compute-time HTTP ჰედერს, რომელიც შეიცავს სრული კონვეიერის ხანგრძლივობას. ქვემოთ შეგიძლიათ იხილოთ გამტარუნარიანობის შედარება Infinity-ის 2 ფიზიკურ ბირთვზე გაშვებისას, ბაჩის ზომით...
თეგები:
#cloud computing
#მანქანური სწავლება
#ოპტიმიზაცია
#intel xeon
#წარმადობა
#ინფერენსი
#ბენჩმარკი
#hugging face infinity
#transformer მოდელები
#ice lake
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი