ახალი ბენჩმარკი: Llama 2-ის განლაგების ოპტიმალური სტრატეგიები Amazon SageMaker-ზე
დიდი ენობრივი მოდელების (დემ) განლაგება გამოწვევებთან არის დაკავშირებული მათი გამოთვლითი მოთხოვნებისა და დაყოვნების საჭიროებების გამო. ამ პრობლემის გადასაჭრელად, შემუშავდა ყოვლისმომცველი ბენჩმარკი, რომელმაც შეაფასა Llama 2-ის 60-ზე მეტი განლაგების კონფიგურაცია Amazon SageMaker-ზე Hugging Face-ის დემ დასკვნის კონტეინერის გამოყენებით. კვლევამ მიზნად დაისახა ოპტიმალური სტრატეგიების მოძიება კომპანიებისთვის, რათა დააბალანსონ ხარჯები, გამტარუნარიანობა და დაყოვნება Llama 2-ის სხვადასხვა ზომისა და Amazo
დიდი ენობრივი მოდელების (დემ) და სხვა გენერაციული ხელოვნური ინტელექტის (AI) მოდელების განლაგება შეიძლება გამოწვევას წარმოადგენდეს მათი გამოთვლითი მოთხოვნებისა და დაყოვნების საჭიროებების გამო. იმისათვის, რომ სასარგებლო რეკომენდაციები მიგვეცა კომპანიებისთვის, რომლებიც Llama 2-ის Amazon SageMaker-ზე, Hugging Face-ის დემ დასკვნის კონტეინერით განლაგებას გეგმავენ, ჩვენ შევქმენით ყოვლისმომცველი ბენჩმარკი, რომელმაც Llama 2-ის 60-ზე მეტი სხვადასხვა განლაგების კონფიგურაცია გააანალიზა. ამ ბენჩმარკში ჩვენ შევაფასეთ Llama 2-ის სხვადასხვა ზომა Amazon EC2-ის ინსტანციის ტიპების დიაპაზონზე, სხვადასხვა დატვირთვის დონით. ჩვენი მიზანი იყო დაყოვნების (მილიწამი ტოკენზე) და გამტარუნარიანობის (ტოკენი წამში) გაზომვა, რათა გვეპოვა განლაგების ოპტიმალური სტრატეგიები სამი გავრცელებული გამოყენების შემთხვევისთვის: იმისათვის, რომ ეს ბენჩმარკი ყოფილიყო სამართლიანი, გამჭვირვალე და რეპროდუცირებადი, ჩვენ ვუზიარებთ ყველა აქტივს, კოდს და მონაცემს, რომელიც გამოვიყენეთ და შევაგროვეთ. ვიმედოვნებთ, რომ მომხმარებლებს შეეძლებათ დემ-ების და Llama 2-ის ეფექტურად და ოპტიმალურად გამოყენება მათი საჭიროებების შესაბამისად. სანამ ბენჩმარკსა და მონაცემებზე გადავიდოდეთ, განვიხილოთ ტექნოლოგიები და მეთოდები, რომლებიც გამოვიყენეთ. Hugging Face LLM DLC არის სპეციალურად შექმნილი დასკვნის კონტეინერი, რომელიც დემ-ების უსაფრთხო და მართვად გარემოში მარტივად განლაგების საშუალებას იძლევა. DLC-ს საფუძვლად უდევს Text Generation Inference (TGI), ღია კოდის, სპეციალურად შექმნილი გადაწყვეტა დემ-ების განლაგებისა და მომსახურებისთვის. TGI უზრუნველყოფს მაღალპროდუქტიულ ტექსტის გენერაციას ტენზორული პარალელიზმისა და დინამიური ბეჩინგის გამოყენებით ყველაზე პოპულარული ღია კოდის დემ-ებისთვის, მათ შორის StarCoder, BLOOM, GPT-NeoX, Falcon, Llama და T5. VMware, IBM, Grammarly, Open-Assistant, Uber, Scale AI და მრავალი სხვა უკვე იყენებს Text Generation Inference-ს. Llama 2 არის Meta-ს მიერ შექმნილი დემ-ების ოჯახი, გაწვრთნილი 2 ტრილიონ ტოკენზე. Llama 2 სამი ზომისაა – 7B, 13B და 70B პარამეტრი – და შემოაქვს მნიშვნელოვანი გაუმჯობესებები, როგორიცაა კონტექსტის უფრო გრძელი სიგრძე, კომერციული ლიცენზირება და ოპტიმიზებული ჩატის შესაძლებლობები გაძლიერებითი სწავლის მეშვეობით, Llama (1)-თან შედარებით. თუ გსურთ მეტი გაიგოთ Llama 2-ის შესახებ, იხილეთ ეს ბლოგ პოსტი. GPTQ არის ვარჯიშის შემდგომი კვანტიზაციის მეთოდი დემ-ების, როგორიცაა GPT, შესაკუმშად. GPTQ შეკუმშავს GPT (დეკოდერის) მოდელებს მოდელში თითოეული წონის შესანახად საჭირო ბიტების რაოდენობის შემცირებით, 32 ბიტიდან მხოლოდ 3-4 ბიტამდე. ეს ნიშნავს, რომ მოდელი გაცილებით ნაკლებ მეხსიერებას იკავებს და შეუძლია იმუშაოს ნაკლებ აპარატურაზე, მაგ. ერთი GPU 13B Llama 2 მოდელებისთვის. GPTQ ცალკე აანალიზებს მოდელის თითოეულ ფენას და მიახლოებით აფასებს წონებს საერთო სიზუსტის შესანარჩუნებლად. თუ გსურთ მეტი გაიგოთ და როგორ გამოიყენოთ ის, იხილეთ „ღია დემ-ების ოპტიმიზაცია GPTQ-სა და Hugging Face Optimum-ის გამოყენებით“. Llama 2-ის რეალური მუშაობის შესაფასებლად, ჩვენ გამოვცადეთ 3 მოდელის ზომა (7B, 13B, 70B პარამეტრი) ოთხ სხვადასხვა ინსტანციის ტიპზე ოთხი სხვადასხვა დატვირთვის დონით, რის შედეგადაც მივიღეთ 60 სხვადასხვა კონფიგურაცია. როგორც მეტრიკა, გამოვიყენეთ გამტარუნარიანობა და დაყოვნება. ჩვენ გამოვიყენეთ ესენი Llama-ს მუშაობის შესაფასებლად სხვადასხვა კონფიგურაციებში, რათა გაგვეგო სარგებელი და კომპრომისები. თუ გსურთ თავად გაუშვათ ბენჩმარკი, ჩვენ შევქმენით Github-ის საცავი. ბენჩმარკის სრული მონაცემები შეგიძლიათ იხილოთ Amazon SageMaker Benchmark: TGI 1.0.3 Llama 2 ფურცელში. ნედლი მონაცემები ხელმისაწვდომია GitHub-ზე. თუ ყველა დეტალი გაინტერესებთ, გირჩევთ, ღრმად ჩაუღრმავდეთ მოწოდებულ ნედლ მონაცემებს. ბენჩმარკის საფუძველზე, ჩვენ გთავაზობთ კონკრეტულ რეკომენდაციებს დემ-ის ოპტიმალური განლაგებისთვის, თქვენი პრიორიტეტებიდან გამომდინარე ხარჯებს, გამტარუნარიანობასა და დაყოვნებას შორის, Llama 2-ის ყველა მოდელის ზომისთვის. შენიშვნა: რეკომენდაციები ეფუძნება ჩვენ მიერ შემოწმებულ კონფიგურაციას. მომავალში, სხვა გარემოებები ან აპარატურული შეთავაზებები, როგორიცაა Inferentia2, შეიძლება კიდევ უფრო ხარჯთეფექტური იყოს. ყველაზე ხარჯთეფექტური კონფიგურაცია ფოკუსირებულია შესრულებას (დაყოვნება და გამტარუნარიანობა) და ღირებულებას შორის სწორ ბალანსზე. მიზანია დახარჯულ დოლარზე მიღებული გამომავალი მაქსიმიზაცია. ჩვენ შევამოწმეთ შესრულება 5 ერთდროული მოთხოვნის დროს. ჩვენ ვხედავთ, რომ GPTQ გთავაზობთ საუკეთესო ხარჯთეფექტურობას, რაც მომხმარებლებს საშუალებას აძლევს Llama 2 13B განალაგონ ერთ GPU-ზე. საუკეთესო გამტარუნარიანობის კონფიგურაცია მაქსიმიზირებს წამში გენერირებული ტოკენების რაოდენობას. ეს შეიძლება დაკავშირებული იყოს საერთო დაყოვნების შემცირებასთან, რადგან უფრო მეტ ტოკენს ერთდროულად ამუშავებთ. ჩვენ განვიხილეთ ყველაზე მაღალი ტოკენი წამში შესრულება ოცი ერთდროული მოთხოვნის დროს, ინსტანციის ღირებულების გათვალისწინებით. ყველაზე მაღალი გამტარუნარიანობა დაფიქსირდა Llama 2 13B-ისთვის ml.p4d.24xlarge ინსტანციაზე 688 ტოკენი/წამში. საუკეთესო დაყოვნების კონფიგურაცია მინიმუმამდე ამცირებს ერთი ტოკენის გენერირებისთვის საჭირო დროს. დაბალი დაყოვნება მნიშვნელოვანია რეალურ დროში გამოყენების შემთხვევებისთვის და მომხმარებლისთვის კარგი გამოცდილების შესაქმნელად, მაგ. ჩატის აპლიკაციებისთვის. ჩვენ განვიხილეთ ყველაზე დაბალი მედიანა მილიწამი ტოკენზე 1 ერთდროული მოთხოვნის დროს. ყველაზე დაბალი საერთო დაყოვნება დაფიქსირდა Llama 2 7B-ისთვის ml.g5.12xlarge ინსტანციაზე 16.8 მილიწამი/ტოკენზე. ამ ბენჩმარკში ჩვენ გამოვცადეთ Llama 2-ის 60 კონფიგურაცია Amazon SageMaker-ზე. ხარჯთეფექტური განლაგებისთვის, აღმოჩნდა, რომ 13B Llama 2 GPTQ-ით g5.2xlarge-ზე უზრუნველყოფს 71 ტოკენს/წამში საათში $1.55 ღირებულებით. მაქსიმალური გამტარუნარიანობისთვის, 13B Llama 2-მა მიაღწია 296 ტოკენს/წამში ml.g5.12xlarge-ზე $2.21-ად 1M ტოკენზე. და...
თეგები:
#ხელოვნური ინტელექტი
#დიდი ენობრივი მოდელები
#hugging face
#ხარჯთეფექტურობა
#amazon sagemaker
#ბენჩმარკინგი
#გამტარუნარიანობა
#llama 2
#დაყოვნება
#gptq
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები