Habana Gaudi2-ის რეკორდული სისწრაფე BridgeTower-ის დახვეწისას: A100-ზე 2.5-ჯერ, H100-ზე 1.4-ჯერ სწრაფი
უახლესი კვლევის მიხედვით, Habana Gaudi2-ზე Optimum Habana v1.7-ის გამოყენებით, შესაძლებელია BridgeTower ხედვა-ენის მოდელის დახვეწის პროცესის მნიშვნელოვნად დაჩქარება. ეს მიღწევა, რომელიც A100-თან შედარებით 2.5-ჯერ, ხოლო H100-თან შედარებით 1.4-ჯერ ზრდის სისწრაფეს, ეფუძნება აპარატურულად აჩქარებულ მონაცემთა ჩატვირთვას. ეს ტექნიკები ნებისმიერ სხვა სამუშაო დატვირთვასაც ესადაგება, სადაც მონაცემთა ჩატვირთვა წარმოადგენს შეფერხებას, რაც ხედვის მოდელებისთვის ხშირია.
Optimum Habana v1.7-ის გამოყენებით Habana Gaudi2-ზე, BridgeTower-ის, უახლესი ხედვა-ენის მოდელის, დახვეწისას მიღწეულია 2.5-ჯერადი აჩქარება A100-თან შედარებით და 1.4-ჯერადი აჩქარება H100-თან შედარებით. ეს შესრულების გაუმჯობესება ეფუძნება აპარატურულად აჩქარებულ მონაცემთა ჩატვირთვას, რათა მაქსიმალურად იქნას გამოყენებული მოწყობილობების შესაძლებლობები. ეს ტექნიკები გამოიყენება ნებისმიერი სხვა სამუშაო დატვირთვისთვისაც, სადაც მონაცემთა ჩატვირთვა შეფერხებას ქმნის, რაც ხედვის მოდელების მრავალი ტიპისთვის ხშირია. ეს პოსტი გაგაცნობთ პროცესსა და ბენჩმარკს, რომელიც გამოვიყენეთ BridgeTower-ის დახვეწის შესადარებლად Habana Gaudi2-ზე, Nvidia H100-ზე და Nvidia A100 80GB-ზე. ის ასევე აჩვენებს, თუ რამდენად მარტივია ამ ფუნქციების გამოყენება Transformer-ზე დაფუძნებულ მოდელებში.
ბოლო დროს, ხედვა-ენის (VL) მოდელებმა უდიდესი მნიშვნელობა შეიძინეს და დომინირებენ მრავალ VL ამოცანაში. ყველაზე გავრცელებული მიდგომები იყენებენ უნი-მოდალურ ენკოდერებს, რათა მოახდინონ წარმოდგენების ამოღება შესაბამისი მოდალობებიდან. შემდეგ ეს წარმოდგენები ან ერთიანდება, ან გადაეცემა ჯვარედინი-მოდალურ ენკოდერს. VL წარმოდგენების სწავლისას არსებული შესრულების ზოგიერთი შეზღუდვისა და ლიმიტის ეფექტურად დასაძლევად, BridgeTower წარმოადგენს მრავალ ხიდის ფენას, რომლებიც კავშირს ამყარებენ უნი-მოდალური ენკოდერების ზედა ფენებსა და ჯვარედინი-მოდალური ენკოდერის თითოეულ ფენას შორის. ეს შესაძლებელს ხდის ეფექტურ "ქვემოდან-ზემოთ" ჯვარედინი-მოდალურ შესაბამისობასა და შერწყმას ვიზუალურ და ტექსტურ წარმოდგენებს შორის ჯვარედინი-მოდალური ენკოდერის სხვადასხვა სემანტიკურ დონეზე. მხოლოდ 4 მილიონი სურათით წინასწარ გაწვრთნილი (იხილეთ დეტალები ქვემოთ), BridgeTower აღწევს უახლეს შესრულებას სხვადასხვა შემდგომ ხედვა-ენის ამოცანაში. კერძოდ, BridgeTower აღწევს 78.73% სიზუსტეს VQAv2 test-std ნაკრებზე, რითაც 1.09%-ით უსწრებს წინა უახლეს მოდელს (METER) იგივე წინასწარი გაწვრთნის მონაცემების, და თითქმის უმნიშვნელო დამატებითი პარამეტრებისა და გამოთვლითი ხარჯების გამოყენებით. აღსანიშნავია, რომ მოდელის შემდგომი მასშტაბირებისას, BridgeTower აღწევს 81.15% სიზუსტეს, რითაც აჭარბებს მოდელებს, რომლებიც წესრიგით უფრო დიდ მონაცემთა ნაკრებებზეა წინასწარ გაწვრთნილი.
NVIDIA H100 Tensor Core GPU არის Nvidia GPU-ების უახლესი და ყველაზე სწრაფი თაობა. ის მოიცავს სპეციალურ Transformer Engine-ს, რომელიც იძლევა fp8 შერეული სიზუსტის გაშვებების საშუალებას. ერთ მოწყობილობას აქვს 80GB მეხსიერება. Nvidia A100 Tensor Core GPU მოიცავს Tensor Core ტექნოლოგიის მე-3 თაობას. ეს კვლავაც ყველაზე სწრაფი GPUა, რომელსაც ღრუბლოვანი სერვისების უმეტეს პროვაიდერთან შეხვდებით. ჩვენ აქ ვიყენებთ 80GB მეხსიერების ვარიანტს, რომელიც ასევე უფრო სწრაფ მეხსიერების გამტარობას გვთავაზობს, ვიდრე 40GB ვარიანტი. Habana Gaudi2 არის ხელოვნური ინტელექტის აპარატურული აქსელერატორის მეორე თაობა, რომელიც Habana Labs-ის მიერაა შექმნილი. ერთი სერვერი შეიცავს 8 აქსელერატორულ მოწყობილობას, რომლებსაც HPU-ები ეწოდებათ და თითოეულს 96GB მეხსიერება აქვს. ჩვენი წინა ბლოგპოსტში იხილეთ უფრო დეტალური შესავალი და გზამკვლევი, თუ როგორ მიიღოთ მასზე წვდომა Intel Developer Cloud-ის მეშვეობით. ბაზარზე არსებული მრავალი AI აქსელერატორისგან განსხვავებით, გაუმჯობესებული ფუნქციების გამოყენება ძალიან მარტივია Gaudi2-ის Optimum Habana-სთან ერთად მაქსიმალური ეფექტურობისთვის, რაც მომხმარებლებს საშუალებას აძლევს Transformer-თან თავსებადი სკრიპტები Gaudi-ზე გადაიტანონ მხოლოდ 2-ხაზიანი ცვლილებით.
ტრენინგის ბენჩმარკისთვის, ჩვენ ვაპირებთ BridgeTower Large-ის 866 მილიონი პარამეტრისგან შემდგარი ქფუნქციონირების წერტილის (checkpoint) დახვეწას. ეს ქფუნქციონირების წერტილი წინასწარ იყო გაწვრთნილი ინგლისურ ენაზე, ნიღბიანი ენის მოდელირების, სურათ-ტექსტის შესაბამისობისა და სურათ-ტექსტის კონტრასტული დანაკარგის გამოყენებით Conceptual Captions-ზე, SBU Captions-ზე, MSCOCO Captions-სა და Visual Genome-ზე. ჩვენ ამ ქფუნქციონირების წერტილს შემდგომში დავხვეწავთ New Yorker Caption Contest-ის მონაცემთა ნაკრებზე, რომელიც მოიცავს The New Yorker-ის მულტფილმებსა და ყველაზე მეტი ხმის მქონე წარწერებს. ჰიპერპარამეტრები ყველა აქსელერატორისთვის იგივეა. ჩვენ გამოვიყენეთ 48 ნიმუშის პაკეტის ზომა თითოეული მოწყობილობისთვის. ჰიპერპარამეტრების ნახვა შეგიძლიათ აქ Gaudi2-ისთვის და იქ A100-ისთვის.
როდესაც სურათების შემცველ მონაცემთა ნაკრებებთან მუშაობისას, მონაცემთა ჩატვირთვა ხშირად წარმოადგენს ვიწრო ყელს, რადგან ბევრი ძვირადღირებული ოპერაცია გამოითვლება CPU-ზე (სურათის დეკოდირება, სურათის გაუმჯობესება) და შემდეგ სრული სურათები იგზავნება სავარჯიშო მოწყობილობებზე. იდეალურ შემთხვევაში, ჩვენ გვსურს მხოლოდ ნედლი ბაიტების გაგზავნა მოწყობილობებზე და შემდეგ დეკოდირებისა და სხვადასხვა სურათის ტრანსფორმაციის შესრულება უშუალოდ მოწყობილობაზე. მაგრამ ჯერ ვნახოთ, როგორ მარტივად გამოვყოთ მეტი რესურსი მონაცემთა ჩატვირთვისთვის თქვენი გაშვებების დასაჩქარებლად. როდესაც სურათის ჩატვირთვა ხდება CPU-ზე, მისი დაჩქარების სწრაფი გზა იქნება მონაცემთა ჩატვირთვისთვის მეტი ქვეპროცესის გამოყოფა. ეს ძალიან მარტივია Transformers-ის TrainingArguments-ით (ან მისი Optimum Habana ეკვივალენტით GaudiTrainingArguments): შეგიძლიათ გამოიყენოთ dataloader_num_workers=N არგუმენტი CPU-ზე მონაცემთა ჩატვირთვისთვის გამოყოფილი ქვეპროცესების (N) რაოდენობის დასადგენად. ნაგულისხმევი მნიშვნელობაა 0, რაც ნიშნავს, რომ მონაცემები იტვირთება მთავარ პროცესში. ეს შეიძლება არ იყოს ოპტიმალური, რადგან მთავარ პროცესს ბევრი რამის მართვა უწევს. ჩვენ შეგვიძლია დავაყენოთ 1-ზე, რათა გვქონდეს ერთი სრულად გამოყოფილი ქვეპროცესი მონაცემთა ჩატვირთვისთვის. როდესაც რამდენიმე ქვეპროცესი გამოიყოფა, თითოეული მათგანი პასუხისმგებელი იქნება პაკეტის მომზადებაზე. ეს ნიშნავს, რომ ოპერატიული მეხსიერების მოხმარება გაიზრდება მუშაკების რაოდენობასთან ერთად. ერთი რეკომენდაცია იქნება მისი CPU ბირთვების რაოდენობაზე დაყენება, მაგრამ ეს ბირთვები შეიძლება სრულად თავისუფალი არ იყოს, ამიტომ მოგიწევთ ექსპერიმენტები...
თეგები:
#მანქანური სწავლება
#დახვეწა
#nvidia a100
#ხედვა-ენის მოდელები
#ai აქსელერატორი
#nvidia h100
#habana gaudi2
#bridgetower
#პერფორმანსი
#მონაცემთა ჩატვირთვა
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი