PatchTSMixer: IBM Research-ისა და Hugging Face-ის რევოლუციური მოდელი დროითი სერიების მოდელირებისთვის
IBM Research-მა Hugging Face-თან ერთად წარმოადგინა PatchTSMixer, ინოვაციური მოდელი, რომელიც Transformers ბიბლიოთეკაშია ინტეგრირებული. ეს მოდელი შექმნილია მრავალვარიანტული დროითი სერიების ეფექტური მოდელირებისთვის, მსუბუქი შერევის გამოყენებით პაჩებს, არხებსა და დამალულ მახასიათებლებს შორის. PatchTSMixer მნიშვნელოვნად აღემატება არსებულ MLP და Transformer მოდელებს პროგნოზირებაში, აჩვენებს 8-60%-იან გაუმჯობესებას და ამცირებს მეხსიერების მოხმარებასა და შესრულების დროს. იგი მხარს უჭერს ტრანსფერულ სწავლ
ეფექტური ცნობადობისა და ღია კოდის პრინციპების პოპულარიზაციის მიზნით, IBM Research გაერთიანდა Hugging Face-ის გუნდთან, რათა წარმოადგინოს ეს მოდელი Transformers ბიბლიოთეკაში. Hugging Face-ის იმპლემენტაციაში, ჩვენ გთავაზობთ PatchTSMixer-ის შესაძლებლობებს, რათა უპრობლემოდ უზრუნველყოს მსუბუქი შერევა პაჩებს, არხებსა და დამალულ მახასიათებლებს შორის, მრავალვარიანტული დროითი სერიების ეფექტური მოდელირებისთვის. ის ასევე მხარს უჭერს ყურადღების სხვადასხვა მექანიზმებს, დაწყებული მარტივი დახურული ყურადღებიდან (gated attention) უფრო რთულ თვითყურადღების ბლოკებამდე (self-attention blocks), რომლებიც შესაბამისად შეიძლება მორგებული იქნას. მოდელი შესაძლებელია წინასწარ გაწვრთნა (pretrained) და შემდგომში გამოყენება სხვადასხვა შემდგომი ამოცანებისთვის, როგორიცაა პროგნოზირება, კლასიფიკაცია და რეგრესია. PatchTSMixer მნიშვნელოვნად აღემატება უახლეს (state-of-the-art) MLP და Transformer მოდელებს პროგნოზირებაში, 8-60%-იანი საკმაო სხვაობით. ის ასევე აღემატება Patch-Transformer მოდელების უახლეს ძლიერ ბენჩმარკებს (1-2%-ით), მეხსიერების და შესრულების დროის (runtime) მნიშვნელოვანი შემცირებით (2-3-ჯერ). დამატებითი დეტალებისთვის იხილეთ ნაშრომი. ამ ბლოგში, ჩვენ გაჩვენებთ PatchTSMixer-თან მუშაობის დაწყების მაგალითებს. პირველ რიგში, წარმოგიდგენთ PatchTSMixer-ის პროგნოზირების შესაძლებლობას Electricity მონაცემთა ნაკრებზე. შემდეგ, ვაჩვენებთ PatchTSMixer-ის ტრანსფერული სწავლის შესაძლებლობას, Electricity-ზე გაწვრთნილი მოდელის გამოყენებით ETTh2 მონაცემთა ნაკრებზე ნულოვანი სწავლების (zero-shot) პროგნოზირებისთვის. PatchTSMixer ყოფს მოცემულ შეყვანის მრავალვარიანტულ დროით სერიებს პაჩების ან ფანჯრების მიმდევრობებად. შემდგომში, ის გადასცემს სერიებს ჩაშენების (embedding) ფენას, რომელიც წარმოქმნის მრავალგანზომილებიან ტენზორს.
მრავალგანზომილებიანი ტენზორი შემდგომში გადაეცემა PatchTSMixer-ის ძირითად არქიტექტურას (backbone), რომელიც შედგება MLP Mixer ფენების მიმდევრობისგან. თითოეული MLP Mixer ფენა სწავლობს პაჩებსშორის, პაჩშიდა და არხთაშორის კორელაციებს პერმუტაციის და MLP ოპერაციების სერიის მეშვეობით.
PatchTSMixer ასევე იყენებს ნარჩენ კავშირებს (residual connections) და დახურულ ყურადღებას (gated attentions) მნიშვნელოვანი მახასიათებლების პრიორიტეტიზაციისთვის.
ამდენად, MLP Mixer ფენების მიმდევრობა ქმნის შემდეგ PatchTSMixer-ის ძირითად არქიტექტურას.
PatchTSMixer-ს აქვს მოდულური დიზაინი, რათა უპრობლემოდ დაუჭიროს მხარი როგორც ნიღბიანი დროითი სერიების წინასწარ გაწვრთნას (masked time series pretraining), ისე დროითი სერიების პირდაპირ პროგნოზირებას.
ამ დემოსთვის საჭიროა Hugging Face Transformers მოდელისთვის და IBM tsfm პაკეტი დამხმარე მონაცემთა წინასწარი დამუშავებისთვის. ორივე შეიძლება დაინსტალირდეს ქვემოთ მოცემული ნაბიჯების მიხედვით. აქ ჩვენ პირდაპირ ვაწვრთნით PatchTSMixer მოდელს Electricity მონაცემთა ნაკრებზე და ვაფასებთ მის მუშაობას. შემდეგ უჯრედში, გთხოვთ, შეასწოროთ შემდეგი პარამეტრები თქვენი აპლიკაციის შესაბამისად: შემდეგ, ჩვენ ვქმნით შემთხვევით ინიციალიზებულ PatchTSMixer მოდელს კონფიგურაციით. ქვემოთ მოცემული პარამეტრები აკონტროლებს არქიტექტურასთან დაკავშირებულ სხვადასხვა ჰიპერპარამეტრებს. პარამეტრების სრული დეტალებისთვის, გთხოვთ, იხილოთ დოკუმენტაცია. ჩვენ გირჩევთ, შეცვალოთ მხოლოდ შემდეგ უჯრედში მოცემული მნიშვნელობები. შემდეგ, შეგვიძლია გამოვიყენოთ Hugging Face Trainer კლასი მოდელის გასაწვრთნელად პირდაპირი პროგნოზირების სტრატეგიის საფუძველზე. ჯერ განვსაზღვრავთ TrainingArguments-ს, რომელიც ჩამოთვლის ტრენინგთან დაკავშირებულ სხვადასხვა ჰიპერპარამეტრებს, როგორიცაა ეპოქების რაოდენობა, სწავლის სიჩქარე და ა.შ. გაითვალისწინეთ, რომ PatchTSMixer-ისთვის ტრენინგისა და შეფასების დანაკარგი არის საშუალო კვადრატული შეცდომის (MSE) დანაკარგი. აქედან გამომდინარე, ჩვენ არ ვანგარიშობთ MSE მეტრიკას ცალკე არცერთ შემდგომ შეფასების ექსპერიმენტში. ჩვენ მივიღეთ MSE ქულა 0.128, რაც Electricity მონაცემებზე მიღებული უახლესი (SOTA) შედეგია. ამ სექციაში ვაჩვენებთ PatchTSMixer მოდელის ტრანსფერული სწავლის (transfer learning) შესაძლებლობას. ჩვენ ვიყენებთ Electricity მონაცემთა ნაკრებზე წინასწარ გაწვრთნილ მოდელს, რათა განვახორციელოთ ნულოვანი სწავლების (zero-shot) პროგნოზირება ETTh2 მონაცემთა ნაკრებზე. ტრანსფერული სწავლით ჩვენ ვგულისხმობთ, რომ ჯერ მოდელს ვაწვრთნით პროგნოზირების ამოცანისთვის წყაროს მონაცემთა ნაკრებზე (რაც ზემოთ გავაკეთეთ Electricity მონაცემთა ნაკრებზე). შემდეგ, ჩვენ გამოვიყენებთ წინასწარ გაწვრთნილ მოდელს ნულოვანი სწავლების პროგნოზირებისთვის სამიზნე მონაცემთა ნაკრებზე. ნულოვანი სწავლებით ვგულისხმობთ, რომ ვამოწმებთ მოდელის მუშაობას სამიზნე დომენში ყოველგვარი დამატებითი ტრენინგის გარეშე. ვიმედოვნებთ, რომ მოდელმა წინასწარი გაწვრთნისგან საკმარისი ცოდნა მიიღო, რომელიც შეიძლება გადავიდეს სხვა მონაცემთა ნაკრებზე. შემდგომში, ჩვენ ჩავატარებთ ხაზოვან გამოკვლევას (linear probing) და (შემდეგ) ზუსტ რეგულირებას (finetuning) წინასწარ გაწვრთნილი მოდელისთვის სამიზნე მონაცემთა სატრენინგო ნაწილზე, და გადავამოწმებთ პროგნოზირების ეფექტურობას სამიზნე მონაცემთა სატესტო ნაწილზე. ამ მაგალითში, წყაროს მონაცემთა ნაკრები არის Electricity, ხოლო სამიზნე მონაცემთა ნაკრები არის ETTh2. ყველა შეფასება ხორციელდება ETTh2 მონაცემთა სატესტო ნაწილზე: ნაბიჯი 1: პირდაპირ შეფასება Electricity-ზე წინასწარ გაწვრთნილი მოდელისთვის. ეს არის ნულოვანი სწავლების (zero-shot) შესრულება. ნაბიჯი 2: შეფასება ხაზოვანი გამოკვლევის (linear probing) შემდეგ. ნაბიჯი 3: შეფასება სრული ზუსტი რეგულირების (full finetuning) შემდეგ. ქვემოთ, ჩვენ ვტვირთავთ ETTh2 მონაცემთა ნაკრებს Pandas მონაცემთა ჩარჩოს (dataframe) სახით. შემდეგ, ვქმნით 3 დაყოფას ტრენინგის, ვალიდაციისა და ტესტირებისთვის. ამის შემდეგ, ვიყენებთ TimeSeriesPreprocessor კლასს, რათა მოვამზადოთ თითოეული დაყოფა მოდელისთვის. რადგან ვაპირებთ პროგნოზირების ეფექტურობის შემოწმებას პირდაპირ (out-of-the-box), ჩვენ ვტვირთავთ ზემოთ წინასწარ გაწვრთნილ მოდელს. როგორც ხედავთ, ვიღებთ საშუალო კვადრატული შეცდომის (MSE) ქულას 0.3 ნულოვანი სწავლებისას (zero-shot), რაც ახლოსაა უახლეს (state-of-the-art) შედეგთან. შემდეგ, ვნახოთ, როგორ შეგვიძლია გავაგრძელოთ...
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#პროგნოზირება
#მონაცემთა ანალიზი
#hugging face
#ღია კოდი
#transformers
#ტრანსფერული სწავლება
#patchtsmixer
#ibm research
#დროითი სერიები
#კლასიფიკაცია
#რეგრესია
#ნულოვანი სწავლება
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი