ღრმა სწავლა და ტრანსფორმერები: ინოვაციები დროითი რიგების პროგნოზირებაში
დროითი რიგების პროგნოზირება, რომელიც ტრადიციულად კლასიკურ მეთოდებს ეყრდნობოდა, დღეს ღრმა სწავლის მოდელების ინტენსიურ გამოყენებას განიცდის. სტატია მიმოიხილავს განსხვავებას ინდივიდუალურ (ლოკალურ) კლასიკურ მეთოდებსა და გლობალურ, ალბათობით ღრმა სწავლის მოდელებს შორის, რომლებიც საშუალებას აძლევენ მოდელებს ისწავლონ მრავალი წყაროდან და წარმოადგინონ პროგნოზების გაურკვევლობები. განსაკუთრებული ყურადღება ეთმობა Transformer-ის არქიტექტურას, როგორც ეფექტურ ინსტრუმენტს უნივარიატული ალბათობითი პროგნოზირებისთვი
დროითი რიგების პროგნოზირება მეცნიერული და ბიზნესის თვალსაზრისით კრიტიკულად მნიშვნელოვან პრობლემას წარმოადგენს. ბოლო დროს, კლასიკურ მეთოდებთან ერთად, ამ სფეროში ღრმა სწავლებაზე დაფუძნებულმა მოდელებმა მნიშვნელოვანი ინოვაციები შემოიტანეს. კლასიკურ მეთოდებს, როგორიცაა ARIMA, და ახალ ღრმა სწავლის მეთოდებს შორის მნიშვნელოვანი განსხვავებაა. როგორც წესი, კლასიკური მეთოდები მორგებულია მონაცემთა ნაკრებში თითოეულ დროით რიგზე ინდივიდუალურად. მათ ხშირად „ინდივიდუალურ“ ან „ლოკალურ“ მეთოდებად მოიხსენიებენ. თუმცა, როდესაც საქმე გვაქვს დიდი რაოდენობით დროით რიგებთან ზოგიერთი აპლიკაციისთვის, მომგებიანია „გლობალური“ მოდელის გაწვრთნა ყველა ხელმისაწვდომ დროით რიგზე, რაც მოდელს საშუალებას აძლევს ისწავლოს ლატენტური წარმოდგენები მრავალი სხვადასხვა წყაროდან.
ზოგიერთი კლასიკური მეთოდი წერტილოვანია (ანუ, ისინი გამოსცემენ მხოლოდ ერთ მნიშვნელობას დროის ყოველ ნაბიჯზე) და მოდელები წვრთნიან L2 ან L1 ტიპის დანაკარგის მინიმიზაციით, რეალურ მონაცემებთან მიმართებაში. თუმცა, ვინაიდან პროგნოზები ხშირად გამოიყენება რეალური სამყაროს გადაწყვეტილების მიღების პროცესში, ადამიანის ჩარევითაც კი, გაცილებით მომგებიანია პროგნოზების გაურკვევლობების ჩვენება. ამას „ალბათობით პროგნოზირებას“ უწოდებენ, „წერტილოვანი პროგნოზირების“ საპირისპიროდ. ეს გულისხმობს ალბათობითი განაწილების მოდელირებას, საიდანაც შესაძლებელია შერჩევა. ასე რომ, მოკლედ, ნაცვლად ლოკალური წერტილოვანი პროგნოზირების მოდელების გაწვრთნისა, ჩვენ ვცდილობთ გლობალური ალბათობითი მოდელების გაწვრთნას.
ღრმა სწავლება ამისთვის შესანიშნავად შეეფერება, რადგან ნერვულ ქსელებს შეუძლიათ ისწავლონ წარმოდგენები რამდენიმე დაკავშირებული დროითი რიგიდან, ასევე მოახდინონ მონაცემების გაურკვევლობის მოდელირება. ალბათობით კონტექსტში ჩვეულებრივია შერჩეული პარამეტრული განაწილების, როგორიცაა გაუსის ან სტუდენტ-T განაწილება, მომავალი პარამეტრების სწავლა; ან პირობითი კვანტილური ფუნქციის სწავლა; ან კონფორმული პროგნოზირების ჩარჩოს გამოყენება, რომელიც ადაპტირებულია დროითი რიგების გარემოზე. მეთოდის არჩევანი არ მოქმედებს მოდელირების ასპექტზე და ამიტომ შეიძლება ჩაითვალოს კიდევ ერთ ჰიპერპარამეტრად. ალბათობითი მოდელის წერტილოვან პროგნოზირების მოდელად გადაქცევა ყოველთვის შესაძლებელია ემპირიული საშუალოების ან მედიანების აღებით.
დროითი რიგების მონაცემების მოდელირების კუთხით, რომლებიც თანმიმდევრული ხასიათისაა, როგორც მოსალოდნელია, მკვლევრებმა შეიმუშავეს მოდელები, რომლებიც იყენებენ რეკურენტულ ნერვულ ქსელებს (RNN), როგორიცაა LSTM ან GRU, ან კონვოლუციურ ქსელებს (CNN), და უფრო ბოლოს კი ტრანსფორმერზე დაფუძნებულ მეთოდებს, რომლებიც ბუნებრივად ჯდება დროითი რიგების პროგნოზირების კონტექსტში. ამ ბლოგპოსტში ჩვენ გამოვიყენებთ სტანდარტულ ტრანსფორმერს (Vaswani et al., 2017) უნივარიატული ალბათობითი პროგნოზირების ამოცანისთვის (ანუ, თითოეული დროითი რიგის 1-განზომილებიანი განაწილების ინდივიდუალურად პროგნოზირებისთვის).
ენკოდერ-დეკოდერის ტრანსფორმერი პროგნოზირებისთვის ბუნებრივი არჩევანია, რადგან ის ლამაზად აერთიანებს რამდენიმე ინდუქციურ გადახრას. პირველ რიგში, ენკოდერ-დეკოდერის არქიტექტურის გამოყენება სასარგებლოა დასკვნის (inference) ეტაპზე, სადაც, როგორც წესი, ზოგიერთი დალოგირებული მონაცემისთვის გვსურს მომავალში რამდენიმე პროგნოზის გაკეთება. ეს შეიძლება ჩაითვალოს ტექსტის გენერაციის ამოცანის ანალოგად, სადაც მოცემული კონტექსტის საფუძველზე, ჩვენ ვიღებთ შემდეგ ტოკენს და უკან გადავცემთ დეკოდერს (ამას ასევე უწოდებენ „ავტორეგრესიულ გენერაციას“). ანალოგიურად, აქაც, მოცემული განაწილების ტიპის მიხედვით, შეგვიძლია მისგან შერჩევა, რათა მივიღოთ პროგნოზები სასურველ პროგნოზირების ჰორიზონტამდე. ეს ცნობილია როგორც წინაპრული შერჩევა (Ancestral Sampling). აქ არის შესანიშნავი ბლოგპოსტი ენის მოდელების კონტექსტში შერჩევის შესახებ.
მეორეც, ტრანსფორმერი გვეხმარება დროითი რიგების მონაცემებზე გაწვრთნაში, რომლებიც შესაძლოა შეიცავდეს ათასობით დროის წერტილს. ყოველთვის არ არის მიზანშეწონილი დროითი რიგის მთელი ისტორიის ერთდროულად მოდელში შეტანა, ყურადღების მექანიზმის დროითი და მეხსიერების შეზღუდვების გამო. ამრიგად, შესაძლებელია განიხილოს შესაბამისი კონტექსტური ფანჯარა და ამ ფანჯრისა და შემდგომი პროგნოზირების სიგრძის ზომის ფანჯრის შერჩევა სავარჯიშო მონაცემებიდან, როდესაც ვაგროვებთ პაკეტებს სტოქასტური გრადიენტული დაშვებისთვის (SGD). კონტექსტური ფანჯარა შეიძლება გადაეცეს ენკოდერს, ხოლო პროგნოზირების ფანჯარა – მიზეზობრივად დაფარულ დეკოდერს. ეს ნიშნავს, რომ დეკოდერს შეუძლია მხოლოდ წინა დროის ნაბიჯებს შეხედოს შემდეგი მნიშვნელობის სწავლისას. ეს ექვივალენტურია იმისა, თუ როგორ გაწვრთნიდა ადამიანი სტანდარტულ ტრანსფორმერს მანქანური თარგმნისთვის, რასაც „მასწავლებლის იძულებას“ უწოდებენ.
ტრანსფორმერების კიდევ ერთი უპირატესობა სხვა არქიტექტურებთან შედარებით არის ის, რომ ჩვენ შეგვიძლია გამოტოვებული მნიშვნელობების (რომლებიც ხშირია დროითი რიგების კონტექსტში) ჩართვა, როგორც დამატებითი ნიღაბი ენკოდერში ან დეკოდერში და მაინც გავწვრთნათ მოდელი შევსების ან იმპუტაციის გარეშე. ეს ექვივალენტურია Transformers ბიბლიოთეკაში არსებული BERT-ისა და GPT-2-ის მსგავსი მოდელების `attention_mask`-ის, რათა არ მოხდეს padding ტოკენების ჩართვა ყურადღების მატრიცის გამოთვლაში.
ტრანსფორმერის არქიტექტურის ნაკლოვანებაა კონტექსტური და პროგნოზირების ფანჯრების ზომის შეზღუდვა, სტანდარტული ტრანსფორმერის კვადრატული გამოთვლითი და მეხსიერების მოთხოვნების გამო (იხ. Tay et al., 2020). გარდა ამისა, ვინაიდან ტრანსფორმერი მძლავრი არქიტექტურაა, ის შესაძლოა უფრო ადვილად მოერგოს ზედმეტად ან ისწავლოს მცდარი კორელაციები სხვა მეთოდებთან შედარებით. 🤗 Transformers ბიბლიოთეკა გთავაზობთ სტანდარტულ ალბათობითი დროითი რიგების ტრანსფორმ...
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#ღრმა სწავლა
#მონაცემთა მეცნიერება
#ნერვული ქსელები
#ტრანსფორმერები
#დროითი რიგების პროგნოზირება
#ალბათობითი პროგნოზირება
#arima
#rnn
#cnn
#ენკოდერ-დეკოდერი
#უნივარიატული პროგნოზირება
#გამოტოვებული მნიშვნელობები
#ზედმეტი მორგება
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი