MIT-ის მკვლევრებმა სივრცითი მონაცემების ანალიზისთვის სანდოობის ინტერვალების ახალი მეთოდი შექმნეს
მანქანური სწავლების არსებული მეთოდები ხშირად იძლევა არაზუსტ სანდოობის ინტერვალებს სივრცეში ცვალებადი მონაცემების ანალიზისას, რამაც შეიძლება მკვლევრები შეცდომაში შეიყვანოს. MIT-ის მეცნიერებმა შეიმუშავეს ახალი ტექნიკა, რომელიც თანმიმდევრულად აგენერირებს სანდო ინტერვალებს ასეთი სივრცითი პრობლემებისთვის, რითაც ზრდის სამეცნიერო დასკვნების სანდოობას გარემოსდაცვითი მეცნიერების, ეკონომიკისა და ეპიდემიოლოგიის სფეროებში.
დავუშვათ, გარემოსდამცველი მეცნიერი იკვლევს, უკავშირდება თუ არა ჰაერის დაბინძურებასთან კონტაქტი დაბადების დაბალ წონას კონკრეტულ ოლქში. მათ შეიძლება ავარჯიშონ მანქანური სწავლების მოდელი ამ ასოციაციის სიდიდის შესაფასებლად, რადგან მანქანური სწავლების მეთოდები განსაკუთრებით კარგად სწავლობენ კომპლექსურ კავშირებს. სტანდარტული მანქანური სწავლების მეთოდები გამოირჩევიან პროგნოზირებაში და ზოგჯერ იძლევა გაურკვევლობებს, როგორიცაა სანდოობის ინტერვალები, ამ პროგნოზებისთვის. თუმცა, ისინი ზოგადად არ იძლევიან შეფასებებს ან სანდოობის ინტერვალებს, როდესაც დგინდება, უკავშირდება თუ არა ორი ცვლადი ერთმანეთს. შემუშავებულია სხვა მეთოდები სპეციალურად ამ ასოციაციის პრობლემის მოსაგვარებლად და სანდოობის ინტერვალების უზრუნველსაყოფად. მაგრამ, სივრცით გარემოში, MIT-ის მკვლევრებმა აღმოაჩინეს, რომ ეს სანდოობის ინტერვალები შეიძლება სრულიად არაზუსტი იყოს. როდესაც ცვლადები, როგორიცაა ჰაერის დაბინძურების დონე ან ნალექი, იცვლება სხვადასხვა ადგილას, სანდოობის ინტერვალების გენერირების გავრცელებულმა მეთოდებმა შეიძლება მოითხოვონ მაღალი სანდოობის დონე, მაშინ როცა, ფაქტობრივად, შეფასებამ სრულად ვერ ასახა რეალური მნიშვნელობა. ეს მცდარი სანდოობის ინტერვალები შეიძლება მომხმარებელი შეცდომაში შეიყვანოს და აიძულოს ენდოს მოდელს, რომელიც ვერ მუშაობს. ამ ხარვეზის იდენტიფიცირების შემდეგ, მკვლევრებმა შეიმუშავეს ახალი მეთოდი, რომელიც შექმნილია სივრცეში ცვალებადი მონაცემების მქონე პრობლემებისთვის სანდო ინტერვალების გენერირებისთვის. სიმულაციებსა და ექსპერიმენტებში რეალური მონაცემებით, მათი მეთოდი იყო ერთადერთი ტექნიკა, რომელიც თანმიმდევრულად აგენერირებდა ზუსტ სანდოობის ინტერვალებს. ეს ნაშრომი დაეხმარება მკვლევრებს ისეთ სფეროებში, როგორიცაა გარემოსდაცვითი მეცნიერება, ეკონომიკა და ეპიდემიოლოგია, უკეთ გაიგონ, როდის უნდა ენდონ გარკვეული ექსპერიმენტების შედეგებს.
„არსებობს უამრავი პრობლემა, სადაც ადამიანებს აინტერესებთ ფენომენების გაგება სივრცეში, მაგალითად, ამინდი ან ტყის მართვა. ჩვენ ვაჩვენეთ, რომ ამ ფართო კლასის პრობლემებისთვის არსებობს უფრო შესაფერისი მეთოდები, რომლებსაც შეუძლიათ მოგვცეს უკეთესი შესრულება, უკეთესი გაგება იმისა, თუ რა ხდება და უფრო სანდო შედეგები“, – ამბობს თამარა ბროდერიკი, MIT-ის ელექტროინჟინერიისა და კომპიუტერული მეცნიერების დეპარტამენტის (EECS) ასოცირებული პროფესორი, ინფორმაციისა და გადაწყვეტილების სისტემების ლაბორატორიის (LIDS) და მონაცემთა, სისტემებისა და საზოგადოების ინსტიტუტის წევრი, კომპიუტერული მეცნიერებისა და ხელოვნური ინტელექტის ლაბორატორიის (CSAIL) ასოცირებული წევრი და ამ კვლევის უფროსი ავტორი. ბროდერიკს ნაშრომზე შეუერთდნენ თანაავტორები: დევიდ რ. ბერტი, პოსტდოკი, და რენატო ბერლინგიერი, EECS-ის მაგისტრანტი; და სტივენ ბეიტსი, EECS-ის ასისტენტ პროფესორი და LIDS-ის წევრი. კვლევა ცოტა ხნის წინ წარმოდგენილი იყო ნერვული ინფორმაციის დამუშავების სისტემების კონფერენციაზე.
არასწორი დაშვებები. სივრცითი ასოციაცია გულისხმობს იმის შესწავლას, თუ როგორ უკავშირდება ცვლადი და გარკვეული შედეგი გეოგრაფიულ არეალზე. მაგალითად, შეიძლება ვინმეს სურდეს შეისწავლოს, თუ როგორ უკავშირდება ხის საფარი შეერთებულ შტატებში სიმაღლეს. ამ ტიპის პრობლემის გადასაჭრელად, მეცნიერს შეუძლია შეაგროვოს დაკვირვების მონაცემები მრავალი ადგილიდან და გამოიყენოს იგი ასოციაციის შესაფასებლად სხვა ადგილას, სადაც მათ არ აქვთ მონაცემები. MIT-ის მკვლევრებმა გააცნობიერეს, რომ ამ შემთხვევაში, არსებული მეთოდები ხშირად აგენერირებენ სანდოობის ინტერვალებს, რომლებიც სრულიად არასწორია. მოდელმა შეიძლება თქვას, რომ ის 95 პროცენტით დარწმუნებულია, რომ მისი შეფასება ასახავს ხის საფარსა და სიმაღლეს შორის ნამდვილ ურთიერთობას, მაშინ როდესაც მან საერთოდ არ ასახა ეს ურთიერთობა. ამ პრობლემის შესწავლის შემდეგ, მკვლევრებმა დაადგინეს, რომ დაშვებები, რომლებსაც ეყრდნობა სანდოობის ინტერვალის ეს მეთოდები, არ მუშაობს, როდესაც მონაცემები სივრცეში იცვლება. დაშვებები არის წესები, რომლებიც უნდა დაიცვან, რათა სტატისტიკური ანალიზის შედეგები იყოს სანდო. სანდოობის ინტერვალების გენერირების გავრცელებული მეთოდები მუშაობს სხვადასხვა დაშვების საფუძველზე. პირველ რიგში, ისინი ვარაუდობენ, რომ საწყისი მონაცემები, რომელიც არის დაკვირვების მონაცემები, შეგროვებული მოდელის სავარჯიშოდ, დამოუკიდებელია და იდენტურად განაწილებული. ეს დაშვება გულისხმობს, რომ მონაცემებში ერთი ადგილის ჩართვის შანსს არ აქვს მნიშვნელობა, ჩაირთვება თუ არა მეორე. მაგრამ, მაგალითად, აშშ-ის გარემოს დაცვის სააგენტოს (EPA) ჰაერის სენსორები განთავსებულია სხვა ჰაერის სენსორების ადგილმდებარეობის გათვალისწინებით. მეორე, არსებული მეთოდები ხშირად ვარაუდობენ, რომ მოდელი სრულყოფილად სწორია, მაგრამ ეს დაშვება პრაქტიკაში არასოდეს არის მართალი. საბოლოოდ, ისინი ვარაუდობენ, რომ საწყისი მონაცემები მსგავსია სამიზნე მონაცემების, სადაც შეფასება უნდა მოხდეს. მაგრამ სივრცით გარემოში, საწყისი მონაცემები შეიძლება ფუნდამენტურად განსხვავდებოდეს...
თეგები:
#ხელოვნური ინტელექტი
#კვლევა
#მანქანური სწავლება
#mit
#სივრცითი მონაცემები
#სანდოობის ინტერვალები
#გარემოსდაცვითი მეცნიერება
#ეპიდემიოლოგია
#მონაცემთა ანალიზი
#სტატისტიკა
წყარო: news.mit.edu
AI-ით გადამუშავებული
მსგავსი სტატიები
მეცნიერება და ტექნოლოგია
MIT-ის მკვლევარები LLM-ების წვრთნის სიჩქარეს აორმაგებენ გამოთვლითი რესურსების ოპტიმიზაციით
მეცნიერება და ტექნოლოგია
კვანტური კომპიუტერები: ნილს ბორის ინსტიტუტმა ქუბითების მდგომარეობის მონიტორინგის სიჩქარე ასჯერ გაზარდა
მეცნიერება და ტექნოლოგია