MIT-ის მკვლევრებმა გამოავლინეს მანქანური სწავლების მოდელების მუშაობის მნიშვნელოვანი ხარვეზები, როდესაც ისინი გამოიყენება სხვა მონაცემებზე, ვიდრე ის, რაზეც იყო გაწვრთნილი, რაც აჩენს კითხვებს მოდელის ახალ გარემოში დანერგვისას მისი ტესტირების აუცილებლობის შესახებ. „ჩვენ ვაჩვენებთ, რომ მაშინაც კი, როდესაც მოდელებს ავარჯიშებთ დიდი რაოდენობით მონაცემებზე და ირჩევთ საუკეთესო საშუალო მოდელს, ახალ გარემოში ეს „საუკეთესო მოდელი“ შეიძლება აღმოჩნდეს ყველაზე უარესი ახალი მონაცემების 6-75 პროცენტისთვის“, – ამბობს მარზიე გასემი, MIT-ის ელექტროინჟინერიისა და კომპიუტერული მეცნიერებების დეპარტამენტის (EECS) ასოცირებული პროფესორი, სამედიცინო ინჟინერიისა და მეცნიერების ინსტიტუტის წევრი და ინფორმაციისა და გადაწყვეტილების სისტემების ლაბორატორიის მთავარი მკვლევარი. დეკემბერში Neural Information Processing Systems (NeurIPS 2025) კონფერენციაზე წარდგენილ ნაშრომში, მკვლევრები აღნიშნავენ, რომ მაგალითად, ერთ საავადმყოფოში გულმკერდის რენტგენის სურათებზე დაავადებების ეფექტურად დიაგნოსტირებისთვის გაწვრთნილი მოდელები, საშუალოდ, შეიძლება ეფექტურად ჩაითვალოს სხვა საავადმყოფოშიც. თუმცა, მკვლევრების მიერ ჩატარებულმა მუშაობის შეფასებამ გამოავლინა, რომ პირველ საავადმყოფოში საუკეთესოდ მოქმედი ზოგიერთი მოდელი, მეორე საავადმყოფოს პაციენტების 75 პროცენტამდე შემთხვევაში, ყველაზე უარესად მუშაობდა, მიუხედავად იმისა, რომ მეორე საავადმყოფოში ყველა პაციენტის გაერთიანებისას, მაღალი საშუალო მაჩვენებლები მალავს ამ ხარვეზს. მათი დასკვნები აჩვენებს, რომ მიუხედავად იმისა, რომ მცდარი კორელაციები — რომლის მარტივი მაგალითია, როდესაც მანქანური სწავლების სისტემა, რომელსაც არ „უნახავს“ ბევრ ძროხა პლაჟზე გამოსახული, პლაჟზე მყოფი ძროხის ფოტოს ორკად აფასებს მხოლოდ მისი ფონის გამო — ითვლება, რომ შემცირდება მხოლოდ დაკვირვებულ მონაცემებზე მოდელის მუშაობის გაუმჯობესებით, სინამდვილეში ისინი მაინც ხდება და რჩება რისკად მოდელის სანდოობისთვის ახალ გარემოში. ბევრ შემთხვევაში — მათ შორის მკვლევრების მიერ შესწავლილ სფეროებში, როგორიცაა გულმკერდის რენტგენი, კიბოს ჰისტოპათოლოგიური გამოსახულებები და სიძულვილის ენის გამოვლენა — ასეთი მცდარი კორელაციების დადგენა გაცილებით რთულია. მაგალითად, გულმკერდის რენტგენის სურათებზე გაწვრთნილი სამედიცინო დიაგნოზის მოდელის შემთხვევაში, მოდელმა შესაძლოა ისწავლა ერთი საავადმყოფოს რენტგენის სურათებზე არსებული კონკრეტული და შეუსაბამო ნიშნის დაკავშირება გარკვეულ პათოლოგიასთან. სხვა საავადმყოფოში, სადაც ეს ნიშანი არ გამოიყენება, პათოლოგია შეიძლება გამორჩეს. გასემის ჯგუფის წინა კვლევებმა აჩვენა, რომ მოდელებს შეუძლიათ მცდარად დააკავშირონ ისეთი ფაქტორები, როგორიცაა ასაკი, სქესი და რასა სამედიცინო მონაცემებთან. მაგალითად, თუ მოდელი გაწვრთნილია პნევმონიით დაავადებული ხანდაზმულების გულმკერდის მეტ რენტგენის სურათზე და არ „უნახავს“ ამდენი ახალგაზრდა ადამიანის რენტგენი, მან შეიძლება იწინასწარმეტყველოს, რომ პნევმონია მხოლოდ ხანდაზმულ პაციენტებს აქვთ. „ჩვენ გვინდა, რომ მოდელებმა ისწავლონ პაციენტის ანატომიური მახასიათებლების დათვალიერება და შემდეგ ამის საფუძველზე გადაწყვეტილების მიღება“, – ამბობს ოლავალე სალაუდენი, MIT-ის პოსტდოქტორი და ნაშრომის წამყვანი ავტორი, „მაგრამ სინამდვილეში, მონაცემებში არსებული ნებისმიერი რამ, რაც დაკავშირებულია გადაწყვეტილებასთან, შეიძლება გამოიყენოს მოდელმა. და ეს კორელაციები შესაძლოა არ იყოს მყარი გარემოს ცვლილებების მიმართ, რაც მოდელის პროგნოზებს გადაწყვეტილების მიღების არასანდო წყაროდ აქცევს.“ მცდარი კორელაციები ხელს უწყობს მიკერძოებული გადაწყვეტილების მიღების რისკებს. NeurIPS კონფერენციის ნაშრომში მკვლევრებმა აჩვენეს, რომ, მაგალითად, გულმკერდის რენტგენის მოდელები, რომლებმაც გააუმჯობესეს დიაგნოსტიკის საერთო შესრულება, სინამდვილეში უარესად მუშაობდნენ პაციენტებზე პლევრალური მდგომარეობით ან გულის გაფართოებით (კარდიომედიასტინუმის გადიდება, რაც გულის ან ცენტრალური გულმკერდის ღრუს გადიდებას ნიშნავს). ნაშრომის სხვა ავტორები არიან PhD სტუდენტები ჰაორან ჟანგი და ქუმაილ ალჰამუდი, EECS-ის ასისტენტ-პროფესორი სარა ბირი და გასემი. მიუხედავად იმისა, რომ წინა ნაშრომებში ზოგადად მიღებული იყო, რომ მოდელები, რომლებიც საუკეთესოდან უარესისკენ არიან დალაგებული შესრულების მიხედვით, შეინარჩუნებენ ამ თანმიმდევრობას ახალ გარემოში გამოყენებისას (რაც „სიზუსტე ხაზზე“ ცნობილია), მკვლევრებმა შეძლეს აჩვენონ მაგალითები, თუ როდის იყო ერთ გარემოში საუკეთესოდ მოქმედი მოდელები, მეორეში ყველაზე უარესად მოქმედი. სალაუდენმა შეიმუშავა ალგორითმი სახელწოდებით OODSelect, რათა ეპოვა მაგალითები, სადაც „სიზუსტე ხაზზე“ ირღვეოდა. ძირითადად, მან გაწვრთნა ათასობით მოდელი შიდა-განაწილების მონაცემების გამოყენებით, რაც ნიშნავს, რომ მონაცემები პირველი გარემოდან იყო, და გამოთვალა მათი სიზუსტე. შემდეგ მან ეს მოდელები გამოიყენა მეორე გარემოს მონაცემებზე. როდესაც პირველი გარემოს მონაცემებზე უმაღლესი სიზუსტის მქონე მოდელები შეცდომას უშვებდნენ მეორე გარემოში მაგალითების დიდ პროცენტზე გამოყენებისას, ამან გამოავლინა პრობლემური ქვეჯგუფები ანუ ქვეპოპულაციები. სალაუდენი ასევე ხაზს უსვამს აგრეგირებული სტატისტიკის საშიშროებას შეფასებისთვის, რამაც შეიძლება დაფაროს უფრო დეტალური და მნიშვნელოვანი ინფორმაცია მოდელის მუშაობის შესახებ. მუშაობის მსვლელობისას, მკვლევრებმა გამოყვეს „ყველაზე არასწორად გათვლილი მაგალითები“, რათა არ მომხდარიყო მონაცემთა ნაკრებში მცდარი კორელაციების აღრევა იმ სიტუაციებთან, რომელთა კლასიფიკაციაც უბრალოდ რთულია. NeurIPS-ის ნაშრომი აქვეყნებს [missing text in original input].