MIT-ის მკვლევრებმა მანქანური სწავლების მოდელების ჩავარდნის მნიშვნელოვანი მაგალითები გამოავლინეს, როდესაც ეს მოდელები გამოიყენება სხვა მონაცემებზე, ვიდრე ის, რაზეც ისინი იყო გაწვრთნილი. ეს აჩენს კითხვებს ახალ გარემოში მოდელის განთავსებისას მუდმივი ტესტირების აუცილებლობის შესახებ. „ჩვენ ვაჩვენებთ, რომ მაშინაც კი, როდესაც მოდელებს დიდი რაოდენობით მონაცემებზე ვავარჯიშებთ და საუკეთესო საშუალო მოდელს ვირჩევთ, ახალ გარემოში ეს „საუკეთესო მოდელი“ შესაძლოა უარესი აღმოჩნდეს ახალი მონაცემების 6-75 პროცენტისთვის“, — ამბობს მარზიე გასემი, MIT-ის ელექტროინჟინერიისა და კომპიუტერული მეცნიერების დეპარტამენტის (EECS) ასოცირებული პროფესორი, სამედიცინო ინჟინერიისა და მეცნიერების ინსტიტუტის წევრი და ინფორმაციისა და გადაწყვეტილების სისტემების ლაბორატორიის მთავარი მკვლევარი. დეკემბერში გამართულ ნევრალური ინფორმაციის დამუშავების სისტემების (NeurIPS 2025) კონფერენციაზე წარდგენილ ნაშრომში მკვლევრები აღნიშნავენ, რომ მოდელები, რომლებიც გაწვრთნილია ერთი საავადმყოფოს რენტგენის სურათებზე დაავადებების ეფექტურად დიაგნოსტირებისთვის, საშუალოდ, შესაძლოა ეფექტურად ჩაითვალოს სხვა საავადმყოფოშიც. თუმცა, მკვლევრების მიერ ჩატარებულმა მუშაობის შეფასებამ გამოავლინა, რომ პირველ საავადმყოფოში საუკეთესოდ მომუშავე მოდელებიდან ზოგიერთი, მეორე საავადმყოფოში პაციენტების 75 პროცენტამდე შემთხვევაში ყველაზე ცუდად მუშაობდა, მიუხედავად იმისა, რომ მეორე საავადმყოფოში ყველა პაციენტის გაერთიანებისას, მაღალი საშუალო მაჩვენებელი ამ ჩავარდნას ფარავდა. მათი აღმოჩენები აჩვენებს, რომ მიუხედავად იმისა, რომ ცრუ კორელაციები — რომლის მარტივი მაგალითია, როდესაც მანქანური სწავლების სისტემა, რომელსაც „არ უნახავს“ ბევრ ძროხა სანაპიროზე, კლასიფიცირებს სანაპიროზე მყოფი ძროხის ფოტოს როგორც კასატკას, უბრალოდ მისი ფონის გამო — ითვლება, რომ შემცირდება მოდელის მუშაობის გაუმჯობესებით დაკვირვებულ მონაცემებზე, ისინი რეალურად კვლავ ხდება და საფრთხეს უქმნის მოდელის სანდოობას ახალ გარემოში. მრავალ შემთხვევაში — მათ შორის მკვლევრების მიერ განხილულ სფეროებში, როგორიცაა გულმკერდის რენტგენი, კიბოს ჰისტოპათოლოგიური გამოსახულებები და სიძულვილის ენის გამოვლენა — ასეთი ცრუ კორელაციების დადგენა ბევრად უფრო რთულია. მაგალითად, გულმკერდის რენტგენზე გაწვრთნილი სამედიცინო დიაგნოსტიკის მოდელის შემთხვევაში, მოდელმა შესაძლოა ისწავლა ერთი საავადმყოფოს რენტგენის სურათებზე არსებული კონკრეტული და შეუსაბამო ნიშნის დაკავშირება გარკვეულ პათოლოგიასთან. სხვა საავადმყოფოში, სადაც ეს ნიშანი არ გამოიყენება, ეს პათოლოგია შესაძლოა შეუმჩნეველი დარჩეს. გასემის ჯგუფის წინა კვლევებმა აჩვენა, რომ მოდელებს შეუძლიათ ცრუ კორელაცია დაამყარონ ისეთ ფაქტორებთან, როგორიცაა ასაკი, სქესი და რასა, სამედიცინო მონაცემებთან. მაგალითად, თუ მოდელი გაწვრთნილია პნევმონიით დაავადებული ხანდაზმული ადამიანების გულმკერდის რენტგენის უფრო მეტ სურათზე და „არ უნახავს“ ამდენი ახალგაზრდა ადამიანის რენტგენი, მან შესაძლოა იწინასწარმეტყველოს, რომ პნევმონია მხოლოდ ხანდაზმულ პაციენტებს აქვთ. „ჩვენ გვსურს, რომ მოდელებმა ისწავლონ პაციენტის ანატომიური მახასიათებლების შემოწმება და შემდეგ ამის საფუძველზე გადაწყვეტილების მიღება“, — ამბობს ოლავალე სალაუდინი, MIT-ის პოსტდოქტორი და ნაშრომის წამყვანი ავტორი, „მაგრამ რეალურად, ყველაფერი, რაც მონაცემებშია და გადაწყვეტილებასთან არის კორელაციაში, შეიძლება გამოყენებულ იქნას მოდელის მიერ. და ეს კორელაციები შესაძლოა არ იყოს მდგრადი გარემოს ცვლილებების მიმართ, რაც მოდელის პროგნოზებს გადაწყვეტილების მიღების არასაიმედო წყაროდ აქცევს.“ ცრუ კორელაციები ხელს უწყობს მიკერძოებული გადაწყვეტილების მიღების რისკებს. NeurIPS-ის კონფერენციის ნაშრომში მკვლევრებმა აჩვენეს, რომ, მაგალითად, გულმკერდის რენტგენის მოდელები, რომლებმაც გააუმჯობესეს დიაგნოზის საერთო შესრულება, რეალურად უარესად მუშაობდნენ პაციენტებზე პლევრის დაავადებებით ან გაფართოებული კარდიომედიასტინუმით, რაც გულის ან ცენტრალური გულმკერდის ღრუს გადიდებას ნიშნავს. ნაშრომის სხვა ავტორები იყვნენ ასპირანტები ჰაორან ჟანგი და ქუმაილ ალჰამუდი, EECS-ის ასისტენტ-პროფესორი სარა ბერი და გასემი. მიუხედავად იმისა, რომ წინა ნაშრომებში ზოგადად მიღებული იყო, რომ მოდელები, რომლებიც დალაგებულია საუკეთესოდან უარესისკენ შესრულების მიხედვით, შეინარჩუნებენ ამ თანმიმდევრობას ახალ გარემოში გამოყენებისას (რაც ცნობილია როგორც „accuracy-on-the-line“), მკვლევრებმა შეძლეს აჩვენონ მაგალითები, როდესაც ერთ გარემოში საუკეთესოდ მომუშავე მოდელები სხვა გარემოში ყველაზე ცუდად მუშაობდნენ. სალაუდინმა შეიმუშავა ალგორითმი სახელწოდებით OODSelect, რათა ეპოვა მაგალითები, სადაც „accuracy-on-the-line“ დარღვეული იყო. ძირითადად, მან ათასობით მოდელი გაავარჯიშა „in-distribution“ მონაცემების გამოყენებით, რაც ნიშნავს, რომ მონაცემები პირველი გარემოდან იყო, და გამოთვალა მათი სიზუსტე. შემდეგ მან ეს მოდელები გამოიყენა მეორე გარემოდან მიღებულ მონაცემებზე. როდესაც პირველი გარემოს მონაცემებზე ყველაზე მაღალი სიზუსტის მქონე მოდელები მცდარი აღმოჩნდა მეორე გარემოს მაგალითების დიდ პროცენტზე გამოყენებისას, ამან გამოავლინა პრობლემური ქვეჯგუფები, ანუ ქვეპოპულაციები. სალაუდინი ასევე ხაზს უსვამს აგრეგირებული სტატისტიკის საშიშროებას შეფასებისთვის, რამაც შეიძლება დაფაროს უფრო დეტალური და მნიშვნელოვანი ინფორმაცია მოდელის მუშაობის შესახებ. მათი მუშაობის მსვლელობისას, მკვლევრებმა გამოყვეს „ყველაზე მცდარად გათვლილი მაგალითები“, რათა არ მომხდარიყო მონაცემთა ნაკრებში არსებული ცრუ კორელაციების აღრევა სიტუაციებთან, რომელთა კლასიფიცირება უბრალოდ რთულია.