ქსელებიც კი, რომლებიც დიდი ხანია „უწვრთნელად“ ითვლებოდნენ, შეუძლიათ ეფექტურად ისწავლონ მცირე დახმარებით. მასაჩუსეტსის ტექნოლოგიური ინსტიტუტის (MIT) კომპიუტერული მეცნიერებისა და ხელოვნური ინტელექტის ლაბორატორიის (CSAIL) მკვლევრებმა აჩვენეს, რომ ნერვულ ქსელებს შორის მოკლე პერიოდის შეთანხმება, მეთოდი, რომელსაც მათ „ხელმძღვანელობა“ (guidance) უწოდეს, შეუძლია მკვეთრად გააუმჯობესოს იმ არქიტექტურების მუშაობა, რომლებიც ადრე არაადეკვატურად ითვლებოდა თანამედროვე ამოცანებისთვის. მათი დასკვნები მიუთითებს, რომ მრავალი ეგრეთ წოდებული „არაეფექტური“ ქსელი შესაძლოა უბრალოდ არასრულყოფილი საწყისი წერტილებიდან იწყებდეს, ხოლო მოკლევადიან „ხელმძღვანელობას“ შეუძლია მათი ისეთ მდგომარეობაში მოყვანა, რაც ქსელისთვის სწავლას აადვილებს. გუნდის „ხელმძღვანელობის“ მეთოდი მუშაობს იმით, რომ მიზნობრივ ქსელს მოუწოდებს, შეესაბამებოდეს „მეგზური“ ქსელის შიდა წარმოდგენებს წვრთნის დროს. ტრადიციული მეთოდებისგან, როგორიცაა ცოდნის დისტილაცია, რომელიც მასწავლებლის გამომავალი მონაცემების მიბაძვაზეა ორიენტირებული, „ხელმძღვანელობა“ სტრუქტურულ ცოდნას უშუალოდ გადასცემს ერთი ქსელიდან მეორეს. ეს ნიშნავს, რომ მიზნობრივი ქსელი სწავლობს, თუ როგორ აწყობს „მეგზური“ ინფორმაციას თითოეულ ფენაში, ნაცვლად იმისა, რომ უბრალოდ დააკოპიროს მისი ქცევა. აღსანიშნავია, რომ გაუწვრთნელი ქსელებიც კი შეიცავს არქიტექტურულ მიკერძოებებს, რომლებიც შეიძლება გადაიცეს, ხოლო გაწვრთნილი „მეგზურები“ დამატებით გადმოსცემენ ნასწავლ ნიმუშებს. „ეს შედეგები საკმაოდ გასაკვირი აღმოჩნდა“, — ამბობს ვიღნეშ სუბრამანიამი (Vighnesh Subramaniam) ’23, MEng ’24, MIT-ის ელექტროინჟინერიისა და კომპიუტერული მეცნიერების (EECS) დეპარტამენტის დოქტორანტი და CSAIL-ის მკვლევარი, რომელიც ამ დასკვნების ამსახველი ნაშრომის ერთ-ერთი წამყვანი ავტორია. „შთამბეჭდავია, რომ ჩვენ შევძელით წარმოდგენითი მსგავსების გამოყენება ამ ტრადიციულად „უსარგებლო“ ქსელების მუშა მდგომარეობაში მოსაყვანად.“ **ხელმძღვანელი ანგელოზი** ერთ-ერთი მთავარი კითხვა იყო, უნდა გაგრძელდეს თუ არა „ხელმძღვანელობა“ მთელი წვრთნის განმავლობაში, თუ მისი ძირითადი ეფექტი უკეთესი ინიციალიზაციის უზრუნველყოფაა. ამის შესასწავლად, მკვლევრებმა ჩაატარეს ექსპერიმენტი ღრმა, სრულად დაკავშირებულ ქსელებთან (FCNs). რეალურ პრობლემაზე წვრთნამდე, ქსელმა რამდენიმე ნაბიჯი გაატარა სხვა ქსელთან ვარჯიშში შემთხვევითი ხმაურის გამოყენებით, ვარჯიშის წინ გაწელვის მსგავსად. შედეგები შთამბეჭდავი იყო: ქსელები, რომლებიც, როგორც წესი, დაუყოვნებლივ ზედმეტად ერგებოდნენ (overfit), სტაბილურები დარჩნენ, მიაღწიეს უფრო დაბალ წვრთნის დანაკარგს და თავიდან აიცილეს შესრულების კლასიკური დეგრადაცია, რომელიც სტანდარტულ FCN-ებში შეინიშნება. ეს შეთანხმება ქსელისთვის სასარგებლო „გახურების“ მსგავსად მოქმედებდა, რაც აჩვენებს, რომ ხანმოკლე სავარჯიშო სესიასაც კი შეუძლია გრძელვადიანი სარგებელი მოიტანოს მუდმივი „ხელმძღვანელობის“ საჭიროების გარეშე. კვლევამ ასევე შეადარა „ხელმძღვანელობა“ ცოდნის დისტილაციას, პოპულარულ მიდგომას, რომლის დროსაც სტუდენტი ქსელი ცდილობს მიბაძოს მასწავლებლის გამომავალ მონაცემებს. როდესაც მასწავლებელი ქსელი გაუწვრთნელი იყო, დისტილაცია სრულად ჩავარდა, რადგან გამომავალი მონაცემები არ შეიცავდა მნიშვნელოვან სიგნალს. „ხელმძღვანელობამ“, კონტრასტულად, მაინც გამოიწვია მნიშვნელოვანი გაუმჯობესება, რადგან ის იყენებს შიდა წარმოდგენებს და არა საბოლოო პროგნოზებს. ეს შედეგი ხაზს უსვამს საკვანძო იდეას: გაუწვრთნელი ქსელები უკვე აკოდირებენ ღირებულ არქიტექტურულ მიკერძოებებს, რომლებსაც შეუძლიათ სხვა ქსელების ეფექტური სწავლისკენ წარმართვა. ექსპერიმენტული შედეგების მიღმა, ამ დასკვნებს ფართო მნიშვნელობა აქვს ნერვული ქსელის არქიტექტურის გასაგებად. მკვლევრები მიიჩნევენ, რომ წარმატება — ან წარუმატებლობა — ხშირად ნაკლებად არის დამოკიდებული ამოცანის სპეციფიკურ მონაცემებზე და უფრო მეტად ქსელის პოზიციაზე პარამეტრულ სივრცეში. „მეგზურ“ ქსელთან შეთანხმებით, შესაძლებელია არქიტექტურული მიკერძოებების წვლილის განცალკევება ნასწავლი ცოდნისგან. ეს მეცნიერებს საშუალებას აძლევს, დაადგინონ, თუ ქსელის დიზაინის რომელი მახასიათებლები უწყობს ხელს ეფექტურ სწავლას და რომელი გამოწვევები მომდინარეობს უბრალოდ ცუდი ინიციალიზაციიდან. „ხელმძღვანელობა“ ასევე ხსნის ახალ გზებს არქიტექტურებს შორის ურთიერთობების შესასწავლად. იმის გაზომვით, თუ რამდენად ადვილად შეუძლია ერთ ქსელს მეორის წარმართვა, მკვლევრებს შეუძლიათ შეისწავლონ ფუნქციურ დიზაინებს შორის მანძილი და ხელახლა შეამოწმონ ნერვული ქსელის ოპტიმიზაციის თეორიები. ვინაიდან მეთოდი ეფუძნება წარმოდგენით მსგავსებას, მას შეუძლია გამოავლინოს ქსელის დიზაინში ადრე დამალული სტრუქტურები, რაც ხელს შეუწყობს იმის იდენტიფიცირებას, თუ რომელი კომპონენტები უწყობს ყველაზე მეტად ხელს სწავლას და რომელი — არა. **უიმედოთა გადარჩენა** საბოლოო ჯამში, ნაშრომი გვიჩვენებს, რომ ეგრეთ წოდებული „უწვრთნელი“ ქსელები თანდაყოლილად განწირულნი არ არიან. „ხელმძღვანელობით“, წარუმატებლობის რეჟიმების აღმოფხვრა, ზედმეტი მორგების (overfitting) თავიდან აცილება და ადრე არაეფექტური არქიტექტურების თანამედროვე შესრულების სტანდარტებთან შესაბამისობაში მოყვანაა შესაძლებელი. CSAIL-ის გუნდი გეგმავს შეისწავლოს, თუ ქსელის რომელი არქიტექტურული ელემენტებია ყველაზე მეტად პასუხისმგებელი ამ გაუმჯობესებებზე და როგორ შეიძლება ამ აღმოჩენებმა გავლენა მოახდინოს ქსელის მომავალ დიზაინზე. ყველაზე ჯიუტი ქსელების ფარული პოტენციალის გამოვლენით, „ხელმძღვანელობა“ გვთავაზობს მძლავრ ახალ ინსტრუმენტს მანქანური სწავლის საფუძვლების გასაგებად — და, იმედია, შესაქმნელად. „ზოგადად მიჩნეულია, რომ სხვადასხვა ნერვული ქსელის არქიტექტურას აქვს თავისი განსაკუთრებული ძლიერი და სუსტი მხარეები“, — ამბობს ლეილა ისიკი (Leyla Isik), ჯონს ჰოპკინსის უნივერსიტეტის კოგნიტური მეცნიერების ასისტენტ-პროფესორი, რომელიც კვლევაში არ მონაწილეობდა. „ეს ამაღელვებელი კვლევა...