ღრმა სწავლის მოდელის მართვის გამოწვევა ხშირად გულისხმობს იმის გაგებას, თუ რატომ აკეთებს ის იმას, რასაც აკეთებს: იქნება ეს xAI-ის განმეორებითი მცდელობები Grok-ის უცნაური პოლიტიკის დასახვეწად, ChatGPT-ის მლიქვნელობასთან ბრძოლა, თუ ჩვეულებრივი ჰალუცინაციები, მილიარდობით პარამეტრის მქონე ნერვული ქსელის სიღრმეში გარკვევა ადვილი არ არის. სან-ფრანცისკოს სტარტაპი Guide Labs, რომელიც აღმასრულებელი დირექტორის ჯულიუს ადებაიოს და მთავარი მეცნიერული ოფიცრის აია აბდელსალამ ისმაილის მიერ არის დაარსებული, ამ პრობლემის გადაწყვეტას გვთავაზობს დღეს. ორშაბათს, კომპანიამ ღია წყარო გახადა 8-მილიარდპარამეტრიანი LLM, Steerling-8B, რომელიც გაწვრთნილია ახალი არქიტექტურით, რათა მისი მოქმედებები ადვილად ინტერპრეტირებადი იყოს: მოდელის მიერ წარმოებული ყოველი ტოკენის მიკვლევა შესაძლებელია მისი საწყისებიდან LLM-ის სავარჯიშო მონაცემებში. ეს შეიძლება იყოს ისეთი მარტივი, როგორიცაა მოდელის მიერ მოყვანილი ფაქტების საცნობარო მასალების დადგენა, ან ისეთი რთული, როგორიცაა იუმორის ან გენდერის მოდელის გაგება. „თუ გენდერის კოდირების ტრილიონი გზა მაქვს და მას 1 ტრილიონიდან 1 მილიარდ რამეში ვაკოდირებ, უნდა დარწმუნდე, რომ იპოვი ყველა ამ 1 მილიარდ რამეს, რაც დავაკოდირე, შემდეგ კი უნდა შეგეძლოს მათი სანდო ჩართვა და გამორთვა“, – განუცხადა ადებაიომ TechCrunch-ს. „ამას შეგიძლიათ მიაღწიოთ არსებული მოდელებით, მაგრამ ეს ძალიან მყიფეა... ეს ერთგვარი წმინდა გრაალის კითხვაა.“ ადებაიომ ეს ნამუშევარი MIT-ში დოქტორანტურის მიღებისას დაიწყო, იყო 2018 წლის ფართოდ ციტირებული ნაშრომის თანაავტორი, რომელიც აჩვენებდა, რომ ღრმა სწავლის მოდელების გაგების არსებული მეთოდები სანდო არ იყო. ამ ნაშრომმა საბოლოოდ გამოიწვია LLM-ების აგების ახალი მეთოდის შექმნა: დეველოპერები მოდელში კონცეფციის ფენას ნერგავენ, რომელიც მონაცემებს მიკვლევად კატეგორიებად ყოფს. ეს მოითხოვს მეტ წინასწარ მონაცემთა ანოტაციას, მაგრამ სხვა AI მოდელების დახმარებით მათ შეძლეს ამ მოდელის გაწვრთნა, როგორც მათი უდიდესი კონცეფციის დასტური. „ინტერპრეტირებადობა, რასაც ხალხი აკეთებს, მოდელზე ნეირომეცნიერებაა, ჩვენ კი ამას ვატრიალებთ“, – თქვა ადებაიომ. „რასაც ჩვენ ვაკეთებთ, არის მოდელის თავიდანვე ინჟინერია, რათა ნეირომეცნიერების კეთება არ დაგჭირდეთ.“ ამ მიდგომასთან დაკავშირებული ერთი შეშფოთება ის არის, რომ მან შესაძლოა აღმოფხვრას ზოგიერთი წარმოშობილი ქცევა, რაც LLM-ებს ასე ინტრიგს ხდის: მათი უნარი განზოგადონ ახლებურად იმ საკითხებზე, რომლებზეც ჯერ არ ყოფილან გაწვრთნილი. ადებაიო ამბობს, რომ ეს ჯერ კიდევ ხდება მის კომპანიის მოდელში: მისი გუნდი თვალყურს ადევნებს იმას, რასაც ისინი „აღმოჩენილ კონცეფციებს“ უწოდებენ, რაც მოდელმა თავისით აღმოაჩინა, მაგალითად, კვანტური გამოთვლები. ადებაიო ამტკიცებს, რომ ეს ინტერპრეტირებადი არქიტექტურა ყველას დასჭირდება. მომხმარებელზე ორიენტირებული LLM-ებისთვის, ეს ტექნიკა მოდელის შემქმნელებს საშუალებას მისცემს გააკეთონ ისეთი რაღაცები, როგორიცაა საავტორო უფლებებით დაცული მასალების გამოყენების დაბლოკვა, ან უკეთ გააკონტროლონ გამომავალი მონაცემები ისეთ თემებზე, როგორიცაა ძალადობა ან ნარკომანია. რეგულირებად ინდუსტრიებს დასჭირდებათ უფრო კონტროლირებადი LLM-ები — მაგალითად, ფინანსებში — სადაც სესხის განმცხადებლების შემფასებელმა მოდელმა უნდა გაითვალისწინოს ისეთი რაღაცები, როგორიცაა ფინანსური ჩანაწერები, მაგრამ არა რასა. ასევე საჭიროა ინტერპრეტირებადობა სამეცნიერო მუშაობაში, კიდევ ერთ სფეროში, სადაც Guide Labs-მა შეიმუშავა ტექნოლოგია. ცილების დაკეცვა დიდი წარმატება იყო ღრმა სწავლის მოდელებისთვის, მაგრამ მეცნიერებს მეტი ინფორმაცია სჭირდებათ იმის შესახებ, თუ რატომ იპოვა მათმა პროგრამულმა უზრუნველყოფამ პერსპექტიული კომბინაციები. „ეს მოდელი აჩვენებს, რომ ინტერპრეტირებადი მოდელების გაწვრთნა აღარ არის მეცნიერება; ეს ახლა საინჟინრო პრობლემაა“, – თქვა ადებაიომ. „ჩვენ გავარკვიეთ მეცნიერება და შეგვიძლია მათი მასშტაბირება, და არ არსებობს მიზეზი, თუ რატომ არ უნდა შეესაბამებოდეს ამ ტიპის მოდელი წამყვანი დონის მოდელების მუშაობას“, რომლებსაც გაცილებით მეტი პარამეტრი აქვთ. Guide Labs ამბობს, რომ Steerling-8B-ს შეუძლია მიაღწიოს არსებული მოდელების შესაძლებლობების 90%-ს, მაგრამ იყენებს ნაკლებ სავარჯიშო მონაცემებს, მისი ახალი არქიტექტურის წყალობით. კომპანიის შემდეგი ნაბიჯი, რომელიც Y Combinator-დან გამოვიდა და 2024 წლის ნოემბერში Initialized Capital-ისგან 9 მილიონი დოლარის საწყისი დაფინანსება მოიზიდა, არის უფრო დიდი მოდელის შექმნა და მომხმარებლებისთვის API და აგენტური წვდომის შეთავაზება. „მოდელების გაწვრთნის გზა, რომელსაც ამჟამად ვიყენებთ, სუპერ პრიმიტიულია, ამიტომ თანდაყოლილი ინტერპრეტირებადობის დემოკრატიზაცია რეალურად გრძელვადიან პერსპექტივაში კარგი იქნება ჩვენი როლისთვის ადამიანთა რასაში“, – განუცხადა ადებაიომ TechCrunch-ს. „რადგან ჩვენ მივდივართ ამ მოდელებისკენ, რომლებიც სუპერინტელექტუალური გახდებიან