ხელოვნური ინტელექტის „შავი ყუთი“ გაიხსნა: აღმოჩენილია კონცეფციების ხაზოვანი შენახვის მეთოდი
კალიფორნიის უნივერსიტეტის სან-დიეგოსა და MIT-ის მკვლევართა გუნდმა აღმოაჩინა, რომ დიდი ენობრივი მოდელები (LLM) რთულ კონცეფციებს, როგორიცაა ენები ან აბსტრაქტული იდეები, ინახავს მარტივი, სწორი ხაზების (ვექტორების) სახით. ეს აღმოჩენა საშუალებას იძლევა AI-ს ქცევის „ქირურგიულად“ მართვისთვის, რაც აუმჯობესებს მის ფუნქციონირებას (მაგ., კოდის თარგმნა) და ეფექტურად ავლენს „ჰალუცინაციებს“ ან ტოქსიკურ შინაარსს. თუმცა, იგივე მეთოდი პოტენციურ რისკებსაც შეიცავს, მათ შორის მოდელების დამცავი მექანიზმების გვერდის
წლების განმავლობაში, დიდი ენობრივი მოდელების (LLM) შიდა მუშაობა, როგორიცაა Llama და Claude, „შავ ყუთს“ ადარებდნენ – ვრცელი, კომპლექსური და მისი მართვა ძალზე რთული იყო. თუმცა, კალიფორნიის უნივერსიტეტის სან-დიეგოსა და MIT-ის მკვლევართა ჯგუფმა ჟურნალ Science-ში ახლახან გამოაქვეყნა კვლევა, რომელიც იმაზე მიუთითებს, რომ ეს „ყუთი“ არც ისე იდუმალია, როგორც გვეგონა.
ჯგუფმა აღმოაჩინა, რომ ხელოვნურ ინტელექტში არსებული კომპლექსური კონცეფციები – სპეციფიკური ენებიდან, როგორიცაა ჰინდი, აბსტრაქტულ იდეებამდე, მაგალითად, შეთქმულების თეორიებამდე – მოდელის მათემატიკურ სივრცეში რეალურად მარტივი, სწორი ხაზების, ანუ ვექტორების სახით ინახება. Recursive Feature Machine (RFM) – ახალი ინსტრუმენტის გამოყენებით, რომელიც არის მახასიათებლების ამოღების ტექნიკა, რაც კონცეფციების წარმომდგენი ხაზოვანი შაბლონებს იდენტიფიცირებს – განწყობებიდან და შიშებიდან დაწყებული, რთულ აზროვნებამდე – მკვლევრებმა შეძლეს ამ გზების ზუსტად მიკვლევა. მას შემდეგ, რაც კონცეფციის მიმართულება დადგინდება, მისი „კორექტირება“ შესაძლებელია. ამ ვექტორების მათემატიკურად მიმატებით ან გამოკლებით, გუნდს შეეძლო მოდელის ქცევის მყისიერად შეცვლა ძვირადღირებული გადამზადების ან რთული მოთხოვნების გარეშე.
ამ მეთოდის ეფექტურობამ ინდუსტრიაში დიდი აჟიოტაჟი გამოიწვია. მხოლოდ ერთი სტანდარტული GPU-ის (NVIDIA A100) გამოყენებით, გუნდს შეეძლო კონცეფციის იდენტიფიცირება და მართვა ერთ წუთზე ნაკლებ დროში, რაც 500-ზე ნაკლებ საწვრთნელ ნიმუშს მოითხოვდა. ხელოვნური ინტელექტისადმი ამ „ქირურგიული“ მიდგომის პრაქტიკული გამოყენება დაუყოვნებელია. ერთ-ერთ ექსპერიმენტში მკვლევრებმა მოდელი ისე მართეს, რომ გაუმჯობესებულიყო მისი Python კოდის C++-ად თარგმნის უნარი. კოდის „ლოგიკის“ ენის „სინტაქსისგან“ იზოლირებით, მართულმა მოდელმა აჯობა სტანდარტულ ვერსიებს, რომლებსაც უბრალოდ ტექსტური მოთხოვნის საშუალებით „თარგმნა“ სთხოვეს.
მკვლევრებმა ასევე აღმოაჩინეს, რომ ამ ვექტორების შიდა „გამოძიება“ ხელოვნური ინტელექტის ჰალუცინაციების ან ტოქსიკური შინაარსის დასადგენად უფრო ეფექტური გზაა, ვიდრე ხელოვნური ინტელექტისთვის საკუთარი ნამუშევრის შეფასების თხოვნა. არსებითად, მოდელმა ხშირად „იცის“, რომ ის იტყუება ან არის ტოქსიკური შინაგანად, თუნდაც მისი საბოლოო გამომავალი საპირისპიროს მიუთითებდეს. შიდა მათემატიკის შესწავლით, მკვლევრებს შეუძლიათ ამ პრობლემების აღმოჩენა ერთი სიტყვის გენერირებამდეც კი.
თუმცა, იგივე ტექნოლოგიამ, რომელიც ხელოვნურ ინტელექტს უფრო უსაფრთხოს ხდის, შესაძლოა ის უფრო სახიფათოც გახადოს. კვლევამ აჩვენა, რომ უარის თქმის კონცეფციის მნიშვნელობის „შემცირებით“, მკვლევრებს შეეძლოთ მოდელების დაცვის ეფექტურად გვერდის ავლა (jailbreak). ტესტებში, მართულმა მოდელებმა გვერდი აუარეს საკუთარ დამცავ მექანიზმებს, რათა მიეცათ ინსტრუქციები უკანონო ქმედებებთან დაკავშირებით ან ხელი შეეწყოთ გაბათილებული შეთქმულების თეორიებისთვის.
შესაძლოა, ყველაზე გასაკვირი აღმოჩენა ამ კონცეფციების უნივერსალურობა იყო. ინგლისური მონაცემებიდან ამოღებული „შეთქმულების თეორეტიკოსის“ ვექტორი ისევე ეფექტურად მუშაობდა, როდესაც მოდელი ჩინურად ან ჰინდიდ საუბრობდა. ეს მხარს უჭერს „ხაზოვანი წარმოდგენის ჰიპოთეზას“ – იდეას, რომ ხელოვნური ინტელექტის მოდელები ადამიანურ ცოდნას სტრუქტურირებული, ხაზოვანი გზით აწყობენ, რომელიც ცალკეულ ენებს სცდება.
მიუხედავად იმისა, რომ კვლევა ფოკუსირებული იყო ღია კოდის მოდელებზე, როგორიცაა Meta-ს Llama და DeepSeek, ასევე OpenAI-ის GPT-4o, მკვლევრებს მიაჩნიათ, რომ აღმოჩენები ყველა მოდელზე ვრცელდება. რაც უფრო დიდი და დახვეწილი ხდება მოდელები, ისინი რეალურად უფრო მართვადნი ხდებიან და არა ნაკლებ. გუნდის შემდეგი მიზანია ამ მართვის მეთოდების დახვეწა, რათა რეალურ დროში მოერგოს მომხმარებლის სპეციფიკურ მოთხოვნებს, რაც პოტენციურად გამოიწვევს მომავალს, სადაც ხელოვნური ინტელექტი არ იქნება მხოლოდ ჩატბოტი, რომელსაც ვესაუბრებით, არამედ სისტემა, რომლის მათემატიკურად „მორგებაც“ შეგვიძლია სრულყოფილი სიზუსტისა და უსაფრთხოებისთვის.
თეგები:
#ხელოვნური ინტელექტი
#llm
#ეთიკა
#კვლევა
#მანქანური სწავლება
#დიდი ენობრივი მოდელები
#მეცნიერება
#კიბერუსაფრთხოება
#ვექტორები
#ai მართვა
წყარო: qudata.com
AI-ით გადამუშავებული