NTT DATA-ს კვლევა: როგორ ხსნის სინთეზური მონაცემები იაპონიის AI-ის მონაცემთა კედელს
იაპონიაში ხელოვნური ინტელექტის (AI) დეველოპერები ექმნებათ მონაცემთა ქრონიკულ დეფიციტს, განსაკუთრებით იაპონური კულტურისა და ენის სპეციფიკური ამოცანებისთვის. NTT DATA-ს ახალი კვლევა, NVIDIA Nemotron-Personas-Japan-ის გამოყენებით, აჩვენებს, რომ სინთეზურ მონაცემებს შეუძლიათ ამ გამოწვევის დაძლევა. ექსპერიმენტმა აჩვენა მოდელის სიზუსტის მნიშვნელოვანი ზრდა იურიდიული Q&A ამოცანებში (15.3%-დან 79.3%-მდე) კონფიდენციალურობის დარღვევის გარეშე. ეს მიდგომა შესაძლებელს ხდის მაღალი ხარისხის, კულტურულად სპეციფიკუ
ეს გამოწვევა განსაკუთრებით მწვავეა დეველოპერებისთვის, რომლებიც ქმნიან ხელოვნური ინტელექტის (AI) სისტემებს იაპონური ენისა და კულტურის გასაგებად. მიუხედავად იმისა, რომ სასწავლო მონაცემები ინგლისურ ენაზე უხვად არის ხელმისაწვდომი, იაპონელი დეველოპერები მონაცემთა ქრონიკული დეფიციტის პრობლემას აწყდებიან. უზარმაზარი დეფიციტია ამოცანებზე ორიენტირებული და იაპონურ კულტურაზე დაფუძნებული მონაცემების, რაც საჭიროა მაღალი ხარისხის მოდელების თავიდანვე ასაშენებლად. ახალი ნიმუშების შეგროვება, გაწმენდა და მარკირება შრომატევადი და ძვირადღირებულია, რაც ართულებს ხელოვნური ინტელექტის სწრაფ განვითარების ციკლს ფეხის აწყობას. შედეგად, იქმნება მონაცემთა კედელი, რომელიც აფერხებს ინოვაციებს მის დაწყებამდე.
მსხვილი IT კომპანიის, NTT DATA-ს ახალი კვლევა აჩვენებს, თუ როგორ შეიძლება ამ კედლის დანგრევა სინთეზური მონაცემებით. შესაძლებელია ოპერაციული დონის მასშტაბური სასწავლო მონაცემთა ნაკრების გენერირება მინიმალური ხელმისაწვდომი საკუთარი მონაცემებიდან, კონფიდენციალურობის ან მოდელის მუშაობის კომპრომეტირების გარეშე. NVIDIA Nemotron-Personas-Japan-ის (NVIDIA-ს პირველი ღია სინთეზური მონაცემთა ნაკრები, რომელიც შედგება 6 მილიონი პერსონისგან, შექმნილი NeMo Data Designer-ის გამოყენებით, იაპონური დემოგრაფიის, გეოგრაფიისა და კულტურის საფუძველზე) გამოყენებით, NTT DATA-მ მოდელის სიზუსტე იურიდიულ Q&A ამოცანებში 15.3%-დან 79.3%-მდე გაზარდა და პასუხების თანმიმდევრულობაშიც ანალოგიური მნიშვნელოვანი გაუმჯობესება მიაღწია. ეს ნიშნავს 60 ქულიანი ზრდის მიღწევას კონფიდენციალური მონაცემების სასწავლო არხისთვის გაუმჟღავნებლად. მკითხველებისთვის, რომლებსაც აინტერესებთ ექსპერიმენტის საერთო მეთოდოლოგია და შეფასების ჩარჩო, NTT DATA-ს დეტალური ტექნიკური ანგარიში (იაპონურ ენაზე) უფრო ღრმად აანალიზებს ამ კვლევის დიზაინსა და შედეგებს.
აქედან მიღებული მნიშვნელოვანი დასკვნა ის არის, რომ კომპანიებს შეუძლიათ შექმნან დომენზე სპეციალიზებული AI სრულად ღია კოდის ინფრასტრუქტურის გამოყენებით, მინიმალური ხელმისაწვდომი საკუთარი მონაცემებიდანაც კი. ღია პერსონა მონაცემების გამოყენებით, შესაძლებელია როგორც მაღალი ხარისხის მოდელების შექმნა, ასევე მონაცემთა მოქნილი ოპერაციების განხორციელება. ამ მიდგომის მკაცრად შესამოწმებლად, NTT DATA-მ ჩაატარა კონტროლირებული შეფასება გამოგონილი იურიდიული დოკუმენტების გამოყენებით, რათა მოდელმა ნამდვილად შეეძლო ახალი ცოდნის შეძენა. სწავლისთვის გამოყენებული იქნა შემდეგი კონფიგურაცია: საბაზისო მოდელი: tsuzumi-v2.0-28B-instruct (NTT-ის საკუთარი LLM), მონაცემთა გაფართოების მოდელი: GPT-OSS-120b, საწყისი მონაცემები: Nemotron-Personas-Japan, შეფასების მოდელი: GPT-5 (LLM-as-a-judge მეთოდი). Nemotron-Personas-Japan-დან ამოღებული 500 პერსონისა და მხოლოდ 450 დაუმუშავებელი საწყისი ნიმუშის გაფართოებით, გენერირდა 138,000-ზე მეტი სასწავლო მონაცემი (სინთეზური მონაცემთა ნაკრები, რომელიც 300-ჯერ აღემატება ადამიანის მიერ შექმნილ ეკვივალენტურ ნიმუშებს) და მოდელის სიზუსტე 15.3%-დან 79.3%-მდე გაუმჯობესდა. ეს შედეგი ნათლად მეტყველებს მონაცემთა დეფიციტის გამოწვევაზე, რომლის წინაშეც დგანან კომპანიები.
სინთეზური მონაცემებით სწავლამ არა მხოლოდ გააუმჯობესა სიზუსტე, არამედ აღმოფხვრა ჰალუცინაციები, რომლებიც აწუხებდა საბაზისო მოდელს. მიუხედავად იმისა, რომ სწავლამდე მოდელი ქმნიდა სავარაუდო, მაგრამ არასწორ იურიდიულ კლასიფიკაციებს, დაწვრილებით გაუმჯობესებულმა მოდელმა შეძლო ზუსტი ტერმინოლოგიის ამოღება ზედმეტი ხმაურის გარეშე.
ალბათ ყველაზე ღირებული აღმოჩენა საწარმოო გარემოში დანერგვისთვის არის ის, რომ NTT DATA-მ დაადგინა, რომ "უწყვეტი წინასწარი სწავლება (CPT)" აღარ არის სავალდებულო, თუ საკმარისი რაოდენობის სინთეზური მონაცემებია ხელმისაწვდომი დეტალური გაუმჯობესებისთვის. ეს ნიშნავს, რომ დეველოპერებს შეუძლიათ მთლიანად გამოტოვონ CPT-ის პროცესი, რომელიც მოიხმარს უამრავ გამოთვლით რესურსს, და კონცენტრირდნენ ზედამხედველობითი დეტალური გაუმჯობესებისთვის (SFT) უფრო განმეორებითი სინთეზური მონაცემების გენერირებაზე, რითაც გამოიყენებენ უფრო ხარჯთეფექტურ სასწავლო არხს. ამ ეფექტურობის გაზრდა პირდაპირ იწვევს გამოთვლითი ხარჯების შემცირებას და განვითარების ციკლების დაჩქარებას.
NTT DATA-ს ტექნოლოგიური ინოვაციების შტაბის AI ტექნოლოგიების განყოფილების დირექტორმა, შინია ჰიგუჩიმ განაცხადა: „Nemotron Personas-ის გამოყენებით მცირე რაოდენობის საკუთარი მონაცემთა ნაკრების გაფართოება გვაძლევს საშუალებას, ეფექტურად ავაშენოთ ამოცანებზე სპეციალიზებული მოდელები, მაშინაც კი, როდესაც ხელმისაწვდომი მონაცემები შეზღუდულია. ეს მიდგომა დიდ პოტენციალს აჩვენებს ისეთ სფეროებში შედეგების გაუმჯობესებისთვის, სადაც საკუთარი მონაცემები ხშირად დეფიციტურია, როგორიცაა წინასწარი კვლევა, მომხმარებელთა მხარდაჭერა და მარკეტინგი.“
აქ სიზუსტის გაუმჯობესება მიმზიდველია, მაგრამ ამავდროულად უფრო ღრმა კითხვებსაც ბადებს. რა ბედი ეწევა მონაცემებს, რომლებიც საერთოდ ვერ ხვდება სასწავლო არხში (არ არის გამოსაყენებელი)? ღირებული კორპორატიული მონაცემების 90%-ზე მეტი გამოუყენებელი რჩება კონფიდენციალურობის რეგულაციების, უსაფრთხოების რისკებისა და ლიცენზირების შეზღუდვების გამო. იაპონიაში, ამ რეალობას ადასტურებს ისეთი ჩარჩოები, როგორიცაა პერსონალური ინფორმაციის დაცვის აქტი (PIPA) და ინოვაციებზე ორიენტირებული AI მმართველობის სახელმძღვანელო პრინციპები (გამოქვეყნდება 2025 წლის სექტემბერში). AI-ის პროგრესის დაჩქარების პირობებშიც კი, მონაცემთა პასუხისმგებელი დამუშავება აუცილებელია. სინთეზური მონაცემები გზას აძლევს ამ ურთიერთსაწინააღმდეგო გამოწვევების გადასაჭრელად. პერსონალური საიდენტიფიკაციო ინფორმაციის (PII) გარეშე სასწავლო მონაცემების გენერირებით, რომლებიც ზუსტად ასახავს რეალური მონაცემების ტენდენციებს (ნიმუშებს), კომპანიებს შეუძლიათ ერთდროულად მიაღწიონ მონაცემთა მინიმიზაციას და მოდელის მუშაობის გაუმჯობესებას. საწყისი გაშვებისთვის გამოიყენება მხოლოდ მინიმალური საკუთარი მონაცემები, შემდეგ კი ის შეიძლება გაფართოვდეს ოპერაციული დონის მასშტაბამდე სინთეზური მონაცემებით.
ეს ნიშნავს, რომ სინთეზური მონაცემები არ არის მხოლოდ „სწავლის პროცესის ოპტიმიზაციის მეთოდი“. ეს არის კონფიდენციალურობის გამაძლიერებელი ტექნოლოგია (PET), რომელიც აღწევს იდეალურ ბალანსს („ოქროს ზონა“), სადაც თანაარსებობს მონაცემთა შესაბამისობა და AI-ის მუშაობა. გარდა ამისა, მონაცემთა სინთეზის არხი ხასიათდება რეპროდუცირებადობითა და აუდიტირებადობით, რაც აკმაყოფილებს სანდოობისა და გამჭვირვალობის მოთხოვნებს, რომლებსაც მმართველობის გუნდები და მარეგულირებელი ორგანოები სულ უფრო მეტად მოითხოვენ.
იაპონური კომპანიებისთვის, რომლებიც ქმნიან სუვერენულ AI-ს, მონაცემთა სუვერენიტეტი აუცილებელი პირობაა. თუმცა, მხოლოდ სუვერენიტეტი არ არის საკმარისი. მოდელებს ასევე სჭირდებათ დასაბუთებული ინტელექტი, რომელიც ფორმირებულია რეგიონული ნორმებითა და დომენის შეზღუდვებით, და არა მხოლოდ სტატისტიკურად მიკერძოებული დასავლეთზე ორიენტირებული კორპუსით. Nemotron-Personas-Japan ფუნქციონირებს, როგორც საბაზისო მონაცემები რეალობაზე დაფუძნებული AI-ის შესაქმნელად. 6 მილიონი პერსონა ეფუძნება იაპონიის ოფიციალურ დემოგრაფიულ და შრომის სტატისტიკას, მოიცავს 1,500-ზე მეტ პროფესიულ კლასიფიკაციას და რეგიონულ განაწილებას.
თუმცა, მისი გავლენა არ შემოიფარგლება მხოლოდ ინდივიდუალური ორგანიზაციებით. NTT DATA და სხვა წამყვანი კომპანიები აქტიურად მუშაობენ „მონაცემთა სივრცეების“ განვითარებაზე. ეს არის თანამშრომლობითი გარემო, სადაც მთავრობებსა და კომპანიებს შეუძლიათ გაცვალონ სინთეზური მონაცემები AI სწავლებისთვის საერთო მმართველობისა და კონფიდენციალურობის გარანტიების ქვეშ. დაშიფვრის ტექნოლოგიები, როგორიცაა ფედერაციული სწავლება (Federated Learning) უზრუნველყოფს ამ დეცენტრალიზებულ მიდგომას. სინთეზური მონაცემები ამას კიდევ უფრო მძლავრად უწყობს ხელს, რაც ორგანიზაციებს საშუალებას აძლევს უსაფრთხოდ მიაწოდონ საკუთარი მონაცემების ტენდენციები (ნიმუშები) სინთეზური მონაცემების სახით, ორიგინალური კონფიდენციალური ინფორმაციის გამჟღავნების გარეშე. ეს გადაიტანს მონაცემთა რისკის მართვას დაცვითი პოზიციიდან „თანამშრომლობით პოზიციაზე“, რაც შეესაბამება იაპონიის ხედვას „ინოვაციებზე ორიენტირებული AI მმართველობის“ შესახებ. ეს მიდგომა ასევე ეჭვქვეშ აყენებს სტერეოტიპს, რომ „AI-ის ევოლუცია უნდა მოდიოდეს გლობალურად გაწვრთნილი რამდენიმე გიგანტური მოდელიდან“. სამაგიეროდ, ის მიუთითებს მომავალზე, სადაც სუვერენული და ურთიერთმოქმედი AI სისტემები აშენდება რეგიონულად ღია და კონფიდენციალურობით დაცულ საფუძვლებზე.
„მონაცემთა კედელი“ ნამდვილად არსებობს. თუმცა, როგორც NTT DATA-ს კვლევა გვიჩვენებს, მისი გადალახვის ინსტრუმენტები უკვე ღია და ყველასთვის ხელმისაწვდომია. სინთეზური მონაცემები აღარ არის „მომავლის ტექნოლოგია“. ეს არის რეალური გადაწყვეტა, რომელიც დეველოპერებს შეუძლიათ „ახლავე“ დანერგონ, რათა შექმნან მონაცემთა სუვერენული, იაპონურ კულტურაზე დაფუძნებული AI სისტემები კონფიდენციალურობისა და მუშაობის კომპრომეტირების გარეშე.
რატომ არ დაიწყებთ ახლავე? გამოიყენეთ ღია კოდის NeMo Data Designer ბიბლიოთეკა, ან გაეცანით Nemotron-Personas-Japan მონაცემთა ნაკრებს Hugging Face-ზე. უფრო დეტალური ტექნიკური ინფორმაციისთვის, იხილეთ NTT DATA-ს დეტალური ანგარიში (იაპონურ ენაზე), რომელიც მოიცავს მეთოდოლოგიასა და ექსპერიმენტის დიზაინს. Nemotron-Personas-Japan ხელმისაწვდომია კომერციული და არაკომერციული გამოყენებისთვის CC BY 4.0 ლიცენზიის პირობებით.
თეგები:
#ხელოვნური ინტელექტი
#llm
#nvidia
#კონფიდენციალურობა
#მონაცემთა სუვერენიტეტი
#სინთეზური მონაცემები
#იაპონია
#nemotron-personas-japan
#ntt data
#მონაცემთა დეფიციტი
წყარო: huggingface.co
AI-ით გადამუშავებული