ეს გამოწვევა განსაკუთრებით მწვავედ დგას დეველოპერებისთვის, რომლებიც იაპონური ენისა და კულტურის გამგები AI სისტემებს ქმნიან. მაშინ როდესაც ინგლისურენოვანი სასწავლო მონაცემები უხვადაა ხელმისაწვდომი, იაპონელი დეველოპერები მონაცემთა ქრონიკული დეფიციტის პრობლემას აწყდებიან. კატასტროფულად აკლია ამოცანებზე ორიენტირებული და იაპონურ კულტურაში ფესვგადგმული მონაცემები, რაც მაღალი ხარისხის მოდელების თავიდანვე გაშვებისთვის არის აუცილებელი. ახალი ნიმუშების შეგროვება, გასუფთავება და მარკირება დროისა და რესურსების დიდ დანახარჯს მოითხოვს, რაც ართულებს ხელოვნური ინტელექტის სწრაფ განვითარების ციკლს ფეხის აწყობას. შედეგად, იქმნება „მონაცემთა კედელი“, რომელიც ხელს უშლის ინოვაციებს ჯერ კიდევ მათ დაწყებამდე. IT გიგანტი NTT DATA-ს ახალი კვლევა აჩვენებს, თუ როგორ შეიძლება ამ ბარიერის დანგრევა სინთეზური მონაცემების მეშვეობით. მინიმალური საკუთარი მონაცემების გამოყენებით შესაძლებელია სამუშაო დონის მასშტაბური სასწავლო მონაცემთა ნაკრების გენერირება, ისე, რომ არ დაირღვეს კონფიდენციალურობა და არ დაზიანდეს მოდელის წარმადობა. NTT DATA-მ NVIDIA Nemotron-Personas-Japan-ის (NVIDIA-ს პირველი ღია სინთეზური მონაცემთა ნაკრები, რომელიც NeMo Data Designer-ის გამოყენებით შეიქმნა და იაპონურ დემოგრაფიას, გეოგრაფიასა და კულტურაზე დაფუძნებულ 6 მილიონ პერსონას მოიცავს) გამოყენებით, იურიდიული კითხვა-პასუხის ამოცანებში მოდელის სიზუსტე 15.3%-დან 79.3%-მდე გაზარდა, რითაც პასუხების თანმიმდევრულობაც მნიშვნელოვნად გაუმჯობესდა. ამან შესაძლებელი გახადა 60 ქულით გაუმჯობესება კონფიდენციალური მონაცემების სასწავლო პროცესში გაჟღერების გარეშე. ექსპერიმენტის საერთო მეთოდოლოგიისა და შეფასების ფრეიმვორკის მოყვარულ მკითხველს, NTT DATA-ს დეტალური ტექნიკური ანგარიში (იაპონურად) უფრო ღრმად განიხილავს ამ კვლევის დიზაინსა და შედეგებს. აქედან გამომდინარე მნიშვნელოვანი დასკვნა ის არის, რომ კომპანიებს შეუძლიათ ააგონ დომენ-სპეციფიკური AI სრულად ღია კოდის ინფრასტრუქტურის გამოყენებით, თუნდაც ხელთ არსებული მინიმალური საკუთარი მონაცემებით. ღია პერსონა მონაცემების გამოყენება შესაძლებელს ხდის როგორც მაღალი ხარისხის მოდელების შექმნას, ასევე მონაცემთა უფრო მოქნილ ოპერირებას. ამ მიდგომის მკაცრი ვერიფიკაციის მიზნით, NTT DATA-მ განახორციელა კონტროლირებადი შეფასება ფიქტიური იურიდიული დოკუმენტების გამოყენებით, რათა მოდელს ჭეშმარიტად ახალი ცოდნა შეეძინა. სწავლებისთვის გამოყენებულ იქნა შემდეგი კონფიგურაცია: * საბაზისო მოდელი: tsuzumi-v2.0-28B-instruct (NTT-ის საკუთარი LLM) * მონაცემთა გაფართოების მოდელი: GPT-OSS-120b * საწყისი მონაცემები: Nemotron-Personas-Japan * შემფასებელი მოდელი: GPT-5 (LLM-როგორც-მოსამართლე მეთოდი) Nemotron-Personas-Japan-დან მოპოვებული 500 პერსონის გამოყენებით და მხოლოდ 450 დაუმუშავებელი საწყისი ნიმუშის გაფართოებით, გენერირებულ იქნა 138,000-ზე მეტი სასწავლო მონაცემი (რაც ხელით შექმნილი ექვივალენტური ნიმუშების 300-ჯერ მეტ სინთეზურ მონაცემთა ნაკრებს უდრის), რამაც მოდელის სიზუსტე 15.3%-დან 79.3%-მდე გაზარდა. ეს შედეგი ნათლად მეტყველებს იმ მონაცემთა დეფიციტის გამოწვევაზე, რომელსაც კომპანიები აწყდებიან. სინთეზური მონაცემებით სწავლამ არა მხოლოდ სიზუსტე გააუმჯობესა, არამედ აღმოფხვრა ჰალუცინაციებიც, რომლებიც საბაზისო მოდელისთვის პრობლემური იყო. მაშინ როდესაც სწავლამდელმა მოდელმა სარწმუნო, მაგრამ მცდარი იურიდიული კლასიფიკაციები შექმნა, დახვეწილმა მოდელმა შეძლო ზუსტი ტერმინოლოგიის ამოღება ზედმეტი ხმაურის გარეშე. საწარმოს გარემოში დანერგვისთვის, ალბათ, ყველაზე ღირებული აღმოჩენაა NTT DATA-ს დასკვნა, რომ საკმარისი რაოდენობის სინთეზური მონაცემების არსებობის შემთხვევაში „უწყვეტი წინასწარი სწავლება (CPT)“ სავალდებულო აღარ არის. ეს ნიშნავს, რომ დეველოპერებს შეუძლიათ სრულად გამოტოვონ CPT-ის გამოთვლითი რესურსების ინტენსიური პროცესი და კონცენტრირდნენ ზედამხედველობითი დახვეწისთვის (SFT) უფრო განმეორებითი სინთეზური მონაცემების გენერირებაზე, რაც უფრო ეკონომიურ სასწავლო პროცესს გულისხმობს. ეფექტურობის ეს ზრდა პირდაპირ იწვევს გამოთვლითი ხარჯების შემცირებას და განვითარების ციკლის დაჩქარებას. NTT DATA-ს ტექნოლოგიური ინოვაციების შტაბის AI ტექნოლოგიების დეპარტამენტის ხელმძღვანელი, შინია ჰიგუჩი აცხადებს: „Nemotron Personas-ის გამოყენებით მცირე რაოდენობის საკუთარი მონაცემთა ნაკრების გაფართოება გვაძლევს საშუალებას, ეფექტურად ავაშენოთ ამოცანებზე ორიენტირებული მოდელები, მაშინაც კი, როცა ხელმისაწვდომი მონაცემები შეზღუდულია. ეს მიდგომა დიდ პოტენციალს აჩვენებს ისეთ სფეროებში შედეგების გასაუმჯობესებლად, როგორიცაა წინასწარი კვლევა, მომხმარებელთა მხარდაჭერა და მარკეტინგი, სადაც საკუთარი მონაცემები ხშირად დეფიციტურია.“ მიუხედავად იმისა, რომ სიზუსტის ეს ზრდა მიმზიდველია, ამავე დროს უფრო ღრმა კითხვებიც ჩნდება. რა ბედი ეწევა მონაცემებს, რომლებიც საერთოდ ვერ ხვდებიან სასწავლო პროცესში (ვერ გამოიყენება)? ღირებული კორპორატიული მონაცემების 90%-ზე მეტი გამოუყენებელი რჩება კონფიდენციალურობის რეგულაციების, უსაფრთხოების რისკებისა და ლიცენზირების შეზღუდვების გამო. იაპონიაში ამ რეალობას ადასტურებს ისეთი ჩარჩოები, როგორიცაა პერსონალური ინფორმაციის დაცვის აქტი (PIPA) და ინოვაციებზე ორიენტირებული AI მმართველობის გაიდლაინები (გამოქვეყნდება 2025 წლის სექტემბერში). AI-ის პროგრესის დაჩქარების პირობებშიც კი, მონაცემების პასუხისმგებლობით მოპყრობა აუცილებელია. სინთეზური მონაცემები ამ წინააღმდეგობრივი გამოწვევების გადაწყვეტის გზას გვთავაზობს. პერსონალური საიდენტიფიკაციო ინფორმაციის (PII) გარეშე სასწავლო მონაცემების გენერირებით, რომლებიც ზუსტად ასახავს რეალური მონაცემების ტენდენციებს (ნიმუშებს), კომპანიებს შეუძლიათ ერთდროულად მიაღწიონ მონაცემთა მინიმიზაციასა და მოდელის წარმადობის გაუმჯობესებას. თავდაპირველი გაშვებისთვის მხოლოდ მინიმალური საკუთარი მონაცემებია საჭირო, შემდეგ კი შესაძლებელია მისი გაფართოება სინთეზური მონაცემებით სამუშაო დონის მასშტაბამდე. ეს ნიშნავს, რომ სინთეზური მონაცემები არ არის უბრალოდ „სასწავლო პროცესის ოპტიმიზაციის მეთოდი“. ის არის კონფიდენციალურობის გამაძლიერებელი ტექნოლოგია (PET), რომელიც აღწევს იდეალურ ბალანსს (გოლდილოქსის ზონას), სადაც მონაცემთა შესაბამისობა და AI-ის წარმადობა თანაარსებობს. გარდა ამისა, მონაცემთა სინთეზის მექანიზმი ხასიათდება რეპროდუცირებადობითა და აუდიტისუნარიანობით, რაც აკმაყოფილებს სანდოობისა და გამჭვირვალობის მოთხოვნებს, რომლებსაც მმართველობის გუნდები და მარეგულირებელი ორგანოები სულ უფრო მეტად ითხოვენ. სუვერენული AI-ის მშენებელი იაპონური კომპანიებისთვის მონაცემთა სუვერენიტეტი აუცილებელი პირობაა. თუმცა, მხოლოდ სუვერენიტეტი საკმარისი არ არის. მოდელებს ესაჭიროებათ ასევე საფუძვლიანი ინტელექტი, რომელიც ჩამოყალიბებულია რეგიონული ნორმებითა და დომენის შეზღუდვებით და არა სტატისტიკურად მიკერძოებული, დასავლეთზე ორიენტირებული კორპუსებით. Nemotron-Personas-Japan საფუძვლად ედება ამ რეალობაზე დაფუძნებული AI-ის შექმნას. 6 მილიონი პერსონა დაფუძნებულია იაპონიის ოფიციალურ დემოგრაფიულ და შრომით სტატისტიკაზე და მოიცავს 1,500-ზე მეტ პროფესიულ კლასიფიკაციასა და რეგიონულ განაწილებას. თუმცა, მისი გავლენა არ შემოიფარგლება მხოლოდ ცალკეული ორგანიზაციებით. NTT DATA-ს ჩათვლით წამყვანი კომპანიები აქტიურად მუშაობენ „მონაცემთა სივრცეების“ განვითარებაზე. ეს არის თანამშრომლობითი გარემო, სადაც მთავრობებსა და კომპანიებს შეუძლიათ AI-ის სწავლისთვის სინთეზური მონაცემების გაცვლა საერთო მმართველობისა და კონფიდენციალურობის გარანტიების პირობებში. ბოლოდან-ბოლომდე დაშიფვრის ტექნოლოგიები, როგორიცაა ფედერაციული სწავლება (Federated Learning), ამ დეცენტრალიზებულ მიდგომას შესაძლებელს ხდის. სინთეზური მონაცემები ამას კიდევ უფრო აძლიერებს, რაც ორგანიზაციებს საშუალებას აძლევს, უსაფრთხოდ მიაწოდონ საკუთარი მონაცემების ტენდენციები (ნიმუშები) სინთეზური მონაცემების სახით, საწყისი კონფიდენციალური ინფორმაციის გამჟღავნების გარეშე. ეს ცვლის მონაცემთა რისკების მართვის მიდგომას თავდაცვითი პოზიციიდან „თანამშრომლობით პოზიციაზე“, რაც შეესაბამება იაპონიის ხედვას „ინოვაციებით განპირობებული AI მმართველობის“ შესახებ. გარდა ამისა, ეს მიდგომა კითხვის ნიშნის ქვეშ აყენებს სტერეოტიპს, რომ AI-ის ევოლუცია უნდა მოდიოდეს რამდენიმე მასშტაბური, გლობალურად გაწვრთნილი მოდელისგან. ნაცვლად ამისა, ის მიუთითებს მომავალზე, სადაც სუვერენული და ურთიერთმოქმედი AI სისტემები შენდება თითოეულ რეგიონში, ღია და კონფიდენციალურობის დაცვის საფუძველზე. „მონაცემთა კედელი“ ნამდვილად არსებობს. თუმცა, როგორც NTT DATA-ს კვლევა გვიჩვენებს, მისი გადალახვის ინსტრუმენტები უკვე ღია და ყველასთვის ხელმისაწვდომია. სინთეზური მონაცემები აღარ არის „მომავლის ტექნოლოგია“. ეს არის რეალური გადაწყვეტა, რომელიც დეველოპერებს „ახლავე“ შეუძლიათ დანერგონ, რათა ააგონ მონაცემთა სუვერენული, იაპონურ კულტურაში ფესვგადგმული AI სისტემები, კონფიდენციალურობისა და წარმადობის კომპრომისის გარეშე. მოდით, დავიწყოთ! გამოიყენეთ ღია კოდის NeMo Data Designer ბიბლიოთეკა ან იხილეთ Nemotron-Personas-Japan მონაცემთა ნაკრები, რომელიც Hugging Face-ზეა გამოქვეყნებული. უფრო დეტალური ტექნიკური ინფორმაციისთვის იხილეთ NTT DATA-ს ვრცელი ანგარიში (იაპონურად), რომელიც მოიცავს მეთოდოლოგიასა და ექსპერიმენტულ დიზაინს. Nemotron-Personas-Japan ხელმისაწვდომია CC BY 4.0 ლიცენზიით, როგორც კომერციული, ისე არაკომერციული გამოყენებისთვის.