ეს გამოწვევა განსაკუთრებით მწვავედ დგას დეველოპერებისთვის, რომლებიც ქმნიან ხელოვნური ინტელექტის სისტემებს, რომლებსაც ესმით იაპონური ენა და კულტურა. მაშინ, როცა ინგლისურენოვანი სასწავლო მონაცემები უხვადაა, იაპონელი დეველოპერები მუდმივი სიმცირის პრობლემის წინაშე დგანან: არასაკმარისი ამოცანაზე ორიენტირებული, კულტურულად დასაბუთებული მონაცემები მაღალეფექტური მოდელების შესაქმნელად. ახალი მაგალითების შეგროვება, გასუფთავება და ეტიკეტირება ნელია, ძვირია და იშვიათად მიჰყვება განმეორებით ციკლებს. შედეგი არის მონაცემთა კედელი, რომელიც ინოვაციას მის დაწყებამდე ბლოკავს. წამყვანი IT ფირმის, NTT DATA-ს, ახალი კვლევა აჩვენებს, თუ როგორ შეუძლია ხელოვნურ მონაცემებს ამ კედლის დანგრევა – მინიმალური საკუთრების მონაცემების გადაქცევა წარმოების მასშტაბის სასწავლო ნაკრებებად, კონფიდენციალურობისა და შესრულების შენარჩუნებით. Nemotron-Personas-Japan-ის (NVIDIA-ს ღია ხელოვნური მონაცემთა ნაკრები, რომელიც მოიცავს 6 მილიონ კულტურულად დასაბუთებულ იაპონურ პერსონას, გენერირებულს NeMo Data Designer-ით) გამოყენებით, NTT DATA-მ მოდელის სიზუსტის მასიური ზრდა მიაღწია იურიდიულ კითხვა-პასუხის ამოცანაში, 15.3%-დან 79.3%-მდე გაზრდით, პასუხების თანმიმდევრულობის მსგავსი ნახტომით. ეს არის 60-ზე მეტი ქულით გაუმჯობესება, მიღწეული მგრძნობიარე მონაცემების სასწავლო მილსადენისთვის გამოვლენის გარეშე. მკითხველებისთვის, რომლებიც დაინტერესებულნი არიან სრული ექსპერიმენტული მეთოდოლოგიითა და შეფასების ჩარჩოთი, NTT DATA-ს დეტალური ტექნიკური აღწერა (ხელმისაწვდომია იაპონურ ენაზე) უფრო ღრმა ხედვას გვთავაზობს კვლევის დიზაინსა და შედეგებზე. დასკვნა: საწარმოებს შეუძლიათ დომენზე ორიენტირებული ინტელექტის შექმნა მინიმალური საკუთრების მონაცემებით, მთლიანად ღია კოდის ინფრასტრუქტურის გამოყენებით. ღია პერსონები შესაძლებელს ხდის როგორც უკეთეს მოდელებს, ასევე მონაცემთა უფრო მოქნილ ოპერაციებს. მიდგომის მკაცრად შესამოწმებლად, NTT DATA-მ შექმნა კონტროლირებადი შეფასება გამოგონილი იურიდიული დოკუმენტების გამოყენებით, რამაც უზრუნველყო მოდელს ჭეშმარიტად ახალი ცოდნის შეძენა. ვარჯიშისთვის მათ გამოიყენეს შემდეგი: საბაზო მოდელი: tsuzumi-v2.0-28B-instruct (NTT-ის საკუთრების LLM) მონაცემთა გაფართოების მოდელი: GPT-OSS-120b საწყისი მონაცემები: Nemotron-Personas-Japan შემფასებელი მოდელი: GPT-5 (LLM-as-a-judge მეთოდი) Nemotron-Personas-Japan-დან 500 პერსონის გამოყენებით მხოლოდ 450 ნედლი საწყისი ნიმუშის გასაფართოებლად, მათ შექმნეს 138 000-ზე მეტი სასწავლო მაგალითი – ხელოვნური ნაკრები, რომელიც 300-ჯერ აღემატება სახელმძღვანელო ეკვივალენტს – და გაზარდეს მოდელის სიზუსტე 15.3%-დან 79.3%-მდე. შედეგები უშუალოდ პასუხობს მონაცემთა სიმცირის გამოწვევას, რომლის წინაშეც დგანან საწარმოები: ნედლი სიზუსტის გარდა, ხელოვნურმა სასწავლო მონაცემებმა აღმოფხვრა ჰალუცინაციები, რომლებიც ბაზისური მოდელისთვის იყო დამახასიათებელი. სადაც გაუწვრთნელ მოდელს შეეძლო დამაჯერებელი, მაგრამ არასწორი იურიდიული კლასიფიკაციების გამოგონება, დახვეწილმა ვერსიამ ისწავლა ზუსტი ტერმინოლოგიის ამოღება ზედმეტი ხმაურის გარეშე. ალბათ ყველაზე ღირებული საწარმოში განთავსებისთვის: NTT DATA-მ აღმოაჩინა, რომ უწყვეტი წინასწარი ვარჯიში (CPT) სურვილისამებრ გახდა, როდესაც საკმარისი ხელოვნური დახვეწის მონაცემები იყო ხელმისაწვდომი. ეს იმაზე მიუთითებს, რომ დეველოპერებს შეუძლიათ გამოიყენონ უფრო ეკონომიური სასწავლო მილსადენი, რომელიც მთლიანად გამოტოვებს რესურსებით ინტენსიურ CPT ფაზას და ფოკუსირებულია უფრო იტერაციულ ხელოვნურ მონაცემთა გენერაციაზე ზედამხედველობითი დახვეწისთვის (SFT). ეს ეფექტურობის ზრდა პირდაპირ ნიშნავს გამოთვლითი ხარჯების შემცირებასა და დაჩქარებულ იტერაციის ციკლებს. მინიმალური საკუთრების მონაცემები. მაქსიმალური დომენური გაუმჯობესება. „მცირე საკუთრების მონაცემთა ნაკრების Nemotron Personas-ით გაფართოებით, ჩვენ შეგვიძლია ეფექტურად ავაშენოთ ამოცანაზე ორიენტირებული მოდელები მაშინაც კი, როდესაც მონაცემთა ხელმისაწვდომობა შეზღუდულია“, – ამბობს შინია ჰიგუჩი, NTT DATA-ს ტექნოლოგიისა და ინოვაციების გენერალური შტაბის AI ტექნოლოგიების დეპარტამენტის უფროსი მენეჯერი. „ეს მიდგომა დიდ პოტენციალს აჩვენებს წინასწარი კვლევის, მომხმარებელთა მხარდაჭერისა და მარკეტინგული აპლიკაციების შედეგების გასაუმჯობესებლად, სადაც საკუთრების მონაცემები მწირია.“ სიზუსტის ზრდა დამაჯერებელია, მაგრამ ის ასევე უფრო ღრმა კითხვას ბადებს: რა ხდება იმ მონაცემებთან, რომლებიც საერთოდ ვერ ხვდება მილსადენში? ღირებული საწარმოო მონაცემების 90%-ზე მეტი გამოუყენებელი რჩება კონფიდენციალურობის რეგულაციების, უსაფრთხოების რისკებისა და ლიცენზირების შეზღუდვების გამო. იაპონიაში, ისეთი ჩარჩოები, როგორიცაა პერსონალური ინფორმაციის დაცვის აქტი (PIPA) და ქვეყნის ინოვაციაზე ორიენტირებული AI მართვის გაიდლაინები (გამოქვეყნდა 2025 წლის სექტემბერში), ამ რეალობას აძლიერებს: მონაცემთა პასუხისმგებლობით დამუშავება არ არის სურვილისამებრ, მაშინაც კი, როდესაც AI განვითარება ჩქარდება. ხელოვნური მონაცემები გთავაზობთ გზას ამ დაძაბულობის გავლით. სასწავლო მაგალითების გენერირებით, რომლებიც ასახავს ავთენტურ ნიმუშებს პერსონალურად იდენტიფიცირებადი ინფორმაციის (PII) გარეშე, ორგანიზაციებს შეუძლიათ მიაღწიონ მონაცემთა მინიმიზაციასა და მოდელის შესრულებას ერთდროულად. უბრალოდ გამოაჩინეთ მინიმალური საკუთრების მონაცემები საწყისი გაშვებისთვის, შემდეგ გააფართოვეთ ხელოვნურად წარმოების მასშტაბამდე. ამრიგად, ხელოვნური მონაცემები არ არის მხოლოდ სასწავლო ოპტიმიზაცია: ეს არის კონფიდენციალურობის გამაძლიერებელი ტექნოლოგია (PET), რომელიც ქმნის „ოქროს ზონას“, სადაც მონაცემთა შესაბამისობა და AI შესაძლებლობები თანაარსებობენ. და რადგან ხელოვნური მილსადენები რეპროდუცირებადი და აუდიტებადია, ისინი ასევე მხარს უჭერენ ნდობისა და გამჭვირვალობის მოთხოვნებს, რომლებსაც მართვის გუნდები და მარეგულირებლები სულ უფრო ხშირად ითხოვენ. იაპონური საწარმოებისთვის, რომლებიც სუვერენულ AI-ს ქმნიან, მონაცემთა სუვერენიტეტი წინაპირობაა. მაგრამ მხოლოდ სუვერენიტეტი საკმარისი არ არის; მოდელებს ასევე სჭირდებათ დაფუძნებული ინტელექტი: ქცევა ჩამოყალიბებული ადგილობრივი ნორმებითა და დომენური შეზღუდვებით, ვიდრე დასავლურ-ცენტრისტულ კორპუსებთან სტატისტიკური ექსპოზიციით. Nemotron-Person