ინდოეთი წარმოადგენს მსოფლიოს ერთ-ერთ უმსხვილეს შესაძლებლობას ხელოვნური ინტელექტის (AI) სფეროში — 700 მილიონზე მეტი ინტერნეტ მომხმარებლით, მრავალი ენით და სწრაფად მზარდი დეველოპერთა ეკოსისტემით. თუმცა, ღია მონაცემთა უმეტესობა ასახავს დასავლურ ნორმებს და მხოლოდ ინგლისურენოვან კონტექსტს, რაც ქმნის მონაცემთა ხარვეზს და ზღუდავს AI-ის ადაპტაციას ინდოეთის მრავალენოვან, მრავალ-წერილობით გარემოში. დღეს ჩვენ ვუშვებთ Nemotron-Personas-India-ს, ინდური პერსონების პირველ ღია სინთეზურ მონაცემთა ბაზას, რომელიც ინდოეთის რეალურ დემოგრაფიულ, გეოგრაფიულ და კულტურულ განაწილებას შეესაბამება. CC BY 4.0 ლიცენზიით, ეს მონაცემთა ბაზა გვთავაზობს კონფიდენციალურობის დამცავ, რეგულაციებისთვის მზა საფუძველს AI სისტემების მასშტაბირებისთვის, რომლებიც ასახავს ინდურ საზოგადოებას — მგრძნობიარე პერსონალურ მონაცემებზე დაყრდნობის გარეშე. Nemotron-Personas-India აგებულია NeMo Data Designer-ით, NVIDIA-ს საწარმოს დონის სინთეზური მონაცემების გენერაციის მიკროსერვისით, და აფართოებს ჩვენს გლობალურ კოლექციას სუვერენული AI მონაცემთა ბაზების. ის ეფუძნება აშშ-სა და იაპონიის პერსონა მონაცემთა ბაზების წარმატებას და მოიცავს ახალ ფუნქციებს, რომლებიც სპეციალურად ინდოეთის კულტურულად მდიდარი ლანდშაფტისთვის არის შექმნილი. ეს მონაცემთა ბაზა შეუფერხებლად ინტეგრირდება Nemotron მოდელებთან და სხვა ღია კოდის LLM-ებთან, რაც აადვილებს AI სისტემების დაზუსტებას ინდური გამოყენების შემთხვევებისთვის — მრავალენოვანი ჩეთბოტებიდან კულტურულად დასაბუთებულ სპეციალიზებულ კოპილოტებამდე. ეს გამოშვება ავსებს ჩვენს ადრინდელ ჰინდის შეფასების მონაცემთა ბაზებს — მათ შორის ChatRAG-Hi, IFEval-Hi, MT-Bench-Hi, GSM8K-Hi და BFCL-Hi — რაც მხარს უჭერს სრულ მილსადენს სინთეზური მონაცემების გენერაციიდან მოდელის მკაცრ შეფასებამდე ინდური AI სისტემებისთვის. Nemotron-Personas-India წარმოებულია NeMo Data Designer-ის, NVIDIA-ს სინთეზური მონაცემების გენერაციის მიკროსერვისის გამოყენებით. ეს კომპლექსური AI სისტემა იძლევა გენერაციის საშუალებას რთული Jinja ტემპლეიტირების, Pydantic ვალიდაციის, სტრუქტურირებული გამომავალი მონაცემების, ავტომატური ხელახალი მცდელობების გამოყენებით და მხარს უჭერს მრავალ გენერაციის ბეკენდს – აუცილებელ ხელსაწყოებს ამ ზომის სინთეზური მონაცემთა ბაზის მასშტაბირებისთვის. ჩვენ ასევე გამოვიყენეთ შემდეგი მოდელები: ეს მონაცემთა ბაზა შეესაბამებოდა ინდოეთის 2011 წლის აღწერის ოფიციალურ დემოგრაფიულ განაწილებას და გაფართოვდა სანდო AI სწავლებისთვის აუცილებელი ატრიბუტების ჩათვლით: არ არის რეალური სახელები. არ არის ხელახალი იდენტიფიკაციის რისკი. ყველა პერსონა სრულად სინთეზურია. მიუხედავად იმისა, რომ დაფუძნებულია 2011 წლის აღწერისა და ინდოეთის საარჩევნო სიების დამუშავებულ მონაცემებზე, არცერთი მონაცემი არ არის დაკავშირებული არცერთ ცოცხალ ან გარდაცვლილ ინდივიდთან. ეს უზრუნველყოფს, რომ დეველოპერებს შეუძლიათ უსაფრთხოდ გაავარჯიშონ AI სისტემები კონფიდენციალურობის რისკების ან მარეგულირებელი ბარიერების გარეშე. **აგებულია ინდოეთისთვის, მზადაა მსოფლიოსთვის** Nemotron-Personas-India შექმნილია როგორც დეველოპერებისთვის, რომლებიც აშენებენ სუვერენულ AI სისტემებს ინდური ბაზრისთვის, ასევე გლობალური გუნდებისთვის, რომლებიც ცდილობენ მოდელების ადაპტირებას ინდოეთის უნიკალურ ენობრივ, კულტურულ და სოციალურ კონტექსტთან. დღევანდელი ღია მონაცემთა უმეტესობა ასახავს ინგლისურენოვან, დასავლურ ნორმებს — რაც ზღუდავს AI-ის მუშაობას ინდოეთის მრავალენოვან, მრავალ-წერილობით და დემოგრაფიულად კომპლექსურ გარემოში. Nemotron-Personas-India-ს მეშვეობით, გუნდებს შეუძლიათ: ინდოეთის 1.4 მილიარდი ადამიანი ასობით ენაზე საუბრობს და ცხოვრობს უზარმაზარ კულტურულ, ეკონომიკურ და გეოგრაფიულ დაყოფებში. ინდოეთის ეროვნული AI პორტალის შეფასებით, 7,000-ზე მეტი AI სტარტაპი და კვლევითი ინსტიტუტი მუშაობს ადგილობრივად შესაბამისი AI სისტემების შესაქმნელად, ხოლო „ციფრული ინდოეთის“ ინიციატივა და სამთავრობო პროგრამები, როგორიცაა IndiaAI, აჩქარებს ადაპტაციას. მაგრამ პროგრესი შეზღუდულია ფუნდამენტური ხარვეზით: მაღალი ხარისხის, კულტურულად დასაბუთებული სასწავლო მონაცემები, რომლებიც ასახავს ინდოეთის დემოგრაფიულ რეალობას. წარმომადგენლობითი მონაცემთა ბაზების გარეშე, AI სისტემებს უჭირთ კოდის შეცვლა ინგლისურსა და ჰინდის შორის, ვერ ახერხებენ რეგიონული პროფესიული კატეგორიების გაგებას და კარგავენ კულტურულ კონტექსტს, რომელიც აუცილებელია ნდობისა და მიღებისთვის. ეს მონაცემთა ბაზა აუმჯობესებს სინთეზურად გენერირებული მონაცემების მრავალფეროვნებას, ამცირებს მიკერძოებას და ხელს უშლის მოდელის კოლაფსს (დეფორმაციას, რომელიც გამოწვეულია სხვა მოდელის გამომავალ მონაცემებზე გაუწონასწორებელი სწავლებით) ინდოეთის რეალური გეოგრაფიული და დემოგრაფიული განაწილების ასახვით. Nemotron-Personas-India მხარს უჭერს ინდურ მოდელის შემქმნელებს სუვერენული AI სისტემების შემუშავებაში, რომლებიც აერთიანებს რეგიონულ დემოგრაფიულ და კულტურულ კონტექსტს. გსურთ შექმნათ AI სისტემები, რომლებსაც ესმით ინდოეთის კულტურა, ენები და ხალხი? ექსპერიმენტის დასაწყებად დღესვე: ხართ თუ არა ინდოელი მოდელის შემქმნელი, რომელიც ავითარებს სუვერენულ AI-ს, თუ გლობალური დეველოპერი, რომელიც უკეთეს რეგიონულ ადაპტაციას ეძებს, Nemotron-Personas-India უზრუნველყოფს ავთენტურ, კონფიდენციალურობის დამცავ საფუძველს თქვენი აპლიკაციებისთვის. ჩამოტვირთეთ. დააზუსტეთ. შექმენით AI, რომელსაც ესმის ინდოეთი. თუ მზად ხართ უფრო ღრმად ჩასწვდეთ, Nemotron-Personas-India-ის გაფართოებული ვერსია (რომელიც მოიცავს, მაგალითად, სახელს/გვარს, რელიგიას და სინთეზურ მისამართებს) ხელმისაწვდომია NeMo Data Designer-ში. ·