დღეს NVIDIA-მ წარმოადგინა NVIDIA Nemotron-Nano-9B-v2-Japanese, რომელმაც Nejumi Leaderboard 4-ზე, 10 მილიარდზე ნაკლები პარამეტრის მქონე მოდელებს შორის, უახლესი მიღწევა (SOTA) აჩვენა. ეს მოდელი იაპონური ენის ღრმა გაგებასა და ძლიერ აგენტურ ფუნქციონირებას ახორციელებს მარტივად დასანერგ, მსუბუქ ზომაში, რაც მნიშვნელოვან ეტაპს წარმოადგენს იაპონური კორპორატიული ხელოვნური ინტელექტის განვითარებაში. ეს მიღწევა ეყრდნობა ორ მნიშვნელოვან საფუძველს: Nemotron-Nano-9B-v2-ის დადასტურებულ არქიტექტურას და მაღალი ხარისხის იაპონური სინთეზური მონაცემების გენერაციას (SDG), რომელიც Nemotron-Personas-Japan-ის მეშვეობით იქნა მიღწეული. არსებული Nemotron 2 Nano მოდელების იაპონური ენისთვის მორგებით, NVIDIA მიზნად ისახავს საზოგადოების წახალისებას, შექმნან და გამოუშვან პერსონალიზებული, უახლესი მოდელები, რომლებიც მოემსახურება მრავალფეროვან გამოყენების შემთხვევებსა და ენებს. Nemotron-ის გუნდი გეგმავს ამ ადაპტაციის შედეგად მიღებული ცოდნის გამოყენებას მომავალ Nemotron-ის გამოშვებებში, რათა გააუმჯობესოს იაპონური ენის მსჯელობის უნარი. **მნიშვნელოვანი ხარვეზი იაპონურ კორპორატიულ ხელოვნურ ინტელექტში:** იაპონური კორპორატიული ხელოვნური ინტელექტის ამჟამინდელ გარემოში თითქმის არ არსებობს SLM (მცირე ენობრივი მოდელები), რომლებიც აერთიანებს „იაპონური ენის მაღალ დონეზე ფლობას“ და „ამოცანების შესრულების აგენტურ შესაძლებლობებს“. ეს ქმნის დანერგვის ბარიერებს, განსაკუთრებით შემდეგ ასპექტებში: * **ლოკალური განლაგების მოთხოვნები:** კომპანიებისთვის, რომლებიც კონფიდენციალურ მონაცემებს ამუშავებენ, მოდელის ფუნქციონირება კერძო ქსელში აუცილებელია. 10 მილიარდზე (10B) ნაკლები პარამეტრის მქონე მოდელებს შეუძლიათ შეინარჩუნონ პრაქტიკული შესრულების დონე, ხოლო მნიშვნელოვნად შეამცირონ ინფრასტრუქტურის დანერგვის ბარიერები. * **ადაპტაციის ეფექტურობა:** დადასტურებული აგენტური შესაძლებლობების მქონე ძლიერ იაპონურ საბაზისო მოდელზე დაყრდნობით, შესაძლებელია დახვეწის (fine-tuning) ციკლების შემცირება. გამოთვლითი რესურსების კონცენტრირება შესაძლებელია კონკრეტულ დომენებთან ადაპტაციაზე, ნაცვლად საბაზისო შესაძლებლობების შექმნისა. * **აგენტის განვითარების დაჩქარება:** ამ მოდელის არქიტექტურა და შესრულება საშუალებას იძლევა მრავალაგენტური სისტემებისა და კომპლექსური სამუშაო პროცესების სწრაფ პროტოტიპირებას, მსხვილი მოდელებისთვის დამახასიათებელი დამატებითი დატვირთვის გარეშე. Nemotron-Nano-9B-v2-Japanese აგებულია NVIDIA Nemotron-Nano-9B-v2-ზე, რომელმაც ინგლისურენოვან ბენჩმარკებში გამორჩეული შედეგები აჩვენა ზომა-შესრულების შეფარდების თვალსაზრისით. ამ ეფექტური არქიტექტურის საფუძველზე განხორციელდა შემდგომი ადაპტაცია, რამაც გააძლიერა იაპონური ენის შესაძლებლობები. დადასტურებული არქიტექტურის იაპონურ ენასთან ადაპტირებით, შენარჩუნებულია საბაზისო მოდელის სიძლიერე და მიღწეულია იაპონური ენის შესანიშნავი შესაძლებლობები. **მონაცემთა სტრატეგია:** ამ მოდელის მონაცემთა სტრატეგია ორიენტირებულია ღია წყაროს (CC BY 4.0) მონაცემთა ნაკრების, „Nemotron-Personas-Japan“-ის გამოყენებაზე, როგორც მაღალი ხარისხის საწყის მონაცემებზე (seed) სინთეზური მონაცემების გენერაციისთვის (SDG). ეს მონაცემთა ნაკრები შედგება სინთეზურად გენერირებული პერსონებისგან, რომლებიც ეფუძნება იაპონიის რეალური სამყაროს დემოგრაფიას, გეოგრაფიულ განაწილებასა და პიროვნულ მახასიათებლებს, რაც ასახავს მოსახლეობის მრავალფეროვნებასა და სიმდიდრეს. ამ კულტურულად ზუსტი პერსონების საფუძველზე შეიქმნა მრავალფეროვანი, მასშტაბირებადი და ძლიერი ტრენინგის მილსადენი. საწყისი მონაცემების მდიდარმა პერსონების ჯგუფმა საშუალება მოგვცა ეფექტურად გაგვეფართოებინა სინთეზური მონაცემთა ნაკრებები მრავალფეროვანი სცენარებისა და ნიუანსების მიმართულებით. ამ მეთოდის საშუალებით, გაფართოებულმა მონაცემებმა მიაღწია უახლესი ტრენინგისთვის საჭირო მასშტაბს, ამასთანავე შეინარჩუნა ორიგინალური პერსონების მკაცრი კულტურული მთლიანობა. კერძოდ, Nemotron-Nano-9B-v2-Japanese-ში, ეს პერსონები გამოყენებული იქნა როგორც ტრენინგის მონაცემების გენერაციის საფუძველი ხელსაწყოების გამოძახების სცენარებში. ამან უზრუნველყო, რომ მოდელის მიერ შეძენილი შესაძლებლობები არ შემოიფარგლებოდა მხოლოდ ხელსაწყოების გამოძახების ფუნქციით, არამედ ეფუძნებოდა კულტურულად შესაბამის იაპონურ დიალოგს და რეალური სამყაროს გამოყენების შემთხვევებს. Nemotron-Personas კოლექცია ასევე მოიცავს მონაცემთა ნაკრებებს აშშ-დან, ინდოეთიდან, სინგაპურიდან და ბრაზილიიდან, რაც შესაძლებელს ხდის იგივე მეთოდოლოგიის გამეორებას სხვა რეგიონებშიც. **ტრენინგის მეთოდოლოგია:** Nemotron-Nano-9B-v2-Japanese შეიქმნა უწყვეტი წინასწარი ტრენინგის, სინთეზური მონაცემების გენერაციის და შემდგომი ტრენინგის პროცესების გამოყენებით, იაპონური ღია წყაროს კორპუსებისა და NVIDIA-ს Nemotron-ის სტეკის კომბინაციით. მოდელის იაპონური ენის შესაძლებლობების მაქსიმიზაციისთვის ჩატარდა უწყვეტი წინასწარი ტრენინგი. ამ პროცესში მაქსიმალურად იქნა გამოყენებული LLM-jp-ის, იაპონიის წამყვანი ღია წყაროს LLM საზოგადოების, რესურსები. ამავდროულად, Nemotron Pre-training Datasets-ის გამოყენებამ უზრუნველყო მოდელის აგენტური ფუნქციების შენარჩუნება. ინსტრუმენტების გამოძახების მონაცემთა ნაკრები, რომელიც SFT-სთვის გამოიყენეს Nemotron-Personas-Japan-ის საწყისი მონაცემებით, გამორჩეულად ძლიერი აღმოჩნდა. შესრულების გაუმჯობესება არ შემოიფარგლებოდა მხოლოდ ხელსაწყოების გამოძახებით, არამედ გავრცელდა იაპონურ ცოდნაზე, კითხვა-პასუხზე, ინსტრუქციების შესრულებაზე და სხვა მრავალ ასპექტზე. გარდა ამისა, ვინაიდან ეს საწყისი მონაცემთა ნაკრები 6 მილიონ პერსონაზე იყო აგებული, SDG-ის ეფექტურად მასშტაბირება მოხერხდა. ამან შესაძლებელი გახადა რეალური სამყაროს მრავალფეროვანი სცენარების დაფარვა, დუბლირებების მინიმიზაციის გზით. Nemotron-Personas კოლექცია აფართოებს სამიზნე ქვეყნების არეალს, რაც საშუალებას აძლევს დეველოპერებს არა მხოლოდ იაპონიაში, არამედ სხვა რეგიონებშიც გამოიყენონ მსგავსი მიდგომა. მოდელის ტრენინგი Nemotron Nano 2-ში დადგენილ ტრენინგის რეცეპტს მისდევს. ამან შესაძლებელი გახადა გამტარუნარიანობის გაუმჯობესება ტრენინგის არასტაბილურობის გამოწვევის გარეშე. ეს მიდგომა უზრუნველყოფს ძლიერ იაპონურ ენობრივ მოდელს, რომელიც ინარჩუნებს გამძლე ხელსაწყოების გამოძახების ფუნქციებსა და მსჯელობის უნარს. **Nejumi Leaderboard 4-ზე შესრულება:** Nemotron-Nano-9B-v2-Japanese-მა პირველი ადგილი დაიკავა 10 მილიარდზე ნაკლები პარამეტრის მქონე მოდელების კატეგორიაში „Nejumi Leaderboard 4“-ზე, რომელიც იაპონიაში LLM-ების ყველაზე ყოვლისმომცველი შეფასების პლატფორმაა. Nejumi Leaderboard აფასებს მოდელებს მრავალმხრივად, დაახლოებით 40 ბენჩმარკის მეშვეობით, რომლებიც მოიცავს შემდეგ სფეროებს. ეს მრავალგანზომილებიანი შეფასებები Nejumi Leaderboard-ს სანდო რესურსად აქცევს დეველოპერებისთვის, რომლებიც ირჩევენ საბაზისო მოდელებს ადაპტაციისა და პრაქტიკული გამოყენებისთვის იაპონურ გარემოში. ბენჩმარკის შედეგები ადასტურებს, რომ Nemotron-Nano-9B-v2-Japanese-მა შეძლო ძლიერი იაპონური ენის შესაძლებლობების ინტეგრირება საბაზისო მოდელ Nemotron-Nano-9B-v2-ში. ეს გაუმჯობესებები სცილდება იაპონურ ცოდნასა და კითხვა-პასუხის შესაძლებლობებს და მოიცავს ისეთ ფართო ამოცანებს, როგორიცაა ხელსაწყოების გამოძახება, კოდირება და გასწორება (alignment). აღსანიშნავია, რომ მან აჯობა მსგავსი ზომის Qwen3-8B-ს და მიაღწია შესანიშნავ ზომა-შესრულების შეფარდებას. **გამოყენების შემთხვევები:** აპლიკაციებში, რომლებიც საჭიროებენ იაპონური ენის მაღალ გაგებას და აგენტურ უნარებს, მოდელი შეიძლება უშუალოდ იქნას განლაგებული და გამოყენებული. მისი უკვე შეძენილი შესაძლებლობები მხარს უჭერს დაუყოვნებლივ ინტეგრაციას აგენტურ სამუშაო პროცესებში. Nemotron 2 Nano-ს მიერ მხარდაჭერილი დასკვნის ძრავები შეუფერხებლად გადადის. Nemotron-Nano-9B-v2-Japanese შეიძლება გამოყენებულ იქნას როგორც საბაზისო მოდელი კონკრეტულ დომენებზე ორიენტირებული დახვეწისთვის (fine-tuning). ბენჩმარკებით დადასტურებული კარგი შესრულება იაპონურ და აგენტურ ამოცანებში წარმოადგენს მყარ საწყის წერტილს სპეციალიზებული აპლიკაციების შემუშავებისთვის. ადაპტაციისთვის შეგიძლიათ გამოიყენოთ NeMo Framework (NeMo Megatron-Bridge, NeMo AutoModel და NeMo-RL). იაპონური ხელოვნური ინტელექტის აპლიკაციების დეველოპერებს შეუძლიათ დაუყოვნებლივ დაიწყონ Nemotron-Nano-9B-v2-Japanese-ის გამოყენება. იქნება ეს მომხმარებელთა მომსახურების აგენტები, შიდა ავტომატიზაციის ინსტრუმენტები თუ დომენზე ორიენტირებული ასისტენტები, ეს მოდელი უზრუნველყოფს შესანიშნავ ზომა-შესრულების შეფარდებას, რაც საჭიროა პრაქტიკული გამოყენებისთვის. Nemotron 2 Nano-ს დადასტურებული არქიტექტურა და მაღალი ხარისხის მონაცემთა ნაკრების საწყის მონაცემების, Nemotron-Personas-Japan-ის კომბინაცია, ეფექტური საწყისი წერტილი იქნება იაპონური სუვერენული ხელოვნური ინტელექტის განვითარებაში. მოხარულნი ვართ მოვიწვიოთ საზოგადოება, გამოიყენონ Nemotron-ის მოდელები, მონაცემთა ნაკრებები, რეცეპტები და ბიბლიოთეკები, რათა Nemotron-ის მოდელები მოარგონ მეტ ენასა და გამოყენების შემთხვევას. მოუთმენლად ველით, თუ რას შექმნით! იყავით განახლებული NVIDIA Nemotron-ის შესახებ NVIDIA-ს სიახლეებზე გამოწერით და NVIDIA AI-ს თვალყურის დევნებით LinkedIn-ზე, X-ზე, YouTube-ზე და Nemotron-ის არხზე Discord-ზე. მიიღეთ წვდომა ღია Nemotron მოდელებზე Hugging Face-ზე და NIM მიკროსერვისების კოლექციასა და დეველოპერის მაგალითებზე build.nvidia.com-ზე. * რეგისტრაცია ან შესვლა კომენტარისთვის