დღეს NVIDIA-მ გამოუშვა Nemotron-Nano-9B-v2-Japanese, რომელმაც Nejumi Leaderboard 4-ზე 10 მილიარდზე ნაკლები პარამეტრის მქონე მოდელებს შორის ხელოვნური ინტელექტის (SOTA) უახლესი დონის შესრულებას მიაღწია. ეს მოდელი, რომელიც მოწინავე იაპონური ენის გაგებასა და ძლიერ აგენტურ ფუნქციებს აერთიანებს მოსახერხებელ, მსუბუქ ზომაში, წარმოადგენს მნიშვნელოვან ეტაპს იაპონური საწარმოო AI-ს განვითარებაში. ეს მიღწევა ეფუძნება Nemotron-Nano-9B-v2-ის დადასტურებულ არქიტექტურას და Nemotron-Personas-Japan-ის მიერ გენერირებულ მაღალი ხარისხის იაპონურ სინთეზურ მონაცემებს (SDG). Nemotron 2 Nano-ს უკვე გამოქვეყნებული მოდელების იაპონურ ენაზე მორგებით, NVIDIA მიზნად ისახავს საზოგადოებას წაახალისოს, შექმნას და გამოაქვეყნოს მორგებული, უახლესი მოდელები მრავალფეროვანი გამოყენების შემთხვევებისა და ენებისთვის. Nemotron-ის გუნდი ამ მორგების შედეგად მიღებულ ცოდნას მომავალი Nemotron-ის გამოშვებებში ასახავს, რაც მიზნად ისახავს იაპონურ ენაზე დასკვნის გამოტანის უნარის გაძლიერებას. **მნიშვნელოვანი ხარვეზი იაპონურ საწარმოო ხელოვნურ ინტელექტში:** იაპონური საწარმოო AI-ს ამჟამინდელ გარემოში თითქმის არ არსებობს SLM-ები, რომლებიც აერთიანებენ „მოწინავე იაპონურ ენის უნარებს“ და „აგენტურ AI-ს, როგორც ამოცანების შესრულების შესაძლებლობას“. ეს ქმნის დანერგვის ბარიერებს, განსაკუთრებით შემდეგ ასპექტებში: * **ონლაინ განთავსების მოთხოვნები:** კომპანიებისთვის, რომლებიც მუშაობენ კონფიდენციალურ მონაცემებთან, მოდელების ოპერირება კერძო ქსელებში აუცილებელია. 10 მილიარდზე (100 მილიონი) ნაკლები პარამეტრის მქონე მოდელებს შეუძლიათ მნიშვნელოვნად შეამცირონ ინფრასტრუქტურის დანერგვის სირთულეები პრაქტიკული შესრულების დონის შენარჩუნებით. * **მორგების ეფექტურობა:** დადასტურებული აგენტური შესაძლებლობების მქონე ძლიერი იაპონური საბაზისო მოდელიდან დაწყება ამცირებს დახვეწის ციკლებს. შესაძლებელია გამოთვლითი რესურსების კონცენტრირება კონკრეტულ დომენთან ადაპტაციაზე, ნაცვლად საბაზისო შესაძლებლობების აშენებისა. * **აგენტების განვითარების დაჩქარება:** ამ მოდელის არქიტექტურა და შესრულება საშუალებას იძლევა მრავალაგენტური სისტემებისა და კომპლექსური სამუშაო პროცესების სწრაფ პროტოტიპირებას მსხვილი მოდელებისთვის დამახასიათებელი დამატებითი ხარჯების გარეშე. **Nemotron-Nano-9B-v2-Japanese-ის არქიტექტურა:** Nemotron-Nano-9B-v2-Japanese აგებულია NVIDIA Nemotron-Nano-9B-v2-ის ბაზაზე, რომელმაც ინგლისურ ბენჩმარკებში გამორჩეული შედეგები აჩვენა ზომისა და შესრულების თანაფარდობის თვალსაზრისით. ამ ეფექტურ არქიტექტურაზე დაყრდნობით განხორციელდა შემდგომი მორგება, რათა გაძლიერებულიყო იაპონური ენის შესაძლებლობები. დადასტურებული არქიტექტურის იაპონურ ენაზე ადაპტირებით, მან შეინარჩუნა საბაზისო მოდელის სიძლიერე და მიაღწია იაპონური ენის შესანიშნავ შესაძლებლობებს. **მონაცემთა სტრატეგია:** ამ მოდელის მონაცემთა სტრატეგია ფოკუსირებულია „Nemotron-Personas-Japan“-ის, ღია კოდის (CC BY 4.0) მონაცემთა ნაკრების, გამოყენებაზე, როგორც მაღალი ხარისხის საწყისზე სინთეზური მონაცემების გენერაციისთვის (SDG). ეს მონაცემთა ნაკრები შედგება სინთეზურად გენერირებული პერსონებისგან, რომლებიც ეფუძნება იაპონიის რეალურ დემოგრაფიულ, გეოგრაფიულ განაწილებასა და პიროვნულ მახასიათებლებს, რაც ასახავს მოსახლეობის მრავალფეროვნებასა და სიმდიდრეს. ამ კულტურულად ზუსტ პერსონებზე დაყრდნობით, აშენდა მაღალ მრავალფეროვანი, მასშტაბირებადი და მყარი სწავლის კონვეიერი. საწყისი მონაცემების მდიდარი პერსონაჟთა ნაკრებიდან გამომდინარე, შესაძლებელი გახდა სინთეზური მონაცემთა ნაკრებების ეფექტურად გაფართოება მრავალფეროვან სცენარებსა და ნიუანსებზე. ეს მეთოდი უზრუნველყოფს, რომ გაფართოებული მონაცემები ინარჩუნებს ორიგინალური პერსონების მკაცრ კულტურულ მთლიანობას, მიაღწიოს უახლესი დონის სწავლისთვის საჭირო მასშტაბს. განსაკუთრებით Nemotron-Nano-9B-v2-Japanese-ში, ეს პერსონები გამოყენებული იქნა როგორც ტრენინგის მონაცემების გენერაციის საფუძველი ინსტრუმენტების გამოძახების სცენარებში. ეს უზრუნველყოფს, რომ მოდელის მიერ შეძენილი შესაძლებლობები არ შემოიფარგლება მხოლოდ ინსტრუმენტების გამოძახების ფუნქციებით, არამედ ეფუძნება კულტურულად შესაბამის იაპონურ დიალოგს და რეალური სამყაროს გამოყენების შემთხვევებს. Nemotron-Personas კოლექცია ასევე მოიცავს მონაცემთა ნაკრებებს აშშ-სთვის, ინდოეთისთვის, სინგაპურისა და ბრაზილიისთვის, რაც იმავე მეთოდის რეგიონთაშორის გამეორების საშუალებას იძლევა. **სწავლის პროცესი:** Nemotron-Nano-9B-v2-Japanese აშენდა უწყვეტი წინასწარი სწავლის, სინთეზური მონაცემების გენერაციის და შემდგომი სწავლის პროცესების კომბინაციით, იაპონური ღია კოდის კორპუსებისა და NVIDIA-ს Nemotron სტეკის გამოყენებით. * **უწყვეტი წინასწარი სწავლა:** მოდელის იაპონური ენის შესაძლებლობების მაქსიმიზაციისთვის, განხორციელდა უწყვეტი წინასწარი სწავლა. აქ მაქსიმალურად იქნა გამოყენებული LLM-jp-ის აქტივები, რომელიც იაპონიის წამყვანი ღია კოდის LLM საზოგადოებაა. ამავდროულად, Nemotron Pre-training Datasets-ის გამოყენებით, შენარჩუნებული იქნა მოდელის აგენტური ფუნქციები. * **SFT (ზედამხედველობითი დახვეწა):** Nemotron-Personas-Japan-ის მიერ დათესილი Tool Calling მონაცემთა ნაკრები, რომელიც გამოყენებული იქნა SFT-სთვის, ძალიან ძლიერი აღმოჩნდა. შესრულების გაუმჯობესება არ შემოიფარგლებოდა მხოლოდ ინსტრუმენტების გამოძახებით, არამედ მოიცავდა იაპონურ ცოდნას, კითხვა-პასუხს, ინსტრუქციების შესრულებას და სხვა მრავალ სფეროს. გარდა ამისა, რადგან ეს საწყისი ნაკრები აგებულია 6 მილიონ პერსონაზე, შესაძლებელი გახდა SDG-ის ეფექტურად მასშტაბირება. ამან წარმატებით მოიცვა რეალური სამყაროს მრავალფეროვანი სცენარები, მინიმალური გადაფარვით. Nemotron-Personas კოლექცია აფართოებს სამიზნე ქვეყნებს, რაც საშუალებას აძლევს დეველოპერებს იაპონიის გარდა სხვა რეგიონებშიც გამოიყენონ მსგავსი მიდგომა. * **სწავლის რეცეპტი:** მოდელის სწავლება Nemotron Nano 2-ში დადგენილ სწავლის რეცეპტს ეფუძნება. ამან შესაძლებელი გახადა გამტარუნარიანობის გაუმჯობესება სწავლის არასტაბილურობის გამოწვევის გარეშე. ამ მიდგომით, მიღწეულია ძლიერი იაპონური ენობრივი მოდელის შესრულება, მტკიცე ინსტრუმენტების გამოძახების ფუნქციებისა და მსჯელობის უნარის შენარჩუნებით. **Nejumi Leaderboard 4-ის შედეგები:** Nemotron-Nano-9B-v2-Japanese-მა პირველი ადგილი დაიკავა 10 მილიარდზე ნაკლები მოდელების კატეგორიაში „Nejumi Leaderboard 4“-ზე, რომელიც იაპონიაში LLM-ის შეფასების ყველაზე ყოვლისმომცველი პლატფორმაა. Nejumi Leaderboard მოდელებს აფასებს მრავალმხრივ, დაახლოებით 40 ბენჩმარკის მეშვეობით ისეთ სფეროებში, როგორიცაა იაპონური NLU, საღი აზრი, მსჯელობა, კოდირება, უსაფრთხოება და სხვა. ეს მრავალგანზომილებიანი შეფასებები Nejumi Leaderboard-ს სანდო საცნობარო წერტილად აქცევს დეველოპერებისთვის, რომლებიც ირჩევენ საბაზისო მოდელებს იაპონურ გარემოში მორგებისა და პრაქტიკული გამოყენებისთვის. ბენჩმარკის შედეგები ადასტურებს, რომ Nemotron-Nano-9B-v2-Japanese-მა შეძლო ძლიერი იაპონური ენის შესაძლებლობების ინტეგრირება საბაზისო მოდელ Nemotron-Nano-9B-v2-ში. ეს გაუმჯობესებები მოიცავს არა მხოლოდ იაპონურ ცოდნასა და კითხვა-პასუხის უნარებს, არამედ ინსტრუმენტების გამოძახებას, კოდირებასა და გასწორებას. აღსანიშნავია, რომ მან აჯობა მსგავსი ზომის Qwen3-8B-ს, რითაც მიაღწია ზომისა და შესრულების შესანიშნავ თანაფარდობას. **განთავსება და მორგება:** აპლიკაციებში, რომლებიც საჭიროებენ იაპონური ენის მაღალ გაგებასა და აგენტურ უნარებს, მოდელის უშუალოდ განთავსება და გამოყენება შესაძლებელია. მისი უკვე ნასწავლი შესაძლებლობები მხარს უჭერს დაუყოვნებლივ ინტეგრაციას აგენტურ სამუშაო პროცესებში. Nemotron 2 Nano-ს მიერ მხარდაჭერილი დასკვნის გამოტანის ძრავები შეუფერხებლად გადადის. Nemotron-Nano-9B-v2-Japanese შეიძლება გამოყენებულ იქნას როგორც საფუძველი დომენზე სპეციფიკური დახვეწისთვის. ბენჩმარკით დადასტურებული კარგი შესრულება იაპონურ და აგენტურ ამოცანებში წარმოადგენს მყარ საწყის წერტილს სპეციალიზებული აპლიკაციების შემუშავებისთვის. მორგებისთვის შეგიძლიათ გამოიყენოთ NeMo Framework (NeMo Megatron-Bridge, NeMo AutoModel და NeMo-RL). **გამოიყენეთ Nemotron-Nano-9B-v2-Japanese ახლავე:** იაპონელი AI აპლიკაციების დეველოპერებისთვის Nemotron-Nano-9B-v2-Japanese ხელმისაწვდომია ახლავე. მიუხედავად იმისა, გამოიყენება მომხმარებელთა მომსახურების აგენტებისთვის, შიდა ავტომატიზაციის ინსტრუმენტებისთვის თუ დომენზე სპეციფიკური ასისტენტებისთვის, ეს მოდელი უზრუნველყოფს ზომისა და შესრულების შესანიშნავ თანაფარდობას, რომელიც საჭიროა პრაქტიკული განთავსებისთვის. Nemotron 2 Nano-ს დადასტურებული არქიტექტურისა და მაღალი ხარისხის მონაცემთა ნაკრების საწყისის, Nemotron-Personas-Japan-ის კომბინაცია, იქნება ეფექტური საწყისი წერტილი იაპონური სუვერენული AI-ს განვითარებაში. ჩვენ მივესალმებით საზოგადოების წევრებს, გამოიყენონ Nemotron-ის მოდელები, მონაცემთა ნაკრებები, რეცეპტები და ბიბლიოთეკები, რათა მორგონ Nemotron-ის მოდელები კიდევ უფრო მეტი ენისა და გამოყენების შემთხვევებისთვის. ჩვენ მოუთმენლად ველით, თუ რას ააშენებთ თქვენ! იყავით განახლებული NVIDIA Nemotron-ის შესახებ NVIDIA-ს სიახლეებზე გამოწერით და NVIDIA AI-ს მიყოლებით LinkedIn-ზე, X-ზე, YouTube-ზე და Nemotron-ის არხზე Discord-ზე. მიიღეთ წვდომა ღია Nemotron მოდელებზე Hugging Face-ზე და NIM მიკროსერვისების კოლექციაზე და დეველოპერის მაგალითებზე build.nvidia.com-ზე.