NVIDIA-მ 6 მილიონიანი მულტილინგვური მსჯელობის მონაცემთა ნაკრები და Nemotron Nano 2 9B გამოუშვა
NVIDIA განაგრძობს ღია ეკოსისტემის მხარდაჭერას 6 მილიონიანი მულტილინგვური მსჯელობის მონაცემთა ნაკრების გამოშვებით, რომელიც ხუთ ენაზეა ნათარგმნი. ამასთან ერთად, წარდგენილია Nemotron Nano 2 9B მოდელი, რომელიც ხელოვნური ინტელექტის შესაძლებლობებს გაუმჯობესებული არქიტექტურითა და კონფიგურირებადი შესრულებით ზღვრულ მოწყობილობებზე აფართოებს. ეს ნაბიჯი ხაზს უსვამს კომპანიის ერთგულებას მოდელების განვითარებაში ღიაობისა და გამჭვირვალობის მიმართ.
NVIDIA აგრძელებს ღია ეკოსისტემის მხარდასაჭერად ნებადართული მონაცემთა ნაკრებების გამოშვებას, ამჯერად წარმოგიდგენთ 6 მილიონიან მულტილინგვურ მსჯელობის მონაცემთა ნაკრებს (Multilingual Reasoning Dataset).
Llama Nemotron Super მოდელში გამოყენებული Nemotron Post-Training Dataset v1-ის ბოლოდროინდელი წარმატებული გამოშვებისა და ამ წლის დასაწყისში ჩვენ მიერ გამოშვებული Llama Nemotron Post-Training Dataset-ის გათვალისწინებით, მოხარულნი ვართ წარმოვადგინოთ მსჯელობის მონაცემთა ნაკრები, რომელიც ხუთ სამიზნე ენაზეა ნათარგმნი: ფრანგული, ესპანური, გერმანული, იტალიური და იაპონური.
ახლად გამოშვებული NVIDIA Nemotron Nano 2 9B ეს შესაძლებლობები ზღვრულ მოწყობილობებზე გადააქვს, რასაც უზრუნველყოფს წამყვანი სიზუსტე და ეფექტურობა ჰიბრიდული Transformer–Mamba არქიტექტურით და კონფიგურირებადი „აზროვნების ბიუჯეტით“. ეს მომხმარებლებს საშუალებას აძლევს, დაარეგულირონ სიზუსტე, გამტარუნარიანობა და ღირებულება საკუთარი რეალური საჭიროებების შესაბამისად.
ეს გამოშვება მნიშვნელოვანი ნაბიჯია მოდელების განვითარებასა და გაუმჯობესებაში ღიაობისა და გამჭვირვალობის მიმართ ჩვენი მუდმივი ერთგულების გზაზე. სავარჯიშო მონაცემების, სავარჯიშო ინსტრუმენტებისა და მოდელის საბოლოო წონების გამოშვებით, NVIDIA მხარს უჭერს ღია წონის მოდელების უწყვეტ გაუმჯობესებას.
ზოგადად, Nemotron Post-Training Dataset V2 იღებს ჩვენს ადრე გამოშვებულ ინგლისურ მსჯელობის მონაცემებს და თარგმნის მათ ხუთ სამიზნე ენაზე (ფრანგული, გერმანული, იტალიური, იაპონური, ესპანური). წინასწარი წვრთნის დროს შეძენილი ინგლისური ცოდნის საუკეთესოდ გამოსაყენებლად, ჩვენ ვთარგმნით მომხმარებლის მოთხოვნასა და მოდელის პასუხს, ამასთანავე ვინარჩუნებთ ორიგინალურ ინგლისურ მსჯელობის ჯაჭვს.
WMT 2024-ის საერთო თარგმნის გაზიარებული დავალების შედეგების მიხედვით, დიდი ენობრივი მოდელები (LLMs) მანქანური თარგმნის ამოცანებში უახლეს შედეგებს აჩვენებენ. თუმცა, პოსტ-ტრენინგის მონაცემების სინთეზური გენერაციისთვის, ჩვენმა წინასწარმა კვლევებმა აჩვენა, რომ საჭიროა დამატებითი მექანიზმები. ამიტომ, ჩვენ ვაერთიანებთ რამდენიმე მექანიზმს თარგმანის მაღალი ხარისხის შესანარჩუნებლად და ჰალუცინაციების მარტივად აღმოსაჩენად.
შეჯამებისთვის, ბენჩმარკინგის შემდეგ, ჩვენ შევარჩიეთ Qwen2.5-32B-Instruct-AWQ (გერმანულისთვის) და Qwen2.5-14B-Instruct (სხვა ენებისთვის) თარგმანის შესასრულებლად. შერჩევის პროცესში გათვალისწინებული იყო მონაცემების უარყოფის თანაფარდობა, რომელიც გამომავალი ფორმატის აღსრულების შედეგად იქნა გაზომილი.
დამატებითი ინფორმაციისთვის იხილეთ მონაცემთა ნაკრები Hugging Face-ის გვერდზე.
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#nvidia
#ღია კოდი
#მონაცემთა ნაკრები
#nemotron
#მულტილინგვური
#edge ai
#თარგმანი
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები