mmBERT: ახალი მასობრივად მრავალენოვანი AI მოდელი რეკორდული წარმადობით
mmBERT არის უახლესი მასობრივად მრავალენოვანი ენკოდერი მოდელი, რომელიც გაწვრთნილია 1800-ზე მეტ ენაზე 3 ტრილიონზე მეტი ტოკენის გამოყენებით. ის წინა მრავალენოვან მოდელებთან შედარებით აჩვენებს მნიშვნელოვან წარმადობისა და სიჩქარის გაუმჯობესებას, პირველია, ვინც XLM-R-ს გადააჭარბა და ამავდროულად შეიმუშავა ეფექტური სტრატეგიები ნაკლებად რესურსული ენების შესასწავლად. მოდელი აგებულია ModernBERT-ის არქიტექტურაზე და მოიცავს ინოვაციურ კომპონენტებს ეფექტური მრავალენოვანი სწავლისთვის.
NVIDIA-ს Nemotron-Personas-India: მონაცემთა უნიკალური ბაზა ინდოეთის მრავალენოვანი AI სისტემებისთვის
ინდოეთი, 700 მილიონზე მეტი ინტერნეტ მომხმარებლით და მრავალი ენით, ხელოვნური ინტელექტის (AI) უზარმაზარ შესაძლებლობებს გვთავაზობს. თუმცა, არსებული მონაცემთა ბაზები ხშირად დასავლურ ნორმებსა და ინგლისურენოვან კონტექსტს ასახავს, რაც ზღუდავს AI-ის ადაპტაციას ინდოეთის მრავალენოვან და მრავალ-წერილობით გარემოში. ამ პრობლემის გადასაჭრელად, NVIDIA-მ გამოუშვა Nemotron-Personas-India — პირველი ღია სინთეზური მონაცემთა ბაზა, რომელიც ინდური პერსონების დემოგრაფიულ, გეოგრაფიულ და კულტურულ მახასიათებლებს ასახავს.