Hugging Face-ისა და IISc/ARTPARK-ის პარტნიორობა მიზნად ისახავს Vaani მონაცემთა ნაკრების ხელმისაწვდომობის გაზრდას და გამოყენებადობის გაუმჯობესებას, რაც ხელს შეუწყობს AI სისტემების განვითარებას, რომლებიც უკეთ გაიგებენ ინდოეთის მრავალფეროვან ენებს და მოემსახურებიან მისი მოსახლეობის ციფრულ საჭიროებებს. Project Vaani, რომელიც 2022 წელს IISc/ARTPARK-მა და Google-მა დაიწყეს, არის პიონერული ინიციატივა, რომელიც მიზნად ისახავს ღია კოდის მრავალმოდალური მონაცემთა ნაკრების შექმნას, რომელიც ჭეშმარიტად წარმოადგენს ინდოეთის ლინგვისტურ მრავალფეროვნებას. ეს მონაცემთა ნაკრები უნიკალურია თავისი გეოცენტრული მიდგომით, რაც საშუალებას იძლევა შეგროვდეს დიალექტები და ენები, რომლებზეც საუბრობენ შორეულ რეგიონებში, ნაცვლად იმისა, რომ მხოლოდ ძირითად ენებზე იყოს ფოკუსირებული. Vaani მიზნად ისახავს 150,000 საათზე მეტი მეტყველების და 15,000 საათის ტრანსკრიბირებული ტექსტური მონაცემების შეგროვებას 1 მილიონი ადამიანისგან ინდოეთის 773-ვე რაიონში, რაც უზრუნველყოფს ენის, დიალექტებისა და დემოგრაფიის მრავალფეროვნებას. მონაცემთა ნაკრები ფაზებად შენდება. პირველი ფაზა მოიცავდა 80 რაიონს და უკვე ღია კოდით არის ხელმისაწვდომი. მეორე ფაზა ამჟამად მიმდინარეობს, რომლის ფარგლებშიც მონაცემთა ნაკრები კიდევ 100 რაიონზე ფართოვდება, რაც კიდევ უფრო აძლიერებს Vaani-ს მიღწევადობას და გავლენას ინდოეთის მრავალფეროვან ლინგვისტურ ლანდშაფტზე. **Vaani მონაცემთა ნაკრების ძირითადი მახასიათებლები (ღია კოდით ხელმისაწვდომი, 2025 წლის 15 თებერვლის მდგომარეობით):** Vaani მონაცემთა ნაკრები აჩვენებს ენების მდიდარ განაწილებას ინდოეთის რაიონებში, რაც ხაზს უსვამს ლინგვისტურ მრავალფეროვნებას ადგილობრივ დონეზე. ეს ინფორმაცია ღირებულია მკვლევრებისთვის, AI დეველოპერებისთვის და ენის ტექნოლოგიების ინოვატორებისთვის, რომლებიც ცდილობენ შექმნან მეტყველების მოდელები, რომლებიც მორგებულია კონკრეტულ რეგიონებსა და დიალექტებზე. დეტალური, რაიონების მიხედვით ენების განაწილების შესასწავლად ეწვიეთ: [Vaani Dataset on HuggingFace](https://huggingface.co/datasets/Vaani-Project/Vaani_data) თუ გსურთ მხოლოდ ტრანსკრიბირებულ მონაცემებზე წვდომა და გსურთ გამოტოვოთ არატრანსკრიბირებული, მხოლოდ აუდიო მონაცემები, უფრო დიდი მონაცემთა ნაკრების ქვეჯგუფი ღია კოდით არის ხელმისაწვდომი აქ. ეს მონაცემთა ნაკრები მოიცავს 790 საათის ტრანსკრიბირებულ აუდიოს, დაახლოებით 700,000 მოსაუბრისგან, რომელიც მოიცავს 70,000 სურათს. ეს რესურსი მოიცავს უფრო მცირე, სეგმენტირებულ აუდიო ერთეულებს ზუსტი ტრანსკრიფციებით, რაც საშუალებას იძლევა სხვადასხვა ამოცანებისთვის, მათ შორის: ბოლო-ბოლო მეტყველების ამოცნობის სისტემების განვითარებასა და უფრო მიზანმიმართული AI გადაწყვეტილებების შექმნას. ეს დამატებითი მონაცემთა ნაკრები ავსებს ძირითად Vaani მონაცემთა ნაკრებს. Vaani მონაცემთა ნაკრები გვთავაზობს რამდენიმე ძირითად უპირატესობას, მათ შორის ენების ფართო გაშუქებას (54 ენა), წარმომადგენლობას მრავალფეროვან გეოგრაფიულ რეგიონებში, მრავალფეროვან საგანმანათლებლო და სოციალურ-ეკონომიკურ ფონს, მოსაუბრეთა ძალიან დიდ გაშუქებას, სპონტანური მეტყველების მონაცემებს და რეალური ცხოვრების მონაცემების შეგროვების გარემოს. ეს მახასიათებლები საშუალებას იძლევა შეიქმნას ინკლუზიური AI მოდელები, რომლებსაც შეუძლიათ უზრუნველყონ საუბრის AI აპლიკაციების ფართო სპექტრი. საგანმანათლებლო ინსტრუმენტებიდან ტელემედიცინის პლატფორმებამდე, ჯანდაცვის გადაწყვეტილებებამდე, ამომრჩეველთა ცხელ ხაზებამდე, მედიის ლოკალიზაციამდე და მრავალენოვან ჭკვიან მოწყობილობებამდე, Vaani მონაცემთა ნაკრები შეიძლება გახდეს თამაშის შემცვლელი რეალურ სამყაროს სცენარებში. IISc/ARTPARK-მა და Google-მა გააფართოვეს პარტნიორობა მეორე ფაზაზე (დამატებით 100 რაიონი). ამით, Vaani მოიცავს ინდოეთის ყველა შტატს! ჩვენ მოხარულნი ვართ, რომ ეს მონაცემთა ნაკრები თქვენამდე მოგვაქვს. რუკა ხაზს უსვამს ინდოეთის იმ რაიონებს, სადაც მონაცემები შეგროვდა 2025 წლის 5 თებერვლის მდგომარეობით. თქვენი ყველაზე მნიშვნელოვანი წვლილი შეიძლება იყოს Vaani მონაცემთა ნაკრების გამოყენება. იქნება ეს ახალი AI აპლიკაციების შექმნა, კვლევის ჩატარება თუ ინოვაციური გამოყენების შემთხვევების შესწავლა, თქვენი ჩართულობა ხელს უწყობს პროექტის გაუმჯობესებას და გაფართოებას. მოხარული ვიქნებით, თუ მივიღებთ თქვენგან გამოხმაურებას ან ინფორმაციას მონაცემთა ნაკრების გამოყენების შესახებ. გთხოვთ, დაუკავშირდეთ [email protected]ს თქვენი გამოცდილების გასაზიარებლად/თანამშრომლობის შესაძლებლობების შესახებ კითხვის დასასმელად ან შეავსეთ ეს უკუკავშირის ფორმა. ❤️-ით შექმნილი ინდოეთის ლინგვისტური მრავალფეროვნებისთვის. მეტი სტატია ჩვენი ბლოგიდან 📻 🎙️ ჰეი, მე შევქმენი AI პოდკასტი ამ ბლოგპოსტის შესახებ, ნახეთ! ეს პოდკასტი გენერირებულია ngxson/kokoro-podcast-generator-ის მეშვეობით, DeepSeek-R1-ისა და Kokoro-TTS-ის გამოყენებით. მე დაინტერესებული ვარ Hugging Face-თან პარტნიორობის შესაძლებლობების შესწავლით. შემიძლია ელფოსტა გავუგზავნო ვინმეს, ვინც პასუხისმგებელია პარტნიორობაზე? დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის.