ინდურმა AI ლაბორატორიამ „სარვამმა“ ახალი დიდი ენობრივი მოდელები წარადგინა, კონკურენციას უწევს გლობალურ გიგანტებს
ინდურმა ხელოვნური ინტელექტის ლაბორატორიამ Sarvam-მა წარმოადგინა ახალი თაობის დიდი ენობრივი მოდელები, მათ შორის 30-მილიარდიანი და 105-მილიარდიანი პარამეტრების მოდელები. კომპანია ფსონს დებს მცირე, ეფექტურ ღია კოდის AI მოდელებზე, რათა დაეუფლოს ბაზრის წილს უფრო ძვირი ამერიკული და ჩინური სისტემებისგან. ეს გაშვება შეესაბამება ინდოეთის მიზანს, შეამციროს დამოკიდებულება უცხოურ AI პლატფორმებზე და მოარგოს მოდელები ადგილობრივ ენებსა და გამოყენების შემთხვევებს, რეალურ დროში აპლიკაციების მხარდაჭერით.
ინდურმა AI ლაბორატორიამ „სარვამმა“ სამშაბათს წარადგინა დიდი ენობრივი მოდელების (LLM) ახალი თაობა. კომპანია იმედოვნებს, რომ მცირე, ეფექტური ღია კოდის AI მოდელები შეძლებენ ბაზრის წილის მოპოვებას უფრო ძვირადღირებული სისტემებისგან, რომლებსაც მისი ბევრად უფრო დიდი ამერიკელი და ჩინელი კონკურენტები გვთავაზობენ.
გაშვება, რომელიც ნიუ დელიში, India AI Impact Summit-ზე გამოცხადდა, შეესაბამება ინდოეთის მთავრობის (ნიუ დელის) ძალისხმევას, შეამციროს დამოკიდებულება უცხოურ AI პლატფორმებზე და მოარგოს მოდელები ადგილობრივ ენებსა და გამოყენების შემთხვევებს. „სარვამის“ განცხადებით, ახალი შემადგენლობა მოიცავს 30-მილიარდიანი და 105-მილიარდიანი პარამეტრების მოდელებს; ტექსტის მეტყველებად გარდამქმნელ მოდელს (text-to-speech); მეტყველების ტექსტად გარდამქმნელ მოდელს (speech-to-text); და ვიზუალურ მოდელს დოკუმენტების გასაანალიზებლად. ეს წარმოადგენს მნიშვნელოვან გაუმჯობესებას კომპანიის 2-მილიარდიანი პარამეტრების მოდელ Sarvam 1-თან შედარებით, რომელიც მან 2024 წლის ოქტომბერში გამოუშვა.
30-მილიარდიანი და 105-მილიარდიანი პარამეტრების მოდელები იყენებენ „ექსპერტთა ნარევის“ (mixture-of-experts) არქიტექტურას, რომელიც ერთდროულად მხოლოდ პარამეტრების ნაწილს ააქტიურებს, რაც მნიშვნელოვნად ამცირებს გამოთვლით ხარჯებს, აღნიშნა „სარვამმა“. 30B მოდელი მხარს უჭერს 32 000-ტოკენიანი კონტექსტის ფანჯარას, რომელიც მიზნად ისახავს რეალურ დროში სასაუბრო გამოყენებას, ხოლო უფრო დიდი მოდელი გთავაზობთ 128 000-ტოკენიანი ფანჯარას უფრო რთული, მრავალსაფეხურიანი მსჯელობის ამოცანებისთვის.
„სარვამის“ განცხადებით, ახალი AI მოდელები ნულიდან მომზადდა და არა არსებული ღია კოდის სისტემებზე დაფუძნებით. 30B მოდელი წინასწარ იყო გაწვრთნილი დაახლოებით 16 ტრილიონ ტექსტურ ტოკენზე, ხოლო 105B მოდელი გაწვრთნილი იყო ტრილიონობით ტოკენზე, რომელიც რამდენიმე ინდურ ენას მოიცავდა, ნათქვამია განცხადებაში. სტარტაპის განცხადებით, მოდელები შექმნილია რეალურ დროში აპლიკაციების მხარდასაჭერად, მათ შორის ხმოვანი ასისტენტებისა და ჩატის სისტემებისთვის ინდურ ენებზე.
სტარტაპის თქმით, მოდელები გაწვრთნილი იქნა ინდოეთის მთავრობის მიერ მხარდაჭერილი IndiaAI მისიის ფარგლებში მოწოდებული გამოთვლითი რესურსების გამოყენებით, ინფრასტრუქტურული მხარდაჭერით მონაცემთა ცენტრის ოპერატორი Yotta-სგან და ტექნიკური მხარდაჭერით Nvidia-სგან. „სარვამის“ აღმასრულებლებმა განაცხადეს, რომ კომპანია გეგმავს მოდელების გაფართოებისას გააზრებულ მიდგომას, ფოკუსირებას რეალურ სამყაროში არსებულ აპლიკაციებზე და არა უბრალო ზომაზე. „ჩვენ გვინდა, რომ გაფართოებისას გააზრებულად ვიმოქმედოთ“, - განაცხადა „სარვამის“ თანადამფუძნებელმა პრატიუშ კუმარმა გაშვებისას. „არ გვინდა გაფართოება უგულისყუროდ. გვსურს გავიგოთ, რომელი ამოცანებია მართლაც მნიშვნელოვანი მასშტაბურად და მათზე ვიმუშაოთ.“
„სარვამის“ განცხადებით, ის გეგმავს 30B და 105B მოდელების ღია კოდით გაშვებას, თუმცა არ დაუკონკრეტებია, გახდება თუ არა საჯარო სავარჯიშო მონაცემები ან სრული სავარჯიშო კოდი. კომპანიამ ასევე წარმოადგინა გეგმები სპეციალიზებული AI სისტემების შესაქმნელად, მათ შორის კოდირებაზე ორიენტირებული მოდელები და საწარმოსთვის განკუთვნილი ინსტრუმენტები, სახელწოდებით Sarvam for Work, ასევე სასაუბრო AI აგენტის პლატფორმა სახელწოდებით Samvaad.
2023 წელს დაარსებულმა „სარვამმა“ 50 მილიონ დოლარზე მეტი დაფინანსება მოიზიდა და მის ინვესტორებს შორის არიან Lightspeed Venture Partners, Khosla Ventures და Peak XV Partners (ყოფილი Sequoia Capital India).
წყარო: techcrunch.com
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი