Google-მა გამოუშვა EmbeddingGemma: უახლესი მულტილინგვური ჩაშენების მოდელი მოწყობილობებისთვის
Google-მა წარადგინა EmbeddingGemma, უახლესი მულტილინგვური ჩაშენების მოდელი, რომელიც ოპტიმიზებულია მოწყობილობებზე გამოსაყენებლად. 308 მილიონი პარამეტრით და 2K კონტექსტური ფანჯრით, ის მხარს უჭერს 100-ზე მეტ ენას და MTEB ბენჩმარკზე 500M-ზე ნაკლებ მოდელებს შორის ყველაზე მაღალრეიტინგულია. მოდელი შექმნილია სიჩქარისა და ეფექტურობისთვის, მნიშვნელოვნად აფართოებს მობილური RAG კონვეიერების შესაძლებლობებს და ინტეგრირებულია პოპულარულ AI ხელსაწყოებთან.
დღეს Google-მა გამოუშვა EmbeddingGemma, უახლესი, მულტილინგვური ჩაშენების მოდელი, რომელიც იდეალურია მოწყობილობაზე გამოსაყენებლად. სიჩქარისა და ეფექტურობისთვის შექმნილი მოდელი კომპაქტურია, აქვს 308 მილიონი პარამეტრი და 2K კონტექსტური ფანჯარა, რაც ახალ შესაძლებლობებს ხსნის მობილური RAG კონვეიერებისთვის, აგენტებისთვის და სხვა. EmbeddingGemma გაწვრთნილია 100-ზე მეტი ენის მხარდასაჭერად და წერის მომენტისთვის, 500M პარამეტრზე ნაკლები მოდელებს შორის, არის ყველაზე მაღალრეიტინგული ტექსტზე დაფუძნებული მულტილინგვური ჩაშენების მოდელი Massive Text Embedding Benchmark-ზე (MTEB).
ტექსტური ჩაშენებები თანამედროვე ბუნებრივი ენის აპლიკაციების ხერხემლად იქცა, სიტყვებს, წინადადებებსა და დოკუმენტებს აქცევს მკვრივ ვექტორებად, რომლებიც აღბეჭდავს მნიშვნელობას, განწყობას და მიზანს. ეს ვექტორები შესაძლებელს ხდის სწრაფ მსგავსების ძიებას, დაჯგუფებას, კლასიფიკაციას და მოძიებას მასშტაბურ კორპუსებში, რაც საფუძვლად უდევს ყველაფერს, სარეკომენდაციო სისტემებიდან და სემანტიკური ძიებიდან დაწყებული, აღდგენით გაძლიერებულ გენერაციამდე და კოდის საძიებო ხელსაწყოებამდე. ჩაშენების მოდელები, რომლებიც ამ ჩაშენებებს ითვლის, ფართოდ გამოიყენება, Hugging Face-ზე თვეში 200 მილიონზე მეტი ჩამოტვირთვით.
ამ საფუძველზე დაყრდნობით, Google DeepMind-ის EmbeddingGemma დღეისათვის ყველაზე ახალი, ყველაზე ეფექტური მცირე მულტილინგვური ჩაშენების მოდელია. მხოლოდ 308 მილიონი პარამეტრით, 2K ტოკენის კონტექსტური ფანჯრით და 100-ზე მეტი ენის მხარდაჭერით, EmbeddingGemma უზრუნველყოფს უახლეს შესრულებას Massive Multilingual Text Embedding Benchmark-ზე (MMTEB), ხოლო კვანტიზაციისას 200 MB ოპერატიული მეხსიერების ფარგლებში რჩება. მრავალფეროვანი დიზაინის გადაწყვეტილებები ქმნის ძალიან პრაქტიკულ, ღია კოდის მქონე ინსტრუმენტს მაღალი ხარისხის მულტილინგვური ჩაშენებების გამოსათვლელად ყოველდღიურ მოწყობილობებზე.
ამ ბლოგპოსტში აღწერილია EmbeddingGemma-ს არქიტექტურა და სწავლება, და ნაჩვენებია, თუ როგორ გამოიყენოთ მოდელი სხვადასხვა ფრეიმვორკებთან, როგორიცაა Sentence Transformers, LangChain, LlamaIndex, Haystack, txtai, Transformers.js, Text Embedding Inference და ONNX. შემდგომში, ნაჩვენებია, თუ როგორ უნდა მოვახდინოთ EmbeddingGemma-ს წვრილი დარეგულირება თქვენს დომენზე კიდევ უფრო ძლიერი შესრულებისთვის. ჩვენს მაგალითში, ჩვენ EmbeddingGemma-ს წვრილად დავარეგულირეთ სამედიცინო ინსტრუქციისა და მოძიების მონაცემთა ნაკრებზე (MIRIAD). მიღებული მოდელი, sentence-transformers/embeddinggemma-300m-medical, უზრუნველყოფს უახლეს შესრულებას ჩვენს ამოცანაში: სამეცნიერო სამედიცინო ნაშრომების ფრაგმენტების მოძიება დეტალურ სამედიცინო კითხვებზე პასუხად. ის ამ ამოცანაში ორჯერ დიდ მოდელებსაც კი აჯობებს.
EmbeddingGemma ეფუძნება Gemma3 ტრანსფორმატორის ბაზას, მაგრამ შეცვლილია ისე, რომ გამოიყენოს ორმხრივი ყურადღება (bi-directional attention) მიზეზობრივი (ცალმხრივი) ყურადღების ნაცვლად. ეს ნიშნავს, რომ თანმიმდევრობის ადრინდელ ტოკენებს შეუძლიათ გაითვალისწინონ გვიანდელი ტოკენები, რაც არქიტექტურას ეფექტურად დეკოდერიდან ენკოდერად აქცევს. ენკოდერ მოდელებს შეუძლიათ აჯობონ დიდ ენობრივ მოდელებს (LLMs), რომლებიც დეკოდერები არიან, ჩაშენების ამოცანებში, როგორიცაა მოძიება (Weller et al., 2025). ამ ბაზის წყალობით, მოდელს შეუძლია ერთდროულად დაამუშაოს 2048 ტოკენი, რაც საკმარისია ტიპიური მოძიების შეყვანებისთვის, განსაკუთრებით იმის გათვალისწინებით, რომ უფრო დიდი შეყვანები ხშირად იწვევს ინფორმაციის დაკარგვას ტექსტურ ჩაშენებებში.
ახალი Gemma3-ზე დაფუძნებული ენკოდერული ბაზის გარდა, რომელიც ტოკენის ჩაშენებებს წარმოქმნის, საშუალო გაერთიანების ფენა (mean pooling layer) ამ ტოკენის ჩაშენებებს ტექსტურ ჩაშენებებად გარდაქმნის. და ბოლოს, ორი მკვრივი ფენა (dense layers) ტექსტურ ჩაშენებებს საბოლოო ფორმაში, 768-განზომილებიან ვექტორად აქცევს.
EmbeddingGemma მოდელი გაწვრთნილია მატრიოშკა წარმოდგენის სწავლით (Matryoshka Representation Learning - MRL), რაც საშუალებას გაძლევთ 768-განზომილებიანი გამოსავალი საჭიროებისამებრ შეამოკლოთ 512, 256 ან 128 განზომილებამდე. ეს იწვევს უფრო სწრაფ შემდგომ დამუშავებას და მეხსიერებისა და დისკის სივრცის ნაკლებ გამოყენებას. ამ შემოკლების შესრულების მაგალითისთვის იხილეთ Sentence Transformers-ის გამოყენება.
მოდელი გაწვრთნილია ფრთხილად შერჩეული, მულტილინგვური კორპუსის გამოყენებით, რომელიც დაახლოებით 320 მილიარდ ტოკენს მოიცავს. კომპანიის მონაცემთა ნაკრები არის საჯაროდ ხელმისაწვდომი ვებ-ტექსტის, კოდის, ტექნიკური დოკუმენტაციისა და სინთეზური, ამოცანებზე ორიენტირებული მაგალითების ნაზავი. ის გაფილტრულია ბავშვთა სექსუალური ძალადობის ამსახველი მასალის (CSAM), მგრძნობიარე მონაცემებისა და დაბალი ხარისხის ან სახიფათო კონტენტის თავიდან ასაცილებლად.
EmbeddingGemma შეფასდა MMTEB (მულტილინგვური, v2) და MTEB (ინგლისური, v2) კომპლექტებზე, რომლებიც მოიცავს ამოცანების, დომენებისა და ენების ფართო სპექტრს. მიუხედავად მისი მოკრძალებული 308 მილიონი პარამეტრის ზომისა, მოდელი მუდმივად აჯობებს მსგავს საბაზისო მოდელებს, თანაც ინარჩუნებს მეხსიერების ძალიან მცირე ნაკვალევს. შედეგები გამოქვეყნდება MTEB-ის ოფიციალურ ლიდერბორდზე. ჩვენ გამოვრიცხავთ ნებისმიერ მოდელს, რომელიც გაწვრთნილია MTEB მონაცემების 20%-ზე მეტზე, პოტენციური ზედმეტი მორგების (over-fitting) შესამცირებლად.
დემოს სრულ ეკრანზე ნახვაც შესაძლებელია. თავად გამოსცადეთ დემო დესკტოპ მოწყობილობაზე.
EmbeddingGemma ინტეგრირებულია ბევრ პოპულარულ ხელსაწყოსთან, რაც აადვილებს მის ჩართვას არსებულ სამუშაო პროცესებსა და აპლიკაციებში. მოდელი ინტეგრირებულია Sentence Transformers-ში, შესაბამისად, ასევე პროექტებში, რომლებიც იყენებენ Sentence Transformers-ს კულისებში, როგორიცაა LangChain, LlamaIndex, Haystack და txtai. იხილეთ ქვემოთ მოცემული მაგალითები, რათა დაიწყოთ მუშაობა თქვენს სასურველ ფრეიმვორკთან. საწარმოო დანერგვისთვის შეგიძლიათ გამოიყენოთ ტექსტი
თეგები:
#ai
#ხელოვნური ინტელექტი
#google
#მანქანური სწავლება
#gemma
#nlp
#deepmind
#embeddinggemma
#მულტილინგვური მოდელი
#ტექსტის ჩაშენება
წყარო: huggingface.co
AI-ით გადამუშავებული