Gemma 3n: მულტიმოდალური AI მოდელი საბოლოოდ ღია კოდის ბიბლიოთეკებში
Google-ის უახლესი მულტიმოდალური AI მოდელი, Gemma 3n, საბოლოოდ ხელმისაწვდომია ყველაზე პოპულარულ ღია კოდის ბიბლიოთეკებში, მათ შორის transformers & timm, MLX, llama.cpp და სხვებში. ეს გამოშვება მოიცავს ორ ზომას (E2B და E4B), რომლებიც გამოირჩევიან მაღალი ეფექტურობით VRAM-ის გამოყენების მხრივ და უზრუნველყოფენ შესანიშნავ ხარისხს. Gemma 3n არა მხოლოდ ენობრივ დეკოდერს, არამედ აუდიო და ვიზუალურ ენკოდერებსაც მოიცავს, რაც მას სრულყოფილ მულტიმოდალურ ინსტრუმენტად აქცევს დეველოპერებისთვის. სტატია დეტალურად აღ
დღეს Gemma 3n საბოლოოდ ხელმისაწვდომია ყველაზე ხშირად გამოყენებად ღია კოდის ბიბლიოთეკებში. ეს მოიცავს transformers & timm, MLX, llama.cpp (ტექსტური შეყვანები), transformers.js, ollama, Google AI Edge და სხვებს. ეს პოსტი სწრაფად განიხილავს პრაქტიკულ მაგალითებს, რათა აჩვენოს, როგორ გამოვიყენოთ მოდელი ამ ბიბლიოთეკებთან და რამდენად ადვილია მისი ოპტიმიზაცია სხვა დომენებისთვის.
**Gemma 3n გამოშვების კოლექცია**
დღეს გამოვიდა მოდელის ორი ზომა, თითოეული ორი ვარიანტით (ბაზური და ინსტრუქციული). მოდელის სახელები არასტანდარტულ ნომენკლატურას მიჰყვება: მათ ეწოდებათ gemma-3n-E2B და gemma-3n-E4B. E პარამეტრების რაოდენობის წინ ნიშნავს "ეფექტურს". მათი რეალური პარამეტრების რაოდენობაა 5B და 8B, შესაბამისად, მაგრამ მეხსიერების ეფექტურობის გაუმჯობესების წყალობით, მათ მხოლოდ 2B და 4B VRAM (GPU მეხსიერება) სჭირდებათ. შესაბამისად, ეს მოდელები აპარატურის მხარდაჭერის თვალსაზრისით 2B და 4B მოდელებივით იქცევიან, მაგრამ ხარისხის მხრივ აღემატებიან 2B/4B მოდელებს. E2B მოდელი შეიძლება გაეშვას სულ რაღაც 2GB GPU RAM-ში, ხოლო E4B შეიძლება გაეშვას მხოლოდ 3GB GPU RAM-ით.
ენის დეკოდერის გარდა, Gemma 3n იყენებს აუდიო ენკოდერს და ვიზუალურ ენკოდერს. ქვემოთ გამოვყოფთ მათ ძირითად მახასიათებლებს და აღვწერთ, თუ როგორ დაემატა ისინი transformers-სა და timm-ს, რადგან ისინი საორიენტაციოა სხვა იმპლემენტაციებისთვის.
მოდელის შემოწმების უმარტივესი გზაა Hugging Face Space-ის გამოყენება. აქ შეგიძლიათ სცადოთ სხვადასხვა მოთხოვნები, სხვადასხვა მოდალობით. 📱 Space
**ინსტალაცია**
დააინსტალირეთ timm-ის (ვიზუალური ენკოდერისთვის) და transformers-ის უახლესი ვერსია, რათა გაუშვათ ინფერენცია, ან თუ გსურთ მისი ოპტიმიზაცია. Gemma 3n-ის გამოყენების დაწყების უმარტივესი გზაა pipeline აბსტრაქციის გამოყენება transformers-ში:
**გამოსავალი:**
ინიციალიზაცია გაუკეთეთ მოდელსა და პროცესორს Hub-იდან და დაწერეთ model_generation ფუნქცია, რომელიც უზრუნველყოფს მოთხოვნების დამუშავებასა და მოდელზე ინფერენციის გაშვებას. ვინაიდან მოდელი მხარს უჭერს ყველა მოდალობას, როგორც შეყვანას, აქ მოცემულია კოდის მოკლე განმარტება, თუ როგორ შეგიძლიათ მათი გამოყენება transformers-ის საშუალებით:
**გამოსავალი:**
**გამოსავალი:**
ვიდეოების მხარდაჭერა ხდება გამოსახულების კადრების კოლექციის სახით.
**გამოსავალი:**
Gemma 3n-ს გააჩნია day 0 მხარდაჭერა MLX-ისთვის სამივე მოდალობის მასშტაბით. დარწმუნდით, რომ განაახლეთ თქვენი mlx-vlm ინსტალაცია.
დაიწყეთ ვიზუალით:
და აუდიოთი:
MLX-ის გარდა, Gemma 3n (მხოლოდ ტექსტი) მუშაობს დამატებითი კონფიგურაციის გარეშე llama.cpp-თან. დარწმუნდით, რომ დააინსტალირეთ llama.cpp/Ollama წყაროდან. იხილეთ llama.cpp-ის ინსტალაციის ინსტრუქციები აქ: https://github.com/ggml-org/llama.cpp/blob/master/docs/install.md
შეგიძლიათ გაუშვათ ასე:
და ბოლოს, ჩვენ ასევე ვუშვებთ ONNX წონებს gemma-3n-E2B-it მოდელის ვარიანტისთვის, რაც საშუალებას იძლევა მოქნილი განთავსების სხვადასხვა runtime-სა და პლატფორმაზე. JavaScript დეველოპერებისთვის Gemma3n ინტეგრირებულია Transformers.js-ში და ხელმისაწვდომია 3.6.0 ვერსიიდან. მოდელის ამ ბიბლიოთეკებთან გასაშვებად დამატებითი ინფორმაციისთვის იხილეთ გამოყენების განყოფილება მოდელის ბარათში.
მოდელის ზომის გათვალისწინებით, საკმაოდ მოხერხებულია მისი ოპტიმიზაცია სპეციფიკური ამოცანებისთვის სხვადასხვა მოდალობის მასშტაბით. იმისათვის, რომ გაგიმარტივოთ მოდელის ოპტიმიზაცია, ჩვენ შევქმენით მარტივი ნოუთბუქი, რომელიც საშუალებას გაძლევთ ექსპერიმენტები ჩაატაროთ უფასო Google Colab-ში! ჩვენ ასევე გთავაზობთ სპეციალურ ნოუთბუქს აუდიო ამოცანებზე ოპტიმიზაციისთვის, რათა მარტივად მოარგოთ მოდელი თქვენს მეტყველების მონაცემთა ნაკრებებსა და ბენჩმარკებს!
ამ გამოშვებით, ჩვენ ასევე წარმოგიდგენთ Hugging Face Gemma Recipes-ის რეპოზიტორიუმს. აქ ნახავთ ნოუთბუქებსა და სკრიპტებს მოდელების გასაშვებად და მათ ოპტიმიზაციისთვის. ჩვენ გვსურს, რომ გამოიყენოთ Gemma მოდელების ოჯახი და დაამატოთ მეტი რეცეპტი! თავისუფლად გახსენით Issues და შექმენით Pull Request-ები რეპოზიტორიუმში. ჩვენ ყოველთვის მოხარულნი ვართ ვუმასპინძლოთ Google-სა და მათ Gemma მოდელების ოჯახს. ვიმედოვნებთ, რომ საზოგადოება გაერთიანდება და მაქსიმალურად გამოიყენებს ამ მოდელებს. მულტიმოდალური, მცირე ზომის და მაღალი შესაძლებლობების მოდელის შესანიშნავი გამოშვებაა!
თუ გსურთ მოდელების უფრო დეტალურად განხილვა, დაიწყეთ დისკუსია ამ ბლოგ-პოსტის ქვემოთ. სიამოვნებით დაგეხმარებით!
დიდი მადლობა არტურს, სირილს, რაუშანს, ლისანდრს და Hugging Face-ის ყველა თანამშრომელს, ვინც იზრუნა ინტეგრაციაზე და ის ხელმისაწვდომი გახადა საზოგადოებისთვის!
**მეტი სტატია ჩვენი ბლოგიდან**
საოცარი გამოშვება! მოდის თუ არა MobileNet-v5 წონები https://huggingface.co/timm-ზე? არის თუ არა რაიმე შედეგი ამ მოდელის (მხოლოდ ვიზუალური ენკოდერი) მუშაობის შესახებ შესამოწმებლად? მადლობა ყველას ძალისხმევისთვის. ეს შესანიშნავი საკითხავი იყო, მათთვის, ვისაც არქიტექტურის უფრო ღრმა გაგება სურს, წაიკითხეთ https://huggingface.co/blog/rishiraj/matformer-in-gemma-3n. მადლობა day 0 MLX მხარდაჭერისთვის 🙏. დიდი მადლობა ამ გამოშვებისთვის! სტატიაში ნათქვამია, რომ მოდელი "აღწევს 60 FPS-ს Google Pixel-ზე" შეყვანის სახით გამოსახულებებით. Google Pixel-ზე მოდელი მუშაობს Google Tensor G4 ჩიპზე, თუ არ ვცდები. მოდელის Qualcomm-ის ჩიპზე (მაგალითად: QCS8550) გასაშვებად, ჩემი გაგებით, უნდა გამოვიყენოთ llama.cpp ბიბლიოთეკა, რომელიც, როგორც ჩანს, არ ითვალისწინებს ViT ენკოდერს (სტატიაში ვკითხულობთ "llama.cpp (ტექსტური შეყვანები)"). სწორია თუ არა ჩემი გაგება, თუ შესაძლოა Qualcomm-ზე საუკეთესო იქნებოდა…
თეგები:
#ხელოვნური ინტელექტი
#google ai
#მანქანური სწავლება
#gpu
#ტრანსფორმერები
#hugging face
#ღია კოდი
#mlx
#ფაინ-ტიუნინგი
#gemma 3n
#მულტიმოდალური
#vram
#llama.cpp
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი