დღეს Google-მა წარმოადგინა Gemma 3, Gemma მოდელების ოჯახის ახალი თაობა. ამ მოდელების პარამეტრების რაოდენობა მერყეობს 1 მილიარდიდან 27 მილიარდამდე, გააჩნია 128k ტოკენამდე კონტექსტური ფანჯარა, შეუძლია გამოსახულებებისა და ტექსტის მიღება და მხარს უჭერს 140-ზე მეტ ენას. სცადეთ Gemma 3 ახლავე 👉🏻 Gemma 3 Space. ყველა მოდელი ხელმისაწვდომია Hub-ზე და მჭიდროდ არის ინტეგრირებული Hugging Face-ის ეკოსისტემასთან. გამოშვებულია როგორც წინასწარ გაწვრთნილი, ასევე ინსტრუქციებზე დაფუძნებული მოდელები. Gemma-3-4B-IT მოდელი აჭარბებს Gemma-2-27B IT-ს, ხოლო Gemma-3-27B-IT ეტალონურ ტესტებში აღემატება Gemini 1.5-Pro-ს. Gemma 3 წარმოადგენს Google-ის ღია წონის დიდი ენობრივი მოდელების (LLM) უახლეს ვერსიას. ის ხელმისაწვდომია ოთხ ზომად: 1 მილიარდი, 4 მილიარდი, 12 მილიარდი და 27 მილიარდი პარამეტრი, როგორც საბაზო (წინასწარ გაწვრთნილი), ისე ინსტრუქციებზე დაფუძნებული ვერსიებით. Gemma 3 მულტიმოდალურია! 4, 12 და 27 მილიარდი პარამეტრის მქონე მოდელებს შეუძლიათ როგორც გამოსახულებების, ისე ტექსტის დამუშავება, ხოლო 1B ვარიანტი მხოლოდ ტექსტს ამუშავებს. შეყვანის კონტექსტური ფანჯრის სიგრძე Gemma 2-ის 8k-დან გაიზარდა 32k-მდე 1B ვარიანტებისთვის და 128k-მდე ყველა დანარჩენისთვის. როგორც სხვა VLM-ების (ვიზუალურ-ენობრივი მოდელების) შემთხვევაში, Gemma 3 წარმოქმნის ტექსტს მომხმარებლის შეყვანის საპასუხოდ, რომელიც შეიძლება შეიცავდეს ტექსტს და, სურვილის შემთხვევაში, გამოსახულებებს. გამოყენების მაგალითები მოიცავს კითხვა-პასუხს, გამოსახულების შინაარსის ანალიზს, დოკუმენტების შეჯამებას და ა.შ. მიუხედავად იმისა, რომ ეს მულტიმოდალური მოდელებია, მათი გამოყენება შესაძლებელია მხოლოდ ტექსტური მოდელის სახით (LLM-ის სახით) ვიზუალური ენკოდერის მეხსიერებაში ჩატვირთვის გარეშე. ამაზე უფრო დეტალურად ინფერენციის განყოფილებაში ვისაუბრებთ. Gemma 3-ის სამი ძირითადი გაუმჯობესება Gemma 2-თან შედარებით არის: ამ განყოფილებაში განვიხილავთ ტექნიკურ დეტალებს, რამაც გამოიწვია ეს გაუმჯობესებები. საინტერესოა, დავიწყოთ Gemma 2-ის ცოდნით და შევისწავლოთ, თუ რა იყო საჭირო ამ მოდელების კიდევ უფრო გასაუმჯობესებლად. ეს სავარჯიშო დაგეხმარებათ იფიქროთ Gemma-ს გუნდის მსგავსად და დააფასოთ დეტალები! კონტექსტის სიგრძის 128k ტოკენამდე გაზრდა მიღწეულ იქნა ეფექტურად, მოდელების ნულიდან გაწვრთნის გარეშე. ამის ნაცვლად, მოდელები წინასწარ გაწვრთნილია 32k თანმიმდევრობით, და მხოლოდ 4B, 12B და 27B მოდელები გაიზარდა 128k ტოკენამდე წინასწარი გაწვრთნის ბოლოს, რამაც მნიშვნელოვნად დაზოგა გამოთვლითი რესურსი. პოზიციური ჩადგმები, როგორიცაა RoPE, მორგებულია — Gemma 2-ის 10k საბაზო სიხშირიდან Gemma 3-ის 1M-მდე გაუმჯობესდა — და 8-ჯერ გაიზარდა უფრო გრძელი კონტექსტებისთვის. KV Cache-ის მართვა ოპტიმიზირებულია Gemma 2-ის მოძრავი ფანჯრის გადახურული ყურადღების გამოყენებით. ჰიპერპარამეტრები დარეგულირდა 5 ლოკალური შრის 1 გლობალურ შრესთან გადასართავად (ადრე 1:1) და ფანჯრის ზომა შემცირდა 1024 ტოკენამდე (4096-დან). რაც მთავარია, მეხსიერების დაზოგვა მიღწეულია სირთულის გაუარესების გარეშე. Gemma 3-ის მოდელები იყენებენ SigLIP-ს გამოსახულების ენკოდერად, რომელიც გამოსახულებებს გარდაქმნის ტოკენებად, რომლებიც შემდეგ ენობრივ მოდელში ინტეგრირდება. ვიზუალური ენკოდერი შეყვანად იღებს კვადრატულ გამოსახულებებს, რომლებიც 896x896 ზომამდე არის შემცირებული. ფიქსირებული შეყვანის რეზოლუცია ართულებს არაკვადრატული ასპექტის თანაფარდობების და მაღალი რეზოლუციის გამოსახულებების დამუშავებას. ამ შეზღუდვების მოსაგვარებლად ინფერენციის დროს, გამოსახულებები შეიძლება ადაპტურად დაიჭრას, და თითოეული ნაჭერი შემდეგ დაპატარავდება 896x896-მდე და ენკოდირდება გამოსახულების ენკოდერის მიერ. ეს ალგორითმი, სახელწოდებით "pan and scan", ეფექტურად აძლევს მოდელს საშუალებას, გაადიდოს გამოსახულების პატარა დეტალები. PaliGemma-ს მსგავსად, Gemma 3-ში ყურადღება განსხვავებულად მუშაობს ტექსტური და გამოსახულების შეყვანისთვის. ტექსტი მუშავდება ცალმხრივი ყურადღებით, სადაც მოდელი ფოკუსირებულია მხოლოდ თანმიმდევრობის წინა სიტყვებზე. გამოსახულებები კი იღებენ სრულ ყურადღებას ნიღბების გარეშე, რაც მოდელს საშუალებას აძლევს, გამოსახულების ყველა ნაწილს ორმხრივი გზით შეხედოს, რაც მას ვიზუალური შეყვანის სრულ, შეუზღუდავ გაგებას აძლევს. ქვემოთ მოცემულ ფიგურაში ჩანს, რომ გამოსახულების ტოკენებს მიეწოდებათ ორმხრივი ყურადღება (მთელი კვადრატი განათებულია), ხოლო ტექსტურ ტოკენებს აქვთ მიზეზობრივი ყურადღება. ის ასევე გვიჩვენებს, თუ როგორ მუშაობს ყურადღება მოძრავი ფანჯრის ალგორითმთან ერთად. იმისათვის, რომ LLM მრავალენოვანი იყოს, წინასწარი გაწვრთნის მონაცემთა ნაკრები მოიცავს უფრო მეტ ენას. Gemma 3-ის მონაცემთა ნაკრები შეიცავს ორჯერ მეტ მრავალენოვან მონაცემს ენების დაფარვის გასაუმჯობესებლად. ცვლილებების გასათვალისწინებლად, ტოკენაიზერი იგივეა, რაც Gemini 2.0-ის. ეს არის SentencePiece ტოკენაიზერი 262K ჩანაწერით. ახალი ტოკენაიზერი მნიშვნელოვნად აუმჯობესებს ჩინური, იაპონური და კორეული ტექსტის ენკოდირებას, ინგლისური და კოდის ტოკენების რაოდენობის მცირედი ზრდის ხარჯზე. დაინტერესებულ პირთათვის, აქ არის Gemma 3-ის ტექნიკური ანგარიში, რათა ღრმად ჩაუღრმავდეთ გაუმჯობესებებს. LMSys Elo ქულა არის რიცხვი, რომელიც აფასებს ენობრივ მოდელებს იმის მიხედვით, თუ რამდენად კარგად ასრულებენ ისინი პირდაპირ კონკურსებში, ადამიანის უპირატესობების მიხედვით. LMSys Chatbot Arena-ზე, Gemma 3 27B IT-ს Elo ქულა 1339-ია და ის მოწინავე 10 საუკეთესო მოდელს შორის იკავებს ადგილს, მათ შორის წამყვან დახურულ მოდელებსაც. Elo შედარებულია o1-preview-სთან და აღემატება სხვა არასააზროვნო ღია მოდელებს. ეს ქულა მიღწეულია Gemma 3-ის მხოლოდ ტექსტურ შეყვანაზე მუშაობით, ისევე როგორც ცხრილში მოცემული სხვა LLM-ები. Gemma 3 შეფასებულია ისეთ ეტალონურ ტესტებში, როგორიცაა MMLU-Pro (27B: 67.5), LiveCodeBench (27B: 29.7) და Bird-SQL (27B: 54.4), რაც აჩვენებს კონკურენტულ შესრულებას დახურულ Gemini მოდელებთან შედარებით. ტესტები, როგორიცაა GPQA Diamond (27B: 42.4) და [ტექსტი წყდება].