Bamba-9B: ახალი ჰიბრიდული Mamba2 მოდელი გაუმჯობესებული ეფექტურობით და ღია წყაროს ხელმისაწვდომობით
წარმოგიდგენთ Bamba-9B-ს, დასკვნის ეფექტურობაზე ორიენტირებულ ჰიბრიდულ Mamba2 მოდელს, რომელიც შემუშავებულია IBM-ის, პრინსტონის, CMU-სა და UIUC-ის მიერ, სრულად ღია მონაცემებზე. მოდელი უზრუნველყოფს 2.5-ჯერ გამტარუნარიანობის გაუმჯობესებას და 2-ჯერ შეყოვნების შემცირებას სტანდარტულ ტრანსფორმერებთან შედარებით და დაუყოვნებლივ ხელმისაწვდომია საზოგადოებისთვის ექსპერიმენტებისთვის სხვადასხვა პოპულარულ ბიბლიოთეკაში. მისი მიზანია KV-ქეშის შეზღუდვების დაძლევა და Mamba არქიტექტურების ფართოდ დანერგვა.
წარმოგიდგენთ Bamba-9B-ს, დასკვნის ეფექტურობაზე ორიენტირებულ ჰიბრიდულ Mamba2 მოდელს, რომელიც გაწვრთნილია IBM-ის, პრინსტონის, CMU-სა და UIUC-ის მიერ, სრულად ღია მონაცემებზე. დასკვნის (inference) ეტაპზე, მოდელი აჩვენებს 2.5-ჯერ გამტარუნარიანობის გაუმჯობესებას და 2-ჯერ შეყოვნების შემცირებას vLLM-ში სტანდარტულ ტრანსფორმერებთან შედარებით. საზოგადოების ექსპერიმენტების წახალისების მიზნით, მოდელი დაუყოვნებლივ ხელმისაწვდომია გამოსაყენებლად ტრანსფორმერებში, vLLM-ში, TRL-სა და llama.cpp-ში. ჩვენ ასევე გამოვაქვეყნებთ მოდელის დარეგულირების, წვრთნისა და გაფართოებული წინასწარი წვრთნის რეცეპტებს მდგომარეობის შემნახველი მონაცემთა ჩამტვირთავით (stateful data loader) და მოვიწვიეთ საზოგადოება, ხელი შეუწყოს ამ მოდელის შემდგომ გაუმჯობესებას. ერთად დავძლიოთ KV-ქეშის შეზღუდვა!
ტრანსფორმერული მოდელები სულ უფრო ხშირად გამოიყენება რეალურ სამყაროს აპლიკაციებში, თუმცა ისინი დასკვნის (inference) დროს აწყდებიან მეხსიერების გამტარუნარიანობის შეზღუდვებს, განსაკუთრებით ხანგრძლივი კონტექსტის მქონე მოდელებში ყოველ სიმბოლოზე დეკოდირებისას. ისეთი ტექნიკები, როგორიცაა დაბალი სიზუსტე, ფენების შემცირება და კომპრესია, შეიძლება შეამსუბუქოს პრობლემა, მაგრამ არ ხსნის ძირეულ მიზეზს, რომელიც არის KV-ქეშისთვის საჭირო მეხსიერების მზარდი რაოდენობა კონტექსტის სიგრძის ზრდასთან ერთად. განვითარებადი არქიტექტურები, როგორიცაა Mamba, Griffin და DeltaNet, აღმოფხვრის ამ შეზღუდვას KV-ქეშის ზომის მუდმივი გახდით.
Mamba არქიტექტურამ ბოლო დროს მნიშვნელოვანი აღიარება მოიპოვა საზოგადოებაში. მაგალითად, Jamba და Samba აერთიანებენ Mamba ფენებს ტრანსფორმერულ ფენებთან და იკვლევენ მიღებულ ჰიბრიდულ Mamba მოდელებს. Codestral Mamba, წმინდა Mamba2 მოდელი, აჩვენებს უახლეს (SOTA) შედეგებს კოდირების ამოცანებში, ხოლო NVIDIA-ს ჰიბრიდული Mamba2 მოდელი კონკურენტუნარიან შესრულებას აჩვენებს როგორც ხანგრძლივი კონტექსტის, ასევე ტრადიციული LLM ბენჩმარკებში. ბოლოდროინდელმა ინოვაციებმა, როგორიცაა Falcon Mamba და Falcon 3 Mamba, მიაღწიეს SOTA რეიტინგებს Hugging Face-ის ლიდერბორდებზე მათი გამოშვების დროს.
ჩვენ წარმოგიდგენთ Bamba-9B-ს, ჰიბრიდულ Mamba2 მოდელს, რომელიც გაწვრთნილია 2.2 ტრილიონ ტოკენზე, რაც კიდევ უფრო ადასტურებს ამ განვითარებად არქიტექტურებს. IBM-ის, პრინსტონის, CMU-სა და UIUC-ის ეს თანამშრომლობა უზრუნველყოფს სრულ წვრთნის ისტორიას, მოდელის საკონტროლო წერტილებს (checkpoints) და წინასწარი წვრთნის კოდს რეპროდუცირებადობისა და ექსპერიმენტების მხარდასაჭერად. გამოქვეყნებული საკონტროლო წერტილების საწვრთნელი მონაცემთა ნაკრები არ შეიცავს ბენჩმარკებთან შესაბამის ინსტრუქციის მონაცემებს (FLAN-ის გარდა), რათა შენარჩუნდეს გაფართოებული წინასწარი წვრთნისა და დაზუსტებული დარეგულირების მოქნილობა. ჩვენი მიზანია ვაჩვენოთ ჰიბრიდული Mamba2 არქიტექტურის პოტენციალი, ძლიერი შესრულების დემონსტრირებით საშუალო ზომის მოდელების მასშტაბით (7B-10B) და საზოგადოებისთვის მივაწოდოთ საკონტროლო წერტილები, რომლებიც სრულად რეპროდუცირებადია და გაწვრთნილია ღია მონაცემთა ნაკრებებით.
საზოგადოების ექსპერიმენტების წახალისების მიზნით, ჩვენ ასევე ვაქვეყნებთ განაწილებულ უმდგომარეო (stateless) მონაცემთა ჩამტვირთავ ფაილს (shuffle data loader) და ვააქტიურებთ ჰიბრიდული Mamba2 არქიტექტურას ღია წყაროს ბიბლიოთეკებში, როგორიცაა transformers, TRL, vLLM და llama.cpp. ვიმედოვნებთ, რომ ეს ძალისხმევა ხელს შეუწყობს Mamba არქიტექტურების მიღებას, შეამსუბუქებს KV-ქეშის შეზღუდვებს და შეამცირებს სხვაობას უახლესი (SOTA) ღია წყაროს მოდელებთან.
Bamba-ს ტრანსფორმერებთან გამოსაყენებლად, შეგიძლიათ გამოიყენოთ ნაცნობი AutoModel კლასები და generate API. დამატებითი დეტალებისთვის, გთხოვთ, მიჰყვეთ ინსტრუქციებს, რომლებიც მოცემულია Bamba GitHub-ზე.
ჩვენი შეფასებები სამ ნაწილად დავყავით: შეფასების კონფიგურაცია ⚙️ 🖥️: ჩვენ ხელახლა გავუშვით ყველა ბენჩმარკი მოცემული კონფიგურაციისა და სკრიპტების მიხედვით ყველა მოდელისთვის, გარდა NVIDIA Mamba2 Hybrid მოდელისა. NVIDIA Mamba2 Hybrid მოდელისთვის ბენჩმარკინგი ვერ განვახორციელეთ, რადგან მოდელის წონები არ არის Hugging Face-ის ტრანსფორმერებთან თავსებად ფორმატში. ამიტომ, ჩვენ მოვიყვანთ ციფრებს ორიგინალური ნაშრომიდან. v2 ლიდერბორდის შედეგებისთვის, ჩვენ ჩავატარეთ ნორმალიზაცია და ვაცნობებთ ნორმალიზებულ შედეგებს. ყველა შეფასებაში, უფრო მაღალი უკეთესია, გარდა მითითებული შემთხვევებისა.
Bamba-9B აჩვენებს ჰიბრიდული Mamba მოდელების კონკურენტუნარიან შესრულებას ტრანსფორმერულ მოდელებთან შედარებით. მიუხედავად იმისა, რომ მას აქვს ხარვეზები მათემატიკის ბენჩმარკებში და MMLU ქულებში (MMLU, GSM8K, MMLU-PRO, MATH Lvl 5), ამ ბენჩმარკების გამორიცხვით მისი საშუალო შესრულება თითქმის ტოლია Meta Llama 3.1 8B-ის (44.68 Llama-სთვის და 45.53 Bamba-სთვის), მოდელის, რომელიც გაწვრთნილია 7-ჯერ მეტ მონაცემზე. ეს ხარვეზები შეიძლება აღმოიფხვრას (ა) წინასწარი წვრთნის მეტი ტოკენებით გაფართოებით (MMLU ქულები სტაბილურად უმჯობესდებოდა წვრთნის დროს) და (ბ) მაღალი ხარისხის მათემატიკური მონაცემების ჩართვით წინასწარი წვრთნის/გარდამავალ ფაზებში. მომავალი გეგმები მოიცავს განახლებული მონაცემთა ნაკრებების, როგორიცაა Olmo2 mix, გამოყენებას და ბენჩმარკებთან შესაბამისი მიქსებით, როგორიცაა Dolmino mix, ოპტიმიზაციას.
Bamba-9B-ის შედეგები ასევე ამსუბუქებს შეშფოთებას NVIDIA-ს ჰიბრიდული Mamba2 მოდელის შედარებით დაბალ ქულებთან დაკავშირებით ლიდერბორდის ბენჩმარკებში. NVIDIA-ს კვლევის მიზანი იყო არქიტექტურების შედარება იდენტურ პირობებში. მათი დასკვნების თანახმად, Bamba-9B ადასტურებს, რომ ჰიბრიდული Mamba2 არქიტექტურა გთავაზობთ ტრანსფორმერული მოდელების კონკურენტუნარიან შესრულებას, ამავდროულად უზრუნველყოფს 5-ჯერ დასკვნის (inference) ეფექტურობას.
ჩვენ ვადარებთ Bamba-9B-ს მსგავსი ზომის უახლესი (SoTA) ტრანსფორმერულ მოდელებთან (Meta Llama 3.1 8B, IBM Granite v3 8B, Olmo2 7B და Gemma 2 9B). ჩვენ ვაკვირდებით, რომ მიუხედავად აშკარა ბენჩმარკის ხარვეზებისა, არ არის ნათელი, მიუთითებს თუ არა ეს ხარვეზები Mamba/Mamba2-ზე დაფუძნებული მოდელების ნაკლოვანებებზე. ფაქტობრივად, ფრთხილად ანალიზი აჩვენებს, რომ ხარვეზები დიდწილად გამოწვეულია მოდელების წვრთნისთვის გამოყენებული მონაცემების რაოდენობით და...
თეგები:
#ხელოვნური ინტელექტი
#llm
#მანქანური სწავლება
#ღია წყარო
#ტრანსფორმერი
#bamba-9b
#mamba2
#ibm
#kv-cache
#პრინსტონი
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები