AutoRound: Intel-ის ინოვაციური მეთოდი ხელოვნური ინტელექტის მოდელების ოპტიმიზაციისთვის
AutoRound, Intel-ის მიერ შემუშავებული პოსტ-საწვრთნელი კვანტიზაციის (PTQ) მეთოდი, მნიშვნელოვნად აუმჯობესებს ხელოვნური ინტელექტის მოდელების ეფექტურობას მინიმალური სიზუსტის დაკარგვით. ის იყენებს ხელმოწერილ გრადიენტულ დაშვებას წონის დამრგვალებისა და ამოჭრის დიაპაზონების ოპტიმიზაციისთვის, რაც უზრუნველყოფს ზუსტ დაბალბიტიან კვანტიზაციას (INT2-INT8) და აღწევს 2.1-ჯერ მეტ ფარდობით სიზუსტეს INT2-ზე პოპულარულ ბაზისებთან შედარებით. მეთოდი სწრაფია, მსუბუქი და თავსებადია მრავალ LLM/VLM არქიტექტურასთან, რაც მა
AutoRound არის მხოლოდ წონაზე დაფუძნებული პოსტ-საწვრთნელი კვანტიზაციის (PTQ) მეთოდი, რომელიც Intel-მა შეიმუშავა. ის იყენებს ხელმოწერილ გრადიენტულ დაშვებას წონის დამრგვალებისა და ამოჭრის დიაპაზონების ერთობლივად ოპტიმიზაციისთვის, რაც უზრუნველყოფს ზუსტ დაბალბიტიან კვანტიზაციას (მაგ., INT2 - INT8) სიზუსტის მინიმალური დაკარგვით უმეტეს სცენარებში. მაგალითად, INT2-ზე ის 2.1-ჯერ მაღალ ფარდობით სიზუსტეს აჩვენებს პოპულარულ ბაზისურ მეთოდებთან შედარებით. ძირითადი ალგორითმის მიმოხილვისთვის, გთხოვთ, იხილოთ ჩვენი ნაშრომი.
ძლიერი წარმადობის მიუხედავად, AutoRound არის სწრაფი და მსუბუქი — 72 მილიარდი პარამეტრის მქონე მოდელის კვანტიზაციას სჭირდება მხოლოდ 37 წუთი A100 GPU-ზე „მსუბუქი რეჟიმის“ გამოყენებით. ის ასევე მხარს უჭერს მრავალბიტიან დარეგულირებას, lm-head კვანტიზაციას, GPTQ/AWQ/GGUF ფორმატში ექსპორტს და კონფიგურირებად რეგულირების რეცეპტებს. AutoRound იძლევა უაღრესად პერსპექტიულ შედეგებს, განსაკუთრებით დაბალბიტიანი კვანტიზაციის სცენარებში. სხვადასხვა ამოცანებზე ჩატარებული შეფასებები აჩვენებს, რომ ის მნიშვნელოვნად აღემატება პოპულარულ მეთოდებს 2-ბიტიანი სიზუსტით (წყარო). 4 ბიტზე, AutoRound აგრძელებს კონკურენტუნარიანობის შენარჩუნებას უმეტეს შემთხვევაში, როგორც ეს Low-Bit Open LLM Leaderboard-ზეა დემონსტრირებული.
LLM-ები: AutoRound მხარს უჭერს თითქმის ყველა პოპულარულ LLM არქიტექტურას, მათ შორის ისეთ ცნობილ მოდელებს, როგორიცაა Qwen, LLaMA და DeepSeek. მზა კვანტიზებული მოდელები ხელმისაწვდომია Hugging Face-ზე OPEA, Kaitchup და fbaldassarri კოლექციების მეშვეობით. VLM-ები: AutoRound მხარს უჭერს 10-ზე მეტ ვიზუალური ენის მოდელს (VLM), მათ შორის Mistral-Small-3.1, Gemma3 და სხვას. სრული სია შეგიძლიათ იხილოთ README-ში, ხოლო მზა კვანტიზებული მოდელები ხელმისაწვდომია OPEA Hugging Face კოლექციაში. ჯერ არასაკმარისად მხარდაჭერილი მოდელებისთვის, შეგიძლიათ გამოიყენოთ ჩვენი RTN მეთოდი `--iters 0` პარამეტრით. რეგულირება საჭირო არ არის, თუმცა მოსალოდნელია სიზუსტის გარკვეული დანაკარგი.
AutoRound-ს მაღალი სიზუსტის მისაღწევად მხოლოდ 200 რეგულირების ნაბიჯი და მცირე კალიბრაციის მონაცემთა ნაკრები (მხოლოდ 128 ნიმუში) სჭირდება. ეს ეფექტურობა ნიშნავს კვანტიზაციის უფრო სწრაფ დროს და რესურსების შემცირებულ მოხმარებას სხვა int2 მეთოდებთან შედარებით, რომლებიც უფრო გამოთვლით ინტენსიურია. ამჟამად, კვანტიზებული მოდელების გენერირებისთვის მხოლოდ ოფლაინ რეჟიმია მხარდაჭერილი. AutoRound ასევე გვთავაზობს ორ დამატებით რეცეპტს, `auto-round-best` და `auto-round-light`, რომლებიც შექმნილია შესაბამისად ოპტიმალური სიზუსტისა და გაუმჯობესებული სიჩქარისთვის. 2 ბიტისთვის, ჩვენ გირჩევთ `auto-round-best` ან `auto-round`-ის გამოყენებას. სამი რეცეპტის შედარებისთვის, იხილეთ დოკუმენტაცია. W4G128-ის საშუალო სიზუსტე 13 ამოცანაზე (mmlu-pro, if_eval, gsm8k და ა.შ.) და დროის ხარჯის შედეგები (ტესტირება ჩატარდა Nvidia A100 80G-ზე PyTorch 2.6.0-ის ვერსიის გამოყენებით `enable_torch_compile`-ით): ეს პარამეტრი გთავაზობთ უკეთეს კომპრომისს სიზუსტესა და რეგულირების ხარჯებს შორის და რეკომენდებულია ყველა სცენარში. AutoRound-ის საუკეთესო/მსუბუქი პარამეტრებისთვის API გამოყენებისთვის ან შერეული ბიტის კონფიგურაციებისთვის, გთხოვთ, იხილოთ AutoRound README.
AutoRound ავტომატურად ირჩევს საუკეთესო ხელმისაწვდომ ბექენდს დაინსტალირებული ბიბლიოთეკების საფუძველზე და მომხმარებელს სთხოვს დამატებითი ბიბლიოთეკების დაინსტალირებას, როდესაც უკეთესი ბექენდი აღმოჩნდება. დამატებითი დეტალებისთვის, გთხოვთ, იხილოთ HF README ან AutoRound README. GPTQ/AWQ მოდელების უმეტესობა შეიძლება გადაკეთდეს AutoRound ფორმატში Intel-ის მოწყობილობებთან უკეთესი თავსებადობისა და მხარდაჭერისთვის. გაითვალისწინეთ, რომ კვანტიზაციის კონფიგურაცია შეიცვლება, თუ მოდელი სერიალიზდება. AutoRound მნიშვნელოვან წინ გადადგმულ ნაბიჯს წარმოადგენს პოსტ-საწვრთნელ კვანტიზაციაში დიდი ენობრივი და ვიზუალური ენის მოდელებისთვის. მაღალი სიზუსტის, განსაკუთრებული ეფექტურობისა და პოპულარულ მოდელებთან, მოწყობილობებთან და ექსპორტის ფორმატებთან ფართო თავსებადობის კომბინაციით, AutoRound დაბალბიტიან კვანტიზაციას ხდის როგორც პრაქტიკულს, ასევე მძლავრს. მიუხედავად იმისა, LLM-ებს ფართო მასშტაბით ავრცელებთ თუ VLM-ებზე კიდეების დასკვნით ექსპერიმენტებს ატარებთ, AutoRound გთავაზობთ ინსტრუმენტებსა და მოქნილობას, რაც გჭირდებათ ოპტიმალური წარმადობის მისაღწევად მინიმალური დანახარჯებით. გეპატიჟებით სცადოთ ის და შეუერთდეთ მზარდ საზოგადოებას, რომელიც აფართოებს ეფექტური ხელოვნური ინტელექტის განლაგების საზღვრებს. AutoRound-ში შეტანილი წვლილი მისასალმებელია და დიდად დასაფასებელი! იქნება ეს შეცდომების გამოსწორება, დოკუმენტაციის გაუმჯობესება, ახალი ფუნქციების დამატება თუ გაუმჯობესების შეთავაზება, თქვენი დახმარება ყოველთვის ფასდება. თუ AutoRound-თან დაკავშირებულ რაიმე პრობლემას წააწყდებით, გთხოვთ, გახსნათ issue AutoRound-ის საცავში. გვინდა მადლობა გადავუხადოთ ღია კოდის დაბალი სიზუსტის ბიბლიოთეკებს, მათ შორის AutoGPTQ, AutoAWQ, GPTQModel, Triton, Marlin და ExLLaMAV2, რომელთა CUDA ბირთვები გამოიყენება AutoRound-ში.
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი