Arm KleidiAI და SDOT: გენერაციული ხელოვნური ინტელექტი მილიარდობით მოწყობილობაზე, მათ შორის ძველ მოდელებზეც
Arm-ის KleidiAI, SDOT CPU ფუნქციის გამოყენებით, გენერაციულ ხელოვნურ ინტელექტს (GenAI) ხელმისაწვდომს ხდის მოწყობილობების ფართო სპექტრზე – უახლესი ფლაგმანური მოდელებიდან დაწყებული, ხუთ წლამდე ძველი სმარტფონებითა და Raspberry Pi 5-ით დამთავრებული. ეს მიიღწევა პოპულარულ AI ფრეიმვორკებში ჩაშენებული ოპტიმიზაციებით და ExecuTorch 0.7 ბეტაში ნაგულისხმევი ჩართვით, რაც უზრუნველყოფს დიდი ენობრივი მოდელების (LLM) ეფექტურ მუშაობას კოდის შეცვლის გარეშე და მნიშვნელოვანი წარმადობის გაუმჯობესებით.
Arm-ის ბოლო SME2 განცხადების გათვალისწინებით, Arm KleidiAI-ის როლი, როგორც Arm-ის AI ამაჩქარებელი შრე, რომელიც AI-ის შემდეგ ტალღას უზრუნველყოფს, სულ უფრო ნათელი ხდება. ფართოდ გამოყენებად Edge AI ფრეიმვორკებში, როგორიცაა XNNPack, MediaPipe, MNN, ONNX Runtime და თუნდაც llama.cpp, ჩაშენებით, KleidiAI-მ მნიშვნელოვანი წარმადობის გაუმჯობესება უზრუნველყო დეველოპერების მხრიდან კოდის ცვლილებების საჭიროების გარეშე. ეს საფუძველი პირდაპირ მიგვიყვანს მოახლოებულ ExecuTorch 0.7 ბეტა ვერსიასთან, სადაც KleidiAI ნაგულისხმევად იქნება ჩართული – რაც ავტომატურ აჩქარებას მოუტანს როგორც უახლეს Arm CPU არქიტექტურაზე აგებულ მოწყობილობებს, ასევე არსებული ტელეფონების ფართო ბაზას, რომლებიც ადრინდელ თაობებზეა შექმნილი. Android-ისა და კროს-პლატფორმული დეველოპერები – მიუხედავად იმისა, არიან თუ არა ისინი პირველი ან მესამე მხარის – მყისიერ წვდომას იღებენ KleidiAI AI წარმადობის ოპტიმიზაციებთან ExecuTorch-ისა და XNNPack-ის მეშვეობით. შედეგი? მოდელების უფრო სწრაფი გაშვება, დაბალი შეყოვნება, ნაკლები მეხსიერების გამოყენება – და ინტეგრაციის სირთულეების არარსებობა. ის, რაც ადრე მორგებულ დაკალიბრებას მოითხოვდა, ახლა მზა გადაწყვეტაა, გამოსაყენებლად მზად შეფუთვიდანვე. ეს ეფექტურობა ხსნის ახალ შესაძლებლობებს – არა მხოლოდ უახლესი მაღალი კლასის მოწყობილობებისთვის, არამედ აპარატურის გაცილებით ფართო სპექტრისთვის.
როდესაც განვიხილავთ გენერაციული ხელოვნური ინტელექტის (GenAI) მობილურ მოწყობილობებზე გაშვებას, ადვილი წარმოსადგენია უახლესი ფლაგმანური სმარტფონები, რომლებიც აღჭურვილია მძლავრი CPU-ებით, GPU-ებითა და NPU-ებით. მაგრამ რა მოხდება, თუ გეტყვით, რომ GenAI გამოცდილება – როგორიცაა დიდი ენობრივი მოდელების (LLM) გაშვება – შეიძლება ხელმისაწვდომი გახდეს 3, 4, ან თუნდაც 5 წლის მოწყობილობებზეც? ან თუნდაც Raspberry Pi 5-ზე? ეს უკვე აღარ არის მხოლოდ ხედვა, არამედ პრაქტიკული რეალობა. Arm SDOT CPU ფუნქციის წყალობით, რომელიც Arm CPU-ებში 2015 წლიდან არის ხელმისაწვდომი. SDOT (Signed Dot Product) ინსტრუქცია, რომელიც დაინერგა Armv8.2 არქიტექტურასა და შემდგომ CPU-ებში, უზრუნველყოფს ეფექტურ წერტილოვან ნამრავლ ოპერაციებს 8-ბიტიანი ხელმოწერილი მთელი რიცხვების ვექტორებზე.
SDOT ინსტრუქცია, რომელიც ხელმისაწვდომია Arm CPU-ებზე, წარმოქმნის ოთხ 32-ბიტიან მთელ რიცხვს, რომელთაგან თითოეული მიიღება მარცხენა მხარის (LHS) და მარჯვენა მხარის (RHS) ვექტორული რეგისტრების ოთხი int8 ელემენტის შესაბამისი ჯგუფების წერტილოვანი ნამრავლის შედეგად. ეს ინსტრუქცია შეიძლება გამოყენებულ იქნას მატრიცული გამრავლების რუტინების დასაჩქარებლად – რაც არის ყოველი LLM-ის ძირითადი გამოთვლითი დატვირთვა – Int8 ან დაბალი ბიტის სიზუსტის ფორმატების, მაგალითად Int4-ის გამოყენებისას. ეს ოპერაციები, როგორც წესი, მოიცავს მრავალ წერტილოვან ნამრავლს მარცხენა მხარის მატრიცის ცალკეულ რიგებსა და მარჯვენა მხარის მატრიცის შესაბამის სვეტებს შორის.
SDOT ინსტრუქცია უკვე ფართოდ არის მხარდაჭერილი მოწყობილობების მრავალფეროვან დიაპაზონში, რაც გზას უხსნის GenAI გამოყენების შემთხვევებს, რათა მიაღწიონ სმარტფონების მომხმარებელთა გაცილებით დიდ აუდიტორიას. დღეის მდგომარეობით, დაახლოებით 3 მილიარდ Arm-ზე დაფუძნებულ მოწყობილობაში არსებული Arm CPU-ები მოიცავს ამ შესაძლებლობას – რაც მომხმარებელთა უმრავლესობისთვის უზრუნველყოფს მძლავრ GenAI გამოცდილებას მოწყობილობაზე. ფაქტობრივად, ყველა მოწყობილობის 72% ახლა მხარს უჭერს ამ ინსტრუქციას.
ExecuTorch-ის წყალობით, ჩვენ ახლა შესაძლებლობას ვაძლევთ ისეთ მოდელებს, როგორიცაა Llama 3.2, ეფექტურად იმუშაონ Android მოწყობილობების უმრავლესობაზე, ასევე Edge მოწყობილობებზე, როგორიცაა Raspberry Pi 5. გასულ წელს Llama 3.2 1B-ის კვანტიზებული ვერსიის გამოცხადებისთვის, ExecuTorch-ისა და KleidiAI-ის გუნდებმა ითანამშრომლეს Int4 მატრიცული გამრავლების ოპტიმიზაციების უზრუნველსაყოფად Arm CPU-ებზე, I8MM ფუნქციის გამოყენებით, რომელიც ხელმისაწვდომია Armv8.6 არქიტექტურიდან მოყოლებული. როგორც წინა ბლოგ პოსტში იყო აღნიშნული, ExecuTorch-ი KleidiAI-სთან ერთად Galaxy S24+-ზე 20%-ით მაღალ შევსების (prefill) წარმადობას აღწევს KleidiAI-ის გარეშე მოქმედ ბირთვებთან შედარებით. ეს ნიშნავს 350-ზე მეტ ტოკენს წამში შევსების ფაზაში და 40-ზე მეტ ტოკენს წამში დეკოდირების ფაზაში. წარმადობის ეს დონე საკმარისია მოწყობილობაზე ისეთი ამოცანების შესასრულებლად, როგორიცაა წაუკითხავი შეტყობინებების შეჯამება, მომხმარებლის შეუფერხებელი გამოცდილებით მხოლოდ Arm CPU-ების გამოყენებით. კონტექსტისთვის, დაახლოებით 50 წაუკითხავი შეტყობინების შეჯამება, როგორც წესი, მოიცავს დაახლოებით 600 ტოკენის დამუშავებას.
წელს, ExecuTorch-ისა და KleidiAI-ის გუნდებმა ყურადღება გაამახვილეს Int4 მატრიცული გამრავლების წარმადობის ოპტიმიზაციაზე SDOT ინსტრუქციის გამოყენებით, მიზნად ისახავდნენ მისი უფრო ფართო გამოყენებას. დამატებითი ინფორმაციისთვის, იხილეთ XNNPack PR GitHub-ზე. მიუხედავად იმისა, რომ LLM-ის წარმადობა Arm CPU-ებზე მხოლოდ SDOT გაფართოებით შეიძლება არ შეესაბამებოდეს უახლესი ფლაგმანური სმარტფონებისას, ის მაინც უზრუნველყოფს შთამბეჭდავ შესაძლებლობებს მოწყობილობაზე გენერაციული AI-ისთვის. ფაქტობრივად, მრავალ სცენარში, დეკოდირების ფაზა უფრო სწრაფია, ვიდრე ადამიანის საშუალო კითხვის სიჩქარე – რაც ხაზს უსვამს იმას, რომ ძველ Arm CPU-ებსაც კი შეუძლიათ პრაქტიკული და მნიშვნელოვანი GenAI გამოყენების შემთხვევების მხარდაჭერა. მაგალითად, მეტყველების ტექსტად გარდაქმნის (speech-to-text) და ტექსტის მეტყველებად გარდაქმნის (text-to-speech) მოდელებთან ერთად, ასეთი ლოკალური LLM შესაძლებლობას იძლევა შეიქმნას სრულად პირადი ჭკვიანი ასისტენტი, რომელიც მუშაობს მთლიანად ოფლაინ რეჟიმში, რითაც აღმოიფხვრება მონაცემთა კონფიდენციალურობის შესახებ შეშფოთება და ამავდროულად გთავაზობთ მდიდარ ხმოვან ინტერაქციებს. ასეთ მოწყობილობას შეუძლია შეუფერხებლად იმოქმედოს თქვენს დაკავშირებულ მოწყობილობებთან, რაც მომხმარებლებს უზრუნველყოფს სიმშვიდეს მათი მონაცემების უსაფრთხოებასთან დაკავშირებით. Llama 3.2 1B-ის გაშვების კიდევ ერთი მიმზიდველი გამოყენების შემთხვევაა კონტექსტზე ორიენტირებული ტექსტის შევსება ლოკალურ ტექსტურ რედაქტორებში. ბეჭდვისას, მოდელი გთავაზობთ ინტელექტუალურ, რეალურ დროში შემოთავაზებებს, რათა გაამარტივოს წერა...
თეგები:
#llm
#raspberry pi
#წარმადობა
#arm
#executorch
#edge ai
#kleidiai
#sdot
#genai
#ხელოვნური ინტელექტის ამაჩქარებელი
#მობილური ai
წყარო: huggingface.co
AI-ით გადამუშავებული