ექსპერტების აზრით, ხელოვნური ინტელექტის განვითარების შემდეგი ეტაპი აგენტური AI-ია. ეს ახალი პარადიგმა იყენებს 'აღქმა - მსჯელობა - მოქმედება' პრინციპს, რათა გააერთიანოს LLM-ების დახვეწილი მსჯელობისა და განმეორებითი დაგეგმვის შესაძლებლობები კონტექსტის გააზრების გაუმჯობესებულ შესაძლებლობასთან. კონტექსტის გააზრების უნარი უზრუნველყოფილია ისეთი ხელსაწყოებით, როგორიცაა ვექტორული მონაცემთა ბაზები და სენსორული მონაცემები, რაც საშუალებას იძლევა შეიქმნას უფრო კონტექსტზე ორიენტირებული AI სისტემები, რომლებსაც შეუძლიათ კომპლექსური, მრავალსაფეხურიანი პრობლემების ავტონომიურად გადაჭრა. გარდა ამისა, LLM-ების ფუნქციების გამოძახების შესაძლებლობა AI აგენტს საშუალებას აძლევს უშუალოდ განახორციელოს მოქმედება, რაც ბევრად აღემატება ჩატბოტების მიერ შემოთავაზებულ საუბრის ფუნქციას. აგენტური AI მრავალ ინდუსტრიაში პროდუქტიულობისა და ოპერაციების გაუმჯობესების საინტერესო პერსპექტივებს გვთავაზობს. აგენტურ AI სისტემებში სულ უფრო მეტი ხელსაწყო ინტეგრირდება და მათი უმეტესობა CPU-ზე მუშაობს, რაც იწვევს შეშფოთებას არამნიშვნელოვანი 'მასპინძელი-აქსელერატორი' ტრაფიკის ზედმეტი დატვირთვის შესახებ ამ პარადიგმაში. ამავდროულად, მოდელების შემქმნელები და მომწოდებლები ქმნიან მცირე ენობრივ მოდელებს (SLM), რომლებიც უფრო კომპაქტური, მაგრამ ძლიერია. უახლესი მაგალითებია Meta-ს 1B და 3B Llama3.2 მოდელები, რომლებსაც აქვთ მოწინავე მრავალენოვანი ტექსტის გენერაციისა და ხელსაწყოების გამოძახების შესაძლებლობები. გარდა ამისა, CPU-ები ვითარდება და სულ უფრო მეტ AI მხარდაჭერას გვთავაზობს. Intel Advanced Matrix Extensions (AMX), ახალი AI ტენზორული ამაჩქარებელი, დაინერგა Xeon CPU-ების მე-4 თაობაში. ამ სამი ტენდენციის გათვალისწინებით, საინტერესო იქნება CPU-ს პოტენციალის შეფასება, რომ მასზე განთავსდეს მთელი აგენტური AI სისტემები, განსაკუთრებით მაშინ, როდესაც ისინი SLM-ებს იყენებენ. ამ სტატიაში, ჩვენ შევადარებთ აგენტური AI-ის 2 წარმომადგენლობით კომპონენტს: ტექსტის ჩაშენებას (embedding) და ტექსტის გენერაციას, ასევე შევაფასებთ CPU-ს თაობიდან თაობაზე გაუმჯობესებულ მუშაობას ამ ორ კომპონენტზე. შედარებისთვის ჩვენ ავარჩიეთ Google Cloud Compute Engine-ის C4 და N2 ინსტანციები. ლოგიკა ასეთია: C4 აღჭურვილია Intel Xeon-ის მე-5 თაობის პროცესორებით (კოდური სახელწოდებით Emerald Rapids), რაც Google Cloud-ზე ხელმისაწვდომი Xeon CPU-ს უახლესი თაობაა და აერთიანებს Intel AMX-ს AI მუშაობის გასაუმჯობესებლად; ხოლო N2 აღჭურვილია Intel Xeon-ის მე-3 თაობის პროცესორებით (კოდური სახელწოდებით Ice Lake), რაც Google Cloud-ზე არსებული Xeon CPU-ს წინა თაობაა და მხოლოდ AVX-512-ს მოიცავს, AMX-ის გარეშე. ჩვენ ვაჩვენებთ AMX-ის უპირატესობებს. მუშაობის გასაზომად გამოვიყენებთ optimum-benchmark-ს, Hugging Face-ის გაერთიანებულ ბენჩმარკინგის ბიბლიოთეკას მრავალი ბეკენდისა და მოწყობილობისთვის. ბენჩმარკინგი შესრულდება optimum-intel ბეკენდზე. optimum-intel არის Hugging Face-ის აჩქარების ბიბლიოთეკა, რომელიც აჩქარებს end-to-end კონვეიერებს Intel-ის არქიტექტურებზე (CPU, GPU). ჩვენი ბენჩმარკინგის შემთხვევები შემდეგია: ეწვიეთ Google Cloud Console-ს და თქვენი პროექტის ქვეშ დააჭირეთ 'VM-ის შექმნას'. შემდეგ, მიჰყევით ქვემოთ მოცემულ ნაბიჯებს, რათა შექმნათ ერთი 96-vcpu ინსტანცია, რომელიც შეესაბამება Intel Ice Lake CPU-ს ერთ სოკეტს. ახლა თქვენ გაქვთ ერთი N2 ინსტანცია. მიჰყევით ქვემოთ მოცემულ ნაბიჯებს, რათა შექმნათ 96-vcpu ინსტანცია, რომელიც შეესაბამება Intel Emerald Rapids-ის ერთ სოკეტს. გთხოვთ გაითვალისწინოთ, რომ ამ სტატიაში C4-სა და N2-ს შორის CPU ბირთვების იდენტურ რაოდენობას ვიყენებთ, რათა უზრუნველვყოთ თანაბარი ბირთვების ბენჩმარკინგი. ახლა თქვენ გაქვთ ერთი C4 ინსტანცია. გარემოს მარტივად მოსაწყობად მიჰყევით ქვემოთ მოცემულ ნაბიჯებს. რეპროდუცირებადობისთვის, ბრძანებებში მითითებულია გამოყენებული ვერსია და კომიტი. ახლა კონტეინერში ვართ, შეასრულეთ შემდეგი ნაბიჯები: თქვენ უნდა განაახლოთ examples/ipex_bert.yaml optimum-benchmark დირექტორიაში ქვემოთ მოცემული წესით, რათა შეაფასოთ WhereIsAI/UAE-Large-V1. ჩვენ ვცვლით NUMA-ს დაკავშირებას 0,1-ზე, რადგან N2-საც და C4-საც აქვთ 2 NUMA დომენი თითო სოკეტზე, შეგიძლიათ გადაამოწმოთ lscpu-ით. შემდეგ, გაუშვით ბენჩმარკინგი: `$ optimum-benchmark --config-dir examples/ --config-name ipex_bert` შეგიძლიათ განაახლოთ examples/ipex_llama.yaml ქვემოთ მოცემული წესით, რათა შეაფასოთ meta-llama/Llama-3.2-3. შემდეგ, გაუშვით ბენჩმარკინგი: `$ optimum-benchmark --config-dir examples/ --config-name ipex_llama` GCP C4 ინსტანცია ტექსტის ჩაშენების ბენჩმარკინგის შემთხვევებში დაახლოებით 10-ჯერ 24-ჯერ აღემატება N2-ის გამტარუნარიანობას. ტექსტის გენერაციის ბენჩმარკინგში C4 ინსტანცია სტაბილურად აჩვენებს დაახლოებით 2.3-ჯერ 3.6-ჯერ მაღალ გამტარუნარიანობას N2-თან შედარებით. 1-დან 16-მდე სერიული ზომების გათვალისწინებით, გამტარუნარიანობა 13-ჯერ უკეთესია, შეყოვნების (latency) მნიშვნელოვანი კომპრომისის გარეშე. ეს იძლევა ერთდროული მოთხოვნების მომსახურების საშუალებას მომხმარებლის გამოცდილების შეწირვის გარეშე. ამ სტატიაში, ჩვენ შევაფასეთ აგენტური AI-ის 2 წარმომადგენლობითი დატვირთვა Google Cloud Compute Engine CPU ინსტანციებზე: C4 და N2. შედეგები აჩვენებს მუშაობის მნიშვნელოვან გაუმჯობესებას Intel Xeon CPU-ებზე AMX-ისა და მეხსიერების გაუმჯობესებული შესაძლებლობების წყალობით. Intel-მა ერთი თვის წინ გამოუშვა Xeon 6 პროცესორები P-ბირთვებით (კოდური სახელწოდებით Granite Rapids), რომელიც Llama 3-ში ~2-ჯერ ზრდის მუშაობას. ჩვენ გვჯერა, რომ ახალი Granite Rapids CPU-ით, შეგვიძლია განვიხილოთ მსუბუქი აგენტური AI გადაწყვეტილებების სრულად CPU-ზე განთავსება, რათა თავიდან ავიცილოთ ინტენსიური 'მასპინძელი-აქსელერატორი' ტრაფიკის ზედმეტი დატვირთვა. ჩვენ შევაფასებთ მას, როგორც კი Google Cloud Compute Engine-ს ექნება Granite Rapids ინსტანცია და წარმოვადგენთ შედეგებს. გმადლობთ წაკითხვისთვის!