შედეგები ცნობილია და ისინი შთამბეჭდავია, რაც მფლობელობის საერთო ღირებულების (TCO) 1.7-ჯერ გაუმჯობესებას აჩვენებს წინა თაობის Google C3 VM ინსტანციებთან შედარებით. Google Cloud C4 VM ინსტანციამ დამატებით მოიტანა: GPT OSS არის OpenAI-ის მიერ გამოშვებული ღია კოდის ექსპერტთა ნაზავის (MoE) მოდელის გავრცელებული სახელწოდება. MoE მოდელი არის ღრმა ნერვული ქსელის არქიტექტურა, რომელიც იყენებს სპეციალიზებულ „ექსპერტ“ ქვე-ქსელებს და „შერჩევის ქსელს“ (gating network) იმის გადასაწყვეტად, თუ რომელი ექსპერტები გამოიყენოს კონკრეტული შეყვანისთვის. MoE მოდელები საშუალებას გაძლევთ ეფექტურად გაზარდოთ თქვენი მოდელის მოცულობა გამოთვლითი ხარჯების ხაზოვანი ზრდის გარეშე. ისინი ასევე იძლევიან სპეციალიზაციის საშუალებას, სადაც სხვადასხვა „ექსპერტები“ სწავლობენ სხვადასხვა უნარებს, რაც მათ საშუალებას აძლევს მოერგონ მრავალფეროვან მონაცემთა განაწილებას. მიუხედავად ძალიან დიდი პარამეტრებისა, თითოეული ტოკენისთვის მხოლოდ ექსპერტების მცირე ქვეჯგუფი აქტიურდება, რაც CPU-ზე ინფერენსს სიცოცხლისუნარიანს ხდის. Intel-მა და Hugging Face-მა ითანამშრომლეს ექსპერტის შესრულების ოპტიმიზაციის (PR #40304) გაერთიანებაზე, რათა აღმოეფხვრათ ჭარბი გამოთვლები, სადაც თითოეული ექსპერტი ყველა ტოკენს ამუშავებდა ტრანსფორმერებისთვის. ამ ოპტიმიზაციამ მიმართა თითოეულ ექსპერტს, რომ ემუშავა მხოლოდ იმ ტოკენებზე, რომლებზეც ის არის მიმართული, რამაც აღმოფხვრა FLOPs-ის არასაჭირო ხარჯვა და გააუმჯობესა გამოყენებადობა. ჩვენ ჩავატარეთ GPT OSS-ის ბენჩმარკინგი კონტროლირებადი, განმეორებადი გენერაციის დატვირთვის პირობებში, რათა გამოგვერჩია არქიტექტურული განსხვავებები (GCP C4 VM-ები Intel Xeon 6 პროცესორებზე (GNR) vs GCP C3 VM-ები მე-4 თაობის Intel Xeon პროცესორებზე (SPR)) და MoE შესრულების ეფექტურობა. აქცენტი გაკეთდა მდგრად დეკოდირებაზე (თითო ტოკენზე შეყოვნება) და ბოლოდან ბოლომდე ნორმალიზებულ გამტარობაზე ბეჩ ზომის გაზრდით, მიმდევრობის სიგრძეების ფიქსირებულად შენარჩუნებით. ყველა გაშვებამ გამოიყენა სტატიკური KV ქეში და SDPA ყურადღების მექანიზმი დეტერმინიზმისთვის. ეწვიეთ Google Cloud Console-ს და თქვენი პროექტის ქვეშ დააწკაპუნეთ „VM-ის შექმნა“-ზე (create a VM). მიჰყევით ქვემოთ მოცემულ ნაბიჯებს 176 vCPU ინსტანციის შესაქმნელად. ეწვიეთ Google Cloud Console-ს და თქვენი პროექტის ქვეშ დააწკაპუნეთ „VM-ის შექმნა“-ზე (create a VM). მიჰყევით ქვემოთ მოცემულ ნაბიჯებს 144 vCPU ინსტანციის შესაქმნელად. ინსტანციაში შედით SSH-ის საშუალებით და შემდეგ დააინსტალირეთ Docker. მიჰყევით ქვემოთ მოცემულ ნაბიჯებს გარემოს მარტივად კონფიგურაციისთვის. რეპროდუცირებადობისთვის, ჩვენ ვაჩვენებთ ბრძანებებში გამოყენებულ ვერსიებს და კომიტებს. ახლა კონტეინერში ვართ, შეასრულეთ შემდეგი ნაბიჯები. თითოეული ბეჩ ზომისთვის, ჩვენ ვაშვებთ numactl -l python benchmark.py-ს შემდეგი კოდებისთვის: ბეჩ ზომების ფართო სპექტრში, 64-მდე, Intel Xeon 6 პროცესორებით აღჭურვილი C4 თანმიმდევრულად აჭარბებს C3-ს 1.4-დან 1.7-ჯერადი გამტარობით თითო vCPU-ზე. ფორმულაა: ```latex \text{normalized\_throughput\_per\_vCPU} = \frac{\text{throughput\_C4} / \text{vCPUs\_C4}} {\text{throughput\_C3} / \text{vCPUs\_C3}} ``` ბეჩ ზომა 64-ზე, C4 უზრუნველყოფს C3-ის თითო vCPU-ზე გამტარობის 1.7-ჯერად მოცულობას; vCPU-ზე ფასის თითქმის თანასწორობით (საათობრივი ღირებულება ხაზობრივად იზრდება vCPU რაოდენობასთან ერთად), ეს იძლევა TCO-ს 1.7-ჯერად უპირატესობას (C3-ს დასჭირდებოდა 1.7-ჯერ მეტი დანახარჯი იგივე მოცულობის გენერირებული ტოკენისთვის). თითო vCPU-ზე გამტარობის თანაფარდობა: ```latex \frac{\text{throughput\_C4} / \text{vCPUs\_C4}}{\text{throughput\_C3} / \text{vCPUs\_C3}} = 1.7 \Rightarrow \frac{\text{TCO\_C3}}{\text{TCO\_C4}} \approx 1.7 ``` Google Cloud C4 VM-ები, რომლებიც აღჭურვილია Intel Xeon 6 პროცესორებით (GNR), უზრუნველყოფენ როგორც შთამბეჭდავ წარმადობის ზრდას, ასევე უკეთეს ხარჯთეფექტურობას დიდი MoE ინფერენსისთვის წინა თაობის Google Cloud C3 VM-ებთან (აღჭურვილი მე-4 თაობის Intel Xeon პროცესორებით) შედარებით. GPT OSS MoE ინფერენსისთვის, ჩვენ დავაფიქსირეთ გაუმჯობესებული გამტარობა, შემცირებული შეყოვნება და შემცირებული ხარჯები. ეს შედეგები ხაზს უსვამს, რომ Intel-ისა და Hugging Face-ის მიერ მიზნობრივი ფრეიმვორკის ოპტიმიზაციების წყალობით, დიდი MoE მოდელების ეფექტურად მომსახურება შესაძლებელია შემდეგი თაობის ზოგადი დანიშნულების CPU-ებზე.