სწორედ აქ ერთვება Optimum-NVIDIA ინფერენსის ბიბლიოთეკა. Hugging Face-ზე ხელმისაწვდომი Optimum-NVIDIA მნიშვნელოვნად აჩქარებს LLM-ის ინფერენსს NVIDIA პლატფორმაზე უკიდურესად მარტივი API-ის საშუალებით. კოდის მხოლოდ ერთი ხაზის შეცვლით, შეგიძლიათ მიაღწიოთ 28-ჯერ უფრო სწრაფ ინფერენსს და 1,200 ტოკენს წამში NVIDIA პლატფორმაზე. Optimum-NVIDIA არის პირველი Hugging Face ინფერენსის ბიბლიოთეკა, რომელიც სარგებლობს ახალი float8 ფორმატით, რომელსაც მხარს უჭერენ NVIDIA Ada Lovelace და Hopper არქიტექტურები. FP8, NVIDIA TensorRT-LLM პროგრამული უზრუნველყოფის მოწინავე კომპილაციის შესაძლებლობებთან ერთად, მკვეთრად აჩქარებს LLM-ის ინფერენსს. LLaMA-ს გაშვება ელვისებურად სწრაფი ინფერენსის სიჩქარით შეგიძლიათ Optimum-NVIDIA-ს კონვეიერის გამოყენებით, სულ რაღაც 3 ხაზის კოდით. თუ უკვე გაქვთ დაყენებული კონვეიერი Hugging Face-ის transformers ბიბლიოთეკიდან LLaMA-ს გასაშვებად, მაქსიმალური მუშაობის მისაღწევად საჭიროა მხოლოდ კოდის ერთი ხაზის შეცვლა! ასევე შეგიძლიათ ჩართოთ FP8 კვანტიზაცია ერთი დროშით (flag), რაც საშუალებას გაძლევთ გაუშვათ უფრო დიდი მოდელი ერთ GPU-ზე უფრო სწრაფად და სიზუსტის დაკარგვის გარეშე. ამ მაგალითში ნაჩვენები დროშა ნაგულისხმევად იყენებს წინასწარ განსაზღვრულ კალიბრაციის სტრატეგიას, თუმცა შეგიძლიათ მიაწოდოთ თქვენი საკუთარი კალიბრაციის მონაცემთა ნაკრები და მორგებული ტოკენიზაცია, რათა კვანტიზაცია თქვენს გამოყენების შემთხვევაზე მორგოთ. კონვეიერის ინტერფეისი შესანიშნავია სწრაფი დაწყებისთვის, მაგრამ მოწინავე მომხმარებლებს, რომლებსაც სურთ შერჩევის პარამეტრების დაყენებაზე დეტალური კონტროლი, შეუძლიათ გამოიყენონ Model API. დამატებითი დეტალებისთვის იხილეთ ჩვენი დოკუმენტაცია. LLM-ის მუშაობის შეფასებისას, ჩვენ განვიხილავთ ორ მეტრიკას: პირველი ტოკენის ლატენტურობას (First Token Latency) და გამტარუნარიანობას (Throughput). პირველი ტოკენის ლატენტურობა (ასევე ცნობილია როგორც დრო პირველ ტოკენამდე ან წინასწარი შევსების ლატენტურობა) ზომავს, თუ რამდენი ხანი ელოდებით თქვენი მოთხოვნის შეყვანიდან გამომავალი ინფორმაციის მიღების დაწყებამდე, ამიტომ ეს მეტრიკა გეტყვით, რამდენად სწრაფად რეაგირებადი იქნება მოდელი. Optimum-NVIDIA უზრუნველყოფს 3.3-ჯერ უფრო სწრაფ პირველი ტოკენის ლატენტურობას სტანდარტულ ტრანსფორმერებთან შედარებით. გამტარუნარიანობა, მეორე მხრივ, ზომავს, თუ რამდენად სწრაფად შეუძლია მოდელს ტოკენების გენერირება და განსაკუთრებით აქტუალურია, როდესაც გსურთ თაობების დაჯგუფება. მიუხედავად იმისა, რომ გამტარუნარიანობის გამოსათვლელად რამდენიმე გზა არსებობს, ჩვენ მივიღეთ სტანდარტული მეთოდი, რომლის მიხედვითაც ბოლო-ბოლო ლატენტურობა იყოფა თანმიმდევრობის მთლიან სიგრძეზე, შეყვანის და გამომავალი ტოკენების ჩათვლით, შეჯამებული ყველა ჯგუფზე. Optimum-NVIDIA უზრუნველყოფს 28-ჯერ უკეთეს გამტარუნარიანობას სტანდარტულ ტრანსფორმერებთან შედარებით. ახლახან გამოცხადებული NVIDIA H200 Tensor Core GPU-ის საწყისი შეფასებები აჩვენებს LLaMA მოდელებისთვის გამტარუნარიანობის დამატებით 2-ჯერ გაზრდას NVIDIA H100 Tensor Core GPU-სთან შედარებით. როდესაც H200 GPU-ები უფრო ხელმისაწვდომი გახდება, ჩვენ გავაზიარებთ Optimum-NVIDIA-ს მუშაობის მონაცემებს მათზე. Optimum-NVIDIA ამჟამად უზრუნველყოფს მაქსიმალურ მუშაობას LLaMAForCausalLM არქიტექტურისა და ამოცანისთვის, ამიტომ ნებისმიერი LLaMA-ზე დაფუძნებული მოდელი, მათ შორის დაზუსტებული ვერსიები, დაუყოვნებლივ უნდა მუშაობდეს Optimum-NVIDIA-ით. ჩვენ აქტიურად ვაფართოებთ მხარდაჭერას, რათა მოვიცვათ ტექსტის გენერირების სხვა მოდელების არქიტექტურები და ამოცანები, ყველა Hugging Face-ის ფარგლებში. ჩვენ ვაგრძელებთ მუშაობის საზღვრების გაფართოებას და ვგეგმავთ უახლესი ოპტიმიზაციის ტექნიკის ჩართვას, როგორიცაა In-Flight Batching, რათა გავაუმჯობესოთ გამტარუნარიანობა მოთხოვნების სტრიმინგისას, და INT4 კვანტიზაცია, რათა გავუშვათ კიდევ უფრო დიდი მოდელები ერთ GPU-ზე. სცადეთ: ჩვენ ვავრცელებთ Optimum-NVIDIA საცავს, ინსტრუქციებით, თუ როგორ უნდა დაიწყოთ. გთხოვთ, გაგვიზიაროთ თქვენი გამოხმაურება!