თუმცა, როგორც კი მზად იქნებით ნოუთბუქებიდან წარმოების ფაზაზე გადასასვლელად, დასკვნის (inference) წარმადობა კრიტიკულად მნიშვნელოვანი ხდება. სწორედ აქ ერთვება SGLang. შექმნილი მაღალი გამტარუნარიანობისა და დაბალი შეყოვნების დასკვნისთვის, SGLang ახლა გვთავაზობს სრულყოფილ ინტეგრაციას ტრანსფორმერებთან, როგორც ბეკენდთან. ეს ნიშნავს, რომ თქვენ შეგიძლიათ დააკავშიროთ ტრანსფორმერების მოქნილობა SGLang-ის მაღალ წარმადობასთან. მოდით, განვიხილოთ, რას გვთავაზობს ეს ინტეგრაცია და როგორ შეგიძლიათ მისი გამოყენება. SGLang ახლა მხარს უჭერს Hugging Face-ის ტრანსფორმერებს, როგორც ბეკენდს, რაც საშუალებას გაძლევთ, ნებისმიერი ტრანსფორმერებთან თავსებადი მოდელი გაუშვათ მაღალეფექტური დასკვნით ყოველგვარი დამატებითი კონფიგურაციის გარეშე. მშობლიური მხარდაჭერა საჭირო არ არის — SGLang ავტომატურად გადადის ტრანსფორმერების გამოყენებაზე საჭიროების შემთხვევაში, ან შეგიძლიათ ხელით დააყენოთ impl="transformers". მოდით, განვიხილოთ მარტივი ტექსტის გენერაციის მაგალითი meta-llama/Llama-3.2-1B-Instruct-ის გამოყენებით, რათა შევადაროთ ორივე მიდგომა. ტრანსფორმერების ბიბლიოთეკა შესანიშნავია ექსპერიმენტებისთვის, მცირე მასშტაბის ამოცანებისა და ტრენინგისთვის, მაგრამ ის არ არის ოპტიმიზებული მაღალი დატვირთვისა და დაბალი შეყოვნების სცენარებისთვის. SGLang განსხვავებულ მიდგომას იყენებს, უპირატესობას ანიჭებს ეფექტურობას ისეთი ფუნქციებით, როგორიცაა RadixAttention (მეხსიერების ეფექტური ყურადღების მექანიზმი). დასკვნა SGLang-ით საგრძნობლად უფრო სწრაფი და რესურსეფექტურია, განსაკუთრებით მაღალი დატვირთვის დროს. აი იგივე ამოცანა SGLang-ში ოფლაინ ძრავის გამოყენებით: ან შეგიძლიათ გაუშვათ სერვერი და გაგზავნოთ მოთხოვნები: გაითვალისწინეთ, რომ SGLang ასევე გთავაზობთ OpenAI-თან თავსებად API-ს, რაც მას გარე სერვისების სრულფასოვან შემცვლელად აქცევს. ტრანსფორმერების ახალი ბეკენდ ინტეგრაციის წყალობით, SGLang-ს ახლა შეუძლია ავტომატურად გადაერთოს ტრანსფორმერების მოდელების გამოყენებაზე, რომლებსაც მშობლიურად არ უჭერს მხარს. პრაქტიკაში ეს ნიშნავს: ეს ხსნის გზას უფრო სწრაფი დასკვნისა და ოპტიმიზებული განლაგებისკენ (მაგ. RadixAttention-ის ჩართვა) ტრანსფორმერების ეკოსისტემის სიმარტივისა და მრავალფეროვნების შეწირვის გარეშე. გაითვალისწინეთ, რომ impl პარამეტრის მითითება სურვილისამებრ არის. თუ მოდელი არ არის მშობლიურად მხარდაჭერილი SGLang-ის მიერ, ის თავისით გადადის ტრანსფორმერების იმპლემენტაციაზე. Hugging Face Hub-ზე არსებული ნებისმიერი მოდელი, რომელიც მუშაობს ტრანსფორმერებთან trust_remote_code=True-ის გამოყენებით და სწორად ახორციელებს ყურადღების მექანიზმს (attention), თავსებადია SGLang-თან. ზუსტი მოთხოვნები შეგიძლიათ იხილოთ ოფიციალურ დოკუმენტაციაში. თუ თქვენი მორგებული მოდელი აკმაყოფილებს ამ კრიტერიუმებს, ყველაფერი რაც უნდა გააკეთოთ, არის trust_remote_code=True-ის დაყენება მისი ჩატვირთვისას. Kyutai Team-ის Helium ჯერ არ არის მშობლიურად მხარდაჭერილი SGLang-ის მიერ. სწორედ აქ ვლინდება ტრანსფორმერების ბეკენდის უპირატესობა, რომელიც ოპტიმიზებულ დასკვნას იძლევა მშობლიური მხარდაჭერის მოლოდინის გარეშე. ჩვენ აქტიურად ვმუშაობთ რამდენიმე ძირითად მიმართულებაზე ამ ინტეგრაციის გასაუმჯობესებლად: * **წარმადობის გაუმჯობესება:** ტრანსფორმერების მოდელები ამჟამად ჩამორჩებიან მშობლიურ ინტეგრაციას წარმადობის თვალსაზრისით. ჩვენი მთავარი მიზანია ამ ხარვეზის ოპტიმიზაცია და შემცირება. * **LoRA მხარდაჭერა და VLM ინტეგრაცია:** ჩვენ ასევე ვმუშაობთ Vision-Language Models (VLM) მხარდაჭერის დამატებაზე, რათა გავაფართოვოთ შესაძლებლობებისა და გამოყენების შემთხვევების სპექტრი.