SGLang და Hugging Face-ის ტრანსფორმერები: წარმოების დონის ხელოვნური ინტელექტის დასკვნა მაქსიმალური სიჩქარით
SGLang, რომელიც შექმნილია ხელოვნური ინტელექტის მაღალი გამტარუნარიანობისა და დაბალი შეყოვნების დასკვნისთვის, ახლა სრულყოფილად ინტეგრირდება Hugging Face-ის ტრანსფორმერებთან. ეს ინტეგრაცია მომხმარებლებს საშუალებას აძლევს, გააერთიანონ ტრანსფორმერების მოქნილობა SGLang-ის მაღალ წარმადობასთან, რაც უზრუნველყოფს AI მოდელების უფრო სწრაფ და რესურსეფექტურ განლაგებას წარმოების გარემოში, თუნდაც იმ მოდელებისთვის, რომლებიც მშობლიურად არ არის მხარდაჭერილი.
თუმცა, როგორც კი მზად იქნებით ნოუთბუქებიდან წარმოების ფაზაზე გადასასვლელად, დასკვნის (inference) წარმადობა კრიტიკულად მნიშვნელოვანი ხდება. სწორედ აქ ერთვება SGLang. შექმნილი მაღალი გამტარუნარიანობისა და დაბალი შეყოვნების დასკვნისთვის, SGLang ახლა გვთავაზობს სრულყოფილ ინტეგრაციას ტრანსფორმერებთან, როგორც ბეკენდთან. ეს ნიშნავს, რომ თქვენ შეგიძლიათ დააკავშიროთ ტრანსფორმერების მოქნილობა SGLang-ის მაღალ წარმადობასთან. მოდით, განვიხილოთ, რას გვთავაზობს ეს ინტეგრაცია და როგორ შეგიძლიათ მისი გამოყენება.
SGLang ახლა მხარს უჭერს Hugging Face-ის ტრანსფორმერებს, როგორც ბეკენდს, რაც საშუალებას გაძლევთ, ნებისმიერი ტრანსფორმერებთან თავსებადი მოდელი გაუშვათ მაღალეფექტური დასკვნით ყოველგვარი დამატებითი კონფიგურაციის გარეშე. მშობლიური მხარდაჭერა საჭირო არ არის — SGLang ავტომატურად გადადის ტრანსფორმერების გამოყენებაზე საჭიროების შემთხვევაში, ან შეგიძლიათ ხელით დააყენოთ impl="transformers". მოდით, განვიხილოთ მარტივი ტექსტის გენერაციის მაგალითი meta-llama/Llama-3.2-1B-Instruct-ის გამოყენებით, რათა შევადაროთ ორივე მიდგომა.
ტრანსფორმერების ბიბლიოთეკა შესანიშნავია ექსპერიმენტებისთვის, მცირე მასშტაბის ამოცანებისა და ტრენინგისთვის, მაგრამ ის არ არის ოპტიმიზებული მაღალი დატვირთვისა და დაბალი შეყოვნების სცენარებისთვის. SGLang განსხვავებულ მიდგომას იყენებს, უპირატესობას ანიჭებს ეფექტურობას ისეთი ფუნქციებით, როგორიცაა RadixAttention (მეხსიერების ეფექტური ყურადღების მექანიზმი). დასკვნა SGLang-ით საგრძნობლად უფრო სწრაფი და რესურსეფექტურია, განსაკუთრებით მაღალი დატვირთვის დროს. აი იგივე ამოცანა SGLang-ში ოფლაინ ძრავის გამოყენებით: ან შეგიძლიათ გაუშვათ სერვერი და გაგზავნოთ მოთხოვნები:
გაითვალისწინეთ, რომ SGLang ასევე გთავაზობთ OpenAI-თან თავსებად API-ს, რაც მას გარე სერვისების სრულფასოვან შემცვლელად აქცევს. ტრანსფორმერების ახალი ბეკენდ ინტეგრაციის წყალობით, SGLang-ს ახლა შეუძლია ავტომატურად გადაერთოს ტრანსფორმერების მოდელების გამოყენებაზე, რომლებსაც მშობლიურად არ უჭერს მხარს. პრაქტიკაში ეს ნიშნავს: ეს ხსნის გზას უფრო სწრაფი დასკვნისა და ოპტიმიზებული განლაგებისკენ (მაგ. RadixAttention-ის ჩართვა) ტრანსფორმერების ეკოსისტემის სიმარტივისა და მრავალფეროვნების შეწირვის გარეშე.
გაითვალისწინეთ, რომ impl პარამეტრის მითითება სურვილისამებრ არის. თუ მოდელი არ არის მშობლიურად მხარდაჭერილი SGLang-ის მიერ, ის თავისით გადადის ტრანსფორმერების იმპლემენტაციაზე. Hugging Face Hub-ზე არსებული ნებისმიერი მოდელი, რომელიც მუშაობს ტრანსფორმერებთან trust_remote_code=True-ის გამოყენებით და სწორად ახორციელებს ყურადღების მექანიზმს (attention), თავსებადია SGLang-თან. ზუსტი მოთხოვნები შეგიძლიათ იხილოთ ოფიციალურ დოკუმენტაციაში. თუ თქვენი მორგებული მოდელი აკმაყოფილებს ამ კრიტერიუმებს, ყველაფერი რაც უნდა გააკეთოთ, არის trust_remote_code=True-ის დაყენება მისი ჩატვირთვისას.
Kyutai Team-ის Helium ჯერ არ არის მშობლიურად მხარდაჭერილი SGLang-ის მიერ. სწორედ აქ ვლინდება ტრანსფორმერების ბეკენდის უპირატესობა, რომელიც ოპტიმიზებულ დასკვნას იძლევა მშობლიური მხარდაჭერის მოლოდინის გარეშე.
ჩვენ აქტიურად ვმუშაობთ რამდენიმე ძირითად მიმართულებაზე ამ ინტეგრაციის გასაუმჯობესებლად:
* **წარმადობის გაუმჯობესება:** ტრანსფორმერების მოდელები ამჟამად ჩამორჩებიან მშობლიურ ინტეგრაციას წარმადობის თვალსაზრისით. ჩვენი მთავარი მიზანია ამ ხარვეზის ოპტიმიზაცია და შემცირება.
* **LoRA მხარდაჭერა და VLM ინტეგრაცია:** ჩვენ ასევე ვმუშაობთ Vision-Language Models (VLM) მხარდაჭერის დამატებაზე, რათა გავაფართოვოთ შესაძლებლობებისა და გამოყენების შემთხვევების სპექტრი.
თეგები:
#ხელოვნური ინტელექტი
#ღრმა სწავლა
#მანქანური სწავლა
#ტრანსფორმერები
#vlm
#hugging face
#წარმადობა
#ai განვითარება
#sglang
#radixattention
წყარო: huggingface.co
AI-ით გადამუშავებული