ამ ბლოგპოსტში ჩვენ გაჩვენებთ, თუ როგორ განათავსოთ ღია კოდის დიდი ენობრივი მოდელები (LLM-ები) Hugging Face Inference Endpoints-ზე – ჩვენს მართულ SaaS გადაწყვეტაზე, რომელიც ამარტივებს მოდელების განთავსებას. გარდა ამისა, ჩვენ გასწავლით, თუ როგორ უნდა მოახდინოთ პასუხების სტრიმინგი და შეამოწმოთ ჩვენი ენდპოინტების წარმადობა. მოდით დავიწყოთ! სანამ დავიწყებთ, მოდით განვაახლოთ ჩვენი ცოდნა Inference Endpoints-ების შესახებ. Hugging Face Inference Endpoints გთავაზობთ მარტივ და უსაფრთხო გზას მანქანური სწავლების მოდელების პროდაქშენში გამოსაყენებლად. Inference Endpoints-ები საშუალებას აძლევს როგორც დეველოპერებს, ასევე მონაცემთა მეცნიერებს, შექმნან AI აპლიკაციები ინფრასტრუქტურის მართვის გარეშე: ამარტივებს განთავსების პროცესს რამდენიმე დაწკაპუნებამდე, მათ შორის მოთხოვნების დიდი მოცულობის მართვას ავტომატური მასშტაბირებით, ინფრასტრუქტურის ხარჯების შემცირებას მასშტაბირება ნულამდე ფუნქციით და უზრუნველყოფს მოწინავე უსაფრთხოებას. აქ მოცემულია LLM-ის განთავსებისთვის ყველაზე მნიშვნელოვანი ფუნქციები: Inference Endpoints-ის გამოყენება შეგიძლიათ დაიწყოთ აქ: https://ui.endpoints.huggingface.co/ დასაწყებად, თქვენ უნდა შეხვიდეთ სისტემაში მომხმარებლის ან ორგანიზაციის ანგარიშით, რომელსაც მიბმული აქვს გადახდის მეთოდი (შეგიძლიათ დაამატოთ აქ), შემდეგ კი შეხვიდეთ Inference Endpoints-ზე https://ui.endpoints.huggingface.co შემდეგ, დააწკაპუნეთ „New endpoint“-ზე. აირჩიეთ რეპოზიტორიუმი, ღრუბელი და რეგიონი, შეცვალეთ ინსტანციის და უსაფრთხოების პარამეტრები და განათავსეთ, ჩვენს შემთხვევაში, tiiuae/falcon-40b-instruct. Inference Endpoints გთავაზობთ ინსტანციის ტიპს მოდელის ზომის მიხედვით, რომელიც საკმარისად დიდი უნდა იყოს მოდელის გასაშვებად. აქ, 4x NVIDIA T4 GPU. LLM-ისთვის საუკეთესო წარმადობის მისაღწევად, შეცვალეთ ინსტანცია GPU [xlarge] · 1x Nvidia A100-ზე. შენიშვნა: თუ ინსტანციის ტიპის არჩევა შეუძლებელია, უნდა დაგვიკავშირდეთ და მოითხოვოთ ინსტანციის კვოტა. შემდეგ შეგიძლიათ განათავსოთ თქვენი მოდელი „Create Endpoint“-ზე დაწკაპუნებით. 10 წუთის შემდეგ, ენდპოინტი ონლაინ რეჟიმში უნდა იყოს და მზად უნდა იყოს მოთხოვნების მოსამსახურებლად. ენდპოინტის მიმოხილვა იძლევა წვდომას Inference ვიჯეტზე, რომელიც შეიძლება გამოყენებულ იქნას მოთხოვნების ხელით გასაგზავნად. ეს საშუალებას გაძლევთ სწრაფად შეამოწმოთ თქვენი ენდპოინტი სხვადასხვა შეყვანებით და გაუზიაროთ ის გუნდის წევრებს. ეს ვიჯეტები არ უჭერს მხარს პარამეტრებს – ამ შემთხვევაში ეს იწვევს „მოკლე“ გენერაციას. ვიჯეტი ასევე წარმოქმნის cURL ბრძანებას, რომლის გამოყენებაც შეგიძლიათ. უბრალოდ დაამატეთ თქვენი hf_xxx და შეამოწმეთ. შეგიძლიათ გამოიყენოთ სხვადასხვა პარამეტრი გენერაციის გასაკონტროლებლად, მათი განსაზღვრით payload-ის პარამეტრების ატრიბუტში. დღეის მდგომარეობით, მხარდაჭერილია შემდეგი პარამეტრები: ტექსტის მოთხოვნა და გენერირება LLM-ებით შეიძლება იყოს დროის მომხმარებელი და განმეორებადი პროცესი. მომხმარებლის გამოცდილების გასაუმჯობესებლად შესანიშნავი გზაა ტოკენების სტრიმინგი მომხმარებლისთვის მათი გენერირებისას. ქვემოთ მოცემულია ორი მაგალითი, თუ როგორ უნდა მოახდინოთ ტოკენების სტრიმინგი პითონისა და JavaScript-ის გამოყენებით. პითონისთვის, ჩვენ გამოვიყენებთ კლიენტს Text Generation Inference-დან, ხოლო JavaScript-ისთვის, HuggingFace.js ბიბლიოთეკას. ჯერ უნდა დააინსტალიროთ huggingface_hub ბიბლიოთეკა: ჩვენ შეგვიძლია შევქმნათ InferenceClient ჩვენი ენდპოინტის URL-ის და სერთიფიკატის მიწოდებით, იმ ჰიპერპარამეტრებთან ერთად, რომელთა გამოყენებაც გვსურს. შეცვალეთ print ბრძანება yield-ით ან ფუნქციით, რომელშიც გსურთ ტოკენების სტრიმინგი. ჯერ უნდა დააინსტალიროთ @huggingface/inference ბიბლიოთეკა. ჩვენ შეგვიძლია შევქმნათ HfInferenceEndpoint ჩვენი ენდპოინტის URL-ის და სერთიფიკატის მიწოდებით, იმ ჰიპერპარამეტრთან ერთად, რომლის გამოყენებაც გვსურს. შეცვალეთ process.stdout გამოძახება yield-ით ან ფუნქციით, რომელშიც გსურთ ტოკენების სტრიმინგი. ამ ბლოგპოსტში ჩვენ გაჩვენეთ, თუ როგორ უნდა განათავსოთ ღია კოდის LLM-ები Hugging Face Inference Endpoints-ის გამოყენებით, როგორ აკონტროლოთ ტექსტის გენერაცია მოწინავე პარამეტრებით და როგორ მოახდინოთ პასუხების სტრიმინგი პითონის ან JavaScript კლიენტთან მომხმარებლის გამოცდილების გასაუმჯობესებლად. Hugging Face Inference Endpoints-ის გამოყენებით შეგიძლიათ მოდელები განათავსოთ, როგორც სამრეწველო გამოყენებისთვის მზა API-ები, სულ რამდენიმე დაწკაპუნებით, შეამციროთ თქვენი ხარჯები ავტომატური მასშტაბირება ნულამდე ფუნქციით და განათავსოთ მოდელები უსაფრთხო ოფლაინ ენდპოინტებში, SOC2 Type 2 სერტიფიცირების მხარდაჭერით. მადლობა კითხვისთვის! თუ გაქვთ რაიმე შეკითხვა, მოგერიდებათ დამიკავშირდეთ Twitter-ზე ან LinkedIn-ზე. მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შედით კომენტარისთვის