AWS Inferentia2 აფართოებს ხელოვნური ინტელექტის შესაძლებლობებს Hugging Face-ის მომხმარებლებისთვის
Amazon Web Services (AWS) აცხადებს, რომ მისი უახლესი მანქანური სწავლების ჩიპი, Inferentia2, სრულად ხელმისაწვდომია Hugging Face Hub-ის მომხმარებლებისთვის. ეს ინტეგრაცია მნიშვნელოვნად ამარტივებს დიდი ენობრივი მოდელების (LLMs) და სხვა AI მოდელების განთავსებასა და გამოყენებას AWS SageMaker-ზე და Hugging Face Inference Endpoints-ის მეშვეობით. Inferentia2 ინსტანციები გვთავაზობს მაღალ წარმადობას, ხარჯთეფექტურობას და მხარდაჭერას 100,000-ზე მეტი მოდელისა და ამოცანისთვის, მათ შორის Llama 3-ისთვის, რაც ხელ
AWS Inferentia2 არის Amazon Web Services-ის (AWS) უახლესი მანქანური სწავლების ჩიპი, რომელიც ხელმისაწვდომია Amazon EC2 Inf2 ინსტანციების მეშვეობით. ხელოვნური ინტელექტის (AI) სამუშაო დატვირთვებისთვის შექმნილი Inf2 ინსტანციები უზრუნველყოფს მაღალ წარმადობასა და ოპტიმალურ ხარჯ/წარმადობის თანაფარდობას საწარმოო დატვირთვებისთვის.
ერთ წელზე მეტია, ვთანამშრომლობთ AWS-ის პროდუქტისა და საინჟინრო გუნდებთან, რათა AWS Trainium და Inferentia ჩიპების წარმადობა და ხარჯთეფექტურობა ხელმისაწვდომი გავხადოთ Hugging Face-ის მომხმარებლებისთვის. ჩვენი ღია კოდის ბიბლიოთეკა optimum-neuron ამაჩქარებლებზე Hugging Face მოდელების გაწვრთნასა და განთავსებას ამარტივებს. მეტი შეგიძლიათ წაიკითხოთ ჩვენი მუშაობის შესახებ transformers, დიდი ენობრივი მოდელებისა (LLMs) და ტექსტის გენერირების inference (TGI) დაჩქარებაზე.
დღეს, Inferentia2-ის ძალას პირდაპირ და ფართოდ ვთავაზობთ Hugging Face Hub-ის მომხმარებლებს.
რამდენიმე თვის წინ, SageMaker-ზე დიდი ენობრივი მოდელების (LLMs) განთავსების ახალი გზა დავნერგეთ, Inferentia/Trainium-ის ახალი ოფციით მხარდაჭერილი მოდელებისთვის, როგორიცაა Meta Llama 3. Llama3 მოდელის განთავსება Inferentia2 ინსტანციებზე SageMaker-ში შესაძლებელია inference-ის ფართომასშტაბიანი მომსახურებისთვის და SageMaker-ის სრულად მართული ფუნქციების სრული პაკეტით სარგებლობისთვის, რაც მოიცავს მოდელების შექმნასა და დახვეწას, MLOps-სა და მართვას.
დღეს, ჩვენ ვაფართოებთ ამ განთავსების გამოცდილების მხარდაჭერას Hugging Face-ზე ხელმისაწვდომი 100,000-ზე მეტ საჯარო მოდელზე, მათ შორის 14 ახალ მოდელის არქიტექტურაზე (albert, bert, camembert, convbert, deberta, deberta-v2, distilbert, electra, roberta, mobilebert, mpnet, vit, xlm, xlm-roberta) და 6 ახალ მანქანური სწავლების ამოცანაზე (text-classification, text-generation, token-classification, fill-mask, question-answering, feature-extraction). ამ მარტივი კოდის ფრაგმენტების გამოყენებით, AWS-ის მომხმარებლები შეძლებენ მოდელების მარტივად განთავსებას Inferentia2 ინსტანციებზე Amazon SageMaker-ში.
Hub-დან მოდელების განთავსების უმარტივესი ვარიანტია Hugging Face Inference Endpoints. დღეს სიამოვნებით წარმოგიდგენთ ახალ Inferentia 2 ინსტანციებს Hugging Face Inference Endpoints-ისთვის. ასე რომ, ახლა, როდესაც Hugging Face-ში იპოვით თქვენთვის საინტერესო მოდელს, შეგიძლიათ მისი განთავსება Inferentia2-ზე სულ რამდენიმე დაწკაპუნებით. ყველაფერი რაც თქვენ გჭირდებათ, არის მოდელის არჩევა, რომლის განთავსებაც გსურთ, შემდეგ Amazon Web Services-ის ინსტანციის კონფიგურაციაში აირჩიეთ ახალი Inf2 ინსტანციის ოფცია და მზად ხართ სამუშაოდ.
მხარდაჭერილი მოდელებისთვის, როგორიცაა Llama 3, შეგიძლიათ აირჩიოთ 2 ვარიანტი: Hugging Face Inference Endpoints საფასური გამოითვლება გამოყენებული სიმძლავრის წამის მიხედვით, ხარჯები იზრდება replica autoscaling-ით და ნულამდე ეცემა scale to zero-თი — ორივე ავტომატიზირებულია და ჩართულია მარტივი პარამეტრებით.
Inference Endpoints იყენებს Text Generation Inference for Neuron (TGI)-ს, რათა Llama 3 გაუშვას AWS Inferentia-ზე. TGI არის სპეციალურად შექმნილი გადაწყვეტა დიდი ენობრივი მოდელების (LLMs) ფართომასშტაბიანი საწარმოო დატვირთვებისთვის განთავსებისა და მომსახურებისთვის, რომელიც მხარს უჭერს უწყვეტ batching-ს, streaming-ს და მრავალ სხვას. გარდა ამისა, Text Generation Inference-ით განთავსებული LLM-ები თავსებადია OpenAI SDK Messages API-სთან, ასე რომ, თუ უკვე გაქვთ გენერაციული AI აპლიკაციები, რომლებიც ინტეგრირებულია LLM-ებთან, არ გჭირდებათ თქვენი აპლიკაციის კოდის შეცვლა, საკმარისია მიუთითოთ თქვენი ახალი endpoint, რომელიც განთავსებულია Hugging Face Inference Endpoints-ის გამოყენებით. Inferentia2-ზე თქვენი endpoint-ის განთავსების შემდეგ, შეგიძლიათ გაგზავნოთ მოთხოვნები UI-ში მოწოდებული Widget-ის ან OpenAI SDK-ის გამოყენებით.
ჩვენ აქტიურად ვმუშაობთ AWS Inferentia2-ზე Hugging Face Inference Endpoints-ის მეშვეობით განთავსებისთვის ხელმისაწვდომი მოდელების სპექტრის გასაფართოებლად. შემდეგ ეტაპზე გვსურს დავამატოთ Diffusion და Embedding მოდელების მხარდაჭერა, რათა შეძლოთ სურათების გენერირება და სემანტიკური ძიებისა და რეკომენდაციის სისტემების აშენება AWS Inferentia2-ის დაჩქარების და Hugging Face Inference Endpoints-ის გამოყენების სიმარტივის უპირატესობით.
გარდა ამისა, ჩვენ ვაგრძელებთ მუშაობას Neuronx-ზე Text Generation Inference (TGI)-ის წარმადობის გასაუმჯობესებლად, რაც უზრუნველყოფს LLM-ების უფრო სწრაფ და ეფექტურ განთავსებას AWS Inferentia 2-ზე ჩვენს ღია კოდის ბიბლიოთეკებში. თვალყური ადევნეთ ამ განახლებებს, რადგან ვაგრძელებთ ჩვენი შესაძლებლობების გაუმჯობესებას და თქვენი განთავსების გამოცდილების ოპტიმიზაციას!
თეგები:
#ai
#llm
#მანქანური სწავლება
#hugging face
#llama 3
#aws
#inference endpoints
#განთავსება
#tgi
#inferentia2
#sagemaker
#ღრუბელი
#neuron
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი