AWS Inferentia2 არის Amazon Web Services-ის (AWS) უახლესი მანქანური სწავლების ჩიპი, რომელიც ხელმისაწვდომია Amazon EC2 Inf2 ინსტანციების მეშვეობით. ხელოვნური ინტელექტის (AI) სამუშაო დატვირთვებისთვის შექმნილი Inf2 ინსტანციები უზრუნველყოფს მაღალ წარმადობასა და ოპტიმალურ ხარჯ/წარმადობის თანაფარდობას საწარმოო დატვირთვებისთვის. ერთ წელზე მეტია, ვთანამშრომლობთ AWS-ის პროდუქტისა და საინჟინრო გუნდებთან, რათა AWS Trainium და Inferentia ჩიპების წარმადობა და ხარჯთეფექტურობა ხელმისაწვდომი გავხადოთ Hugging Face-ის მომხმარებლებისთვის. ჩვენი ღია კოდის ბიბლიოთეკა optimum-neuron ამაჩქარებლებზე Hugging Face მოდელების გაწვრთნასა და განთავსებას ამარტივებს. მეტი შეგიძლიათ წაიკითხოთ ჩვენი მუშაობის შესახებ transformers, დიდი ენობრივი მოდელებისა (LLMs) და ტექსტის გენერირების inference (TGI) დაჩქარებაზე. დღეს, Inferentia2-ის ძალას პირდაპირ და ფართოდ ვთავაზობთ Hugging Face Hub-ის მომხმარებლებს. რამდენიმე თვის წინ, SageMaker-ზე დიდი ენობრივი მოდელების (LLMs) განთავსების ახალი გზა დავნერგეთ, Inferentia/Trainium-ის ახალი ოფციით მხარდაჭერილი მოდელებისთვის, როგორიცაა Meta Llama 3. Llama3 მოდელის განთავსება Inferentia2 ინსტანციებზე SageMaker-ში შესაძლებელია inference-ის ფართომასშტაბიანი მომსახურებისთვის და SageMaker-ის სრულად მართული ფუნქციების სრული პაკეტით სარგებლობისთვის, რაც მოიცავს მოდელების შექმნასა და დახვეწას, MLOps-სა და მართვას. დღეს, ჩვენ ვაფართოებთ ამ განთავსების გამოცდილების მხარდაჭერას Hugging Face-ზე ხელმისაწვდომი 100,000-ზე მეტ საჯარო მოდელზე, მათ შორის 14 ახალ მოდელის არქიტექტურაზე (albert, bert, camembert, convbert, deberta, deberta-v2, distilbert, electra, roberta, mobilebert, mpnet, vit, xlm, xlm-roberta) და 6 ახალ მანქანური სწავლების ამოცანაზე (text-classification, text-generation, token-classification, fill-mask, question-answering, feature-extraction). ამ მარტივი კოდის ფრაგმენტების გამოყენებით, AWS-ის მომხმარებლები შეძლებენ მოდელების მარტივად განთავსებას Inferentia2 ინსტანციებზე Amazon SageMaker-ში. Hub-დან მოდელების განთავსების უმარტივესი ვარიანტია Hugging Face Inference Endpoints. დღეს სიამოვნებით წარმოგიდგენთ ახალ Inferentia 2 ინსტანციებს Hugging Face Inference Endpoints-ისთვის. ასე რომ, ახლა, როდესაც Hugging Face-ში იპოვით თქვენთვის საინტერესო მოდელს, შეგიძლიათ მისი განთავსება Inferentia2-ზე სულ რამდენიმე დაწკაპუნებით. ყველაფერი რაც თქვენ გჭირდებათ, არის მოდელის არჩევა, რომლის განთავსებაც გსურთ, შემდეგ Amazon Web Services-ის ინსტანციის კონფიგურაციაში აირჩიეთ ახალი Inf2 ინსტანციის ოფცია და მზად ხართ სამუშაოდ. მხარდაჭერილი მოდელებისთვის, როგორიცაა Llama 3, შეგიძლიათ აირჩიოთ 2 ვარიანტი: Hugging Face Inference Endpoints საფასური გამოითვლება გამოყენებული სიმძლავრის წამის მიხედვით, ხარჯები იზრდება replica autoscaling-ით და ნულამდე ეცემა scale to zero-თი — ორივე ავტომატიზირებულია და ჩართულია მარტივი პარამეტრებით. Inference Endpoints იყენებს Text Generation Inference for Neuron (TGI)-ს, რათა Llama 3 გაუშვას AWS Inferentia-ზე. TGI არის სპეციალურად შექმნილი გადაწყვეტა დიდი ენობრივი მოდელების (LLMs) ფართომასშტაბიანი საწარმოო დატვირთვებისთვის განთავსებისა და მომსახურებისთვის, რომელიც მხარს უჭერს უწყვეტ batching-ს, streaming-ს და მრავალ სხვას. გარდა ამისა, Text Generation Inference-ით განთავსებული LLM-ები თავსებადია OpenAI SDK Messages API-სთან, ასე რომ, თუ უკვე გაქვთ გენერაციული AI აპლიკაციები, რომლებიც ინტეგრირებულია LLM-ებთან, არ გჭირდებათ თქვენი აპლიკაციის კოდის შეცვლა, საკმარისია მიუთითოთ თქვენი ახალი endpoint, რომელიც განთავსებულია Hugging Face Inference Endpoints-ის გამოყენებით. Inferentia2-ზე თქვენი endpoint-ის განთავსების შემდეგ, შეგიძლიათ გაგზავნოთ მოთხოვნები UI-ში მოწოდებული Widget-ის ან OpenAI SDK-ის გამოყენებით. ჩვენ აქტიურად ვმუშაობთ AWS Inferentia2-ზე Hugging Face Inference Endpoints-ის მეშვეობით განთავსებისთვის ხელმისაწვდომი მოდელების სპექტრის გასაფართოებლად. შემდეგ ეტაპზე გვსურს დავამატოთ Diffusion და Embedding მოდელების მხარდაჭერა, რათა შეძლოთ სურათების გენერირება და სემანტიკური ძიებისა და რეკომენდაციის სისტემების აშენება AWS Inferentia2-ის დაჩქარების და Hugging Face Inference Endpoints-ის გამოყენების სიმარტივის უპირატესობით. გარდა ამისა, ჩვენ ვაგრძელებთ მუშაობას Neuronx-ზე Text Generation Inference (TGI)-ის წარმადობის გასაუმჯობესებლად, რაც უზრუნველყოფს LLM-ების უფრო სწრაფ და ეფექტურ განთავსებას AWS Inferentia 2-ზე ჩვენს ღია კოდის ბიბლიოთეკებში. თვალყური ადევნეთ ამ განახლებებს, რადგან ვაგრძელებთ ჩვენი შესაძლებლობების გაუმჯობესებას და თქვენი განთავსების გამოცდილების ოპტიმიზაციას!