ღია Embedding მოდელების განთავსება Amazon SageMaker-ზე Hugging Face Embedding კონტეინერის გამოყენებით
ეს ბლოგი დეტალურად აღწერს, თუ როგორ უნდა განათავსოთ ღია Embedding მოდელები, როგორიცაა Snowflake Arctic Embed, Amazon SageMaker-ზე ინფერენციისთვის, ახალი Hugging Face Embedding კონტეინერის გამოყენებით. სტატია მოიცავს განვითარების გარემოს დაყენებას, კონტეინერის მოძიებას, მოდელის განთავსებას და მისი მუშაობის შეფასებას როგორც CPU, ასევე GPU ინსტანციებზე, ხაზს უსვამს Text Embedding Inference (TEI)-ის ეფექტურობას და ხარჯ-ეფექტურობას.
ამ ბლოგში ჩვენ გაჩვენებთ, თუ როგორ უნდა განათავსოთ ღია Embedding მოდელები, როგორიცაა Snowflake/snowflake-arctic-embed-l, BAAI/bge-large-en-v1.5 ან sentence-transformers/all-MiniLM-L6-v2 Amazon SageMaker-ზე ინფერენციისთვის, ახალი Hugging Face Embedding კონტეინერის გამოყენებით. ჩვენ განვათავსებთ Snowflake/snowflake-arctic-embed-m-v1.5-ს, ერთ-ერთ საუკეთესო ღია Embedding მოდელს ინფორმაციის მოძიებისთვის (retrieval) – მისი რეიტინგების ნახვა შეგიძლიათ MTEB Leaderboard-ზე.
მაგალითი მოიცავს:
Hugging Face Embedding კონტეინერი არის ახალი, სპეციალურად შექმნილი Inference კონტეინერი Embedding მოდელების უსაფრთხო და მართვად გარემოში მარტივად განსათავსებლად. DLC (Deep Learning Container) მუშაობს Text Embedding Inference (TEI)-ის მეშვეობით, რომელიც არის უაღრესად სწრაფი და მეხსიერების ეფექტური გადაწყვეტა Embedding მოდელების განთავსებისა და სერვისისთვის. TEI უზრუნველყოფს მაღალეფექტურ ექსტრაქციას ყველაზე პოპულარული მოდელებისთვის, მათ შორის FlagEmbedding, Ember, GTE და E5. TEI ახორციელებს მრავალ ფუნქციას, ის ასევე მხარს უჭერს შემდეგი მოდელის არქიტექტურებს.
დავიწყოთ!
ჩვენ გამოვიყენებთ sagemaker python SDK-ს Snowflake Arctic-ის Amazon SageMaker-ზე განსათავსებლად. უნდა დავრწმუნდეთ, რომ გვაქვს კონფიგურირებული AWS ანგარიში და დაინსტალირებული sagemaker python SDK. თუ SageMaker-ს გამოიყენებთ ლოკალურ გარემოში, დაგჭირდებათ წვდომა IAM როლზე SageMaker-ისთვის საჭირო ნებართვებით. მეტის გაგება შეგიძლიათ აქ.
ჩვეულებრივი Hugging Face მოდელების განთავსებასთან შედარებით, ჩვენ ჯერ უნდა მოვიძიოთ კონტეინერის URI და მივაწოდოთ ის ჩვენს HuggingFaceModel მოდელის კლასს image_uri-ით, რომელიც მიუთითებს გამოსახულებაზე. Amazon SageMaker-ში ახალი Hugging Face Embedding კონტეინერის მოსაძიებლად, ჩვენ შეგვიძლია გამოვიყენოთ sagemaker SDK-ის მიერ მოწოდებული get_huggingface_llm_image_uri მეთოდი. ეს მეთოდი საშუალებას გვაძლევს მოვიძიოთ URI სასურველი Hugging Face Embedding კონტეინერისთვის. მნიშვნელოვანია აღინიშნოს, რომ TEI-ს აქვს 2 განსხვავებული ვერსია CPU-სა და GPU-სთვის, ამიტომ ჩვენ ვქმნით დამხმარე ფუნქციას სწორი image URI-ის მოსაძიებლად, ინსტანციის ტიპის მიხედვით.
Snowflake/snowflake-arctic-embed-m-v1.5-ის Amazon SageMaker-ზე განსათავსებლად, ჩვენ ვქმნით HuggingFaceModel მოდელის კლასს და განვსაზღვრავთ ჩვენი ენდპოინტის კონფიგურაციას, მათ შორის HF_MODEL_ID-ს, instance_type-ს და ა.შ. ჩვენ გამოვიყენებთ c6i.2xlarge ინსტანციის ტიპს, რომელსაც აქვს 4 Intel Ice-Lake vCPU, 8 GB ოპერატიული მეხსიერება და საათში დაახლოებით $0.204 ღირს.
HuggingFaceModel-ის შექმნის შემდეგ, შეგვიძლია მისი განთავსება Amazon SageMaker-ზე deploy მეთოდის გამოყენებით. მოდელს განვათავსებთ ml.c6i.2xlarge ინსტანციის ტიპით. SageMaker ახლა შექმნის ჩვენს ენდპოინტს და განათავსებს მასზე მოდელს. ამას შეიძლება დასჭირდეს დაახლოებით 5 წუთი.
ენდპოინტის განთავსების შემდეგ, შეგვიძლია მასზე ინფერენციის გაშვება. ჩვენ გამოვიყენებთ predictor-ის predict მეთოდს ჩვენს ენდპოინტზე ინფერენციის გასაშვებად. შესანიშნავია! ახლა, როცა შეგვიძლია ემბედინგების გენერირება, მოდით, შევამოწმოთ ჩვენი მოდელის მუშაობა (performance).
ჩვენ გავაგზავნით 3,900 მოთხოვნას ჩვენს ენდპოინტზე და გამოვიყენებთ threading-ს 10 პარალელური ნაკადით. ჩვენ გავზომავთ ჩვენი ენდპოინტის საშუალო ლატენტურობასა და გამტარუნარიანობას. ჩვენ გავაგზავნით 256 ტოკენის შეტანას, ჯამში ~1 მილიონი ტოკენისთვის. ჩვენ გადავწყვიტეთ გამოგვეყენებინა 256 ტოკენი შეტანის სიგრძედ, რათა სწორი ბალანსი გვეპოვა მოკლე და გრძელ შეტანებს შორის. შენიშვნა: დატვირთვის ტესტის გაშვებისას, მოთხოვნები გაიგზავნა ევროპიდან, ხოლო ენდპოინტი განთავსებულია us-east-1-ში. ეს ამატებს ქსელის დამატებით ლატენტურობას მოთხოვნებს. 3,900 მოთხოვნის გაგზავნას ან 1 მილიონი ტოკენის ემბედირებას დასჭირდა დაახლოებით 841 წამი. ეს ნიშნავს, რომ შეგვიძლია დაახლოებით ~5 მოთხოვნის გაშვება წამში. მაგრამ გაითვალისწინეთ, რომ ეს მოიცავს ქსელის ლატენტურობას ევროპიდან us-east-1-მდე. როდესაც CloudWatch-ის მეშვეობით ვამოწმებთ ენდპოინტის ლატენტურობას, ვხედავთ, რომ ჩვენი Embeddings მოდელისთვის ლატენტურობა არის 2 წამი 10 პარალელური მოთხოვნის დროს. ეს ძალიან შთამბეჭდავია მცირე და ძველი CPU ინსტანციისთვის, რომელიც თვეში დაახლოებით $150 ღირს. თქვენ შეგიძლიათ მოდელი განათავსოთ GPU ინსტანციაზე უფრო სწრაფი ინფერენციის დროის მისაღებად.
შენიშვნა: ჩვენ იგივე ტესტი ჩავატარეთ ml.g5.xlarge ინსტანციაზე 1x NVIDIA A10G GPU-ით. 1 მილიონი ტოკენის ემბედირებას დასჭირდა დაახლოებით 30 წამი. ეს ნიშნავს, რომ შეგვიძლია დაახლოებით ~130 მოთხოვნის გაშვება წამში. ენდპოინტის ლატენტურობა არის 4 მილიწამი (ms) 10 პარალელური მოთხოვნის დროს. ml.g5.xlarge Amazon SageMaker-ზე საათში დაახლოებით $1.408 ღირს. GPU ინსტანციები გაცილებით სწრაფია, ვიდრე CPU ინსტანციები, მაგრამ ისინი ასევე უფრო ძვირია. თუ გსურთ ემბედინგების მასობრივი დამუშავება, შეგიძლიათ გამოიყენოთ GPU ინსტანცია. თუ გსურთ მცირე ენდპოინტის გაშვება დაბალი ხარჯებით, შეგიძლიათ გამოიყენოთ CPU ინსტანცია. მომავალში ვგეგმავთ Hugging Face Embedding კონტეინერისთვის მიძღვნილი ბენჩმარკის შექმნას.
გასასუფთავებლად, შეგვიძლია წავშალოთ მოდელი და ენდპოინტი. ახალი Hugging Face Embedding კონტეინერი საშუალებას გაძლევთ მარტივად განათავსოთ ღია Embedding მოდელები, როგორიცაა Snowflake/snowflake-arctic-embed-l, Amazon SageMaker-ზე ინფერენციისთვის. ჩვენ განვიხილეთ განვითარების გარემოს დაყენება, კონტეინერის მოძიება, მოდელის განთავსება და მისი ინფერენციის მუშაობის შეფასება. ამ ახალი კონტეინერით მომხმარებლებს შეუძლიათ მარტივად განათავსონ მაღალეფექტური Embedding მოდელები, რაც შესაძლებელს ხდის დახვეწილი გენერაციული AI აპლიკაციების შექმნას გაუმჯობესებული ეფექტურობით. ჩვენ მოუთმენლად ველით, თუ რას შექმნით ახალი Hugging Face Embedding კონტეინერის გამოყენებით.
თეგები:
#ai
#ღრუბლოვანი ტექნოლოგიები
#მანქანური სწავლება
#hugging face
#aws
#embedding models
#amazon sagemaker
#ინფერენცია
#tei
#snowflake arctic embed
#განთავსება
#მუშაობა
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი