დიდ ენობრივ მოდელებთან (LLM-ებთან) შედარებით, Embedding მოდელები უფრო მცირე ზომისაა და ინფერენსისთვის უფრო სწრაფია. ეს უმნიშვნელოვანესია, რადგან თქვენი Embedding-ების ხელახლა შექმნა გჭირდებათ მოდელის შეცვლის ან მისი დახვეწის შემდეგ. გარდა ამისა, მნიშვნელოვანია, რომ ინფორმაციის მოძიებით გაძლიერების მთელი პროცესი მაქსიმალურად სწრაფი იყოს მომხმარებლისთვის უკეთესი გამოცდილების უზრუნველსაყოფად. ამ ბლოგპოსტში გაჩვენებთ, თუ როგორ უნდა განათავსოთ ღია კოდის Embedding მოდელები Hugging Face Inference Endpoints-ზე Text Embedding Inference-ის (TEI) გამოყენებით, რომელიც ჩვენი მართული SaaS გადაწყვეტაა და მოდელების განთავსებას ამარტივებს. ასევე, გასწავლით, თუ როგორ უნდა შეასრულოთ დიდი მოცულობის პაკეტური მოთხოვნები. სანამ დავიწყებთ, გავიხსენოთ Inference Endpoints-ის შესახებ ცოდნა. Hugging Face Inference Endpoints გთავაზობთ მარტივ და უსაფრთხო გზას მანქანური სწავლების მოდელების პროდუქციაში გამოსაყენებლად განსათავსებლად. Inference Endpoints აძლევს საშუალებას დეველოპერებსა და მონაცემთა მეცნიერებს შექმნან გენერაციული ხელოვნური ინტელექტის აპლიკაციები ინფრასტრუქტურის მართვის გარეშე: ამარტივებს განთავსების პროცესს რამდენიმე დაწკაპუნებამდე, მათ შორის მოთხოვნების დიდი მოცულობის დამუშავებას ავტომატური მასშტაბირებით (autoscaling), ინფრასტრუქტურის ხარჯების შემცირებას ნულამდე მასშტაბირებით (scale-to-zero) და მოწინავე უსაფრთხოების შეთავაზებას. აქ მოცემულია ყველაზე მნიშვნელოვანი მახასიათებლები: Inference Endpoints-ის გამოყენების დაწყება შეგიძლიათ აქ: https://ui.endpoints.huggingface.co/ Text Embeddings Inference (TEI) არის სპეციალურად შექმნილი გადაწყვეტა ღია კოდის ტექსტური Embedding მოდელების განსათავსებლად და მოსამსახურებლად. TEI აგებულია მაღალი წარმადობის ექსტრაქციისთვის და მხარს უჭერს ყველაზე პოპულარულ მოდელებს. TEI მხარს უჭერს Massive Text Embedding Benchmark (MTEB) Leaderboard-ის ყველა ტოპ 10 მოდელს, მათ შორის FlagEmbedding, Ember, GTE და E5. TEI ამჟამად ახორციელებს შემდეგი წარმადობის ოპტიმიზაციის მახასიათებლებს: ამ მახასიათებლებმა შესაძლებელი გახადა ინდუსტრიაში წამყვანი წარმადობა გამტარუნარიანობისა და ხარჯების თვალსაზრისით. BAAI/bge-base-en-v1.5 მოდელის ბენჩმარკში Nvidia A10G Inference Endpoint-ზე, თანმიმდევრობის 512 ტოკენის სიგრძით და 32-ის პაკეტური ზომით, ჩვენ მივაღწიეთ 450+ მოთხოვნას წამში, რამაც გამოიწვია 0.00156$ ღირებულება 1 მილიონ ტოკენზე, ან 0.00000156$ 1 ათას ტოკენზე. ეს 64-ჯერ უფრო იაფია, ვიდრე OpenAI Embeddings (0.0001$ / 1 ათას ტოკენზე). დასაწყებად, საჭიროა შეხვიდეთ მომხმარებლის ან ორგანიზაციის ანგარიშით, რომელსაც გააქტიურებული აქვს გადახდის მეთოდი (შეგიძლიათ დაამატოთ აქ), შემდეგ შეხვიდეთ Inference Endpoints-ზე https://ui.endpoints.huggingface.co-ზე. შემდეგ, დააწკაპუნეთ „New endpoint“-ზე. აირჩიეთ რეპოზიტორი, ღრუბელი და რეგიონი, დაარეგულირეთ ინსტანციისა და უსაფრთხოების პარამეტრები და განათავსეთ ჩვენს შემთხვევაში BAAI/bge-base-en-v1.5. Inference Endpoints მოდელის ზომის მიხედვით გვთავაზობს ინსტანციის ტიპს, რომელიც საკმარისად დიდი უნდა იყოს მოდელის გასაშვებად. მაგალითად, Intel Ice Lake 2 vCPU. ჩვენს მიერ ჩატარებული ბენჩმარკის წარმადობის მისაღებად, შეცვალეთ ინსტანცია 1x Nvidia A10G-ზე. შენიშვნა: თუ ინსტანციის ტიპი ვერ აირჩევა, უნდა დაგვიკავშირდეთ და მოითხოვოთ ინსტანციის კვოტა. შემდეგ შეგიძლიათ განათავსოთ თქვენი მოდელი „Create Endpoint“-ზე დაწკაპუნებით. 1-3 წუთის შემდეგ, Endpoint ონლაინ რეჟიმში იქნება და მზად იქნება მოთხოვნების მოსამსახურებლად. Endpoint-ის მიმოხილვა იძლევა წვდომას Inference Widget-ზე, რომელიც შეიძლება გამოყენებულ იქნას მოთხოვნების ხელით გასაგზავნად. ეს საშუალებას გაძლევთ სწრაფად შეამოწმოთ თქვენი Endpoint სხვადასხვა შეყვანებით და გაუზიაროთ ის გუნდის წევრებს. შენიშვნა: TEI ამჟამად ავტომატურად არ ჭრის შეყვანას. ამ ფუნქციის ჩართვა შეგიძლიათ მოთხოვნაში truncate: true-ს დაყენებით. ვიჯეტის გარდა, მიმოხილვა გთავაზობთ კოდის ნიმუშს cURL-ისთვის, Python-ისთვის და Javascript-ისთვის, რომელთა გამოყენებაც შეგიძლიათ მოდელისთვის მოთხოვნების გასაგზავნად. კოდის ნიმუში გიჩვენებთ, თუ როგორ უნდა გაგზავნოთ ერთი მოთხოვნა, მაგრამ TEI ასევე მხარს უჭერს პაკეტურ მოთხოვნებს, რაც საშუალებას გაძლევთ გაგზავნოთ მრავალი დოკუმენტი ერთდროულად თქვენი Endpoint-ის გამოყენების გასაზრდელად. ქვემოთ მოცემულია მაგალითი, თუ როგორ უნდა გაგზავნოთ პაკეტური მოთხოვნა truncate: true-ს დაყენებით. TEI Hugging Face Inference Endpoints-ზე იძლევა ხელოვნური ინტელექტის უახლესი Embedding მოდელების უსწრაფესი და ულტრა-ხარჯთეფექტური განთავსების საშუალებას. ინდუსტრიაში წამყვანი გამტარუნარიანობით – 450+ მოთხოვნა წამში – და დაბალი ხარჯებით, როგორიცაა 0.00000156$ / 1k ტოკენზე, Inference Endpoints უზრუნველყოფს 64-ჯერ ხარჯების დაზოგვას OpenAI Embeddings-თან შედარებით. დეველოპერებისა და კომპანიებისთვის, რომლებიც იყენებენ ტექსტურ Embedding-ებს სემანტიკური ძიების, ჩეთბოტების, რეკომენდაციების და სხვა მიზნებისთვის, Hugging Face Inference Endpoints გამორიცხავს ინფრასტრუქტურის ზედმეტ ხარჯებს და უზრუნველყოფს მაღალ გამტარუნარიანობას ყველაზე დაბალ ფასად, რაც აუმჯობესებს პროცესს კვლევიდან პროდუქციამდე. მადლობა წაკითხვისთვის! თუ გაქვთ შეკითხვები, შეგიძლიათ დამიკავშირდეთ Twitter-ზე ან LinkedIn-ზე.