LLM-ებთან შედარებით, ემბედინგის მოდელები უფრო მცირე ზომისაა და უფრო სწრაფად ახორციელებენ ინფერენსს. ეს ძალზე მნიშვნელოვანია, რადგან თქვენი მოდელის შეცვლის ან მისი ფაინ-ტუნინგის გაუმჯობესების შემდეგ საჭიროა ემბედინგების ხელახლა გენერირება. გარდა ამისა, მომხმარებლის უკეთესი გამოცდილებისთვის, მნიშვნელოვანია, რომ აღდგენის მთელი პროცესი მაქსიმალურად სწრაფი იყოს. ამ ბლოგ-პოსტში ჩვენ გაჩვენებთ, თუ როგორ უნდა განათავსოთ ღია კოდის ემბედინგის მოდელები Hugging Face Inference Endpoints-ზე Text Embedding Inference-ის (TEI) გამოყენებით, რომელიც ჩვენი მართული SaaS გადაწყვეტაა და მოდელების განთავსებას ამარტივებს. გარდა ამისა, ჩვენ გასწავლით, თუ როგორ განახორციელოთ ფართომასშტაბიანი პაკეტური მოთხოვნები. სანამ დავიწყებთ, გავიხსენოთ Inference Endpoints-ის შესახებ. Hugging Face Inference Endpoints გვთავაზობს მანქანური სწავლების მოდელების წარმოებაში გამოსაყენებლად განთავსების მარტივ და უსაფრთხო გზას. Inference Endpoints დეველოპერებსა და მონაცემთა მეცნიერებს საშუალებას აძლევს შექმნან გენერაციული AI აპლიკაციები ინფრასტრუქტურის მართვის გარეშე: განთავსების პროცესი გამარტივებულია რამდენიმე კლიკამდე, რაც მოიცავს მოთხოვნების დიდი მოცულობის დამუშავებას ავტომატური სკალირებით, ინფრასტრუქტურის ხარჯების შემცირებას "scale-to-zero"-ს გამოყენებით და მოწინავე უსაფრთხოებას. აქ მოცემულია ყველაზე მნიშვნელოვანი მახასიათებლები: Inference Endpoints-ის გამოყენება შეგიძლიათ დაიწყოთ: https://ui.endpoints.huggingface.co/ Text Embeddings Inference (TEI) არის მიზანმიმართულად შექმნილი გადაწყვეტა ღია კოდის ტექსტის ემბედინგის მოდელების განთავსებისა და სერვისისთვის. TEI შექმნილია მაღალი წარმადობის ექსტრაქციისთვის, რომელიც მხარს უჭერს ყველაზე პოპულარულ მოდელებს. TEI მხარს უჭერს Massive Text Embedding Benchmark (MTEB) Leaderboard-ის ტოპ 10 მოდელს, მათ შორის FlagEmbedding, Ember, GTE და E5. TEI ამჟამად ახორციელებს შემდეგ წარმადობის ოპტიმიზაციის ფუნქციებს: ეს ფუნქციები უზრუნველყოფს ინდუსტრიაში წამყვან წარმადობას გამტარუნარიანობისა და ხარჯების მიხედვით. BAAI/bge-base-en-v1.5 მოდელის ბენჩმარკში Nvidia A10G Inference Endpoint-ზე, 512 ტოკენის სიგრძითა და 32-ის პაკეტური ზომით, ჩვენ მივაღწიეთ 450+ მოთხოვნა/წამში გამტარუნარიანობას, რამაც გამოიწვია 0.00156$ / 1M ტოკენი ან 0.00000156$ / 1K ტოკენის ღირებულება. ეს 64-ჯერ უფრო იაფია, ვიდრე OpenAI Embeddings ($0.0001 / 1K ტოკენი). დასაწყებად, საჭიროა შეხვიდეთ მომხმარებლის ან ორგანიზაციის ანგარიშით, რომელსაც მიბმული აქვს გადახდის მეთოდი (შეგიძლიათ დაამატოთ აქ), შემდეგ შეხვიდეთ Inference Endpoints-ზე მისამართზე https://ui.endpoints.huggingface.co. შემდეგ დააწკაპუნეთ „New endpoint“-ზე. აირჩიეთ რეპოზიტორიუმი, ღრუბელი და რეგიონი, დაარეგულირეთ ინსტანციისა და უსაფრთხოების პარამეტრები და განათავსეთ ჩვენს შემთხვევაში BAAI/bge-base-en-v1.5. Inference Endpoints გთავაზობთ ინსტანციის ტიპს მოდელის ზომის მიხედვით, რომელიც საკმარისად დიდი უნდა იყოს მოდელის გასაშვებად. მაგალითად, Intel Ice Lake 2 vCPU. ჩვენ მიერ განხორციელებული ბენჩმარკის შესრულების მისაღებად, შეცვალეთ ინსტანცია 1x Nvidia A10G-ზე. შენიშვნა: თუ ინსტანციის ტიპის არჩევა შეუძლებელია, უნდა დაგვიკავშირდეთ და მოითხოვოთ ინსტანციის კვოტა. შემდეგ შეგიძლიათ განათავსოთ თქვენი მოდელი „Create Endpoint“-ზე დაწკაპუნებით. 1-3 წუთის შემდეგ, Endpoint ონლაინ რეჟიმში იქნება და მზად იქნება მოთხოვნების მოსამსახურებლად. Endpoint-ის მიმოხილვა უზრუნველყოფს წვდომას Inference Widget-ზე, რომელიც შეიძლება გამოყენებულ იქნას მოთხოვნების ხელით გასაგზავნად. ეს საშუალებას გაძლევთ სწრაფად შეამოწმოთ თქვენი Endpoint სხვადასხვა შეყვანებით და გაუზიაროთ გუნდის წევრებს. შენიშვნა: TEI ამჟამად ავტომატურად არ ამოკლებს შეყვანას (input). ამის ჩასართავად, თქვენს მოთხოვნაში უნდა დააყენოთ truncate: true. ვიჯეტის გარდა, მიმოხილვა გთავაზობთ კოდის ნიმუშებს cURL-ისთვის, Python-ისთვის და Javascript-ისთვის, რომელთა გამოყენებაც შეგიძლიათ მოდელზე მოთხოვნების გასაგზავნად. კოდის ნიმუში გიჩვენებთ, თუ როგორ გაგზავნოთ ერთი მოთხოვნა, მაგრამ TEI ასევე მხარს უჭერს პაკეტურ მოთოვნებს, რაც საშუალებას გაძლევთ ერთდროულად გაგზავნოთ მრავალი დოკუმენტი თქვენი Endpoint-ის გამოყენების ეფექტურობის გასაზრდელად. ქვემოთ მოცემულია პაკეტური მოთხოვნის გაგზავნის მაგალითი, სადაც truncation დაყენებულია true-ზე. TEI Hugging Face Inference Endpoints-ზე უზრუნველყოფს უაღრესად სწრაფ და ულტრა-ხარჯთეფექტურ განთავსებას უახლესი ემბედინგის მოდელებისათვის. ინდუსტრიაში წამყვანი გამტარუნარიანობით 450+ მოთხოვნა წამში და ხარჯებით 0.00000156$ / 1K ტოკენი, Inference Endpoints გვთავაზობს 64-ჯერ უფრო დაბალ ხარჯებს OpenAI Embeddings-თან შედარებით. დეველოპერებისა და კომპანიებისთვის, რომლებიც იყენებენ ტექსტის ემბედინგებს სემანტიკური ძიების, ჩეთბოტების, რეკომენდაციებისა და სხვა ფუნქციების გასააქტიურებლად, Hugging Face Inference Endpoints აცილებს ინფრასტრუქტურულ დატვირთვას და უზრუნველყოფს მაღალ გამტარუნარიანობას მინიმალურ ფასად, რაც აჩქარებს პროცესს კვლევიდან წარმოებამდე. გმადლობთ წაკითხვისთვის! თუ გაქვთ შეკითხვები, დამიკავშირდით Twitter-ზე ან LinkedIn-ზე. მეტი სტატია ჩვენი ბლოგიდან · დარეგისტრირდით ან შეხვიდეთ კომენტარისთვის.