როგორ აძლიერებს Intel-ი RAG აპლიკაციებს OPEA პლატფორმაზე: Gaudi 2 და Xeon CPU-ები
ინფორმაციის მოძიებით გაძლიერებული გენერაცია (RAG) კრიტიკულად მნიშვნელოვანია დიდი ენობრივი მოდელებისთვის (LLM) ახალი ცოდნის ინკორპორირებისთვის, რაც აუმჯობესებს წარმადობასა და უსაფრთხოებას. Intel, OPEA პლატფორმის ფარგლებში, დეველოპერებს სთავაზობს სრულყოფილ გადაწყვეტილებებს RAG აპლიკაციების შესაქმნელად და ოპტიმიზაციისთვის. სტატია დეტალურად აღწერს Intel Gaudi 2 AI ამაჩქარებლებისა და Xeon CPU-ების როლს საწარმოო წარმადობის მნიშვნელოვნად გაზრდაში. ასევე განხილულია LangChain ფრეიმვორკის გამოყენება RAG ა
ინფორმაციის მოძიებით გაძლიერებული გენერაცია (RAG) აუმჯობესებს ტექსტის გენერაციას დიდი ენობრივი მოდელის გამოყენებით, გარე მონაცემთა საცავში შენახული ახალი დომენის ცოდნის ინკორპორირებით. თქვენი კომპანიის მონაცემების გამოყოფა ენობრივი მოდელების მიერ ვარჯიშის დროს მიღებული ცოდნისგან აუცილებელია წარმადობის, სიზუსტისა და უსაფრთხოების/კონფიდენციალურობის მიზნების დასაბალანსებლად. ამ ბლოგში გაეცნობით, თუ როგორ დაგეხმარებათ Intel RAG აპლიკაციების შემუშავებასა და დანერგვაში OPEA-ის, ანუ საწარმოო ხელოვნური ინტელექტის ღია პლატფორმის ფარგლებში. ასევე აღმოაჩენთ, თუ როგორ შეუძლიათ Intel Gaudi 2 ხელოვნური ინტელექტის ამაჩქარებლებსა და Xeon CPU-ებს მნიშვნელოვნად გააუმჯობესონ საწარმოს წარმადობა რეალური RAG გამოყენების მაგალითის მეშვეობით. დეტალებში ჩაღრმავებამდე, მოდით ჯერ აპარატურა განვიხილოთ. Intel Gaudi 2 მიზანმიმართულად არის შექმნილი ღრმა სწავლის ვარჯიშისა და ინფერენციის დასაჩქარებლად მონაცემთა ცენტრებსა და ღრუბლოვან სისტემებში. ის საჯაროდ ხელმისაწვდომია Intel Developer Cloud-ზე (IDC) და ასევე ლოკალური დანერგვისთვის. IDC არის ყველაზე მარტივი გზა Gaudi 2-ით მუშაობის დასაწყებად. თუ ჯერ არ გაქვთ ანგარიში, გთხოვთ, დარეგისტრირდეთ, გამოიწეროთ „პრემიუმი“ და შემდეგ მოითხოვოთ წვდომა. პროგრამული უზრუნველყოფის მხრივ, ჩვენს აპლიკაციას ავაწყობთ LangChain-ის გამოყენებით, რომელიც არის ღია კოდის ფრეიმვორკი, შექმნილი LLM-ების მეშვეობით ხელოვნური ინტელექტის აპლიკაციების შექმნის გასამარტივებლად. ის გთავაზობთ შაბლონებზე დაფუძნებულ გადაწყვეტილებებს, რაც დეველოპერებს საშუალებას აძლევს შექმნან RAG აპლიკაციები მორგებული ჩაშენებებით (embeddings), ვექტორული მონაცემთა ბაზებითა და LLM-ებით. დამატებით ინფორმაციას ნახავთ LangChain-ის დოკუმენტაციაში. Intel აქტიურად შეაქვს მრავალი ოპტიმიზაცია LangChain-ში, რაც დეველოპერებს საშუალებას აძლევს ეფექტურად განათავსონ GenAI აპლიკაციები Intel-ის პლატფორმებზე. LangChain-ში ჩვენ გამოვიყენებთ rag-redis შაბლონს ჩვენი RAG აპლიკაციის შესაქმნელად, BAAI/bge-base-en-v1.5 ჩაშენების მოდელით და Redis-ით, როგორც ნაგულისხმევი ვექტორული მონაცემთა ბაზით. ჩაშენების მოდელი იმუშავებს Intel Granite Rapids CPU-ზე. Intel Granite Rapids არქიტექტურა ოპტიმიზებულია საკუთრების ყველაზე დაბალი საერთო ღირებულების (TCO) უზრუნველსაყოფად მაღალი ბირთვული წარმადობისადმი მგრძნობიარე და ზოგადი დანიშნულების გამომთვლელ სამუშაო დატვირთვებისთვის. GNR ასევე მხარს უჭერს AMX-FP16 ინსტრუქციების ნაკრებს, რაც იწვევს წარმადობის 2-3-ჯერ ზრდას შერეული ხელოვნური ინტელექტის სამუშაო დატვირთვებისთვის. LLM იმუშავებს Intel Gaudi 2 ამაჩქარებელზე. რაც შეეხება Hugging Face მოდელებს, Optimum Habana ბიბლიოთეკა წარმოადგენს ინტერფეისს Hugging Face Transformers და Diffusers ბიბლიოთეკებსა და Gaudi-ს შორის. ის გთავაზობთ ინსტრუმენტებს მოდელების მარტივი ჩატვირთვის, ვარჯიშისა და ინფერენციისთვის ერთ- და მრავალბარათიან კონფიგურაციებში სხვადასხვა შემდგომი ამოცანისთვის. ჩვენ გთავაზობთ Dockerfile-ს LangChain-ის განვითარების გარემოს კონფიგურაციის გასამარტივებლად. Docker კონტეინერის გაშვების შემდეგ, შეგიძლიათ დაიწყოთ ვექტორული მონაცემთა ბაზის, RAG პაიპლაინისა და LangChain აპლიკაციის აწყობა Docker გარემოში. დეტალური ნაბიჯ-ნაბიჯ ინსტრუქციისთვის, მიჰყევით ChatQnA მაგალითს. ვექტორული მონაცემთა ბაზის შესავსებად, ჩვენ ვიყენებთ Nike-ის საჯარო ფინანსურ დოკუმენტებს. LangChain-ში ჩვენ ვიყენებთ Chain API-ს, რათა დავაკავშიროთ მოთხოვნა (prompt), ვექტორული მონაცემთა ბაზა და ჩაშენების მოდელი. სრული კოდი ხელმისაწვდომია რეპოზიტორიუმში. ჩვენ გავუშვებთ ჩვენს ჩატის მოდელს Gaudi2-ზე Hugging Face Text Generation Inference (TGI) სერვერთან ერთად. ეს კომბინაცია უზრუნველყოფს მაღალწარმადობიან ტექსტის გენერაციას პოპულარული ღია კოდის LLM-ებისთვის Gaudi2 აპარატურაზე, როგორიცაა MPT, Llama და Mistral. კონფიგურაცია არ არის საჭირო. შეგვიძლია გამოვიყენოთ წინასწარ აწყობილი Docker იმიჯი და გადავცეთ მოდელის სახელი (მაგ., Intel NeuralChat). სერვისი ნაგულისხმევად იყენებს ერთ Gaudi ამაჩქარებელს. უფრო დიდი მოდელის გასაშვებად (მაგ., 70B) შეიძლება საჭირო გახდეს მრავალი ამაჩქარებელი. ამ შემთხვევაში, გთხოვთ, დაამატოთ შესაბამისი პარამეტრები, მაგალითად, --sharded true და --num_shard 8. დაცული მოდელებისთვის, როგორიცაა Llama ან StarCoder, ასევე დაგჭირდებათ -e HUGGING_FACE_HUB_TOKEN= პარამეტრის მითითება თქვენი Hugging Face ტოკენის გამოყენებით. მას შემდეგ, რაც კონტეინერი იმუშავებს, ჩვენ ვამოწმებთ სერვისის ფუნქციონირებას TGI endpoint-ზე მოთხოვნის გაგზავნით. თუ ხედავთ გენერირებულ პასუხს, LLM სწორად მუშაობს და ახლა შეგიძლიათ ისიამოვნოთ მაღალი წარმადობის ინფერენციით Gaudi 2-ზე! TGI Gaudi კონტეინერი ნაგულისხმევად იყენებს bfloat16 მონაცემთა ტიპს. უფრო მაღალი გამტარუნარიანობისთვის, შესაძლოა მოგინდეთ FP8 კვანტიზაციის ჩართვა. ჩვენი ტესტირების შედეგების მიხედვით, FP8 კვანტიზაციამ უნდა უზრუნველყოს გამტარუნარიანობის 1.8-ჯერ გაზრდა BF16-თან შედარებით. FP8 ინსტრუქციები ხელმისაწვდომია README ფაილში. და ბოლოს, შეგიძლიათ ჩართოთ კონტენტის მოდერაცია Meta Llama Guard მოდელის გამოყენებით. README ფაილი შეიცავს ინსტრუქციებს Llama Guard-ის TGI Gaudi-ზე დასანერგად. server.py სკრიპტი განსაზღვრავს სერვისის endpoint-ებს fastAPI-ის გამოყენებით. ნაგულისხმევად, TGI Gaudi endpoint-ი იმუშავებს localhost-ზე 8080 პორტზე (ანუ http://127.0.0.1:8080). თუ ის მუშაობს სხვა მისამართზე ან პორტზე, გთხოვთ, შესაბამისად დააყენოთ TGI_ENDPOINT გარემოს ცვლადი. ქვემოთ მოცემული ინსტრუქციების გამოყენებით ჩვენ დავაყენებთ წინა ნაწილის (frontend) GUI კომპონენტებს. შემდეგ, განვაახლებთ DOC_BASE_URL გარემოს ცვლადს .env ფაილში, localhost IP მისამართის (127.0.0.1) შეცვლით რეალური
თეგები:
#ხელოვნური ინტელექტი
#llm
#ოპტიმიზაცია
#rag
#intel
#xeon
#მონაცემთა ბაზა
#langchain
#genai
#gaudi 2
#opea
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი