NVIDIA NIM ამარტივებს ხელოვნური ინტელექტის მოდელების, მათ შორის LLM-ების განთავსებას
NVIDIA NIM ინფერენციის მიკროსერვისები მომხმარებლებსა და პარტნიორებს საშუალებას აძლევს, გამარტივებული მიდგომით, სწრაფად და საიმედოდ განათავსონ ხელოვნური ინტელექტის უახლესი მოდელები, განსაკუთრებით დიდი ენობრივი მოდელები (LLM). ის მხარს უჭერს 100 000-ზე მეტ LLM-ს Hugging Face-ზე, მუშაობს ერთ Docker კონტეინერში და უზრუნველყოფს ავტომატურ ოპტიმიზაციას კონფიგურაციის გარეშე. ეს სისტემა მიზნად ისახავს AI ინოვაციების დაჩქარებას NVIDIA-ს აჩქარებულ ინფრასტრუქტურაზე, რაც დეველოპერებსა და საწარმოებს ეხმარება
NVIDIA AI-ის მომხმარებლები და ეკოსისტემის პარტნიორები იყენებენ NVIDIA NIM ინფერენციის მიკროსერვისებს, რათა გაამარტივონ უახლესი AI მოდელების განთავსება NVIDIA-ს აჩქარებულ ინფრასტრუქტურაზე. ეს მოიცავს დიდ ენობრივ მოდელებს (LLM), მულტიმოდალურ და დომენ-სპეციფიკურ მოდელებს NVIDIA-დან, Meta-დან, Mistral AI-დან, Google-დან და ასობით სხვა ინოვაციური მოდელის შემქმნელისგან. ჩვენ დავინახეთ, რომ მომხმარებლები და პარტნიორები უფრო მეტ ინოვაციას გვთავაზობენ, უფრო სწრაფად, მოდელების განთავსების გამარტივებული და საიმედო მიდგომით, და დღეს მოხარულები ვართ, რომ NIM-ის საშუალებით Hugging Face-ზე 100,000-ზე მეტი LLM-ის სწრაფი და საიმედო განთავსება გახდა ხელმისაწვდომი.
NIM ამჟამად უზრუნველყოფს ერთ Docker კონტეინერს LLM-ების ფართო სპექტრის განსათავსებლად, რომლებსაც მხარს უჭერენ წამყვანი ინფერენციის ფრეიმვორკები NVIDIA-სგან და საზოგადოებისგან, მათ შორის NVIDIA TensorRT-LLM, vLLM და SGLang. როდესაც LLM მიეწოდება NIM კონტეინერს, ის ასრულებს რამდენიმე ნაბიჯს განთავსებისა და მუშაობის ოპტიმიზაციისთვის, ხელით კონფიგურაციის გარეშე:
ცხრილი 1. NVIDIA NIM LLM ადაპტაციის ფაზები და ფუნქციონალი
ერთი NIM კონტეინერი მხარს უჭერს LLM-ის წონის გავრცელებულ ფორმატებს, მათ შორის:
NIM-ის გამოსაყენებლად, დარწმუნდით, რომ თქვენს გარემოს აქვს NVIDIA GPU-ები შესაბამისი დრაივერებით (CUDA 12.1+), დაინსტალირებული Docker, NVIDIA NGC ანგარიში და API Key NIM Docker სურათებისთვის, და Hugging Face ანგარიში და API ტოკენი ავთენტიფიკაციას საჭირო მოდელებისთვის. დამატებითი ინფორმაცია გარემოს წინაპირობების შესახებ შეგიძლიათ იხილოთ NIM დოკუმენტაციაში.
გარემოს დაყენება მოიცავს გარემოს ცვლადების დაყენებას და მუდმივი ქეშის დირექტორიის შექმნას. დარწმუნდით, რომ `nim_cache` დირექტორიას აქვს Unix-ის სწორი ნებართვები, იდეალურ შემთხვევაში, ის უნდა ეკუთვნოდეს იმავე Unix მომხმარებელს, რომელიც Docker კონტეინერს უშვებს, რათა თავიდან აიცილოთ ნებართვებთან დაკავშირებული პრობლემები. ამის სამართავად ბრძანებები იყენებენ `-u $(id -u)`-ს. სიმარტივისთვის, მოდით, ხშირად გამოყენებული ინფორმაციის ნაწილი გარემოს ცვლადებში შევინახოთ.
LLM-ის განთავსება Hugging Face-დან ნაჩვენებია Codestral-22B-ის მაგალითზე:
ლოკალურად გადმოწერილი მოდელებისთვის, `NIM_MODEL_NAME` მიუთითეთ გზაზე და დაამონტაჟეთ დირექტორია:
მოდელის განთავსებისას, შეგიძლიათ შეამოწმოთ გამომავალი ჟურნალები, რათა გაერკვეთ NIM-ის მიერ მოდელის განთავსების დროს გაკეთებულ არჩევანში. განთავსებული მოდელები ხელმისაწვდომია `http://localhost:8000`-ზე, API ენდპოინტებით `http://localhost:8000/docs`-ზე. დამატებითი არგუმენტები ხელმისაწვდომია ძირითადი ძრავის მეშვეობით. ასეთი არგუმენტების სრული სიის შემოწმება შეგიძლიათ კონტეინერში `nim-run --help`-ის გაშვებით, როგორც ეს ნაჩვენებია ქვემოთ.
თავსებადი ბექენდების შესამოწმებლად ან კონკრეტული ბექენდის ასარჩევად, გამოიყენეთ `list-model-profiles`:
ეს ბრძანება აჩვენებს თავსებად პროფილებს, მათ შორის LoRA ადაპტერებისთვის. კონკრეტული ბექენდით, მაგალითად vLLM-ით, განსათავსებლად, გამოიყენეთ `NIM_MODEL_PROFILE` გარემოს ცვლადი, `list-model-profiles`-ის მიერ მოწოდებული გამომავალი ინფორმაციის გამოყენებით:
NIM ხელს უწყობს კვანტიზებული მოდელების განთავსებას. ის ავტომატურად ამოიცნობს კვანტიზაციის ფორმატს (მაგ., GGUF, AWQ) და ირჩევს შესაბამის ბექენდს სტანდარტული განთავსების ბრძანებების გამოყენებით:
მოწინავე მომხმარებლებისთვის NIM გთავაზობთ კონფიგურაციის შესაძლებლობას გარემოს ცვლადების მეშვეობით, როგორიცაა `NIM_MAX_MODEL_LEN` კონტექსტის სიგრძისთვის. დიდი LLM-ებისთვის, `NIM_TENSOR_PARALLEL_SIZE` უზრუნველყოფს მრავალ-GPU განთავსებას. დარწმუნდით, რომ Docker-ს გადასცემთ `--shm-size=` მრავალ-GPU კომუნიკაციისთვის.
NIM კონტეინერი მხარს უჭერს LLM-ების ფართო სპექტრს, რომლებსაც მხარს უჭერენ NVIDIA TensorRT-LLM, vLLM და SGLang, მათ შორის პოპულარული LLM-ები და სპეციალიზებული ვარიანტები Hugging Face-ზე. მხარდაჭერილი LLM-ების შესახებ დამატებითი დეტალებისთვის იხილეთ დოკუმენტაცია.
NIM შექმნილია იმისთვის, რომ გაამარტივოს AI მოდელების განთავსება NVIDIA-ს აჩქარებულ ინფრასტრუქტურაზე, დააჩქაროს ინოვაცია და ღირებულების მიღების დრო მაღალი წარმადობის AI შემქმნელებისთვის და საწარმოს AI გუნდებისთვის. ჩვენ მოუთმენლად ველით Hugging Face საზოგადოების ჩართულობასა და უკუკავშირს. დაიწყეთ დეველოპერის მაგალითით NVIDIA-ს ჰოსტირებულ გამოთვლით გარემოში build.nvidia.com-ზე.
თეგები:
#ხელოვნური ინტელექტი
#llm
#ტექნოლოგია
#nvidia
#ai მოდელები
#hugging face
#ინფერენცია
#განთავსება
#nim
#docker
წყარო: huggingface.co
AI-ით გადამუშავებული