NVIDIA Cosmos Reasoning 2B მოდელის განთავსება Jetson მოწყობილობებზე vLLM-ის გამოყენებით
ხელოვნური ინტელექტის მოდელების სწრაფმა ევოლუციამ, რაც ზრდის მათ სიზუსტესა და ეფექტურობას, ისინი იდეალურს ხდის პერიფერიული მოწყობილობებისთვის. NVIDIA Jetson-ის ოჯახი, მაღალპროდუქტიული AGX Thor-დან და AGX Orin-დან დაწყებული კომპაქტური Orin Nano Super-ით დამთავრებული, შექმნილია ფიზიკური ხელოვნური ინტელექტისა და რობოტიკისთვის განკუთვნილი აპლიკაციების დასაჩქარებლად, რაც უზრუნველყოფს ოპტიმიზებულ შესრულებას ღია კოდის წამყვანი მოდელებისთვის. ეს სახელმძღვანელო დეტალურად აღწერს, თუ როგორ უნდა განათავსოთ N
მსჯელობის სიზუსტისა და ეფექტურობის სწრაფმა ევოლუციამ ეს მოდელები იდეალურს ხდის პერიფერიული მოწყობილობებისთვის. NVIDIA Jetson-ის ოჯახი, მაღალპროდუქტიული AGX Thor-დან და AGX Orin-დან დაწყებული კომპაქტური Orin Nano Super-ით დამთავრებული, მიზანმიმართულად არის შექმნილი ფიზიკური ხელოვნური ინტელექტისა და რობოტიკისთვის განკუთვნილი აჩქარებული აპლიკაციების გასაშვებად, რაც უზრუნველყოფს ოპტიმიზებულ შესრულების დროს, რომელიც საჭიროა წამყვანი ღია კოდის მოდელებისთვის.
ამ სახელმძღვანელოში ჩვენ ვაჩვენებთ, თუ როგორ უნდა განვათავსოთ NVIDIA Cosmos Reasoning 2B მოდელი Jetson-ის მოწყობილობებზე vLLM ფრეიმვორკის გამოყენებით. ჩვენ ასევე გიხელმძღვანელებთ ამ მოდელის Live VLM WebUI-სთან დაკავშირებაში, რაც უზრუნველყოფს რეალურ დროში, ვებკამერაზე დაფუძნებულ ინტერფეისს ინტერაქტიული ფიზიკური ხელოვნური ინტელექტისთვის.
**მხარდაჭერილი მოწყობილობები:**
**JetPack ვერსია:**
**მეხსიერება:** საჭიროა NVMe SSD
**ანგარიშები:**
**მუშაობის პროცესი ორივე მოწყობილობისთვის ერთნაირია:**
NGC CLI გაძლევთ საშუალებას ჩამოტვირთოთ მოდელის საკონტროლო წერტილები NVIDIA NGC Catalog-დან.
**თქვენ მოგეთხოვებათ:**
**ჩამოტვირთეთ FP8 კვანტიზებული საკონტროლო წერტილი. ის გამოიყენება ყველა Jetson მოწყობილობაზე:**
```bash
# Example command - replace with actual NGC CLI command
ngc registry model download-version "nvidia/cosmos_reasoning/cosmos-reasoning-2b:1208" --version v1.2.0.8
```
ეს ქმნის დირექტორიას სახელწოდებით `cosmos-reason2-2b_v1208-fp8-static-kv8/`, რომელიც შეიცავს მოდელის წონებს. ჩაინიშნეთ სრული გზა — მას Docker კონტეინერში დაამონტაჟებთ როგორც მოცულობას (volume).
**Thor**
Thor-ს აქვს საკმარისი GPU მეხსიერება და შეუძლია მოდელის გაშვება კონტექსტის გულუხვი სიგრძით.
**დააყენეთ გზა თქვენი გადმოწერილი მოდელისკენ და გაათავისუფლეთ ქეშირებული მეხსიერება ჰოსტზე:**
```bash
MODEL_PATH="/path/to/cosmos-reason2-2b_v1208-fp8-static-kv8"
sudo sh -c 'echo 3 > /proc/sys/vm/drop_caches'
```
**გაუშვით კონტეინერი დამონტაჟებული მოდელით:**
```bash
docker run -it --rm --runtime nvidia \
--network host \
--volume $MODEL_PATH:/model \
nvcr.io/nvidia/vllm:latest \
bash
```
**კონტეინერის შიგნით, გაააქტიურეთ გარემო და მოემსახურეთ მოდელს:**
```bash
vllm --model /model --dtype float8 --gpu-memory-utilization 0.90 \
--max-model-len 2048 --reasoning-parser qwen3 \
--media-io-kwargs '{"image_resolution": 512}'
```
**შენიშვნა:** `--reasoning-parser qwen3` დროშა უზრუნველყოფს აზროვნების ჯაჭვის ამოღებას. `--media-io-kwargs` დროშა აკონფიგურირებს ვიდეო კადრების დამუშავებას.
**დაელოდეთ სანამ ნახავთ:**
`Uvicorn running on http://0.0.0.0:8000 (Press CTRL+C to quit)`
**AGX Orin**
AGX Orin-ს აქვს საკმარისი მეხსიერება მოდელის გასაშვებად ისეთივე გულუხვი პარამეტრებით, როგორც Thor-ს.
**დააყენეთ გზა თქვენი გადმოწერილი მოდელისკენ და გაათავისუფლეთ ქეშირებული მეხსიერება ჰოსტზე:**
```bash
MODEL_PATH="/path/to/cosmos-reason2-2b_v1208-fp8-static-kv8"
sudo sh -c 'echo 3 > /proc/sys/vm/drop_caches'
```
**1. გაუშვით კონტეინერი:**
```bash
docker run -it --rm --runtime nvidia \
--network host \
--volume $MODEL_PATH:/model \
nvcr.io/nvidia/vllm:latest \
bash
```
**2. კონტეინერის შიგნით, გაააქტიურეთ გარემო და მოემსახურეთ:**
```bash
vllm --model /model --dtype float8 --gpu-memory-utilization 0.90 \
--max-model-len 2048 --reasoning-parser qwen3 \
--media-io-kwargs '{"image_resolution": 512}'
```
**დაელოდეთ სანამ ნახავთ:**
`Uvicorn running on http://0.0.0.0:8000 (Press CTRL+C to quit)`
**Orin Super Nano**
Orin Super Nano-ს აქვს მნიშვნელოვნად ნაკლები RAM, ამიტომ გვჭირდება მეხსიერების აგრესიული ოპტიმიზაციის დროშები.
**დააყენეთ გზა თქვენი გადმოწერილი მოდელისკენ და გაათავისუფლეთ ქეშირებული მეხსიერება ჰოსტზე:**
```bash
MODEL_PATH="/path/to/cosmos-reason2-2b_v1208-fp8-static-kv8"
sudo sh -c 'echo 3 > /proc/sys/vm/drop_caches'
```
**1. გაუშვით კონტეინერი:**
```bash
docker run -it --rm --runtime nvidia \
--network host \
--volume $MODEL_PATH:/model \
nvcr.io/nvidia/vllm:latest \
bash
```
**2. კონტეინერის შიგნით, გაააქტიურეთ გარემო და მოემსახურეთ:**
```bash
vllm --model /model --dtype float8 --gpu-memory-utilization 0.65 \
--max-model-len 512 --reasoning-parser qwen3 \
--media-io-kwargs '{"image_resolution": 256}'
```
**ძირითადი დროშების განმარტება (მხოლოდ Orin Super Nano-სთვის):**
`--gpu-memory-utilization`: GPU მეხსიერების გამოყენების შემცირება.
`--max-model-len`: კონტექსტის სიგრძის შემცირება.
`--media-io-kwargs '{"image_resolution": 256}'`: გამოსახულების გარჩევადობის შემცირება.
**დაელოდეთ სანამ სერვერი მზად იქნება:**
`Uvicorn running on http://0.0.0.0:8000 (Press CTRL+C to quit)`
**Jetson-ის სხვა ტერმინალიდან:**
```bash
curl http://localhost:8000/v1/models
```
პასუხში უნდა ნახოთ მოდელი ჩამოთვლილი.
**WebUI-ს დაკავშირებამდე, გადაამოწმეთ, რომ მოდელი სწორად რეაგირებს:**
```bash
curl -X POST -H "Content-Type: application/json" \
-d '{"prompt": "Hello, AI!", "max_tokens": 50}' \
http://localhost:8000/v1/completions
```
**რჩევა:** API მოთხოვნაში გამოყენებული მოდელის სახელი უნდა ემთხვეოდეს იმას, რასაც vLLM იუწყება. გადაამოწმეთ `curl http://localhost:8000/v1/models` ბრძანებით.
**Live VLM WebUI**
Live VLM WebUI უზრუნველყოფს რეალურ დროში ვებკამერა-VLM ინტერფეისს. vLLM-ით Cosmos Reasoning 2B-ის მომსახურებისას, შეგიძლიათ თქვენი ვებკამერის სტრიმინგი და ხელოვნური ინტელექტის ანალიზის მიღება მსჯელობით.
**უმარტივესი მეთოდია pip (გახსენით სხვა ტერმინალი):**
```bash
pip install live-vlm-webui
python -m live_vlm_webui --endpoint http://localhost:8000
```
**ან გამოიყენეთ Docker:**
```bash
docker run -it --rm --network host \
nvcr.io/nvidia/live-vlm-webui:latest \
python -m live_vlm_webui --endpoint http://localhost:8000
```
WebUI ახლა გადასცემს თქვენი ვებკამერის კადრებს Cosmos Reasoning 2B-ს და აჩვენებს მოდელის ანალიზს რეალურ დროში. ვინაიდან Orin მუშაობს კონტექსტის უფრო მოკლე სიგრძით, დაარეგულირეთ ეს პარამეტრები WebUI-ში:
**პრობლემა:** vLLM ითიშება CUDA-ს მეხსიერების ამოწურვის შეცდომებით.
**გამოსავალი:** სისტემის მეხსიერების გათავისუფლება გაშვებამდე:
* შეამცირეთ `--gpu-memory-utilization` (სცადეთ 0.55 ან 0.50)
* კიდევ უფრო შეამცირეთ `--max-model-len` (სცადეთ 128)
* დარწმუნდით, რომ სხვა GPU-ზე ინტენსიური პროცესები არ მუშაობს
**პრობლემა:** მოდელი არ ჩანს Live VLM WebUI-ს ჩამოსაშლელ სიაში.
**პრობლემა:** თითოეულ პასუხს ძალიან დიდი დრო სჭირდება.
**პრობლემა:** vLLM იუწყება, რომ მოდელის გზა არ არსებობს ან მისი ჩატვირთვა შეუძლებელია.
ამ სახელმძღვანელოში ჩვენ ვაჩვენეთ, თუ როგორ უნდა განვათავსოთ NVIDIA Cosmos Reasoning 2B მოდელი Jetson-ის მოწყობილობების ოჯახზე vLLM-ის გამოყენებით. Cosmos Reasoning 2B-ის აზროვნების ჯაჭვის შესაძლებლობების კომბინაცია Live VLM WebUI-ს რეალურ დროში სტრიმინგთან იდეალურს ხდის მას კომპიუტერული მხედველობის AI აპლიკაციების პროტოტიპირებისთვის და შესაფასებლად პერიფერიულ მოწყობილობებზე.
· დარეგისტრირდით ან შედით კომენტარისთვის.
თეგები:
#ხელოვნური ინტელექტი
#რობოტიკა
#nvidia
#განთავსება
#edge ai
#vllm
#სახელმძღვანელო
#jetson
#cosmos reasoning 2b
#live vlm webui
წყარო: huggingface.co
AI-ით გადამუშავებული