თუ ოდესმე გქონიათ რთული მათემატიკური ამოცანის ამოხსნის პრობლემა, იცით, რამდენად სასარგებლოა ცოტა ხანს დაფიქრება და დეტალურად მუშაობა. OpenAI-ის o1 მოდელმა აჩვენა, რომ როდესაც დიდი ენობრივი მოდელები (LLM) გაწვრთნილია იგივეს გასაკეთებლად — ინფერენციის დროს მეტი გამოთვლითი რესურსის გამოყენებით — ისინი მნიშვნელოვნად უკეთესად წყვეტენ მსჯელობით ამოცანებს, როგორიცაა მათემატიკა, კოდირება და ლოგიკა. თუმცა, OpenAI-ის მსჯელობითი მოდელების შექმნის საიდუმლო რეცეპტი კარგად იყო დაცული. ასე იყო გასულ კვირამდე, სანამ DeepSeek-მა არ გამოუშვა თავისი DeepSeek-R1 მოდელი და მყისიერად არ მოიცვა ინტერნეტი (და საფონდო ბაზარი!). DeepSeek AI-მ გაასაჯაროვა DeepSeek-R1-Zero, DeepSeek-R1 და ექვსი მკვრივი მოდელი, რომლებიც DeepSeek-R1-დან არის გამოყვანილი Llama და Qwen არქიტექტურებზე დაფუძნებით. ყველა მათგანის ნახვა შეგიძლიათ DeepSeek R1 კოლექციაში. ჩვენ ვთანამშრომლობთ Amazon Web Services-თან, რათა დეველოპერებისთვის გამარტივდეს უახლესი Hugging Face მოდელების განთავსება AWS სერვისებზე უკეთესი გენერაციული AI აპლიკაციების შესაქმნელად. მოდით განვიხილოთ, როგორ შეგიძლიათ DeepSeek R1 მოდელების განთავსება და დახვეწა Hugging Face-ის დახმარებით AWS-ზე. Hugging Face Inference Endpoints გთავაზობთ მარტივ და უსაფრთხო გზას მანქანური სწავლების მოდელების გასაშვებად AWS-ზე, წარმოებაში გამოსაყენებლად გამოყოფილ გამოთვლით რესურსებზე. Inference Endpoints საშუალებას აძლევს დეველოპერებსა და მონაცემთა მეცნიერებს შექმნან AI აპლიკაციები ინფრასტრუქტურის მართვის გარეშე: განთავსების პროცესი გამარტივებულია რამდენიმე დაწკაპუნებამდე, მათ შორის მოთხოვნების დიდი მოცულობის დამუშავება ავტომატური სკალირებით (autoscaling), ინფრასტრუქტურის ხარჯების შემცირება scale-to-zero ფუნქციით და მოწინავე უსაფრთხოების შეთავაზება. Inference Endpoints-ის საშუალებით შეგიძლიათ განათავსოთ DeepSeek-R1-დან გამოყვანილი 6 დისტილირებული მოდელიდან ნებისმიერი, ასევე Unsloth-ის მიერ შექმნილი DeepSeek R1-ის კვანტიზირებული ვერსია: https://huggingface.co/unsloth/DeepSeek-R1-GGUF. მოდელის გვერდზე დააჭირეთ „Deploy“-ს, შემდეგ „HF Inference Endpoints“-ს. თქვენ გადამისამართდებით Inference Endpoint გვერდზე, სადაც ჩვენ თქვენთვის შერჩეული გვაქვს ოპტიმიზებული ინფერენციის კონტეინერი და რეკომენდებული აპარატურა მოდელის გასაშვებად. თქვენი endpoint-ის შექმნის შემდეგ, შეგიძლიათ გაგზავნოთ თქვენი მოთხოვნები DeepSeek R1-ზე 8.3$ საათში AWS-ის საშუალებით 🤯. DeepSeek R1 და დისტილირებული მოდელები, ისევე როგორც სხვა პოპულარული ღია LLM-ები, მზად არიან განთავსებისთვის ოპტიმიზებულ კონფიგურაციებზე Inference Endpoints Model Catalog-ში. | შენიშვნა: გუნდი მუშაობს DeepSeek მოდელების Inferentia ინსტანციებზე განთავსების შესაძლებლობაზე. თვალყური ადევნეთ სიახლეებს! შეგიძლიათ DeepSeek-ის დისტილირებული მოდელები განათავსოთ Amazon Bedrock-ზე მარკეტფლეისის საშუალებით, რაც ფარულად განათავსებს endpoint-ს Amazon SageMaker AI-ში. აქ არის ვიდეო, თუ როგორ შეგიძლიათ ნავიგაცია AWS კონსოლში: | შენიშვნა: გუნდი მუშაობს DeepSeek-R1-ის განთავსებაზე Amazon SageMaker AI-ზე Hugging Face LLM DLC-ების გამოყენებით GPU-ზე. თვალყური ადევნეთ სიახლეებს! შეგიძლიათ DeepSeek-ის დისტილირებული მოდელები განათავსოთ Amazon SageMaker AI-ზე Hugging Face LLM DLC-ების გამოყენებით უშუალოდ Jumpstart-ის ან Python SageMaker SDK-ის მეშვეობით. აქ არის ვიდეო, თუ როგორ შეგიძლიათ ნავიგაცია AWS კონსოლში: ახლა, როცა ვნახეთ, თუ როგორ უნდა განვახორციელოთ განთავსება Jumpstart-ის გამოყენებით, განვიხილოთ DeepSeek-R1-Distill-Llama-70B-ის განთავსება Python SageMaker SDK-ის მეშვეობით. კოდის ფრაგმენტები ხელმისაწვდომია მოდელის გვერდზე „Deploy“ ღილაკის ქვეშ! მანამდე, დავიწყოთ რამდენიმე წინაპირობით. დარწმუნდით, რომ გაქვთ კონფიგურირებული SageMaker Domain, საკმარისი კვოტა SageMaker-ში და JupyterLab სივრცე. DeepSeek-R1-Distill-Llama-70B-ისთვის, თქვენ უნდა გაზარდოთ ml.g6.48xlarge-ის ნაგულისხმევი კვოტა endpoint-ის გამოყენებისთვის 1-მდე. საცნობაროდ, აქ მოცემულია აპარატურის კონფიგურაციები, რომელთა გამოყენებასაც გირჩევთ თითოეული დისტილირებული ვარიანტისთვის: ნოუთბუქში შესვლის შემდეგ, დარწმუნდით, რომ დაინსტალირებულია SageMaker SDK-ის უახლესი ვერსია. შემდეგ, შექმენით `sagemaker_session` ობიექტი, რომელიც გამოიყენება მიმდინარე რეგიონისა და შესრულების როლის დასადგენად. შექმენით SageMaker Model ობიექტი Python SDK-ის საშუალებით: განათავსეთ მოდელი SageMaker endpoint-ზე და შეამოწმეთ endpoint: სულ ესაა, თქვენ განათავსეთ Llama 70B-ის მსჯელობითი მოდელი! ვინაიდან ფარულად იყენებთ TGI v3 კონტეინერს, მოცემული აპარატურისთვის ყველაზე ეფექტური პარამეტრები ავტომატურად შეირჩევა. დარწმუნდით, რომ წაშალეთ endpoint ტესტირების დასრულების შემდეგ. მოდით განვიხილოთ DeepSeek-R1-Distill-Llama-70B-ის განთავსება Neuron ინსტანციაზე, როგორიცაა AWS Trainium 2 და AWS Inferentia 2. კოდის ფრაგმენტები ხელმისაწვდომია მოდელის გვერდზე „Deploy“ ღილაკის ქვეშ! Neuron ინსტანციაზე განთავსების წინაპირობები იგივეა. დარწმუნდით, რომ გაქვთ კონფიგურირებული SageMaker Domain, საკმარისი კვოტა SageMaker-ში და JupyterLab სივრცე. DeepSeek-R1-Distill-Llama-70B-ისთვის, თქვენ უნდა გაზარდოთ ml.inf2.48xlarge-ის ნაგულისხმევი კვოტა endpoint-ის გამოყენებისთვის 1-მდე. შემდეგ, შექმენით `sagemaker_session` ობიექტი, რომელიც გამოიყენება მიმდინარე რეგიონისა და შესრულების როლის დასადგენად. შექმენით SageMaker Model ობიექტი Python SDK-ის საშუალებით: განათავსეთ მოდელი SageMaker endpoint-ზე და შეამოწმეთ endpoint: სულ ესაა, თქვენ განათავსეთ Llama 70B-ის მსჯელობითი მოდელი Neuron ინსტანციაზე! ფარულად, მან გადმოწერა წინასწარ კომპილირებული მოდელი Hugging Face-დან, რათა დაეჩქარებინა endpoint-ის გაშვების დრო. დარწმუნდით, რომ წაშალეთ endpoint ტესტირების დასრულების შემდეგ. ეს სახელმძღვანელო დეტალურად აღწერს, თუ როგორ უნდა მოხდეს ექსპორტი...