ამ კვირაში DeepSeek-ის ახალი მოდელი ჩუმად გამოჩნდა Hub-ზე. ეს არის DeepSeek-V3-ის განახლებული ვერსია, საბაზისო მოდელი, რომელიც R1 მსჯელობის მოდელს უდევს საფუძვლად. ამ ახალი მოდელის შესახებ ჯერ ბევრი ინფორმაცია არ არის ხელმისაწვდომი, მაგრამ რამდენიმე რამ ვიცით! მოდელს აქვს იგივე არქიტექტურა, რაც ორიგინალ DeepSeek-V3-ს და ახლა უკვე მოყვება MIT ლიცენზია, მაშინ როცა წინა V3 მოდელს ჰქონდა საბაჟო მოდელის ლიცენზია. ამ მოდელის გამოშვების მთავარი მიზანი იყო ინსტრუქციების შესრულების, ასევე კოდირებისა და მათემატიკური შესაძლებლობების გაუმჯობესება. მოდით, გადავხედოთ! DeepSeek-ის გუნდმა მოდელი შეაფასა მრავალი მათემატიკური და კოდირების ამოცანაზე და ჩვენ შეგვიძლია ვიხილოთ მოდელის ძლიერი შესაძლებლობები სხვა წამყვან მოდელებთან შედარებით: აშკარაა, რომ მოდელი უმაღლეს ლიგაში თამაშობს: ხშირად GPT-4.5-ის დონეზეა და ზოგადად უფრო ძლიერია, ვიდრე Claude-Sonnet-3.7. შეჯამებისთვის, მოდელმა მნიშვნელოვანი გაუმჯობესება განიცადა ბენჩმარკებში. კონკრეტულად, მოდელის ბარათში DeepSeek-ი აღნიშნავს მიზანმიმართულ გაუმჯობესებებს შემდეგ სფეროებში: მაშ, შეიძლება გაჩნდეს კითხვა: როგორ გააკეთეს ეს სინამდვილეში? მოდით, ცოტა ვივარაუდოთ! დასახელებისა და არქიტექტურის გათვალისწინებით, საკმაოდ უსაფრთხოა ვივარაუდოთ, რომ ახალი მოდელი დაფუძნებულია წინა V3 მოდელზე და მასზეა დამატებით გაწვრთნილი. არსებობს ორი შესაძლო სფერო, თუ როგორ გააუმჯობესეს მათ მოდელები: სანამ გუნდი არ გამოაქვეყნებს ტექნიკურ ანგარიშს, ზუსტად არ ვიცით, რა ცვლილებები შეიტანეს, მაგრამ პოსტ-ტრეინინგის პროცესი საკმაოდ სავარაუდოა და შესაძლოა, დაემატა ცოტა პრე-ტრეინინგიც. ახლა კი ვნახოთ, როგორ გამოვიყენოთ მოდელები! შეგიძლიათ გამოიყენოთ Hugging Face-ის Inference Providers ამ მოდელთან სწრაფი ექსპერიმენტებისთვის. ის ხელმისაწვდომია Fireworks-ის, Hyperbolic-ისა და Novita-ს მეშვეობით. აქ მოცემულია მაგალითი `huggingface_hub` ბიბლიოთეკის გამოყენებით. ასევე შეგიძლიათ გამოიყენოთ OpenAI-ის კლიენტის ბიბლიოთეკა, როგორც ამ მაგალითშია. TGI ასევე უზრუნველყოფს DeepSeek V3-0324-ის გაშვებას უახლესი გამოშვებით. შეგიძლიათ გამოიყენოთ იგი პირდაპირ ტეგირებული Docker გამოსახულებით H100-ების კვანძზე. SGLang მხარს უჭერს DeepSeek V3-0324-ის გაშვებას ყუთიდანვე, Multi Latent Attention-ისა და Data Parallelism ოპტიმიზაციებთან ერთად. გამოსაყენებლად, შეგიძლიათ უბრალოდ გაუშვათ შემდეგი H100-ების კვანძზე. დამატებითი ინფორმაციისთვის მიჰყევით აქ. **დინამიური კვანტიზაცია Unsloth-დან და Llama.cpp-დან** დიდი LLM-ების, როგორიცაა DeepSeek V3-0324, გაშვება შეიძლება იყოს საკმაოდ გამოთვლაზე ინტენსიური და დასჭირდება დიდი რაოდენობით GPU VRAM. სწორედ აქ შემოდის კვანტიზაცია; ის მომხმარებელს საშუალებას აძლევს გამოიყენოს იგივე მოდელი, მაგრამ გაცილებით დაბალი VRAM მოხმარებით, მცირე კომპრომისით შემდგომ მუშაობაში. Unsloth AI-მ შექმნა დინამიური კვანტიზაციები, რომლებიც საშუალებას აძლევს DeepSeek V3-ის გაშვებას H100-ის ერთი კვანძის გამოთვლითი სიმძლავრის ნახევარზე და შეუძლია Llama.cpp-ით გაშვება ბენჩმარკებში დიდი დეგრადაციის გარეშე. მეტი წაიკითხეთ აქ: https://huggingface.co/unsloth/DeepSeek-V3-0324-GGUF **ენის მოდელების უსაფრთხო გაშვება** ენის მოდელის უსაფრთხოდ გაშვება ყოველთვის ყურადღების ცენტრში იყო, პირველი GPT მოდელების გამოშვების შემდეგ. DeepSeek მოდელების უზარმაზარი პოპულარობითა და მათი წარმოშობით, ამ კითხვამ ახალი ინტერესი შეიძინა. მოდით, განვიხილოთ ის საკითხები, რომლებიც უსაფრთხოა და ის სფეროები, სადაც სიფრთხილეა საჭირო. ეს არ არის DeepSeek-ისთვის დამახასიათებელი, არამედ ყველა ღია მოდელისთვის მართებულია! პირველ რიგში – უსაფრთხოა თუ არა საერთოდ მოდელის ჩამოტვირთვა? დიახ, მოდელის ჩამოტვირთვა უსაფრთხოა. Hub-ის მხარეს არის რამდენიმე სიფრთხილის ზომა, რომელიც უზრუნველყოფს მოდელების უსაფრთხო ჩამოტვირთვასა და გაშვებას: მაშასადამე, წონების ჩამოტვირთვა უსაფრთხოა, ისევე როგორც მოდელირების კოდის შესრულება კოდის გადახედვის შემდეგ. ეს ნიშნავს, რომ DeepSeek მოდელის გაშვება შეგიძლიათ ლოკალურად უკანა კარიბჭეების ან მავნე კოდის შესრულების რისკის გარეშე. მაშ, რა იქნება ძირითადი რისკები მოდელის ჩამოტვირთვისა და გაშვების გარდა? ეს დამოკიდებულია იმაზე, თუ რას გააკეთებთ მოდელის გამოსავალთან! შემდეგი რჩევა არ არის კონკრეტული რომელიმე მოდელისთვის და ვრცელდება როგორც ღია, ასევე დახურულ მოდელებზე: იქნება ეს რისკები, რომლებიც მოდელში ჩაშენებული საიდუმლო ქცევებიდან მომდინარეობს, თუ მოდელის მიერ შემთხვევით ცუდი გამოსავლების წარმოქმნიდან. ჩვენ განვიხილავთ რისკებს სამ სფეროში: შეწყობა (alignment), კოდის გენერაცია და აგენტები. * **შეწყობის შეუსაბამობა (Alignment mismatch):** ყველა მოდელის პროვაიდერი ირჩევს, როგორ და რა ღირებულებებთან არის შეწყობილი მათი მოდელები. თუ რა არის ეს ღირებულებები და როგორ ირჩევა, როგორც წესი, გაუმჭვირვალე რჩება და ისინი შეიძლება დროთა განმავლობაში შეიცვალოს კიდეც (იხილეთ ეს კვლევა). ღია მოდელების უპირატესობა ის არის, რომ შეწყობა შეიძლება შეიცვალოს საბაჟო დაზუსტებული ტრეინინგით მოგვიანებით ეტაპზე, როგორც Perplexity-ის DeepSeek 1776-ის მაგალითი გვიჩვენებს. როგორც წესი, მომხმარებლებმა უნდა იცოდნენ, რომ ნებისმიერი LLM არის მიკერძოებული ამა თუ იმ გზით და შესაბამისად უნდა მოექცნენ მოდელის გამოსავლებს. * **კოდის გენერაცია:** LLM-ების ერთ-ერთი ყველაზე პოპულარული გამოყენების შემთხვევა არის კოდირების ასისტენტები. თუმცა, სწორედ აქ შეიძლება ჰქონდეს მოდელის გამოსავლის განურჩეველ გამოყენებას ყველაზე უარყოფითი ეფექტები. მოდელები გაწვრთნილია გამოქვეყნებული კოდის უზარმაზარ რაოდენობაზე, ახალსა თუ ძველზე. ეს, როგორც წესი, მოიცავს პოტენციურად მავნე კოდს ან კოდს, რომელიც შეიცავს ცნობილ მოწყვლადობებს. ამიტომ მოდელებმა შეიძლება წარმოქმნან მსგავსი მოწყვლადობები კოდის გადაწყვეტილებების შეთავაზებისას. მაშ, როგორ შეგიძლიათ თავიდან აიცილოთ უსაფრთხოების პრობლემები LLM-ების გამოყენებისას კოდის შემუშავებისთვის? საჭიროა საფუძვლიანი შემოწმება და ტესტირება.