AI ინფრასტრუქტურის ფარული ხარჯი: მეხსიერების გაზრდილი როლი და სირთულე
AI ინფრასტრუქტურის ხარჯებზე საუბრისას ძირითადად Nvidia-სა და GPU-ებზეა ფოკუსირება, თუმცა მეხსიერება სულ უფრო მნიშვნელოვანი ნაწილი ხდება. DRAM ჩიპების ფასი ბოლო წელს დაახლოებით 7-ჯერ გაიზარდა. მეხსიერების ეფექტური მართვა გადამწყვეტია AI მოდელებისთვის, რადგან ის საშუალებას აძლევს კომპანიებს, შეამცირონ ტოკენების გამოყენება და ოპერაციული ხარჯები. ის, ვინც ამ სფეროს დაეუფლება, მნიშვნელოვან უპირატესობას მოიპოვებს.
ხელოვნური ინტელექტის ვიდეო გენერაციის მოდელები: მიმდინარე მდგომარეობა და ოპტიმიზაციის გზები
ღია კოდის პროექტებში ვიდეოს გენერაციის მოდელების სწრაფი განვითარება შეინიშნება, რამაც შეიძლება გამოიწვიოს „Stable Diffusion მომენტის“ განმეორება ვიდეო საზოგადოებაში. ეს სტატია მიმოიხილავს ვიდეოს გენერაციის მოდელების მიმდინარე მდგომარეობას, მათ შეზღუდვებს (კერძოდ, მოძრაობის ხარისხს, თანმიმდევრულობასა და კონსისტენტურობას დროის განმავლობაში) და არქიტექტურულ თავისებურებებს, როგორიცაა 3D ვიდეო ტოკენების დამუშავება. ყურადღება ექცევა Diffusers-ის გუნდის მიერ შემოთავაზებულ მეხსიერების ოპტიმიზაციის ტექნი
უსაფრთხოების გაუმჯობესება: Git ავტორიზაცია Hugging Face-ზე გადადის ტოკენებსა და SSH კლავიშებზე
Hugging Face-ის მომხმარებლებმა Git ოპერაციებისთვის პაროლის ნაცვლად უნდა გამოიყენონ პირადი წვდომის ტოკენები ან SSH კლავიშები 2023 წლის 1 ოქტომბრამდე. ეს ცვლილება მიზნად ისახავს პლატფორმის უსაფრთხოების მნიშვნელოვნად გაუმჯობესებას.
LLM შეფასების კრიტიკული ხარვეზები DROP ბენჩმარკში: ნორმალიზაციისა და „გაჩერების ტოკენების“ პრობლემა
Open LLM Leaderboard-ზე DROP ბენჩმარკის დამატების შემდეგ, მოდელების f1-ქულებმა მოულოდნელად დაბალი შედეგები აჩვენა. გამოკვლევამ გამოავლინა ორი ძირითადი პრობლემა: არასწორი ნორმალიზაცია, რომელიც უგულებელყოფდა რიცხვით პასუხებს არასტანდარტული სიცარიელის სიმბოლოების გამო, და წერტილის (.) „გაჩერების ტოკენად“ გამოყენება. ამ ხარვეზების აღმოფხვრა, მათ შორის \n სიმბოლოზე დაყოფა, მნიშვნელოვნად აუმჯობესებს ქულების კორელაციას საერთო შესრულებასთან. თუმცა, სრული ხელახალი შეფასება ძვირი და შრომატევადია, რაც მიუთ
დიდი ენობრივი მოდელების ოპტიმიზაცია: ინფერენციის ფაზების გამოწვევები
კომპანია TNG-ი დიდი ენობრივი მოდელების (LLM) თვით-ჰოსტინგის გამოცდილებას გვიზიარებს, სადაც 24 H100 GPU-ს კლასტერი საათში 5000-ზე მეტ ინფერენციას ამუშავებს. სტატიაში დეტალურად არის განხილული ტოკენების გენერაციის ავტორეგრესიული ბუნება, KV ქეშის როლი და განსხვავება 'პრეფილის' (პირველი ტოკენის გენერაცია) და 'დეკოდირების' (შემდგომი ტოკენების გენერაცია) ფაზებს შორის. განმარტებულია, თუ როგორ მოქმედებს ეს ფაზები შეყოვნებაზე (latency) და გამტარუნარიანობაზე (throughput), და როგორ გამოიყენება GPU რესურსები
BLOOM ინფერენსის ოპტიმიზაცია GPU-ებზე: წარმადობის ბენჩმარკინგი
ეს სტატია განიხილავს BLOOM ხელოვნური ინტელექტის მოდელის ინფერენსის ოპტიმიზაციას სხვადასხვა GPU კონფიგურაციებზე. მოცემულია აპარატურული მოთხოვნები 352GB bf16 წონებისთვის, სადაც რეკომენდებულია 8x80GB A100 GPU-ები, თუმცა განიხილება ალტერნატივებიც. სტატია აანალიზებს მოდელის ჩატვირთვის დროს და ტოკენების გენერირების წარმადობას (throughput) ისეთი გადაწყვეტების გამოყენებით, როგორიცაა Deepspeed-Inference და Accelerate, ასევე 8-ბიტიანი კვანტიზაცია მეხსიერების შესამცირებლად. ბენჩმარკინგის შედეგები აჩვენებს
უსაფრთხოების ინციდენტი Hugging Face-ის Spaces პლატფორმაზე: არაავტორიზებული წვდომა გამოვლინდა
Hugging Face-მა გამოავლინა არაავტორიზებული წვდომა Spaces პლატფორმაზე, რამაც შესაძლოა კომპრომეტირება მოახდინა Spaces-ის საიდუმლოებების ნაწილს. საწყისი ნაბიჯები მოიცავს HF ტოკენების გაუქმებას და მომხმარებლებისთვის გასაღებების განახლებასა და წვრილმარცვლოვანი წვდომის ტოკენებზე გადასვლის რეკომენდაციას. მიმდინარეობს გამოძიება კიბერუსაფრთხოების სპეციალისტებთან ერთად და განხორციელდა უსაფრთხოების მნიშვნელოვანი გაუმჯობესებები ინფრასტრუქტურაში.
Google-ის გაფრთხილება: მარკდაუნი [Markdown] AI ქროლერებისთვის – კარგი იდეაა თუ „სულელური“?
Google Search Advocate ჯონ მიულერი [John Mueller] მკაცრად ეწინააღმდეგება იდეას, რომ ხელოვნური ინტელექტის (AI) დიდი ენობრივი მოდელების ქროლერებს [LLM crawlers] Markdown ფაილები მიეწოდოთ HTML-ის ნაცვლად. მიულერის აზრით, ეს მიდგომა, რომელიც ტოკენების მოხმარების შემცირებას ისახავს მიზნად, სერიოზულ ტექნიკურ და სტრუქტურულ პრობლემებს შექმნის საძიებო სისტემებისთვის.