GaLore: გარღვევა ხელოვნური ინტელექტის მოდელების ვარჯიშში სამომხმარებლო GPU-ებზე
GaLore-ის ინოვაციური შესაძლებლობა, ავარჯიშოს 7 მილიარდ პარამეტრამდე ხელოვნური ინტელექტის მოდელები, როგორიცაა Llama არქიტექტურაზე დაფუძნებული მოდელები, სამომხმარებლო GPU-ებზე (მაგალითად, NVIDIA RTX 4090), წარმოადგენს მნიშვნელოვან გარღვევას. ეს მიიღწევა ოპტიმიზატორის მდგომარეობებისა და გრადიენტებისთვის საჭირო მეხსიერების მოთხოვნების მკვეთრი შემცირებით, დაბალი რანგის პროექციისა და 8-ბიტიანი სიზუსტის ოპტიმიზატორების კომბინაციით, რაც დიდ მოდელებს უფრო ხელმისაწვდომს ხდის ფართო მომხმარებლისთვის და ზღვა
Flux.1-Dev მოდელის ინფერენციის ოპტიმიზაცია LoRA-ს გამოყენებით: 2.3x-მდე სიჩქარის ზრდა
ეს პოსტი დეტალურად განიხილავს Flux.1-Dev ტექსტიდან გამოსახულების გენერაციის მოდელის ინფერენციის სიჩქარის ოპტიმიზაციას, განსაკუთრებით LoRA-ების გამოყენებისას. შემოთავაზებულია "ცხელი გაცვლის" (hotswapping) ტექნიკა ხელახალი კომპილაციის თავიდან ასაცილებლად, FP8 კვანტიზაციის უპირატესობები, და სტრატეგიები სამომხმარებლო GPU-ებისთვის, როგორიცაა RTX 4090, CPU-ზე გადმოტვირთვით და T5 ტექსტური ენკოდერის კვანტიზაციით, რაც უზრუნველყოფს 2.3-ჯერადი სიჩქარის ზრდას.