TRL ბიბლიოთეკა DPO-ს მხარდაჭერას იწყებს ვიზუალური ენობრივი მოდელებისთვის (VLM-ები)
უპირატესობების ოპტიმიზაცია, რომელიც ფართოდ გამოიყენება ენობრივი მოდელების დასახვეწად, ახლა ვრცელდება ვიზუალურ ენობრივ მოდელებზე (VLM-ები) TRL ბიბლიოთეკის მეშვეობით. TRL-მა დაამატა პირდაპირი უპირატესობის ოპტიმიზაციის (DPO) მხარდაჭერა VLM-ებისთვის, რაც საშუალებას იძლევა მოდელების გაწვრთნას მომხმარებლის პრეფერენციების ამსახველი მონაცემებით. სტატია დეტალურად აღწერს VLM-ების DPO-ით გაწვრთნის პროცესს, მონაცემთა ნაკრების მომზადებიდან (მაგ., `openbmb/RLAIF-V-Dataset`) და მეხსიერების ოპტიმიზაციის ტექნიკე
როგორ ვავარჯიშოთ ვიზუალურ-ენობრივი მოდელები (VLMs) TRL-ისა და DPO-ს გამოყენებით
უპირატესობის ოპტიმიზაცია ფართოდ გამოიყენება ენობრივი მოდელების დაზუსტებისთვის, თუმცა მისი გამოყენება შესაძლებელია ვიზუალურ-ენობრივი მოდელებისთვისაც (VLM). TRL ბიბლიოთეკა ახლა უკვე პირდაპირი უპირატესობის ოპტიმიზაციას (DPO) უჭერს მხარს VLMs-ისთვის. ეს სტატია დაწვრილებით განგიმარტავთ VLMs-ის წვრთნის პროცესს TRL-ისა და DPO-ს გამოყენებით, მონაცემთა მომზადებიდან დაწყებული მეხსიერების ოპტიმიზაციის ტექნიკების ჩათვლით.