TRL ბიბლიოთეკა DPO-ს მხარდაჭერას იწყებს ვიზუალური ენობრივი მოდელებისთვის (VLM-ები)
უპირატესობების ოპტიმიზაცია, რომელიც ფართოდ გამოიყენება ენობრივი მოდელების დასახვეწად, ახლა ვრცელდება ვიზუალურ ენობრივ მოდელებზე (VLM-ები) TRL ბიბლიოთეკის მეშვეობით. TRL-მა დაამატა პირდაპირი უპირატესობის ოპტიმიზაციის (DPO) მხარდაჭერა VLM-ებისთვის, რაც საშუალებას იძლევა მოდელების გაწვრთნას მომხმარებლის პრეფერენციების ამსახველი მონაცემებით. სტატია დეტალურად აღწერს VLM-ების DPO-ით გაწვრთნის პროცესს, მონაცემთა ნაკრების მომზადებიდან (მაგ., `openbmb/RLAIF-V-Dataset`) და მეხსიერების ოპტიმიზაციის ტექნიკე
უპირატესობების ოპტიმიზაცია ფართოდ გამოიყენება ენობრივი მოდელების დასახვეწად, თუმცა მისი გამოყენება ასევე შესაძლებელია ვიზუალური ენობრივი მოდელებისთვის (VLM). მოხარულები ვართ გაცნობოთ, რომ TRL ბიბლიოთეკა ახლა მხარს უჭერს პირდაპირი უპირატესობის ოპტიმიზაციას (DPO) VLM-ებისთვის. ეს სტატია გაგიძღვებათ VLM-ების TRL-ისა და DPO-ს გამოყენებით გაწვრთნის პროცესში. უპირატესობების ოპტიმიზაციისთვის საჭიროა მონაცემები, რომლებიც აღბეჭდავს მომხმარებლის პრეფერენციებს. ბინარული არჩევანის კონტექსტში, თითოეული მაგალითი მოიცავს მოთხოვნას (prompt) და ორ კანდიდატ პასუხს: ერთს, რომელიც არჩეულია და ერთს, რომელიც უარყოფილია. მოდელის მიზანია ისწავლოს არჩეული პასუხის პროგნოზირება უარყოფილთან შედარებით. მაგალითად, თქვენ უნდა გქონდეთ შემდეგი ტიპის ნიმუშები: ❔ შეკითხვა: რამდენი ოჯახი? გაითვალისწინეთ, რომ არჩეული მესიჯი სულაც არ არის აუცილებლად სწორი. მაგალითად, არჩეული პასუხი, რომელიც ამბობს 18,000 ოჯახი, მაინც არასწორია, მაგრამ ის ნაკლებად არასწორია უარყოფილ პასუხთან შედარებით. ამ ბლოგპოსტისთვის გამოვიყენებთ openbmb/RLAIF-V-Dataset-ს, რომელიც მოიცავს 83,000-ზე მეტ ანოტირებულ სტრიქონს. მოდით, უფრო ახლოს დავაკვირდეთ მონაცემთა ნაკრებს: ჩვენი მოდელი საჭიროებს როგორც ტექსტს, ასევე სურათებს შეყვანის სახით, ამიტომ პირველი ნაბიჯი არის მონაცემთა ნაკრების ფორმატირება ამ მოთხოვნის შესაბამისად. მონაცემები უნდა იყოს სტრუქტურირებული ისე, რომ მოახდინოს მომხმარებელსა და ასისტენტს შორის საუბრის სიმულაცია. მომხმარებელი წარმოადგენს მოთხოვნას, რომელიც მოიცავს სურათს და შეკითხვას, ასისტენტი კი პასუხობს. აი, როგორ ხდება ეს ფორმატირება: ჩვენი მონაცემთა ნაკრები ახლა ფორმატირებულია. მოდით, გადავხედოთ პირველ მაგალითს: გაათბეთ თქვენი GPU-ები, მონაცემთა ნაკრები მზადაა წვრთნისთვის! მაგალითისთვის, ჩვენ გავწვრთნით Idefics2-8b მოდელს, მაგრამ გაითვალისწინეთ, რომ DPO-ს იმპლემენტაცია TRL-ში მხარს უჭერს სხვა მოდელებსაც, როგორიცაა Llava 1.5 და PaliGemma. დამატებითი ინფორმაცია განყოფილებაში „Llava 1.5, PaliGemma და სხვათა დახვეწა“. წვრთნის პროცესის განხილვამდე, პირველ რიგში, დავრწმუნდებით, რომ ყველაფერი შეუფერხებლად ჯდება მეხსიერებაში. მე მაქვს GPU 80GB VRAM-ით. საკმარისია თუ არა ეს ჩემი Idefics2-8b მოდელის გასაწვრთნელად? აქ მოცემულია გამოთვლის ნაბიჯები საჭირო მეხსიერების სავარაუდო შეფასების მისაღებად. დავუშვათ N არის პარამეტრების რაოდენობა, P კი სიზუსტე. შემდეგი კომპონენტები უნდა მოთავსდეს ერთად მეხსიერებაში: Idefics2-8b-ს აქვს 8 მილიარდი პარამეტრი და ჩვენ ვიყენებთ float32 სიზუსტეს, რაც მოითხოვს 4 ბაიტს თითო float-ზე. ასე რომ, მთლიანი საჭირო მეხსიერებაა: ეს ბევრად აღემატება ჩემი GPU-ს მეხსიერების მოცულობას. საბედნიეროდ, ისეთი ტექნიკების გამოყენებით, როგორიცაა კვანტიზაცია და LoRA, ჩვენ შეგვიძლია მნიშვნელოვნად შევამციროთ მეხსიერების მოთხოვნები და წვრთნა შესაძლებელი გავხადოთ. ვნახოთ, როგორ გავაკეთოთ ეს. კვანტიზაცია არის ტექნიკა, რომელიც ამცირებს მოდელის წონებისა და აქტივაციების სიზუსტეს. float32-დან bfloat16 სიზუსტეზე გადასვლა ანახევრებს შენახვის მოთხოვნას თითო პარამეტრზე 4 ბაიტიდან 2 ბაიტამდე. ეს ოპტიმიზაცია ზოგავს მეხსიერებას და ასევე აჩქარებს გამოთვლებს, უზრუნველყოფს მაღალ წარმადობას მინიმალური კომპრომისით. bfloat16 სიზუსტის მოდელში დასანერგად: bfloat16 სიზუსტის გამოყენება ასევე შესაძლებელია ოპტიმიზატორზე, `bf16=True` დაყენებით წვრთნის არგუმენტებში: LoRA არის მეთოდი, რომელიც ამცირებს სავარჯიშო პარამეტრების რაოდენობას რანგის-დეკომპოზიციის მატრიცების წყვილების სწავლით, ორიგინალური წონების გაყინულ მდგომარეობაში შენარჩუნებისას. ეს მნიშვნელოვნად ამცირებს LLM-ებისთვის შენახვის საჭიროებებს, რომლებიც ადაპტირებულია კონკრეტულ ამოცანებზე. LoRA ინტეგრირებულია PEFT-ში და მისი დაყენება შესაძლებელია უმოკლეს დროში: PEFT მოდელის ირგვლივ გარსის (ე.წ. ადაპტერის) როლს ასრულებს. ეს არის ადაპტერი, რომელიც გაიწვრთნება, ხოლო შიდა მოდელი გაყინული იქნება. რამდენად ამცირებს LoRA სავარჯიშო პარამეტრების რაოდენობას? ის ამცირებს სავარჯიშო პარამეტრების რაოდენობას 8 მილიარდიდან 55 მილიონამდე, რაც უზარმაზარი სხვაობაა და მნიშვნელოვნად შეამცირებს მეხსიერების მოთხოვნებს. ახლა, როდესაც შევამცირეთ მეხსიერების მოთხოვნები, მოდით, ხელახლა გამოვთვალოთ საჭირო მეხსიერება: ამჯერად, Idefics2-8b მოდელის დასახვეწად გვჭირდება დაახლოებით 32GB მეხსიერება, რაც გაცილებით გონივრულია და ჯდება ჩემი GPU-ს ფარგლებში! მეხსიერების გამოყენების ოპტიმიზაციის შესახებ დამატებითი ინფორმაციისთვის LoRA-სა და QLoRA-ს გამოყენებით, იხილეთ PEFT დოკუმენტაცია ან LoRA და QLoRA Google-ის რეკომენდაციები LLM-ებისთვის. ჩვენი მეხსიერების გაანგარიშება ზუსტი არ არის, რადგან ის არ ითვალისწინებს აქტივაციებს. აქტივაციები არის ქსელური ფენების შუალედური გამომავალი მონაცემები და მათი მეხსიერების მოთხოვნები დამოკიდებულია მოდელის სტრუქტურაზე და ბატჩის ზომაზე. აქტივაციებისთვის საჭირო მეხსიერების ზუსტი გაანგარიშება რთულია, ამიტომ ემპირიულ დაკვირვებებს დავეყრდნობით. წვრთნის შესაბამისი ბატჩის ზომის (per_device_train_batch_size) შესარჩევად, დაიწყეთ თქვენთვის სასურველი ბატჩის ზომით (მაგ., 64). ეს სავარაუდოდ გამოიწვევს მეხსიერების ამოწურვის (OOM) შეცდომას. თუ ასე მოხდა, შეამცირეთ ბატჩის ზომა შუაზე და გააორმაგეთ გრადიენტის დაგროვების ნაბიჯები (gradient_accumulation_steps), რათა შეინარჩუნოთ იგივე ეფექტური ბატჩის ზომა. გაიმეორეთ ეს პროცესი მანამ, სანამ მეხსიერება არ მოთავსდება თქვენს GPU-ში. ჩვენს შემთხვევაში, ვიღებთ ბატჩის ზომას 2 და გრადიენტის დაგროვების 32 ნაბიჯს. დამატებითი ოპტიმიზაციაა გრადიენტის გამშვები პუნქტების (gradient_checkpointing) გამოყენება აქტივაციებისთვის საჭირო მეხსიერების შესამცირებლად. ეს ტექნიკა მეხსიერების სანაცვლოდ გამოთვლებს იყენებს ხელახალი გამოთვლით
თეგები:
#ai
#მანქანური სწავლება
#ოპტიმიზაცია
#gpu
#ღრმა სწავლება
#vlm
#dpo
#idefics2
#lora
#კვანტიზაცია
#trl ბიბლიოთეკა
#დახვეწა
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი