Vision Language მოდელები (VLMs) მუდმივად ძლიერდება, მაგრამ მათი ადამიანის პრეფერენციებთან შესაბამისობაში მოყვანა კვლავ უმნიშვნელოვანესია. TRL-ში ჩვენ უკვე ვაჩვენეთ, თუ როგორ შეიძლება VLM-ების შემდგომი წვრთნა ზედამხედველობითი დახვეწილი კორექტირებით (SFT) და პირდაპირი პრეფერენციის ოპტიმიზაციით (DPO). ამჯერად, ჩვენ კიდევ უფრო შორს მივდივართ. მოკლედ, აი რა არის ახალი TRL-ში: ამ ინოვაციებმა სცილდება წყვილური DPO-ს ფარგლებს, ამონაცვლებს უფრო მდიდარ სიგნალებს პრეფერენციის მონაცემებიდან და უკეთესად მასშტაბირდება თანამედროვე VLM-ებთან. ჩვენ ასევე გავაფართოვეთ არსებული მეთოდები VLM-ების მხარდასაჭერად, რაც უზრუნველყოფს უფრო ეფექტურ და მასშტაბირებად მულტიმოდალურ შესაბამისობას. ტრადიციულად, საბაზისო მოდელის ინსტრუქციების შესასრულებლად გამოიყენებოდა SFT, შემდეგ კი DPO, რათა ის პრეფერენციულ მონაცემებთან შესაბამისობაში მოეყვანათ. ადრე, ჩვენ მოვარგეთ ეს მიდგომა Vision Language მოდელებს (VLM) და ვალიდირება მოვახდინეთ IDEFICS2-ზე, რამაც მოდელის პასუხების გაუმჯობესება აჩვენა. DPO მუშაობს მოდელის პასუხების წყვილებს შორის პრეფერენციების ოპტიმიზაციით, კონტრასტული დანაკარგის გამოყენებით: თქვენ გაქვთ არჩეული და უარყოფილი პასუხი და თქვენი პრეფერენციების ოპტიმიზაცია ხდება იმის მიხედვით, თუ რა გსურთ და რა არა. თუმცა, ბოლო ერთი წლის განმავლობაში პოპულარობა მოიპოვა მულტიმოდალური შესაბამისობის ახალმა მეთოდებმა, GRPO-მ და MPO-მ, რომლებსაც შეუძლიათ VLM-ის მუშაობის კიდევ უფრო გაუმჯობესება. ამ ბლოგ პოსტის ბოლოს შეგიძლიათ იპოვოთ ცხრილი, რომელიც ასახავს მოდელის პასუხებს შორის განსხვავებებს. მულტიმოდალური მოდელების SFT-ით შესაბამისობაში მოყვანა აზროვნების ამოცანების შესასრულებლად ნაკლოვანებას ავლენს განაწილების ცვლის გამო. ამასობაში, DPO-ით შესაბამისობაში მოყვანილი მოდელები ვერ ახერხებენ თანმიმდევრული დასაბუთებების გენერირებას და შესაძლოა წარმოქმნან განმეორებითი პასუხები. ამ პრობლემის მოსაგვარებლად, არსებობს ახალი ტექნიკა, სახელწოდებით შერეული პრეფერენციის ოპტიმიზაცია (MPO), რომელიც სპეციალურად მულტიმოდალური მოდელებისთვისაა შექმნილი. ეს მეთოდი არსებითად DPO-ის გაფართოებაა მრავალი დანაკარგით: პრეფერენციის დანაკარგი DPO-დან (სიგმოიდი), ხარისხის დანაკარგი ბინარული კლასიფიკატორის ოპტიმიზაციიდან (BCO) და გენერაციის დანაკარგი SFT-დან. ნაშრომის მიხედვით, მხოლოდ ამ კომბინირებულ დანაკარგზე გადასვლა იწვევს 6.2 ქულით გაუმჯობესებას MathVista-ში! ვინაიდან ეს მხოლოდ დანაკარგის მოდიფიკაციას გულისხმობს, ჩვენ დავამატეთ კომბინირებული დანაკარგის მხარდაჭერა TRL-ის DPOTrainer კლასს. მის გამოსაყენებლად საჭიროა DPOConfig-ისა და შემდეგ DPOTrainer-ის ინიციალიზაცია. დაინტერესებულ პირებს სრული ნოუთბუქის მაგალითის ნახვა შეუძლიათ მოცემულ ბმულზე. ჯგუფური შედარებითი პოლიტიკის ოპტიმიზაცია (GRPO) არის უახლესი შესაბამისობის მეთოდი, რომელიც თავდაპირველად წარმოდგენილი იყო DeepSeek Math-ის ნაშრომში და მოგვიანებით ინტეგრირებული იქნა DeepSeek R1-ში, გარდამტეხ LLM-ში. ის წარმოადგენს PPO-ის გაფართოებას, სადაც პოლიტიკის განახლებები ხორციელდება ჯგუფებზე (ტრაექტორიების პაკეტები, რომლებიც წარმოადგენს დიალოგის განვითარებას). ეს ფუნქცია მას უფრო მდგრადს ხდის ჯილდოს ხმაურის მიმართ, რადგან ხმაური ჯგუფებში საშუალო ნიშნულამდე დაიყვანება. ვინაიდან მოდელი სწავლობს კარგი პასუხის უფრო ფართო გაგებას, ვიდრე ცალკეული მაღალი ჯილდოს მქონე ნიმუშებს, ეს მეთოდი მოდელს ასევე მაღალეფექტურს ხდის. TRL-ში ახლა წარმოგიდგენთ GRPO-ის მხარდაჭერას Vision Language მოდელებისთვის. ჩვენ არ მოგაწვდით სრულ სასწავლო სკრიპტის მაგალითს, რადგან მისი ნახვა შეგიძლიათ ნოუთბუქში. ამის ნაცვლად, ყურადღებას გავამახვილებთ ძირითად კომპონენტებსა და კონცეფციებზე. იმისთვის, რომ სასწავლო სკრიპტი ეფექტურად მუშაობდეს, საჭიროა დავრწმუნდეთ, რომ პასუხის ფორმატი სწორია და თავად გადაწყვეტა დასრულებულ ნაწილებთან ახლოსაა, ამიტომ ვწერთ ორ ჯილდოს ფუნქციას. იმისთვის, რომ რეალურად დაინახოთ გაუმჯობესება ამ უკანასკნელ ჯილდოში, დაგჭირდებათ საკმაოდ მაქსიმალისტური წყობა, სადაც გექნებათ შედარებით დიდი მოდელები, ბევრი გენერაცია და მაღალი ხარისხის, მრავალფეროვანი მონაცემთა ნაკრები. შემდეგ, შეგიძლიათ GRPOConfig-ისა და GRPOTrainer-ის ინიციალიზაცია, ზემოთ განსაზღვრული ჯილდოს ფუნქციების გადაცემა და train() ფუნქციის გამოძახება წვრთნის დასაწყებად. სრული ნოუთბუქის მაგალითი ხელმისაწვდომია დაინტერესებულთათვის. ჯგუფური თანმიმდევრობის პოლიტიკის ოპტიმიზაცია (GSPO) არის RL შესაბამისობის ალგორითმი, რომელიც ცოტა ხნის წინ გამოუშვა Qwen-მა და რომელიც სძლევს GRPO-ის ზოგიერთ შეზღუდვას. ის აღწევს უფრო სტაბილურ წვრთნას მნიშვნელობის შერჩევის წონების გამოთვლით თანმიმდევრობის დონეზე, თითოეული ტოკენის ნაცვლად. მისი სარგებელი უფრო აქტუალურია MoE სტილის მოდელებში. TRL-ის უახლესი ვერსია ასევე წარმოგიდგენთ GSPO-ის მხარდაჭერას და ვინაიდან ის GRPO-ის დანაკარგის ვარიანტია, მას გააჩნია მულტიმოდალური მხარდაჭერა. ტრენერის შესაქმნელად, პროცესი იგივეა, რაც GRPO-ს შემთხვევაში, მაგრამ ემატება შემდეგი დამატებითი პარამეტრები (მნიშვნელობები ამოღებულია ნაშრომიდან). ქვემოთ მოცემულია ცხრილი, რომელიც აჯამებს Qwen2.5VL-3B მოდელის გამოსავალს, რომელიც დახვეწილია ზემოთ განხილული ტექნიკებით. გაითვალისწინეთ, რომ ჩვენ შევასრულეთ მინიმალური გაშვებები მონაცემთა ნაკრების ქვეჯგუფებზე და მოდელები დახვეწილი იყო სხვადასხვა მონაცემთა ნაკრებზე, ამიტომ შედარება შესრულებულია მხოლოდ ზოგადი შემოწმებისთვის (vibe-check). **მაგალითი:** **სურათი:** [სურათის აღწერა, მაგალითად: გეომეტრიული ფიგურა O ცენტრით, A, B, P წერტილებით] **შეკითხვა:** მოცემულ ფიგურაში, თუ APO კუთხე არის 25.0 გრადუსი, რა არის AOB კუთხის ზომა? **არჩევანი:** A: 140° B: 130° C: 120° D: 110° **პასუხი მონაცემთა ნაკრებიდან:** AOB კუთხის ზომის საპოვნელად, შეგვიძლია გამოვიყენოთ თვისება, რომ ოთხკუთხედის შიდა კუთხეების ჯამი 360 გრადუსის ტოლია. ამ თვისების გამოყენებით, შეგვიძლია გამოვთვალოთ AOB კუთხე, როგორც 360 - OAP კუთხე - OBP კუთხე - P კუთხე. რადგან OAP კუთხე და OBP კუთხე ორივე 90 გრადუსია, ხოლო P კუთხე მოცემულია 50 გრადუსად, შეგვიძლია ეს მნიშვნელობები ჩავსვათ განტოლებაში, რათა მივიღოთ AOB კუთხე = 360 - 90 - 90 - 50 = 130 გრადუსი. აქედან გამომდინარე, AOB კუთხის ზომა 130 გრადუსია.