Deepseek R1-ის 'აჰა მომენტი' და მისი ხელახლა შექმნა GRPO-სა და Countdown თამაშის მეშვეობით
Deepseek R1-ის გამოშვებამ ინდუსტრია შეძრა, რადგან ის არის ღია მოდელი, რომელიც OpenAI-ის o1-ს ეჯიბრება კომპლექსური მსჯელობის ამოცანებში. მოდელი გამოირჩევა „აჰა მომენტით“ – თვითვერიფიკაციის უნარით ადამიანური ჩარევის გარეშე. ეს ბლოგ პოსტი მიზნად ისახავს ამ უნიკალური ქცევის ხელახლა შექმნას Group Relative Policy Optimization (GRPO) და Countdown თამაშის გამოყენებით, დისტრიბუციულ ტრენინგზე ფოკუსირებით Deepspeed-ისა და vLLM-ის მეშვეობით.
Deepseek R1-ის გამოშვებამ ინდუსტრია შეძრა. რატომ? DeepSeek-R1 არის ღია მოდელი, რომელიც ეჯიბრება OpenAI-ის o1-ს კომპლექსური მსჯელობის ამოცანებში. ის წარმოდგენილია Group Relative Policy Optimization (GRPO) და RL-ზე ორიენტირებული მრავალსაფეხურიანი ტრენინგის მიდგომის გამოყენებით. მათ არა მხოლოდ მოდელი, არამედ კვლევითი ნაშრომიც გამოაქვეყნეს მისი შექმნის მეთოდოლოგიაზე. ნაშრომში აღწერილია "აჰა მომენტი", რომელიც მათ განიცადეს მოდელის წმინდა RL-ის გამოყენებით ვარჯიშისას. ამ ფაზაში, DeepSeek-R1-Zero (DeepSeek-R1-ის პირველი ტესტი) სწავლობს მეტი დროის დათმობას პრობლემის გადაჭრისთვის, საწყისი მიდგომის ხელახალი შეფასებით, ყოველგვარი ადამიანური უკუკავშირის ან მონაცემების გარეშე, რომლებიც აღწერს, თუ როგორ უნდა გაკეთდეს ეს. ისინი ამას "აჰა მომენტად" აღწერენ: „ეს ქცევა არა მხოლოდ მოდელის მზარდი მსჯელობის უნარების დასტურია, არამედ მომხიბვლელი მაგალითია იმისა, თუ როგორ შეიძლება გაძლიერებით სწავლებამ (reinforcement learning) მოულოდნელ და დახვეწილ შედეგებამდე მიგვიყვანოს.“
ამ ბლოგ პოსტში გვსურს ხელახლა შევქმნათ DeepSeek-R1-ის მცირე "აჰა მომენტი" Group Relative Policy Optimization (GRPO) და Countdown თამაშის გამოყენებით. ჩვენ მოვამზადებთ ღია მოდელს გაძლიერებით სწავლების გამოყენებით, ვეცდებით ვასწავლოთ მას თვითვერიფიკაცია და ძიების უნარები დამოუკიდებლად, რათა გადაჭრას Countdown თამაში. Countdown თამაში არის რიცხვების თავსატეხი, სადაც მოთამაშეები იყენებენ შემთხვევით ამორჩეული რიცხვების ნაკრებს და ძირითად არითმეტიკულ ოპერაციებს (+, -, ×, ÷) სამიზნე რიცხვამდე მისასვლელად ან მასთან მაქსიმალურად მიახლოებისთვის. ბლოგ პოსტი ფოკუსირებულია დისტრიბუციულ ტრენინგზე Deepspeed-ისა და vLLM-ის გამოყენებით. ის გაშვებული იყო 4x NVIDIA H100 GPU-ზე.
შენიშვნა: ეს ბლოგი შთაგონებულია Jiayi Pan-ის ნაშრომით, რომელმაც თავდაპირველად გამოიკვლია ეს იდეა და დაამტკიცა ის პატარა მოდელით. მაგრამ სანამ დავიწყებთ, მოდით გადავხედოთ Group Relative Policy Optimization (GRPO)-ს და გავიგოთ, როგორ მუშაობს ის. Group Relative Policy Optimization (GRPO) არის გაძლიერებით სწავლების ალგორითმი LLM-ების მსჯელობის შესაძლებლობების გასაუმჯობესებლად. ის წარმოდგენილი იყო DeepSeekMath-ის ნაშრომში მათემატიკური მსჯელობის კონტექსტში. GRPO ცვლის ტრადიციულ Proximal Policy Optimization (PPO)-ს იმით, რომ გამორიცხავს მნიშვნელობის ფუნქციის (value function) მოდელის საჭიროებას. ამის ნაცვლად, ის აფასებს ბაზის ხაზებს (baselines) ჯგუფური ქულებიდან, რაც ამცირებს მეხსიერების გამოყენებას და გამოთვლით ხარჯებს. GRPO, რომელსაც ახლა Qwen-ის გუნდიც იყენებს, შეიძლება გამოყენებულ იქნას როგორც წესებზე/ბინარულზე დაფუძნებულ ჯილდოებთან (Rewards), ასევე ზოგად ჯილდოს მოდელებთან (General Reward Models) ერთად, მოდელების ეფექტურობის გასაუმჯობესებლად.
ჩვენი პირველი ნაბიჯი არის Hugging Face-ის ბიბლიოთეკების, Pytorch-ის, vllm-ის, trl-ის, transformers-ისა და datasets-ის დაყენება. თუ ჯერ არ გსმენიათ trl-ის შესახებ, არ ინერვიულოთ. ეს არის ახალი ბიბლიოთეკა transformers-ისა და datasets-ის თავზე, რომელიც აადვილებს ღია LLM-ების დახვეწას (fine-tune), RLHF-ს და გასწორებას (align). შენიშვნა: შესაძლოა დაგჭირდეთ kernel-ის გადატვირთვა განახლებული პაკეტების გამოსაყენებლად. ჩვენ გამოვიყენებთ Hugging Face Hub-ს, როგორც დისტანციურ მოდელის ვერსიონირების სერვისს. ეს ნიშნავს, რომ ტრენინგის დროს ავტომატურად ავტვირთავთ ჩვენს მოდელს, ჟურნალებს და ინფორმაციას Hub-ზე. ამისთვის საჭიროა დარეგისტრირდეთ Hugging Face-ზე. ანგარიშის შექმნის შემდეგ, ჩვენ გამოვიყენებთ huggingface_hub პაკეტიდან login util-ს ჩვენს ანგარიშში შესასვლელად და ჩვენი ტოკენის (წვდომის გასაღების) დისკზე შესანახად.
ჩვენ გამოვიყენებთ Jiayi-Pan/Countdown-Tasks-3to4 მონაცემთა ნაკრებს, რომელიც შეიცავს ნიმუშებს 3-დან 4-მდე რიცხვით და გადაწყვეტილებებით. მოდელად გამოვიყენებთ Qwen/Qwen2.5-3B-Instruct-ს, რომელიც არის 3 მილიარდი პარამეტრის ინსტრუქციებით დარეგულირებული (instruction tuned) მოდელი. ეს აადვილებს "აჰა მომენტის" დემონსტრირებას, რადგან მას უკვე შეუძლია ინსტრუქციების შესრულება. Jiayi Pan-მა შეისწავლა, რომ მოდელს უნდა ჰქონდეს გარკვეული ხარისხი მსჯელობის პროცესის სასწავლებლად, დაწყებული > 1.5 მილიარდი პარამეტრიდან. TRL მხარს უჭერს Group Relative Policy Optimization (GRPO)-ს სპეციალური GRPOTrainer-ის მეშვეობით, LLM-ების შესასწორებლად უპირატესობის მონაცემებიდან, როგორც აღწერილია DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models ნაშრომში. GRPOTrainer არის transformers ბიბლიოთეკის Trainer-ის ქვეკლასი და მხარს უჭერს ყველა იმავე ფუნქციას, მათ შორის ლოგირებას (logging), ჩექპოინტინგს (checkpointing), დისტრიბუციულ ტრენინგს და პარამეტრულად ეფექტურ დახვეწას (PEFT).
GRPOTrainer მხარს უჭერს ზოგად შედეგების ჯილდოს მოდელებს (Outcome Reward Models - ORM) და მორგებულ ჯილდოს ფუნქციებს, რომლებიც შეიძლება გამოყენებულ იქნას წესებზე დაფუძნებული ჯილდოს მოდელების (Rule-Based Reward Models) განსახორციელებლად. Deepseek R1-ის ნაშრომში მათ განახორციელეს წესებზე დაფუძნებული ჯილდოს მოდელები გენერირებული გადაწყვეტილებების სისწორის შესამოწმებლად. ჩვენს მაგალითში ჩვენ მსგავს მიდგომას გამოვიყენებთ, სადაც შევქმნით 2 ჯილდოს ფუნქციას, რომლებიც: შენიშვნა: ჩვენს მაგალითში სწორი მოიცავს განტოლებას, მაგალითად 55 + 36 - 7 - 19 . Hugging Face TRL-მა დაამატა მხარდაჭერა დისტრიბუციული ტრენინგისთვის Deepspeed-თან ერთად და vLLM-ის გამოყენება უფრო სწრაფი გენერაციისთვის. მე მოვამზადე run_r1_grpo.py სკრიპტი და receipes/grpo-qwen-2.5-3b-deepseek-r1-countdown.yaml კონფიგურაციის ფაილი ტრენინგის გასაშვებად. ეს კონფიგურაცია ტესტირებულია და ვალიდირებულია 4x H100 80GBs-იანი Node-ზე, სადაც ერთი ნაბიჯი დაახლოებით 45-60 წამი სჭირდება, რადგან შეგვიძლია გამოვიყენოთ vLLM გენერაციისთვის და DeepSpeed დისტრიბუციული ტრენინგისთვის. ამიტომ, უნდა დავრწმუნდეთ, რომ num_processes სწორად დავაყენეთ თქვენს მიერ არსებული GPU-ების რაოდენობაზე - 1, რადგან ბოლო GPU გამოყენებული იქნება vLLM-თან ერთად გენერაციისთვის. თუ
თეგები:
#ai
#openai
#llm
#deepseek r1
#hugging face
#deepspeed
#გაძლიერებითი სწავლება
#grpo
#vllm
#countdown თამაში
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი