Open R1 პროექტი წარმოგიდგენთ OpenR1-Math-220k: მათემატიკური მსჯელობის ახალ, მასშტაბურ მონაცემთა ნაკრებს
Open R1 პროექტი, რომლის მიზანია DeepSeek R1-ის ტრენინგის პროცესებისა და სინთეზური მონაცემების აღდგენა, სიამოვნებით აცხადებს OpenR1-Math-220k-ის შექმნას – მათემატიკური მსჯელობისთვის განკუთვნილი პირველი ფართომასშტაბიანი მონაცემთა ნაკრები. ეს პოსტი დეტალურად აღწერს მის შექმნის პროცესს, მათ შორის 512 H100 გრაფიკული პროცესორის გამოყენებას გენერაციისთვის და ხარისხის უზრუნველსაყოფად წესებზე დაფუძნებული (Math Verify) და დიდი ენობრივი მოდელებზე დაფუძნებული (Llama-3.3-70B-Instruct) ვალიდაციის მეთოდების კო
Open R1 პროექტის დაწყებიდან ორი კვირა გავიდა. პროექტი მიზნად ისახავს DeepSeek R1-ის დაკარგული კომპონენტების — კერძოდ, ტრენინგის პროცესებისა და სინთეზური მონაცემების — აღდგენას. ამ პოსტში სიამოვნებით გაგიზიარებთ OpenR1-Math-220k-ის შექმნის ამბავს: ეს არის ჩვენი პირველი ფართომასშტაბიანი მონაცემთა ნაკრები მათემატიკური მსჯელობისთვის! ასევე, განვიხილავთ საზოგადოების ზოგიერთ საინტერესო მიღწევას მცირე, მაღალი ხარისხის მონაცემთა ნაკრებების კურატორულად შეგროვებაში ზუსტი დარეგულირებისთვის (fine-tuning), და მივიღებთ ინფორმაციას, თუ როგორ გავაკონტროლოთ მსჯელობის მოდელების „აზროვნების ჯაჭვის“ (chain-of-thought) სიგრძე როგორც ტრენინგის, ისე ინფერენციის დროს. მოდით, დავიწყოთ!
DeepSeek R1-ის ერთ-ერთი მთავარი უპირატესობა არის მისი უნარი, მოწინავე მსჯელობის შესაძლებლობები გადასცეს მცირე მოდელებს ცოდნის დისტილაციის (distillation) გზით. DeepSeek-ის გუნდმა ეს აჩვენა 600 ათასი მსჯელობის კვალის გენერირებით და Qwen და Llama მოდელების სერიის ზუსტი დარეგულირებით, რამაც დაამტკიცა, რომ R1-დან პირდაპირ დისტილაციას შეუძლია კონკურენტუნარიანი მსჯელობის შესრულების მიღწევა გაძლიერებითი სწავლების (reinforcement learning) გარეშე. აღსანიშნავია, რომ DeepSeek-R1-Distill-Qwen-7B-მა AIME 2024-ზე 55.5% შედეგი აჩვენა, რითაც აჯობა უფრო დიდ მოდელებს, როგორიცაა QwQ-32B-Preview. თუმცა, დისტილაციისთვის გამოყენებული მსჯელობის კვალი საჯაროდ არ გამოქვეყნებულა, რამაც საზოგადოებას უბიძგა დამოუკიდებლად შეექმნა მსგავსი მონაცემთა ნაკრებები. ამ დროისთვის, საზოგადოების მიერ გამოქვეყნებულია მრავალი ღია მონაცემთა ნაკრები, მათ შორის OpenThoughts-114k, Bespoke-Stratos-17k, Dolphin-R1 და LIMO. 🐳
წარმოგიდგენთ OpenR1-Math-220k-ს, ფართომასშტაბიან მათემატიკური მსჯელობის მონაცემთა ნაკრებს, რომელიც ლოკალურად გენერირდა 512 H100 გრაფიკულ პროცესორზე, თითოეულ ამოცანაზე მრავალი პასუხით. OpenR1-Math-220k-ის შესაქმნელად, ჩვენ ვითანამშრომლეთ Numina-სთან, რომელმაც შეიმუშავა მათი პოპულარული NuminaMath-CoT მონაცემთა ნაკრების სრულიად ახალი ვერსია. რა არის ახალი OpenR1 მონაცემთა ნაკრებში არსებულ ნაკრებებთან შედარებით: მასშტაბური, მაღალი ხარისხის მსჯელობის მონაცემების გენერირების დემონსტრირებით, ვიმედოვნებთ, რომ ეს პროცესი შეიძლება გაფართოვდეს მათემატიკის მიღმა ისეთ სფეროებში, როგორიცაა კოდის გენერაცია.
OpenR1-220k-ის შესაქმნელად, ჩვენ DeepSeek R1-ს მივეცით დავალება, რომ გენერირებინა ამოხსნები NuminaMath 1.5-დან 400 ათასი ამოცანისთვის. ჩვენ მივყვებით მოდელის ბარათის რეკომენდებულ პარამეტრებს და მომხმარებლის მოთხოვნას ვუძღვით შემდეგ ინსტრუქციას: „გთხოვთ, იმსჯელოთ ეტაპობრივად და თქვენი საბოლოო პასუხი ჩასვათ \boxed{} ნიშნულების ფარგლებში.“ ჩვენ დავაყენეთ 16k ტოკენის ლიმიტი თითოეულ გენერაციაზე, რადგან ჩვენმა ანალიზმა აჩვენა, რომ ამოცანების მხოლოდ 75% შეიძლებოდა 8k ტოკენზე ნაკლებში ამოიხსნას, ხოლო დარჩენილი ამოცანების უმეტესობას სრული 16k ტოკენი დასჭირდა.
თავდაპირველად, ჩვენ ვიყენებდით vLLM-ს ინფერენციისთვის, მივაღწიეთ 15 გენერაციას საათში თითო H100-ზე, და ჩვენი გენერაციის სკრიპტები გაზიარებული გვაქვს წინა განახლებებში და OpenR1 რეპოზიტორიუმში. ცოტა ხნის წინ, ჩვენ დავიწყეთ SGLang-თან ექსპერიმენტები და შევძელით 25 ამოხსნის გენერირება საათში თითო H100-ზე (თითქმის 2-ჯერ გაზრდილი სიჩქარე!), რამაც მოგვცა საშუალება, გენერირებინა 300 ათასი ამოცანის ამოხსნა დღეში 512 H100-ზე. ამან საშუალება მოგვცა, სულ რამდენიმე დღეში 800 ათასი მსჯელობის კვალი შეგვექმნა. ჩვენ ვგენერირებთ ორ ამოხსნას თითო ამოცანაზე — ზოგიერთ შემთხვევაში კი ოთხს — რათა უზრუნველვყოთ მოქნილობა ფილტრაციისა და ტრენინგის დროს. ეს მიდგომა იძლევა უარყოფითი შერჩევის (rejection sampling) შესაძლებლობას, DeepSeek R1-ის მეთოდოლოგიის მსგავსად, და ასევე ხდის მონაცემთა ნაკრებს შესაფერისს უპირატესობის ოპტიმიზაციის მეთოდებისთვის, როგორიცაა DPO. მონაცემთა გენერაციის სკრიპტები ხელმისაწვდომია აქ: https://github.com/huggingface/open-r1/tree/main/slurm გაუფილტრავი მონაცემთა ნაკრები ხელმისაწვდომია აქ: https://huggingface.co/datasets/open-r1/OpenR1-Math-Raw
მხოლოდ მაღალი ხარისხის, სწორი მსჯელობის კვალის შესანარჩუნებლად, ჩვენ ვიყენებთ Math Verify-ს, მათემატიკური გამოსახულებების შეფასების მძლავრ სისტემას, რომელიც შექმნილია LLM-ის მიერ გენერირებული პასუხების შესაფასებლად. ჩვენ ვამოწმებთ მოდელის მიერ გენერირებული პასუხების საბოლოო ვერსიებს და ვადარებთ მათ მონაცემთა ნაკრებში არსებულ რეალურ პასუხებს. აღმოჩნდა, რომ ამოცანების 55%-ს აქვს მინიმუმ ერთი სწორი პასუხი. თუმცა, NuminaMath 1.5-ის ზოგიერთი რეალური პასუხი ცარიელი იყო ან არ იყო გადამოწმებად ფორმატში, რაც ართულებდა ავტომატურ ვალიდაციას. მიუხედავად იმისა, რომ ჩვენ გავაუმჯობესეთ Math-Verify ამ არატიპიური გამომავალი ფორმატების უფრო ზუსტად დასამუშავებლად (იხილეთ Math-Verify-ის გაუმჯობესებები ქვემოთ), ჩვენ ასევე შევისწავლეთ ალტერნატიული მეთოდი უარყოფილი ნიმუშებიდან სწორი ამოხსნების აღსადგენად: Llama-3.3-70B-Instruct-ის გამოყენება მსაჯულად უარყოფილი ამოცანების ქვეჯგუფიზე. ამ ვერიფიკაციის ნაბიჯის გაშვებამდე, ჩვენ ვფილტრავთ არასრულ ან ცარიელი რეალური პასუხის მქონე ნიმუშებს, რათა უზრუნველვყოთ, რომ მხოლოდ სწორად ჩამოყალიბებული პასუხები მკაფიოდ შეფუთული საბოლოო პასუხით იყოს განხილული. ამ პროცესმა წარმატებით დაიბრუნა 28,000 ადრე უარყოფილი ამოცანა. Llama3.3-70B-Instruct-ს შემდეგნაირად ვკითხავთ:
წესებზე დაფუძნებული ვერიფიკაციის (Math Verify) და LLM-ზე დაფუძნებული შეფასების კომბინაციით, ჩვენ ვაუმჯობესებთ მონაცემთა ნაკრების ხარისხს, მასშტაბის შენარჩუნებით. საბოლოო მონაცემთა ნაკრები შედგება 220 ათასი ამოცანისგან ვერიფიცირებული მსჯელობის კვალით, რაც მას ღირებულ რესურსად აქცევს მსჯელობის მოდელების ტრენინგისთვის. თითოეულ ამოცანაზე მრავალი ამოხსნის მიწოდება საზოგადოებას აძლევს მოქნილობას, შეარჩიოს უკეთესი გენერაციები და გამოიყენოს უფრო მიზანმიმართული გაუმჯობესებები NuminaMath მონაცემთა წყაროებისა და ამოცანების ტიპების საფუძველზე. მონაცემთა ნაკრები ხელმისაწვდომია ორ ნაწილად: იმ სტრიქონებისთვის, რომლებსაც მრავალი სწორი პასუხი აქვთ, ჩვენ ასევე ვცადეთ Reward Model (RM) გამოყენება, როგორც საბოლოო ფილტრი საუკეთესოს შესარჩევად.
თეგები:
#ხელოვნური ინტელექტი
#llm
#მანქანური სწავლება
#deepseek r1
#მონაცემთა ნაკრები
#ფაინ-ტიუნინგი
#h100
#open r1
#მათემატიკური მსჯელობა
#numinamath
#openr1-math-220k
#დისტილაცია
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი