"OlympicCoder": ხელოვნური ინტელექტის ახალი მოდელები კონკურენტულ პროგრამირებაში გიგანტებს აჭარბებენ
მკვლევრებმა შეიმუშავეს ხელოვნური ინტელექტის მოდელების ახალი ნაკრები, სახელწოდებით „OlympicCoder“, რომელიც სპეციალურად კონკურენტული პროგრამირებისთვის არის შექმნილი. CodeForces-ისა და IOI-ის მორგებულ მონაცემთა ბაზებზე გაწვრთნილი OlympicCoder-32B აჩვენებს უმაღლეს დონის შესრულებას, აჯობა ბევრ მნიშვნელოვნად უფრო დიდ, ღია წყაროს მოდელს კოდის მსჯელობის ამოცანებში. ეს მიღწევა უპასუხებს არსებული მონაცემთა ბაზების შეზღუდვებს, სრულად გადამოწმებადი პრობლემური ნაკრებებისა და დეტალური გადაწყვეტილებების მიწოდე
ბოლო რამდენიმე კვირის განმავლობაში, ჩვენი ძალისხმევა მიმართული იყო DeepSeek-R1-ის რეცეპტის კონკურენტული პროგრამირების (კოდის მსჯელობის) ასპექტების რეპროდუცირებაზე. ამ პოსტში, სიხარულით წარმოგიდგენთ: აქ არის მიმოხილვა, თუ როგორ ადარებს OlympicCoder-ის მოდელები სხვადასხვა ინსტრუქციებზე დაფუძნებულ და მსჯელობის მოდელებს. ჩვენ აღმოვაჩინეთ, რომ მოდელების CodeForces-CoTs-ზე გაწვრთნა უზრუნველყოფს უმაღლესი დონის შესრულებას, OlympicCoder-32B-მა კი აჯობა ყველა ღია წყაროს მოდელს, რომელიც ჩვენ გამოვცადეთ, მათ შორის ისეთებსაც, რომლებიც 100-ჯერ უფრო დიდი ზომის არიან 🤯. წაიკითხეთ, რათა გაიგოთ, როგორ შევქმენით მონაცემთა ნაკრები, ბენჩმარკინგი და მოდელები!
**CodeForces, საერთაშორისო ოლიმპიადა ინფორმატიკაში (IOI) და OlympicCoder**
CodeForces კონკურენტული პროგრამისტებს შორის ერთ-ერთი ყველაზე პოპულარული ვებგვერდია, სადაც რეგულარულად ტარდება კონკურსები. მონაწილეებს უწევთ რთული ალგორითმული ოპტიმიზაციის ამოცანების ამოხსნა. ამ ამოცანების სირთულე მათ საინტერესო მონაცემთა ბაზად აქცევს მოდელების კოდის მსჯელობის შესაძლებლობების გასაუმჯობესებლად და შესამოწმებლად. მიუხედავად იმისა, რომ წინა მცდელობებმა, როგორიცაა DeepMind-ის CodeContests მონაცემთა ნაკრები, შეადგინა CodeForces-ის მრავალი ამოცანა, დღეს ჩვენ ვუშვებთ ჩვენს საკუთარ open-r1/codeforces მონაცემთა ნაკრებს, რომელიც მოიცავს 10 ათასზე მეტ ამოცანას პირველივე კონკურსებიდან 2025 წლამდე, რომელთაგან დაახლოებით 3 ათასი არ იყო DeepMind-ის მონაცემთა ნაკრებში. გარდა ამისა, ამოცანების დაახლოებით 60%-ისთვის ჩვენ დავამატეთ სარედაქციო განმარტება, რომელიც კონკურსის ორგანიზატორების მიერ არის დაწერილი და სწორ გადაწყვეტას ხსნის. ასევე იპოვით 3 სწორ გადაწყვეტას თითოეული ამოცანისთვის, რომელიც ამოღებულია ოფიციალური ვებგვერდიდან.
ამას გარდა, ჩვენ ვუშვებთ open-r1/codeforces-cots მონაცემთა ნაკრებს, რომელიც შეიცავს DeepSeek-R1-ის მიერ ამ ამოცანებზე შექმნილ „აზროვნების ჯაჭვის“ (chain of thought) გენერაციებს. ჩვენ მოდელს ვთხოვეთ გადაწყვეტილებების შექმნა C++-ში (კონკურენტულ პროგრამირებაში ძირითადი ენა) და Python-ში, რაც ჯამში თითქმის 100 ათას ნიმუშს შეადგენს. ჩვენ გავწვრთენით Qwen2.5 Coder Instruct 7B და 32B ამ მონაცემთა ნაკრებზე, რის შედეგადაც მივიღეთ ჩვენი OlympicCoder-7B და OlympicCoder-32B მოდელები. ამ მოდელების შესახებ მეტ დეტალს ბლოგპოსტში იპოვით.
მიუხედავად იმისა, რომ ისეთი მონაცემთა ნაკრებები, როგორიცაა DeepMind-ის კონკურსები და სხვა, რომლებიც შეიცავს კონკურენტული პროგრამირების ამოცანებს, მოიცავს სატესტო შემთხვევებს და აცხადებენ, რომ გადამოწმებადია, ეს სატესტო შემთხვევები ხშირად კონკურსის ვებგვერდებზე გამოყენებული სრული ნაკრების მცირე ქვეჯგუფია. CodeForces, კერძოდ, ზღუდავს ნაჩვენებ სატესტო შემთხვევებს ~500 სიმბოლომდე, რაც ნიშნავს, რომ ეს მონაცემთა ნაკრებები მხოლოდ მოკლე, მარტივ სატესტო შემთხვევებს შეიცავს, რომლებიც ამ ლიმიტში ჯდება. მაგალითად, ჩვენ ავიღეთ 7 ამოცანა, რომლებზეც R1-ის მიერ გენერირებულმა გადაწყვეტამ გაიარა ყველა საჯარო სატესტო შემთხვევა და ვცადეთ მათი გაგზავნა CodeForces პლატფორმაზე: მიუხედავად იმისა, რომ მათ გაიარეს მოკლე ტესტები, ამ გადაწყვეტილებებიდან თითოეული ჩავარდა სრულ სატესტო კომპლექტზე. ეს ხაზს უსვამს ახალი, სრულად გადამოწმებადი კონკურენტული პროგრამირების მონაცემთა ნაკრების საჭიროებას.
მიუხედავად იმისა, რომ ჩვენ ვგეგმავთ მოდელზე დაფუძნებული გადაწყვეტილებების გამოცდას, რათა შევქმნათ და დავამტკიცოთ დამატებითი რთული ტესტები, რომლებიც შესაძლოა მომავალში დაემატოს ჩვენს CodeForces მონაცემთა ნაკრებს, ამ დროისთვის ჩვენ სხვაგან ვეძებდით სრულად ხელმისაწვდომ პრობლემურ მონაცემებს. ინფორმატიკის საერთაშორისო ოლიმპიადა (IOI) არის ერთ-ერთი ხუთი საერთაშორისო სამეცნიერო ოლიმპიადიდან (თუ AIME-ს იცნობთ, IOI არის IMO-ს პროგრამირების ეკვივალენტი, რომელშიც AIME-ში მონაწილე საუკეთესო სტუდენტები არიან მოწვეულნი) და ამოწმებს სკოლის მოსწავლეების ძალიან შერჩეულ ჯგუფს (4 თითო ქვეყანაზე) კომპლექსურ ალგორითმულ ამოცანებში. ამოცანები უკიდურესად რთულია, ხოლო სრული სატესტო კომპლექტები ხელმისაწვდომია და გამოქვეყნებულია ნებადართული (CC-BY) ლიცენზიით. ეს ნიშნავს, რომ IOI იდეალური მონაცემთა ნაკრებია მოდელის კოდის მსჯელობის შესაძლებლობების შესამოწმებლად.
IOI-ში თითოეულ ამოცანას აქვს რამდენიმე ქვეამოცანა, თითოეულს განსხვავებული შეყვანის შეზღუდვები აქვს. ქვეამოცანის ამოსახსნელად, წარდგენამ უნდა გაიაროს ყველა მისი სატესტო შემთხვევა (მკაცრი) დროის ლიმიტებში. მიუხედავად იმისა, რომ საბოლოო ქვეამოცანა, როგორც წესი, არის „სრული ამოცანა“, ზოგიერთი ქვეამოცანა ეფექტურად აღწერს გაცილებით მარტივ (უფრო შეზღუდულ) ამოცანას და კონკურსანტები ხშირად კონკრეტულ ქვეამოცანებზე არიან ორიენტირებულნი ნაწილობრივი ქულების მისაღებად, იმის ნაცვლად, რომ უბრალოდ სრული ამოცანის ამოხსნა სცადონ (სრულყოფილი ქულები შედარებით იშვიათია). OpenAI-ის ბოლო ნაშრომის შემდეგ, სადაც o1-მა იასპარეზა IOI’2024-ზე (ბოლო იტერაცია), ჩვენ ანალოგიურად დავამუშავეთ IOI’2024-ის (ასევე წინა IOI-ების 2020 წლამდე) ყველა ამოცანა და დავყავით ისინი ქვეამოცანებად, ისე რომ თითოეული მოთხოვნა მოდელებს ერთი კონკრეტული ქვეამოცანის ამოხსნას სთხოვდა. ჩვენ ვუშვებთ დამუშავებულ ამოცანათა განცხადებებს, ასევე ყველა შეფასების/შემოწმების ფაილს, რომელიც საჭიროა მათი გასაშვებად და სატესტო შემთხვევებს open-r1/ioi-სა და open-r1/ioi-test-cases-ში. ჩვენ შევქმენით მორგებული კოდი გადაწყვეტილებების გასაშვებად (ბევრ ამოცანას რთული დაყენება აქვს, რაც მოითხოვს „მენეჯერის“ პროცესს, რომელიც ურთიერთობს რამდენიმე პროცესთან, რომლებიც ასრულებენ მომხმარებლის წარდგენას და სპეციალურ შემმოწმებლებს გადაწყვეტილებების ვალიდაციისთვის) და IOI-ის წესების მიხედვით შესაფასებლად, რაც ხელმისაწვდომია https://github.com/huggingface/ioi-ზე, და შევაფასეთ 40-ზე მეტი წამყვანი მსჯელობის მოდელი IOI’2024-ზე. IOI-ზე კონკურსანტებს აქვთ 50 წარდგენის ლიმიტი თითო ამოცანაზე. ჩვენ შევქმენით 50 წარდგენა თითოეული ქვეამოცანისთვის და შემდეგ გამოვიყენეთ შერჩევის სტრატეგია, რომელიც მსგავსია o-ის...
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#ალგორითმები
#მონაცემთა ნაკრები
#deepseek-r1
#olympiccoder
#კონკურენტული პროგრამირება
#codeforces
#ioi
#კოდის მსჯელობა
წყარო: huggingface.co
AI-ით გადამუშავებული