თუ ოდესმე გიბრძოლიათ რთულ მათემატიკურ ამოცანასთან, იცით, რამდენად სასარგებლოა ცოტა ხნით მეტი ფიქრი და ყურადღებით მუშაობა. OpenAI-ის o1 მოდელმა აჩვენა, რომ როდესაც დიდი ენობრივი მოდელები (LLM) ვარჯიშდებიან იგივეს გასაკეთებლად — მეტი გამოთვლითი რესურსის გამოყენებით დასკვნის გამოტანისას — ისინი მნიშვნელოვნად უკეთ ასრულებენ მსჯელობის ამოცანებს, როგორიცაა მათემატიკა, კოდირება და ლოგიკა. თუმცა, OpenAI-ის მსჯელობის მოდელების შექმნის რეცეპტი საგულდაგულოდ იყო დაცული საიდუმლო. ეს შეიცვალა გასულ კვირას, როდესაც DeepSeek-მა გამოუშვა DeepSeek-R1 მოდელი და მყისიერად „გატეხა ინტერნეტი“ (და საფონდო ბაზარი!). o1-ზე არანაკლებ ან უკეთესი შესრულების გარდა, DeepSeek-R1-ის გამოშვებას თან ახლდა დეტალური ტექნიკური ანგარიში, რომელშიც აღწერილი იყო მათი სავარჯიშო რეცეპტის ძირითადი ნაბიჯები. ეს რეცეპტი მოიცავდა რამდენიმე ინოვაციას, ყველაზე აღსანიშნავია წმინდა გაძლიერებითი სწავლის (reinforcement learning) გამოყენება საბაზისო ენობრივი მოდელისთვის მსჯელობის უნარის სწავლებაში ადამიანის ზედამხედველობის გარეშე. როგორც ქვემოთ მოცემულ ფიგურაზეა ნაჩვენები, მძლავრი მსჯელობის მოდელის შექმნა ახლა ძალიან მარტივია, თუ თქვენ გაქვთ წვდომა ქმედითუნარიან საბაზისო მოდელზე და მაღალი ხარისხის მონაცემთა ნარევზე: თუმცა, DeepSeek-R1-ის გამოშვება რამდენიმე კითხვას ბადებს: ამ კითხვებმა გვიბიძგა დავიწყოთ Open-R1 პროექტი — ინიციატივა, რომელიც მიზნად ისახავს DeepSeek-R1-ის მონაცემთა და სავარჯიშო პლატფორმის სისტემატურ რეკონსტრუქციას, მისი მტკიცებების ვალიდაციას და ღია მსჯელობის მოდელების საზღვრების გაფართოებას. Open-R1-ის შექმნით, ჩვენ მიზნად ვისახავთ გამჭვირვალობის უზრუნველყოფას იმის შესახებ, თუ როგორ შეუძლია გაძლიერებით სწავლას მსჯელობის გაუმჯობესება, რეპროდუცირებადი ცოდნის გაზიარებას ღია კოდის საზოგადოებასთან და საფუძვლის შექმნას მომავალი მოდელებისთვის, რათა მათ ამ ტექნიკების გამოყენება შეძლონ. ამ ბლოგპოსტში ჩვენ განვიხილავთ DeepSeek-R1-ის ძირითად ინგრედიენტებს, იმ ნაწილებს, რომელთა რეპლიკაციასაც ვგეგმავთ და იმას, თუ როგორ შეგიძლიათ წვლილი შეიტანოთ Open-R1 პროექტში. მოდით ჩავუღრმავდეთ 🚀! DeepSeek-R1 არის მსჯელობის მოდელი, რომელიც DeepSeek-V3-ის საფუძველზეა აგებული. როგორც ნებისმიერი კარგი მსჯელობის მოდელი, ის ძლიერი საბაზისო მოდელით იწყება, და DeepSeek-V3 სწორედ ასეთია. ეს 671B ექსპერტთა ნარევის (MoE) მოდელი ისეთი მძიმეწონოსნების დონეზე მუშაობს, როგორებიც არიან Sonnet 3.5 და GPT-4o. განსაკუთრებით შთამბეჭდავია მისი მომგებიანობა ვარჯიშისას — სულ რაღაც 5.5 მილიონი აშშ დოლარი — რაც განპირობებულია არქიტექტურული ცვლილებებით, როგორიცაა მრავალტოკენური პროგნოზირება (MTP), მრავალთავიანი ლატენტური ყურადღება (MLA) და უამრავი (სერიოზულად, უამრავი) აპარატურული ოპტიმიზაცია. DeepSeek-მა ასევე წარმოადგინა ორი მოდელი: DeepSeek-R1-Zero და DeepSeek-R1, თითოეული განსხვავებული სავარჯიშო მიდგომით. DeepSeek-R1-Zero-მ სრულად გამოტოვა კონტროლირებადი დაზუსტება (supervised fine-tuning) და მთლიანად გაძლიერებით სწავლას (RL) დაეყრდნო, Group Relative Policy Optimization (GRPO) მეთოდის გამოყენებით პროცესის ეფექტურობის გასაზრდელად. მოდელის სამართავად გამოყენებული იქნა მარტივი ჯილდოს სისტემა, რომელიც უკუკავშირს აწვდიდა პასუხების სიზუსტისა და სტრუქტურის მიხედვით. ამ მიდგომამ მოდელს მსჯელობის სასარგებლო უნარების განვითარებაში შეუწყო ხელი, როგორიცაა პრობლემების ნაბიჯებად დაყოფა და საკუთარი გამოსავლების შემოწმება. თუმცა, მისი პასუხები ხშირად მოკლებული იყო სიცხადეს და ძნელი იყო წასაკითხად. სწორედ აქ შემოდის DeepSeek-R1. ის დაიწყო „ცივი სტარტის“ ფაზით, დაზუსტებით მცირე რაოდენობის გულდასმით შემუშავებულ მაგალითებზე, სიცხადისა და წაკითხვადობის გასაუმჯობესებლად. ამის შემდეგ, მან გაიარა მეტი RL და დახვეწის ეტაპი, მათ შორის დაბალი ხარისხის გამოსავლების უარყოფა, როგორც ადამიანის პრეფერენციებზე დაფუძნებული, ასევე გადამოწმებადი ჯილდოს მეშვეობით, რათა შექმნილიყო მოდელი, რომელიც არა მხოლოდ კარგად მსჯელობს, არამედ აწარმოებს დახვეწილ და თანმიმდევრულ პასუხებს. ეს ყველაფერი შესანიშნავად ჟღერს, მაგრამ რა აკლია რეალურად? მოდით შევხედოთ თავსატეხის დაკარგულ ნაწილებს. DeepSeek-R1-ის გამოშვება საოცარი სიკეთეა საზოგადოებისთვის, მაგრამ მათ ყველაფერი არ გამოუშვიათ — მოდელის წონები ღიაა, თუმცა მოდელის სავარჯიშო მონაცემთა ნაკრებები და კოდი არა 😢. Open-R1-ის მიზანია ამ დაკარგული ნაწილების შექმნა, რათა მთელმა კვლევითმა და ინდუსტრიულმა საზოგადოებამ შეძლოს მსგავსი ან უკეთესი მოდელების აგება ამ რეცეპტებისა და მონაცემთა ნაკრებების გამოყენებით. და ამის ღიად გაკეთებით, საზოგადოების ყველა წევრს შეუძლია წვლილი შეიტანოს! როგორც ქვემოთ მოცემულ ფიგურაზეა ნაჩვენები, აქ არის ჩვენი შეტევის გეგმა: აღსანიშნავია, რომ ჩვენ არ გვინდა მხოლოდ მათემატიკის მონაცემთა ნაკრებებზე გაჩერება. დიდი პოტენციალია სხვა სფეროების შესწავლაში, აშკარაა კოდირება, მაგრამ ასევე სამეცნიერო სფეროები, როგორიცაა მედიცინა, სადაც მსჯელობის მოდელებს შეიძლება მნიშვნელოვანი გავლენა ჰქონდეთ. ეს ინიციატივა მხოლოდ შედეგების რეპლიკაციას არ ეხება — ის საზოგადოებისთვის ცოდნის გაზიარებას გულისხმობს. იმის დოკუმენტირებით, თუ რა მუშაობს, რა არა და რატომ, ჩვენ ვიმედოვნებთ, რომ სხვებს დავზოგავთ დროსა და გამოთვლით რესურსებს არაპროდუქტიულ გზებზე. თუ ეს საინტერესოდ ჟღერს, მოხარული ვიქნებით თქვენი დახმარებით! იქნება ეს კოდის შეტანა, Hugging Face-ზე დისკუსიებში მონაწილეობა, ჩართულობის მრავალი გზა არსებობს. მოდით, ეს ერთად ავაშენოთ! 🚀