თუკი ოდესმე გქონიათ რთულ მათემატიკურ ამოცანასთან ჭიდილი, გეცოდინებათ, რამდენად სასარგებლოა, თუკი მასზე ცოტა ხანს დაფიქრდებით და გულდასმით იმუშავებთ. OpenAI-ის o1 მოდელმა აჩვენა, რომ როდესაც დიდი ენობრივი მოდელები (LLMs) იგივეს გასაკეთებლად არიან გაწვრთნილი — დასკვნის გამოტანისას მეტი გამოთვლითი რესურსის გამოყენებით — ისინი მნიშვნელოვნად უმჯობესდებიან ისეთი მსჯელობის ამოცანების გადაჭრაში, როგორიცაა მათემატიკა, კოდირება და ლოგიკა. თუმცა, OpenAI-ის მსჯელობის მოდელების მიღმა არსებული „რეცეპტი“ კარგად შენახული საიდუმლო იყო. ეს ასე იყო გასულ კვირამდე, სანამ DeepSeek-მა არ გამოუშვა თავისი DeepSeek-R1 მოდელი, რამაც მყისიერად „ააფეთქა“ ინტერნეტი (და საფონდო ბაზარი!). o1-ზე არანაკლებ ან უკეთესი მუშაობის გარდა, DeepSeek-R1-ის გამოშვებას თან ახლდა დეტალური ტექნიკური ანგარიში, რომელიც აღწერდა მათი წვრთნის „რეცეპტის“ ძირითად ნაბიჯებს. ეს „რეცეპტი“ მოიცავდა რამდენიმე ინოვაციას, მათ შორის ყველაზე აღსანიშნავია წმინდა გაძლიერებული სწავლების გამოყენება, რათა საბაზისო ენობრივი მოდელისთვის ესწავლებინათ მსჯელობა ადამიანის ყოველგვარი ზედამხედველობის გარეშე. მძლავრი მსჯელობის მოდელის შექმნა, როგორც აღმოჩნდა, ახლა ძალიან მარტივია, თუკი გაქვთ წვდომა ქმედუნარიან საბაზისო მოდელთან და მაღალი ხარისხის მონაცემთა ნაზავთან. თუმცა, DeepSeek-R1-ის გამოშვება რამდენიმე კითხვას ბადებს. ამ კითხვებმა გვიბიძგა, დაგვეწყო Open-R1 პროექტი — ინიციატივა, რომელიც მიზნად ისახავს DeepSeek-R1-ის მონაცემთა და წვრთნის მეთოდოლოგიის სისტემატურ რეკონსტრუქციას, მისი პრეტენზიების გადამოწმებას და ღია მსჯელობის მოდელების საზღვრების გაფართოებას. Open-R1-ის შექმნით, ჩვენ მიზნად ვისახავთ გამჭვირვალობის უზრუნველყოფას იმის შესახებ, თუ როგორ შეუძლია გაძლიერებულ სწავლებას მსჯელობის გაუმჯობესება, ხელახლა გამეორებადი შეხედულებების გაზიარებას ღია წყაროს საზოგადოებისთვის და მომავალი მოდელებისთვის საფუძვლის შექმნას, რათა მათაც გამოიყენონ ეს ტექნიკა. ამ ბლოგპოსტში განვიხილავთ DeepSeek-R1-ის ძირითად კომპონენტებს, იმ ნაწილებს, რომელთა რეპლიკაციასაც ვგეგმავთ და იმას, თუ როგორ შეგიძლიათ წვლილი შეიტანოთ Open-R1 პროექტში. მოდით, ჩავუღრმავდეთ! 🚀 DeepSeek-R1 არის მსჯელობის მოდელი, რომელიც DeepSeek-V3-ის საფუძველზეა შექმნილი. როგორც ნებისმიერი კარგი მსჯელობის მოდელი, ის ძლიერი საბაზისო მოდელით იწყება და DeepSeek-V3 ზუსტად ასეთია. ეს 671 მილიარდი პარამეტრის ექსპერტთა ნაზავის (MoE) მოდელი ისეთი გიგანტების თანაბრად მუშაობს, როგორებიც არიან Sonnet 3.5 და GPT-4o. განსაკუთრებით შთამბეჭდავია მისი წვრთნის ხარჯთეფექტურობა — სულ რაღაც 5.5 მილიონი დოლარი — რაც განპირობებულია არქიტექტურული ცვლილებებით, როგორიცაა მრავალტოკენის პროგნოზირება (MTP), მრავალთავიანი ლატენტური ყურადღება (MLA) და მრავალი (მართლაც, მრავალი) აპარატურული ოპტიმიზაცია. DeepSeek-მა ასევე წარმოადგინა ორი მოდელი: DeepSeek-R1-Zero და DeepSeek-R1, თითოეული განსხვავებული წვრთნის მიდგომით. DeepSeek-R1-Zero-მ სრულად გამოტოვა ზედამხედველობითი დახვეწა და მთლიანად გაძლიერებულ სწავლებაზე (RL) დაეყრდნო, Group Relative Policy Optimization (GRPO) მეთოდის გამოყენებით პროცესის გასაუმჯობესებლად. მოდელის სამართავად გამოყენებული იქნა მარტივი ჯილდოს სისტემა, რომელიც უკუკავშირს აწვდიდა მისი პასუხების სიზუსტისა და სტრუქტურის მიხედვით. ამ მიდგომამ მოდელს სასარგებლო მსჯელობის უნარების განვითარებაში შეუწყო ხელი, როგორიცაა პრობლემების ეტაპებად დაყოფა და საკუთარი გამონატანი შედეგების გადამოწმება. თუმცა, მისი პასუხები ხშირად მოკლებული იყო სიცხადეს და ძნელი წასაკითხი იყო. სწორედ აქ ერთვება DeepSeek-R1. ის დაიწყო „ცივი სტარტის“ ფაზით, რომლის ფარგლებშიც მოდელი დახვეწილი იქნა მცირე რაოდენობის ზედმიწევნით შემუშავებულ მაგალითებზე, სიცხადისა და წაკითხვადობის გასაუმჯობესებლად. ამის შემდეგ, მან გაიარა მეტი გაძლიერებული სწავლებისა და დახვეწის ეტაპები, მათ შორის დაბალი ხარისხის შედეგების უარყოფა, როგორც ადამიანის პრეფერენციებზე დაფუძნებული, ასევე გადამოწმებადი ჯილდოს მეშვეობით, რათა შექმნილიყო მოდელი, რომელიც არა მხოლოდ კარგად მსჯელობს, არამედ გამართულ და თანმიმდევრულ პასუხებსაც იძლევა. ეს ყველაფერი შესანიშნავად ჟღერს, მაგრამ რა აკლია სინამდვილეში? მოდით, გადავხედოთ თავსატეხის დაკარგულ ნაწილებს. DeepSeek-R1-ის გამოშვება საზოგადოებისთვის საოცარი სიკეთეა, მაგრამ მათ ყველაფერი არ გაასაჯაროვეს — მოდელის წონები ღიაა, თუმცა მოდელის წვრთნისთვის გამოყენებული მონაცემთა ნაკრებები და კოდი — არა 😢. Open-R1-ის მიზანია ამ ბოლო დაკარგული ნაწილების შექმნა, რათა მთელმა კვლევითმა და სამრეწველო საზოგადოებამ შეძლოს მსგავსი ან უკეთესი მოდელების აგება ამ „რეცეპტებისა“ და მონაცემთა ნაკრებების გამოყენებით. და ამის ღიად გაკეთებით, საზოგადოების ყველა წევრს შეუძლია წვლილის შეტანა! წარმოგიდგენთ ჩვენს სამოქმედო გეგმას: გაითვალისწინეთ, რომ არ გვინდა მხოლოდ მათემატიკის მონაცემთა ნაკრებებით შემოვიფარგლოთ. დიდი პოტენციალია სხვა სფეროების შესწავლაში, აშკარაა კოდირება, მაგრამ ასევე სამეცნიერო სფეროები, როგორიცაა მედიცინა, სადაც მსჯელობის მოდელებს შეიძლება მნიშვნელოვანი გავლენა ჰქონდეთ. ეს ინიციატივა არ არის მხოლოდ შედეგების რეპლიკაციაზე — ის საზოგადოებასთან ცოდნის გაზიარებაზეა. იმის დოკუმენტირებით, თუ რა მუშაობს, რა — არა და რატომ, ვიმედოვნებთ, რომ სხვებს დავზოგავთ დროისა და გამოთვლითი რესურსების ფლანგვისგან არაპროდუქტიულ გზებზე. თუ ეს საინტერესოდ ჟღერს, სიამოვნებით მივიღებთ თქვენს დახმარებას! იქნება ეს კოდის შეტანა, Hugging Face-ზე დისკუსიებში მონაწილეობა, ჩართულობის მრავალი გზა არსებობს. მოდით, ეს ერთად ავაშენოთ! 🚀