DeepSeek R1-ის გამოშვებიდან ორი კვირა: ღია-R1 პროექტის მიღწევები და გამოწვევები
სტატია აჯამებს ღია-R1 პროექტის განვითარებას, რომელიც DeepSeek R1-ის სასწავლო კონვეიერისა და სინთეზური მონაცემების რეპლიკაციას ისახავს მიზნად. მიღწევებს შორისაა DeepSeek-ის შეფასების ქულების რეპროდუცირება და GRPO-ის ინტეგრაცია TRL-ში. პროექტი DeepSeek R1-ის ხანგრძლივი პასუხების გამო GPU მეხსიერებისა და გენერაციის ეფექტურობის გამოწვევების წინაშე დგას, თუმცა ინფერენსის ოპტიმიზაციაში მნიშვნელოვანი პროგრესია. ინიციატივამ მედიის ფართო ინტერესიც გამოიწვია.
DeepSeek R1-ის გამოშვებიდან ორი კვირა გავიდა და მხოლოდ ერთი კვირაა, რაც დავიწყეთ open-r1 პროექტი, რათა დაკარგული კომპონენტების, კერძოდ, სასწავლო კონვეიერისა და სინთეზური მონაცემების რეპლიკაცია მოვახდინოთ. ეს პოსტი აჯამებს პროექტის განახლებას, ისევე როგორც DeepSeek-R1-ის ირგვლივ არსებული საინტერესო რესურსების კრებულს. დავიწყოთ იმ პროგრესის მიმოხილვით, რომელიც Open-R1-ზე მივაღწიეთ.
Open-R1 მხოლოდ ერთი კვირის წინ დავიწყეთ და გუნდების წევრები, ისევე როგორც საზოგადოება, გაერთიანდნენ მასზე სამუშაოდ, რის შედეგადაც გვაქვს გარკვეული პროგრესი, რომლის შესახებაც შეგვიძლია მოგახსენოთ. რეპროდუქციის პირველი ნაბიჯი არის იმის გადამოწმება, შეგვიძლია თუ არა შეფასების ქულების დამთხვევა. ჩვენ შევძელით DeepSeek-ის მიერ მოხსენებული შედეგების რეპროდუცირება MATH-500 ბენჩმარკზე: ამ შეფასებების გასაშვებად საჭირო ინსტრუქციები შეგიძლიათ იხილოთ open-r1 საცავში.
ერთ-ერთი დაკვირვება, რაც გავაკეთეთ, არის DeepSeek-ის მოდელებიდან გენერირებული პასუხების უზარმაზარი ზომა, რაც მოდელის შეფასებასაც კი ართულებს. R1-ის პასუხების განაწილება აჩვენებს, რომ ისინი საშუალოდ ძალიან გრძელია, საშუალო პასუხი საშუალოდ 6,000 ტოკენის სიგრძისაა, ხოლო ზოგიერთი პასუხი 20,000 ტოკენზე მეტს შეიცავს. აღსანიშნავია, რომ საშუალო გვერდი დაახლოებით 500 სიტყვას შეიცავს და ერთი ტოკენი საშუალოდ ოდნავ ნაკლებია სიტყვაზე, რაც იმას ნიშნავს, რომ მრავალი პასუხი 10 გვერდზე მეტი სიგრძისაა. (წყარო: https://x.com/gui_penedo/status/1884953463051649052)
პასუხების სიგრძე GPRO ტრენინგს გამოწვევად აქცევს, რადგან მოგვიწევს გრძელი დასრულებების გენერირება, რაც საჭიროებს GPU მეხსიერების მნიშვნელოვან ნაწილს აქტივაციებისა და გრადიენტების შესანახად ოპტიმიზაციის ეტაპზე. ჩვენი პროგრესის საჯაროდ გასაზიარებლად, შევქმენით open-r1 შეფასების ლიდერბორდი, რათა საზოგადოებას შეეძლოს თვალყური ადევნოს ჩვენს რეპროდუქციის მცდელობებს.
Open R1-ის გამოშვების შემდეგ, GRPO (Grouped Relative Policy Optimization) ინტეგრირებული იქნა TRL-ის უახლეს ვერსიაში (0.14). ეს ინტეგრაცია საშუალებას იძლევა ნებისმიერი მოდელის წვრთნას ერთი ან მრავალი ჯილდოს ფუნქციის ან მოდელის გამოყენებით. GRPO-ის იმპლემენტაცია ინტეგრირებულია DeepSpeed ZeRO 1/2/3-თან პარალელური ტრენინგისთვის, რომელიც მასშტაბირებადია მრავალ GPU-ზე, და იყენებს vLLM-ს სწრაფი გენერაციისთვის, რაც ონლაინ ტრენინგის მეთოდებში მთავარი შეფერხებაა. ჯერ კიდევ არსებობს გარკვეული შეზღუდვები მაღალი მეხსიერების გამოყენებასთან დაკავშირებით და მიმდინარეობს მუშაობა მათ პროფილაციასა და შემცირებაზე.
R1 ანგარიშის ერთ-ერთი ყველაზე ამაღელვებელი აღმოჩენა იყო ის, რომ ძირითადი მოდელის გამოყენება შესაძლებელია სინთეზური მსჯელობის ტრასების გენერირებისთვის, ხოლო ამ მონაცემთა ნაკრებზე დახვეწილ მცირე მოდელებს მსგავსი წარმადობის გაუმჯობესება აქვთ, როგორც ძირითად მოდელს. ასე რომ, ბუნებრივია, გვსურს სინთეზური მსჯელობის მონაცემთა ნაკრების ხელახლა შექმნაც, რათა საზოგადოებამ შეძლოს მასზე სხვა მოდელების დახვეწა.
R1-ის ზომის მოდელის შემთხვევაში, მთავარი გამოწვევაა გენერაციის ეფექტურად და სწრაფად მასშტაბირება. ერთი კვირა გავატარეთ სხვადასხვა პარამეტრებისა და კონფიგურაციების ცდაში. მოდელი თავსდება ორ 8xH100 ნოდზე, ამიტომ ბუნებრივია, დავიწყეთ ექსპერიმენტები ამ პარამეტრებით და vLLM გამოვიყენეთ როგორც ინფერენს სერვერი. თუმცა, სწრაფად შევამჩნიეთ, რომ ეს კონფიგურაცია არ იყო იდეალური: გამტარუნარიანობა სუბ-ოპტიმალურია და მხოლოდ 8 პარალელური მოთხოვნის საშუალებას იძლევა, რადგან GPU KV ქეში ძალიან სწრაფად ივსება. როდესაც ქეში ივსება, ის მოთხოვნები, რომლებიც დიდ ქეშს მოიხმარენ, წყდება და თუ კონფიგურაცია იყენებს PreemptionMode.RECOMPUTE-ს, მოთხოვნები ხელახლა დაიგეგმება მოგვიანებით, როდესაც მეტი VRAM იქნება ხელმისაწვდომი.
შემდეგ გადავედით პარამეტრზე ოთხი 8xH100 ნოდით, ანუ სულ 32 GPU-ით. ეს ტოვებს საკმარის თავისუფალ VRAM-ს 32 პარალელური მოთხოვნის გასაშვებად, თითქმის არცერთი მათგანის გადაგეგმვა არ მომხდარა 100%-იანი ქეშის გამოყენების გამო. თავდაპირველად, vLLM სერვერებზე მოთხოვნებს პაკეტებად ვგზავნიდით, მაგრამ სწრაფად შევამჩნიეთ, რომ პაკეტებში არსებული შეფერხებები იწვევდა GPU-ს გამოყენების ცვლილებას, რადგან ახალი პაკეტის დამუშავება მხოლოდ წინა პაკეტის ბოლო ნიმუშის დასრულების შემდეგ დაიწყებოდა. პაკეტური ინფერენსის სტრიმინგზე გადართვამ მნიშვნელოვნად მოახდინა GPU-ს გამოყენების სტაბილიზაცია: ამას მხოლოდ vLLM სერვერებზე მოთხოვნების გამგზავნი კოდის შეცვლა დასჭირდა.
ჩვენ ვგენერირებთ საკმაოდ მუდმივი სიჩქარით, მაგრამ შესაძლოა კიდევ შევისწავლოთ, მაგალითად, არის თუ არა CPU ქეშზე გადართვა უკეთესი სტრატეგია, როდესაც გრძელი მოთხოვნები წყდება. მიმდინარე ინფერენსის კოდი შეგიძლიათ იხილოთ აქ.
open-r1-ის მიმართ ფართო ინტერესი გამოიხატა, მათ შორის მედიის მხრიდან, რის გამოც გუნდის სხვადასხვა წევრი გასულ კვირას მედიის ყურადღების ცენტრში მოექცა: სხვა ხსენებები: Washington Post, Financial Times, Fortune, The Verge, Financial Review, Tech Crunch, Die Zeit, New York Times, The Wall Street Journal, EuroNews, Barrons, Vox, Nature, SwissInfo, Handelsblatt, Business Insider, IEEE Spectrum, MIT Tech Review, LeMonde. მიუხედავად იმისა, რომ საზოგადოება ჯერ კიდევ აანალიზებს DeepSeek-R1-ის შედეგებსა და ანგარიშს, DeepSeek-მა ფართო საზოგადოების ყურადღება მიიპყრო მისი გამოშვებიდან სულ რაღაც ორ კვირაში. გამოშვებიდან შედარებით მშვიდი პირველი კვირის შემდეგ,
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#gpu
#deepseek r1
#ინფერენსი
#გენერაციული მოდელები
#grpo
#vllm
#ტრენინგი
#open-r1
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი