NVIDIA-მ წარადგინა Palmyra-mini AI მოდელები გაუმჯობესებული მსჯელობის უნარებით
NVIDIA-მ გამოუშვა Palmyra-mini ხელოვნური ინტელექტის მოდელების ახალი სერია, მათ შორის 'მოაზროვნე' ვარიანტები, რომლებიც გაწვრთნილია აზროვნების ჯაჭვის (CoT) მიდგომით. ეს მოდელები მნიშვნელოვნად აუმჯობესებენ ლოგიკური აზროვნების უნარებს და ხელმისაწვდომია GGUF და MLX კვანტიზაციით. სერია მოიცავს მოდელებს, რომლებიც გამოირჩევიან რთული ამოცანების გადაჭრითა და მაღალი ქულებით სხვადასხვა ბენჩმარკებზე, რაც მათ მრავალმხრივ გადაწყვეტილებად აქცევს გენერაციული და ლოგიკური ამოცანებისთვის.
'მოაზროვნე' მოდელები გაწვრთნილია 'აზროვნების ჯაჭვის' (Chain of Thought - CoT) მიდგომით, რაც აუმჯობესებს მათ მსჯელობის უნარებს. მოუთმენლად ველით, თუ რას შექმნის საზოგადოება ამ ახალი მოდელების გამოყენებით!
თქვენი მოხერხებულობისთვის ასევე ხელმისაწვდომია GGUF და MLX კვანტიზაციები: palmyra-mini-GGUF, palmyra-mini-thinking-a-GGUF, palmyra-mini-thinking-b-GGUF, palmyra-mini-MLX-BF16, palmyra-mini-thinking-a-MLX-BF16, palmyra-mini-thinking-b-MLX-BF16.
palmyra-mini: ჩვენი გაუმჯობესებული საბაზისო მოდელი, რომელიც არ არის ორიენტირებული მსჯელობაზე, მიაღწია 52.6%-იან მაჩვენებელს Big Bench Hard-ზე (get-answer)(exact_match), რაც მას ფანტასტიკურ უნივერსალურ გადაწყვეტილებად აქცევს გენერაციული ამოცანების ფართო სპექტრისთვის.
palmyra-mini-thinking-a: ეს ვარიანტი იდეალურია რთული ლოგიკური გამოწვევებისთვის. გაწვრთნილია აზროვნების ჯაჭვის (CoT) მიდგომით, მან მიაღწია შთამბეჭდავ 82.87%-ს GSM8K-ზე (მკაცრი შესაბამისობა), რაც ადასტურებს მის მძლავრ მსჯელობის უნარებს. მას აქვს ყველაზე მაღალი საერთო საშუალო ქულა ბენჩმარკებზე, გამოშვებულ სხვა მოდელებთან შედარებით.
palmyra-mini-thinking-b: ეს მოდელი, რომელიც აფართოებს პრობლემის გადაჭრის საზღვრებს, AMC23-ზე მყარ 92.5%-ს აღწევს. ის შესანიშნავი არჩევანია, როდესაც გჭირდებათ მოდელი, რომელსაც შეუძლია 'იფიქროს' მომთხოვნ ამოცანებზე. მას აქვს ყველაზე მაღალი საშუალო ბენჩმარკების ქულები AIME24, AIME25, GPQA, HMMT25, HLE, MMLU_PRO, MATH500, LCB ბენჩმარკებზე, გამოშვებულ სხვა მოდელებთან შედარებით.
ჩვენ ვაქვეყნებთ როგორც pass@1(avg-of-1), ასევე pass@1(avg-of-64) შედეგებს.
ბენჩმარკინგის მეთოდოლოგია (სემპლირების პარამეტრები: ტემპერატურა 0.6, top_p 0.95):
Pass@1(avg-of-1) ქულები: GSM8K-დან MBPP-მდე: შეგროვებულია lm_eval ფრეიმვორკის გამოყენებით.
AIME24-დან HMMT25-მდე: შეგროვებულია lighteval ფრეიმვორკის გამოყენებით.
Pass@1(avg-of-64) ქულები: შეგროვებულია nemoskills ფრეიმვორკის გამოყენებით.
ვინაიდან ყველა საბაზისო მოდელი Qwen არქიტექტურისაა, ინფერენსი უნდა იყოს გაშვებადი პოპულარულ ინფერენსის ფრეიმვორკებზე, როგორიცაა vLLM, SGLang, TRTLLM, TGI.
palmyra-thinking-b-ისთვის საბაზისო მოდელი იყო https://huggingface.co/nvidia/OpenReasoning-Nemotron-1.5B. ჩვენ განვახორციელეთ გაძლიერებული სწავლის (RL) დაზუსტება და დავაკვირდით, რომ მას შეუძლია მუშაობის გაუმჯობესება. მიუხედავად იმისა, რომ გაძლიერებულმა სწავლამ გააუმჯობესა ერთჯერადი სიზუსტე (pass@1), მან შეამცირა სემპლირების მრავალფეროვნება, რამაც გამოიწვია majority@64-ის მუშაობის ვარდნა SFT საბაზისო მოდელთან შედარებით.
ეს ხაზს უსვამს კომპრომისს სიზუსტესა და მრავალფეროვნებას შორის, და გვჯერა, რომ ამ აღმოჩენების გამჭვირვალობა სტიმულს მისცემს შემდგომ კვლევებს რეჟიმის კოლაფსის, მცირე მოდელების მუშაობისა და სხვა სფეროებში. ამ ნაშრომით ჩვენ ვეცადეთ გაგვეფართოებინა ის საზღვრები, რისი მიღწევაც შესაძლებელია მცირე პარამეტრების მქონე მოდელებით, და მოუთმენლად ველით, თუ როგორ განაგრძობს საზოგადოება ინფერენსის ეფექტურობის გაუმჯობესებას მუშაობის ხარისხის შეწირვის გარეშე.
თეგები:
#მანქანური სწავლება
#ai მოდელები
#კვანტიზაცია
#ინფერენსი
#ბენჩმარკინგი
#აზროვნების ჯაჭვი
#გაძლიერებული სწავლა
#palmyra-mini
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი