'მოაზროვნე' მოდელები გაწვრთნილია 'აზროვნების ჯაჭვის' (Chain of Thought - CoT) მიდგომით, რაც აუმჯობესებს მათ მსჯელობის უნარებს. მოუთმენლად ველით, თუ რას შექმნის საზოგადოება ამ ახალი მოდელების გამოყენებით! თქვენი მოხერხებულობისთვის ასევე ხელმისაწვდომია GGUF და MLX კვანტიზაციები: palmyra-mini-GGUF, palmyra-mini-thinking-a-GGUF, palmyra-mini-thinking-b-GGUF, palmyra-mini-MLX-BF16, palmyra-mini-thinking-a-MLX-BF16, palmyra-mini-thinking-b-MLX-BF16. palmyra-mini: ჩვენი გაუმჯობესებული საბაზისო მოდელი, რომელიც არ არის ორიენტირებული მსჯელობაზე, მიაღწია 52.6%-იან მაჩვენებელს Big Bench Hard-ზე (get-answer)(exact_match), რაც მას ფანტასტიკურ უნივერსალურ გადაწყვეტილებად აქცევს გენერაციული ამოცანების ფართო სპექტრისთვის. palmyra-mini-thinking-a: ეს ვარიანტი იდეალურია რთული ლოგიკური გამოწვევებისთვის. გაწვრთნილია აზროვნების ჯაჭვის (CoT) მიდგომით, მან მიაღწია შთამბეჭდავ 82.87%-ს GSM8K-ზე (მკაცრი შესაბამისობა), რაც ადასტურებს მის მძლავრ მსჯელობის უნარებს. მას აქვს ყველაზე მაღალი საერთო საშუალო ქულა ბენჩმარკებზე, გამოშვებულ სხვა მოდელებთან შედარებით. palmyra-mini-thinking-b: ეს მოდელი, რომელიც აფართოებს პრობლემის გადაჭრის საზღვრებს, AMC23-ზე მყარ 92.5%-ს აღწევს. ის შესანიშნავი არჩევანია, როდესაც გჭირდებათ მოდელი, რომელსაც შეუძლია 'იფიქროს' მომთხოვნ ამოცანებზე. მას აქვს ყველაზე მაღალი საშუალო ბენჩმარკების ქულები AIME24, AIME25, GPQA, HMMT25, HLE, MMLU_PRO, MATH500, LCB ბენჩმარკებზე, გამოშვებულ სხვა მოდელებთან შედარებით. ჩვენ ვაქვეყნებთ როგორც pass@1(avg-of-1), ასევე pass@1(avg-of-64) შედეგებს. ბენჩმარკინგის მეთოდოლოგია (სემპლირების პარამეტრები: ტემპერატურა 0.6, top_p 0.95): Pass@1(avg-of-1) ქულები: GSM8K-დან MBPP-მდე: შეგროვებულია lm_eval ფრეიმვორკის გამოყენებით. AIME24-დან HMMT25-მდე: შეგროვებულია lighteval ფრეიმვორკის გამოყენებით. Pass@1(avg-of-64) ქულები: შეგროვებულია nemoskills ფრეიმვორკის გამოყენებით. ვინაიდან ყველა საბაზისო მოდელი Qwen არქიტექტურისაა, ინფერენსი უნდა იყოს გაშვებადი პოპულარულ ინფერენსის ფრეიმვორკებზე, როგორიცაა vLLM, SGLang, TRTLLM, TGI. palmyra-thinking-b-ისთვის საბაზისო მოდელი იყო https://huggingface.co/nvidia/OpenReasoning-Nemotron-1.5B. ჩვენ განვახორციელეთ გაძლიერებული სწავლის (RL) დაზუსტება და დავაკვირდით, რომ მას შეუძლია მუშაობის გაუმჯობესება. მიუხედავად იმისა, რომ გაძლიერებულმა სწავლამ გააუმჯობესა ერთჯერადი სიზუსტე (pass@1), მან შეამცირა სემპლირების მრავალფეროვნება, რამაც გამოიწვია majority@64-ის მუშაობის ვარდნა SFT საბაზისო მოდელთან შედარებით. ეს ხაზს უსვამს კომპრომისს სიზუსტესა და მრავალფეროვნებას შორის, და გვჯერა, რომ ამ აღმოჩენების გამჭვირვალობა სტიმულს მისცემს შემდგომ კვლევებს რეჟიმის კოლაფსის, მცირე მოდელების მუშაობისა და სხვა სფეროებში. ამ ნაშრომით ჩვენ ვეცადეთ გაგვეფართოებინა ის საზღვრები, რისი მიღწევაც შესაძლებელია მცირე პარამეტრების მქონე მოდელებით, და მოუთმენლად ველით, თუ როგორ განაგრძობს საზოგადოება ინფერენსის ეფექტურობის გაუმჯობესებას მუშაობის ხარისხის შეწირვის გარეშე.