ბოლო წლებში არაბულმა დიდმა ენობრივმა მოდელებმა (LLM) მნიშვნელოვან პროგრესს მიაღწიეს, თუმცა არსებული ბენჩმარკები არასაკმარისია მაღალღირებულ ტექნიკურ სფეროებში მათი შესაძლებლობების შესაფასებლად. დღემდე ჩატარებული შეფასებების უმეტესობა ფოკუსირებული იყო ზოგად ამოცანებზე, როგორიცაა შეჯამება, სენტიმენტების ანალიზი ან ზოგადი კითხვა-პასუხი. მიუხედავად ამისა, სამეცნიერო მსჯელობა და პროგრამირება გადამწყვეტია რეალური სამყაროს მრავალი გამოყენებისთვის, განათლებიდან დაწყებული ტექნიკური პრობლემების გადაჭრამდე. ამ ხარვეზის აღმოსაფხვრელად, ჩვენ წარმოგიდგენთ 3LM (علم)-ს, მრავალკომპონენტიან ბენჩმარკს, რომელიც მორგებულია არაბული LLM-ების შესაფასებლად STEM (მეცნიერება, ტექნოლოგია, ინჟინერია და მათემატიკა) საგნებსა და კოდის გენერაციაში. 3LM არის პირველი ასეთი სახის ბენჩმარკი, რომელიც სპეციალურად შექმნილია არაბული მოდელების სტრუქტურულ მსჯელობასა და ფორმალურ ლოგიკაში შესამოწმებლად – სფეროებში, რომლებიც ტრადიციულად ნაკლებად იყო წარმოდგენილი არაბულ NLP-ში. 3LM შედგება სამი მონაცემთა ნაკრებისგან, რომელთაგან თითოეული შეფასების კონკრეტულ მიმართულებას ეხება: რეალურ სამყაროში არსებული მრავალპასუხიანი STEM კითხვები (MCQ), სინთეზური მაღალი სირთულის STEM კითხვები და ნათარგმნი კოდის გენერაციის ამოცანები. „მშობლიური STEM“ ბენჩმარკი მოიცავს 865 მრავალპასუხიან კითხვას (MCQ), რომლებიც მოპოვებულია ნამდვილი არაბული საგანმანათლებლო კონტენტიდან, მათ შორის სახელმძღვანელოებიდან, სამუშაო ფურცლებიდან და საგამოცდო ბანკებიდან მე-8-დან მე-12 კლასების ჩათვლით. კითხვები მოიცავს ხუთ ძირითად საგანს: ფიზიკა, ქიმია, ბიოლოგია, მათემატიკა და გეოგრაფია. თითოეული კითხვა ანოტირებულია მეტამონაცემებით, მათ შორის დომენითა და სირთულით (1-დან 10-მდე მასშტაბით). მონაცემები მოპოვებულ იქნა საპროცესო ხაზის გამოყენებით, რომელიც აერთიანებდა OCR-ს (მათ შორის LaTeX მათემატიკის გარჩევას Pix2Tex-ის საშუალებით), LLM-ის დახმარებით კითხვა-პასუხის ამოღებას და სახელმძღვანელო შემოწმებას. ეს მონაცემთა ნაკრები უზრუნველყოფს რეალისტურ სატესტო გარემოს არაბული მოდელების ფაქტობრივი და კონცეპტუალური გაგების შესაფასებლად რეალური საგანმანათლებლო მასალების გამოყენებით. უფრო მეტი გამოწვევისა და მრავალფეროვნების შესატანად, ჩვენ შევქმენით 1,744 სინთეზური MCQ-ის ქვეჯგუფი YourBench საპროცესო ხაზის გამოყენებით. ეს კომპონენტი იყენებს არაბული სახელმძღვანელოების ტექსტებს, რომლებიც იყოფა ნაწილებად, რეზიუმირდება და გამოიყენება LLM-ზე დაფუძნებული კითხვების გენერაციის სისტემის შეყვანად. შედეგი არის კითხვების შერჩეული ნაკრები, რომელიც ფოკუსირებულია საშუალო და მაღალი სირთულის მსჯელობაზე, მათ შორის კონცეპტუალურ, ანალიტიკურ და გამოყენებაზე დაფუძნებულ პრობლემებზე. „სინთეზური STEM“ წარმოადგენს მნიშვნელოვან საპირწონეს მშობლიური MCQ-ებისთვის, რადგან ის ამოწმებს მსჯელობის უფრო ღრმა უნარებს და ამცირებს პასუხის მიკერძოებას. ყველა გენერირებულმა კითხვამ გაიარა ფილტრაცია სიცხადის, სტრუქტურისა და შინაარსის ვალიდურობის საფუძველზე, რასაც მოჰყვა ხარისხის უზრუნველყოფა სახელმძღვანელო შემოწმების გზით. 3LM-ის მესამე კომპონენტი მიზნად ისახავს კოდის გენერაციას, რაც LLM შეფასების მზარდი სფეროა. ჩვენ ვთარგმნეთ და მოვარგეთ ფართოდ გამოყენებული HumanEval+ და MBPP+ ბენჩმარკები არაბულ ენაზე, შევქმენით პირველი კოდის მონაცემთა ნაკრებები, რომლებიც ამოწმებენ არაბულ LLM-ებს პროგრამირებისთვის ბუნებრივი ენის მოთხოვნებზე. ჩვენ გამოვიყენეთ GPT-4o მოთხოვნების თარგმნისთვის და შედეგები დავადასტურეთ უკუ-თარგმანის საპროცესო ხაზით, უარვყავით დაბალი ხარისხის ნიმუშები ROUGE-L F1 ზღვარზე დაყრდნობით (< 0.8). დამატებითმა ადამიანურმა ფილტრაციამ უზრუნველყო მოთხოვნების სიცხადე და სისწორე. კოდი და სატესტო ნაკრებები უცვლელი დარჩა ქულების სიზუსტის შესანარჩუნებლად. შეფასებებში გამოიყენება EvalPlus ფრეიმვორკი pass@1 და pass@1+ მეტრიკებისთვის. 3LM-ის თითოეულმა მონაცემთა ნაკრებმა გაიარა მრავალეტაპიანი განვითარების პროცესი მონაცემთა ხარისხის, სამართლიანობისა და წარმომადგენლობითობის უზრუნველსაყოფად. „მშობლიური STEM“-ისთვის შეგროვდა არაბული PDF წყაროები და გამოყენებულ იქნა ორმაგი OCR მიდგომა როგორც უბრალო ტექსტის, ასევე მათემატიკური ფორმულების აღსადგენად. კითხვები ამოღებულ იქნა LLM-ზე დაფუძნებული დანაწილებისა და ნიმუშების ამოცნობის გამოყენებით, რასაც მოჰყვა კლასიფიკაცია MCQ ფორმატში შემთხვევითი პასუხის თანმიმდევრობით. საბოლოო ნიმუშები გადაიხედა მშობლიური არაბულენოვანი ექსპერტების მიერ STEM სფეროში, რათა დადასტურებულიყო პასუხის ვალიდურობა და წაკითხვადობა. „სინთეზური STEM“-ისთვის YourBench საპროცესო ხაზი ადაპტირებული იქნა არაბული შეყვანისთვის. წყაროს დოკუმენტები, მონაცემთა შეტანის შემდეგ, ჯერ შეჯამდა, დაიყო ნაწილებად და შემდეგ მიეწოდა კოდით კონტროლირებად გენერატორს MCQ-ების შესაქმნელად. ჩვენ გავფილტრეთ გამოსახულებაზე დამოკიდებული ან ორაზროვანი შინაარსი და შევინარჩუნეთ მხოლოდ კითხვები სამიზნე სირთულის დიაპაზონში. შედეგი არის სუფთა, მაღალი ხარისხის სინთეზური არაბული MCQ-ების ნაკრები STEM-ისთვის. კოდის ბენჩმარკებისთვის, ჩვენი მიზანი იყო ენის გაგების იზოლირება კოდის ლოგიკის შენარჩუნებისას. მოთხოვნების თარგმნა განხორციელდა GPT-4o-ის მიერ უკუ-თარგმანის საშუალებით გადამოწმებით. კოდი და ტესტები ხელუხლებელი დარჩა ინგლისურ ვერსიებთან შეფასების თანასწორობის უზრუნველსაყოფად. შედეგი არის ბენჩმარკი, სადაც არაბული მოთხოვნების შეფასება შესაძლებელია უშუალოდ EvalPlus ინსტრუმენტების ნაკრებით. ჩვენ შევაფასეთ 40-ზე მეტი LLM, მათ შორის არაბულზე ორიენტირებული, მრავალენოვანი, ზოგადი და ინსტრუქციებით დარეგულირებული მოდელები. შეფასება ჩატარდა როგორც მრავალპასუხიანი კითხვების სიზუსტის, ასევე გენერაციული დასრულების მეტრიკების გამოყენებით. MCQ გარემოში, Qwen2.5-72B-Instruct-მა მიაღწია საუკეთესო შედეგებს როგორც მშობლიური (71.8%), ასევე სინთეზური (67.0%) STEM ქვეჯგუფებში. დასრულების ამოცანებისთვის, Gemma-3-27B-მ აჩვენა ყველაზე ძლიერი შედეგები 43.2% სიზუსტით STEM პასუხებზე. კოდის გენერაციაში, GPT-4o-მ აჩვენა საუკეთესო შესრულება როგორც HumanEval-ar-ზე (83.5% pass@1+), ასევე MBPP-ar-ზე (63.6% pass@1+). ეს შედეგები ხაზს უსვამს ძლიერ კორელაციას (~0.97) არაბულ და ინგლისურ...