FilBench: ფილიპინური ენებისთვის LLM-ების შეფასების ყოვლისმომცველი სისტემა
FilBench, ახალი ყოვლისმომცველი შეფასების სისტემა, შეიქმნა დიდი ენობრივი მოდელების (LLM) შესაძლებლობების შესაფასებლად ფილიპინურ ენებზე: ტაგალურზე, ფილიპინურსა და სებუანურზე. ის აფასებს ენობრივ უნარებს, მთარგმნელობით შესაძლებლობებს და კულტურულ ცოდნას ოთხი ძირითადი კატეგორიისა და 12 ამოცანის მიხედვით. FilBench-მა გამოავლინა, რომ მიუხედავად SEA-სპეციფიკური LLM-ების ეფექტურობისა, დახურული კოდის მოდელები (როგორიცაა GPT-4o) ჯერ კიდევ სჯობია მათ. ასევე, უმეტეს მოდელს გენერაციის უნარები უჭირს. კვლევამ აჩ
ამიტომ შევიმუშავეთ FilBench: ყოვლისმომცველი შეფასების ნაკრები, რომელიც აფასებს დიდი ენობრივი მოდელების (LLM) შესაძლებლობებს ტაგალურ, ფილიპინურ (ტაგალურის სტანდარტიზებული ფორმა) და სებუანურ ენებზე, შეუფერხებლობის, ლინგვისტური და მთარგმნელობითი უნარების, ასევე სპეციფიკური კულტურული ცოდნის მიხედვით. ჩვენ ის გამოვიყენეთ 20-ზე მეტი უახლესი LLM-ის შესაფასებლად FilBench-ის მეშვეობით, რამაც მოგვცა მათი მუშაობის ყოვლისმომცველი შეფასება ფილიპინურ ენებზე. FilBench-ის შეფასების ნაკრები შედგება ოთხი ძირითადი კატეგორიისგან – კულტურული ცოდნა, კლასიკური NLP, წაკითხულის გააზრება და გენერაცია – დაყოფილი 12 ამოცანად. მაგალითად, კლასიკური NLP კატეგორია მოიცავს ისეთ ამოცანებს, როგორიცაა სენტიმენტების ანალიზი, ხოლო გენერაციის ამოცანები მოიცავს თარგმანის სხვადასხვა ასპექტს.
იმის უზრუნველსაყოფად, რომ ეს კატეგორიები ასახავდეს პრიორიტეტებსა და ტენდენციებს NLP კვლევასა და გამოყენებაში, ჩვენ ისინი შევარჩიეთ ფილიპინურ ენებზე NLP კვლევების ისტორიული მიმოხილვის საფუძველზე, 2006 წლიდან 2024 წლის დასაწყისამდე. (ამ კატეგორიების უმეტესობა ექსკლუზიურად შეიცავს არათარგმნილ კონტენტს, რათა უზრუნველყოფილი იყოს ფილიპინური ენების ბუნებრივი გამოყენების ერთგულება.) თითოეული ეს კატეგორია უზრუნველყოფს აგრეგირებულ მეტრულ მაჩვენებელს. ერთიანი წარმომადგენლობითი ქულის შესაქმნელად, ჩვენ ვიანგარიშებთ შეწონილ საშუალოს თითოეულ კატეგორიაში არსებული მაგალითების რაოდენობის მიხედვით, რასაც FilBench ქულას ვუწოდებთ. გამოყენებისა და დაყენების გასამარტივებლად, FilBench ავაშენეთ Lighteval-ის თავზე, რომელიც წარმოადგენს ყოვლისმომცველ ჩარჩოს LLM-ების შეფასებისთვის.
ენისთვის სპეციფიკური შეფასებისთვის, პირველ რიგში განვსაზღვრეთ მთარგმნელობითი წყვილები ინგლისურიდან ტაგალურზე (ან სებუანურზე) შეფასებაში გამოყენებული საერთო ტერმინებისთვის, როგორიცაა „კი“ (oo), „არა“ (hindi) და „მართალია“ (totoo) სხვათა შორის. შემდეგ, ჩვენ გამოვიყენეთ მოწოდებული შაბლონები სასურველი შესაძლებლობებისთვის მორგებული ამოცანების განსახორციელებლად. FilBench ახლა ხელმისაწვდომია, როგორც საზოგადოებრივი ამოცანების ნაკრები Lighteval-ის ოფიციალურ საცავში!
FilBench-ზე რამდენიმე LLM-ის შეფასებით, ჩვენ გამოვავლინეთ არაერთი საინტერესო დასკვნა იმის შესახებ, თუ როგორ მუშაობენ ისინი ფილიპინურ ენაზე. ბოლო რამდენიმე წლის განმავლობაში, შეინიშნება რეგიონ-სპეციფიკური LLM-ების ზრდა, რომლებიც მიზნად ისახავს სამხრეთ-აღმოსავლეთ აზიის ენებს (SEA-specific), როგორიცაა SEA-LION და SeaLLM. ეს არის ღია წონის LLM-ები, რომელთა უფასოდ ჩამოტვირთვა შეგიძლიათ HuggingFace-დან. ჩვენ აღმოვაჩინეთ, რომ SEA-სპეციფიკური LLM-ები ხშირად ყველაზე პარამეტრობრივად ეფექტურია ჩვენი ენებისთვის, ისინი აღწევენ FilBench-ის უმაღლეს ქულებს მათი ზომის სხვა მოდელებთან შედარებით. თუმცა, საუკეთესო SEA-სპეციფიკურ მოდელსაც კი სჯობს დახურული კოდის LLM-ები, როგორიცაა GPT-4o. რეგიონ-სპეციფიკური LLM-ების შექმნა მაინც აზრიანია, რადგან ჩვენ ვაკვირდებით შესრულების 2-3%-იან ზრდას, როდესაც საბაზისო LLM-ს განუწყვეტლივ ვაზუსტებთ SEA-სპეციფიკური ინსტრუქციების მონაცემებით. ეს იმაზე მიუთითებს, რომ ფილიპინური/SEA-სპეციფიკური საწვრთნელი მონაცემების შეგროვების მცდელობები დაზუსტებისთვის კვლავ აქტუალურია, რადგან მათ შეუძლიათ FilBench-ზე უკეთესი შედეგები გამოიღონ.
ჩვენ ასევე აღვნიშნავთ, რომ FilBench-ის ოთხივე კატეგორიაში, მოდელების უმეტესობას უჭირს გენერაციის შესაძლებლობები. გენერაციის ხარვეზების შემოწმებისას აღმოვაჩინეთ, რომ ეს მოიცავს შემთხვევებს, როდესაც მოდელი ვერ იცავს თარგმნის ინსტრუქციებს, ქმნის გადაჭარბებულად ვრცელ ტექსტებს, ან ჰალუცინაციებს უშვებს სხვა ენაზე ტაგალურის ან სებუანურის ნაცვლად.
ფილიპინებს აქვს შეზღუდული ინტერნეტ ინფრასტრუქტურა და დაბალი საშუალო შემოსავალი [3], რაც აუცილებელს ხდის ხელმისაწვდომი LLM-ების არსებობას, რომლებიც ხარჯთეფექტური და გამოთვლითად ეფექტურია. FilBench-ის მეშვეობით, ჩვენ შევძელით ისეთი LLM-ების იდენტიფიცირება, რომლებიც ეფექტურობის პარეტოს ზღვარზე იმყოფებიან. ზოგადად, ჩვენ აღმოვაჩინეთ, რომ ღია წონის LLM-ები, ანუ მოდელები, რომელთა უფასოდ ჩამოტვირთვა შეგიძლიათ HuggingFace-დან, გაცილებით იაფია, ვიდრე კომერციული მოდელები, მათი შესრულების ხარჯზე კომპრომისის გარეშე. თუ გსურთ GPT-4o-ის ალტერნატივა თქვენი ფილიპინური ენის ამოცანებისთვის, მაშინ სცადეთ Llama 4 Maverick! ჩვენ ასევე ვაქვეყნებთ ამ ინფორმაციას FilBench-ის ლიდერბორდის HuggingFace სივრცეში.
ვიმედოვნებთ, რომ FilBench უზრუნველყოფს უფრო ღრმა ხედვას LLM-ის შესაძლებლობების შესახებ ფილიპინური ენებისთვის და ხელს შეუწყობს ფილიპინური NLP კვლევებისა და განვითარების წინსვლას. FilBench-ის შეფასების ნაკრები აგებულია Hugging Face-ის Lighteval-ის თავზე, რაც LLM დეველოპერებს საშუალებას აძლევს მარტივად შეაფასონ თავიანთი მოდელები ჩვენს ბენჩმარკზე.
დამატებითი ინფორმაციისთვის, გთხოვთ ეწვიოთ ქვემოთ მოცემულ ბმულებს: ავტორები მადლობას უხდიან Cohere Labs-ს, Cohere Research Grant-ის მეშვეობით Aya მოდელების სერიის გაშვებისთვის მიწოდებული კრედიტებისთვის, და Together AI-ს დამატებითი გამოთვლითი კრედიტებისთვის რამდენიმე ღია მოდელის გაშვებისთვის. ასევე მადლობას ვუხდით Hugging Face-ის გუნდს, განსაკუთრებით OpenEvals-ის გუნდს (Clémentine Fourrier და Nathan Habib) და დენიელ ვან სტრიენს, ამ ბლოგპოსტის გამოქვეყნებაში გაწეული მხარდაჭერისთვის. თუ FilBench-ზე ატარებთ შეფასებას, გთხოვთ მოიყვანოთ ჩვენი ნაშრომი. მეტი სტატია ჩვენი ბლოგიდან.
თეგები:
#ხელოვნური ინტელექტი
#llm
#gpt-4o
#nlp
#ღია კოდის მოდელები
#huggingface
#filbench
#ფილიპინური ენები
#ტაგალური
#ფილიპინური
#სებუანური
#შეფასება
#lighteval
#llama 4 maverick
#რეგიონ-სპეციფიკური llm-ები
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი