HELMET: ყოვლისმომცველი ბენჩმარკი გრძელკონტექსტური ენობრივი მოდელების შესაფასებლად
HELMET, რომელიც გასულ ოქტომბერს გამოვიდა, გახდა პოპულარული ინსტრუმენტი გრძელკონტექსტური ენობრივი მოდელების (LCLM) შესაფასებლად, რომელსაც იყენებენ ისეთი კომპანიები, როგორებიცაა Microsoft და AI21. მუდმივად განვითარებადი LCLM-ების გათვალისწინებით, HELMET გთავაზობთ ახალ, გაფართოებულ შეფასების მეთოდებს, რომლებიც წარმოდგენილი იქნება ICLR 2025-ზე. ეს ბენჩმარკი მიზნად ისახავს გადაჭრას არსებული შეფასების მეთოდების ნაკლოვანებები, უზრუნველყოფს მოდელების მრავალფეროვან, კონტროლირებად და საიმედო შედარებას რეა
მას შემდეგ, რაც გასულ ოქტომბერში HELMET პირველად გამოვაქვეყნეთ, გრძელკონტექსტური ენობრივი მოდელების (LCLM) განვითარება უპრეცედენტო ტემპით მიმდინარეობს. მოხარულნი ვართ, რომ საზოგადოება აქტიურად იყენებს HELMET-ს, მათ შორის Microsoft-ის Phi-4 და AI21-ის Jamba 1.6. საწყისი გამოშვების შემდეგ, ჩვენ დავამატეთ მეტი მოდელი ჩვენს შეფასების სისტემას და ჩავატარეთ დამატებითი ანალიზები. მოხარულნი ვართ, რომ გაგიზიარებთ ჩვენს ახალ შედეგებს და წარვადგენთ HELMET-ს ICLR 2025-ზე! ამ ბლოგში აღვწერთ HELMET-ის შექმნას, ჩვენს ძირითად მიგნებებს და იმას, თუ როგორ შეუძლიათ პრაქტიკოსებს გამოიყენონ HELMET სხვადასხვა LCLM-ის გასარჩევად სამომავლო კვლევებსა და აპლიკაციებში. და ბოლოს, სტატიას დავასრულებთ HELMET-ის HuggingFace-თან გამოყენების სწრაფი დაწყების სახელმძღვანელოთი. მრავალი იურიდიული დოკუმენტის შეჯამებიდან დაწყებული, ახალი ამოცანების სწრაფად სწავლამდე, გრძელკონტექსტურ ენობრივ მოდელებს (LCLM) უზარმაზარი პოტენციალი აქვთ, რომ შეცვალონ ჩვენი ენობრივ მოდელებთან ურთიერთობისა და მათი გამოყენების გზა.
ენობრივი მოდელები შეზღუდული იყო მათი კონტექსტის ფანჯრით, რომელიც დაახლოებით 2K-დან 8K ტოკენამდე იყო (მაგ., ChatGPT, Llama-2/3). ბოლო დროს, მოდელების დეველოპერები მუდმივად ზრდიან თავიანთი მოდელების კონტექსტის ფანჯარას, ისეთი უახლესი მოდელები, როგორებიცაა GPT-4o, Claude-3 და Gemini-1.5, მილიონობით ტოკენის კონტექსტის ფანჯრებს უჭერენ მხარს. თუმცა, კონტექსტის გაზრდილი ფანჯრებით, წინა ბუნებრივი ენის ბენჩმარკები (მაგ., Scrolls) აღარ არის შესაფერისი LCLM-ების შესაფასებლად. შესაბამისად, პერპლექსურობა და სინთეზური ამოცანები (მაგ., „ნემსი თივის ზვინში“) გახდა ყველაზე პოპულარული შეფასების მეტრიკა უახლესი LCLM-ებისთვის, მაგრამ ისინი ხშირად არ ასახავს რეალურ სამყოში არსებულ შესრულებას. მოდელების დეველოპერებმა შესაძლოა შეფასებები სხვა თვითნებურ მონაცემთა ნაკრებებზეც ჩაატარონ, რაც ართულებს მოდელების შედარებას. გარდა ამისა, LCLM-ებისთვის არსებულმა ბენჩმარკებმა შესაძლოა აჩვენონ დამაბნეველი და კონტრ-ინტუიციური შედეგები, რაც ართულებს სხვადასხვა მოდელის ძლიერი და სუსტი მხარეების გაგებას (ნახატი 1).
ამ ნაშრომში ჩვენ გთავაზობთ HELMET-ს (How to Evaluate Long-Context Models Effectively and Thoroughly), ყოვლისმომცველ ბენჩმარკს LCLM-ების შესაფასებლად, რომელიც აუმჯობესებს არსებულ ბენჩმარკებს რამდენიმე ასპექტში – მრავალფეროვნებაში, კონტროლირებადობასა და სანდოობაში. ჩვენ შევაფასეთ 59 უახლესი LCLM და აღმოვაჩინეთ, რომ გადამწყვეტი მნიშვნელობა აქვს მოდელების შეფასებას მრავალფეროვან აპლიკაციებში მათი შესაძლებლობების გასაგებად, და რომ წამყვან LCLM-ებსაც კი კვლავ აქვთ შეზღუდვები რთულ ამოცანებში. LCLM-ების განვითარებასთან ერთად, როგორც ინდუსტრიაში, ასევე ღია წყაროების საზოგადოებაში, გადამწყვეტია ამ მოდელების შეფასებისა და შედარების საიმედო მეთოდის ქონა. თუმცა, ამჟამინდელი მოდელები ხშირად სხვადასხვა ბენჩმარკებზე ფასდება (ცხრილი 1). გრძელკონტექსტური ენობრივი მოდელების შეფასების გავრცელებული პრაქტიკაა პერპლექსურობის ან სინთეზური ამოცანების გამოყენება, როგორიცაა „ნემსი თივის ზვინში“ (NIAH).
თუმცა, ბოლო ნაშრომებმა აჩვენა, რომ პერპლექსურობა კარგად არ კორელაციას არ წარმოქმნის შემდგომ შესრულებასთან (Fang et al., 2024). ნახატ 2-ზე ვაჩვენებთ, რომ სინთეზური ამოცანები, როგორიცაა NIAH, არ კორელაციას არ წარმოქმნის რეალურ სამყაროში არსებულ შესრულებასთან, თუმცა უფრო რთული სინთეზური ამოცანები უფრო მაღალ კორელაციას აღწევს რეალურ სამყაროს ამოცანებთან. რეალისტური აპლიკაციების მქონე არსებულ ბენჩმარკებს შორის, როგორიცაა ZeroScrolls (Shaman et al., 2023), LongBench (Bai et al., 2024) და InfiniteBench (Zhang et al., 2024), კვლავაც არსებობს მნიშვნელოვანი შეზღუდვები. ამიტომ, ჩვენ ვთავაზობთ HELMET-ს ამ შეზღუდვების მოსაგვარებლად და LCLM-ების ყოვლისმომცველი შეფასების უზრუნველსაყოფად. ჩვენ შევქმენით HELMET შემდეგი მოთხოვნების გათვალისწინებით: ცხრილი 2 წარმოადგენს ბენჩმარკის მიმოხილვას.
ჩვენს ექსპერიმენტებში შევაფასეთ შეყვანის სიგრძე 8K-დან 128K ტოკენამდე, მაგრამ HELMET მარტივად შეიძლება გაფართოვდეს უფრო გრძელი კონტექსტის სიგრძეებისთვისაც. **მრავალფეროვანი გაშუქება:** HELMET მოიცავს ამოცანების მრავალფეროვან ნაკრებს, როგორიცაა მოძიებით გაუმჯობესებული გენერაცია (RAG) რეალური ამონარიდებით, ციტირებით გენერაცია და შეჯამება. ჩვენ ფრთხილად შევარჩიეთ მონაცემთა ნაკრებები ბუნებრივად გრძელი კონტექსტებით, რომლებიც ასახავს რეალურ სამყაროში არსებულ აპლიკაციებს. ამ მონაცემთა ნაკრებებს ავსებს სანდო შეფასების პარამეტრები, როგორიცაა მოდელზე დაფუძნებული შეფასებები და ადამიანური კვლევები. **კონტროლირებადი სიგრძე და სირთულე:** LCLM-ების შეფასებისას გასათვალისწინებელი მნიშვნელოვანი განზომილება არის შეყვანის სიგრძე, რადგან უფრო გრძელ შეყვანას შეუძლია მეტი ინფორმაციის მიწოდება, ამავდროულად აყენებს გამოწვევას მოდელის შესაძლებლობას, დაამუშაოს ხმაურიანი კონტექსტები. ჩვენს ამოცანებში, ჩვენ შეგვიძლია გავაკონტროლოთ შეყვანის სიგრძე მოძიებული პასაჟების რაოდენობის (RAG, ციტირება, ხელახალი რანჟირება), დემონსტრაციების რაოდენობის (ICL) ან შეყვანის დოკუმენტის სიგრძის (LongQA, შეჯამება) შეცვლით. მიუხედავად იმისა, რომ LongQA და Summ მარტივად არ შეიძლება გაფართოვდეს უფრო გრძელ კონტექსტებზე, ჩვენ განზრახ ავარჩიეთ მონაცემთა ნაკრებები ბუნებრივი დოკუმენტებით, რომელთა სიგრძე გაცილებით აღემატება 100K ტოკენს, რათა ისინი კვლავაც გამოყენებულ იქნას წამყვანი LCLM-ების შესაფასებლად. **სანდო შეფასება:** ბევრი არსებული ბენჩმარკი კვლავ იყენებს n-გრამზე დაფუძნებულ მეტრიკას, როგორიცაა ROUGE, მიუხედავად იმისა, რომ მათ ცუდი კორელაცია აქვთ ადამიანურ შეფასებებთან (Goyal et al., 2023). ჩვენ ვიყენებთ მოდელზე დაფუძნებულ შეფასებებს, რომლებიც უკეთესად განასხვავებენ მოდელებსა და შეყვანის სხვადასხვა სიგრძეებს (ნახატი 3). გარდა ამისა, ჩვენი ადამიანური კვლევები აჩვენებს, რომ ჩვენს მეტრიკას მაღალი თანხმობა აქვს ადამიანურ შეფასებებთან. **მყარი პრომპტინგი:** არსებული გრძელკონტექსტური ბენჩმარკები ხშირად...
თეგები:
#ხელოვნური ინტელექტი
#ბენჩმარკი
#huggingface
#შეფასება
#helmet
#გრძელკონტექსტური ენობრივი მოდელები
#lclm
#iclr 2025
წყარო: huggingface.co
AI-ით გადამუშავებული