ახალი LLM ლიდერბორდი რეალურ ბიზნეს სცენარებში ენის მოდელების შეფასებისთვის
ეს ლიდერბორდი მიზნად ისახავს ენის დიდი მოდელების (LLM) მუშაობის შეფასებას რეალური ბიზნეს ამოცანების კონტექსტში. ის მხარს უჭერს 6 მრავალფეროვან დავალებას, როგორიცაა FinanceBench და იურიდიული კონფიდენციალურობა, და ზომავს მოდელების ეფექტურობას ისეთი მეტრიკებით, როგორიცაა სიზუსტე, ჩართულობა და ტოქსიკურობა. ლიდერბორდი შემუშავდა იმისათვის, რომ დაეხმაროს მომხმარებლებს პრაქტიკული გამოყენებისთვის საუკეთესო მოდელის არჩევაში და აქტიურად ცდილობს თავიდან აიცილოს ტესტ-კომპლექტის დაბინძურება ზოგიერთი მონაცემთა
აღნიშნული ლიდერბორდის მიზანია ენის დიდი მოდელების (LLM) მუშაობის შეფასება რეალური ბიზნეს სცენარების გათვალისწინებით. ის ამჟამად მხარს უჭერს 6 მრავალფეროვან დავალებას: FinanceBench, იურიდიული კონფიდენციალურობა (Legal Confidentiality), კრეატიული წერა (Creative Writing), მომხმარებელთა მხარდაჭერის დიალოგი (Customer Support Dialogue), ტოქსიკურობა (Toxicity) და საწარმოს პერსონალური საიდენტიფიკაციო ინფორმაცია (Enterprise PII).
მოდელების მუშაობა ფასდება ისეთი მეტრიკებით, როგორიცაა სიზუსტე, ჩართულობა, ტოქსიკურობა, შესაბამისობა და საწარმოს პერსონალური საიდენტიფიკაციო ინფორმაციის (Enterprise PII) დამუშავება.
ჩვენ მიგვაჩნდა, რომ არსებობდა LLM ლიდერბორდის საჭიროება, რომელიც ფოკუსირებული იქნებოდა რეალურ, საწარმოს გამოყენების შემთხვევებზე, მაგალითად, ფინანსურ კითხვებზე პასუხის გაცემაზე ან მომხმარებელთა მხარდაჭერასთან ურთიერთობაზე. LLM ბენჩმარკების უმეტესობა იყენებს აკადემიურ დავალებებსა და მონაცემთა ნაკრებებს, რომლებიც სასარგებლოა მოდელების მუშაობის შესადარებლად შეზღუდულ გარემოში. თუმცა, საწარმოს გამოყენების შემთხვევები ხშირად მნიშვნელოვნად განსხვავდება. ჩვენ შევარჩიეთ დავალებებისა და მონაცემთა ნაკრებების ნაკრები კომპანიებთან საუბრების საფუძველზე, რომლებიც იყენებენ LLM-ებს მრავალფეროვან რეალურ სცენარებში.
ვიმედოვნებთ, რომ ლიდერბორდი სასარგებლო საწყისი წერტილი იქნება მომხმარებლებისთვის, რომლებიც ცდილობენ გაარკვიონ, რომელი მოდელი გამოიყენონ თავიანთი პრაქტიკული პროგრამებისთვის. ასევე, ბოლო დროს გამოითქვა შეშფოთება ლიდერბორდების „მოტყუების“ შესახებ, როდესაც მომხმარებლები წარადგენენ მოდელებს, რომლებიც ტესტ-კომპლექტებზეა დაზუსტებული (fine-tuned). ჩვენი ლიდერბორდისთვის, ჩვენ გადავწყვიტეთ აქტიურად შევეცადოთ თავიდან ავიცილოთ ტესტ-კომპლექტის დაბინძურება ჩვენი ზოგიერთი მონაცემთა ნაკრების დახურულ წყაროდ შენარჩუნებით.
FinanceBench-ისა და იურიდიული კონფიდენციალურობის ამოცანების მონაცემთა ნაკრებები ღია წყაროა, ხოლო დანარჩენი ოთხი მონაცემთა ნაკრები დახურულია. ამ ოთხი ამოცანისთვის ჩვენ ვაქვეყნებთ ვალიდაციის კომპლექტს, რათა მომხმარებლებმა უკეთ გაიგონ თავად ამოცანა. მაგალითად: შეფასების მეტრიკა: სისწორე. შეფასების მეტრიკა: სიზუსტე. შეფასების მეტრიკა: თანმიმდევრულობა, ჩართულობა. შეფასების მეტრიკა: ჩართულობა, თანმიმდევრულობა, საუბრის სიღრმე. შეფასების მეტრიკა: ტოქსიკურობის ქულა. შეფასების მეტრიკა: Enterprise PII კლასიფიკატორი.
ლიდერბორდზე მოდელის წარდგენამდე დარწმუნდით, რომ მოდელი საჯაროა და მისი ჩატვირთვა შესაძლებელია HuggingFace-ზე AutoClasses-ის გამოყენებით. თუ შეფერხებას წააწყდებით, გთხოვთ, გახსნათ ახალი დისკუსია ლიდერბორდის საზოგადოების განყოფილებაში. მიუხედავად იმისა, რომ შეფასების კოდი არ არის ღია წყარო, მოდელების გენერაციები და შეფასებები ვალიდაციის ნაკრებებზე ხელმისაწვდომი იქნება აქ, ლიდერბორდზე წარდგენილი ყველა მოდელისთვის.
დამატებითი სტატიებისთვის ეწვიეთ ჩვენს ბლოგს. კომენტარების დასატოვებლად, გთხოვთ, დარეგისტრირდეთ ან შეხვიდეთ სისტემაში.
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი