აღნიშნული ლიდერბორდის მიზანია ენის დიდი მოდელების (LLM) მუშაობის შეფასება რეალური ბიზნეს სცენარების გათვალისწინებით. ის ამჟამად მხარს უჭერს 6 მრავალფეროვან დავალებას: FinanceBench, იურიდიული კონფიდენციალურობა (Legal Confidentiality), კრეატიული წერა (Creative Writing), მომხმარებელთა მხარდაჭერის დიალოგი (Customer Support Dialogue), ტოქსიკურობა (Toxicity) და საწარმოს პერსონალური საიდენტიფიკაციო ინფორმაცია (Enterprise PII). მოდელების მუშაობა ფასდება ისეთი მეტრიკებით, როგორიცაა სიზუსტე, ჩართულობა, ტოქსიკურობა, შესაბამისობა და საწარმოს პერსონალური საიდენტიფიკაციო ინფორმაციის (Enterprise PII) დამუშავება. ჩვენ მიგვაჩნდა, რომ არსებობდა LLM ლიდერბორდის საჭიროება, რომელიც ფოკუსირებული იქნებოდა რეალურ, საწარმოს გამოყენების შემთხვევებზე, მაგალითად, ფინანსურ კითხვებზე პასუხის გაცემაზე ან მომხმარებელთა მხარდაჭერასთან ურთიერთობაზე. LLM ბენჩმარკების უმეტესობა იყენებს აკადემიურ დავალებებსა და მონაცემთა ნაკრებებს, რომლებიც სასარგებლოა მოდელების მუშაობის შესადარებლად შეზღუდულ გარემოში. თუმცა, საწარმოს გამოყენების შემთხვევები ხშირად მნიშვნელოვნად განსხვავდება. ჩვენ შევარჩიეთ დავალებებისა და მონაცემთა ნაკრებების ნაკრები კომპანიებთან საუბრების საფუძველზე, რომლებიც იყენებენ LLM-ებს მრავალფეროვან რეალურ სცენარებში. ვიმედოვნებთ, რომ ლიდერბორდი სასარგებლო საწყისი წერტილი იქნება მომხმარებლებისთვის, რომლებიც ცდილობენ გაარკვიონ, რომელი მოდელი გამოიყენონ თავიანთი პრაქტიკული პროგრამებისთვის. ასევე, ბოლო დროს გამოითქვა შეშფოთება ლიდერბორდების „მოტყუების“ შესახებ, როდესაც მომხმარებლები წარადგენენ მოდელებს, რომლებიც ტესტ-კომპლექტებზეა დაზუსტებული (fine-tuned). ჩვენი ლიდერბორდისთვის, ჩვენ გადავწყვიტეთ აქტიურად შევეცადოთ თავიდან ავიცილოთ ტესტ-კომპლექტის დაბინძურება ჩვენი ზოგიერთი მონაცემთა ნაკრების დახურულ წყაროდ შენარჩუნებით. FinanceBench-ისა და იურიდიული კონფიდენციალურობის ამოცანების მონაცემთა ნაკრებები ღია წყაროა, ხოლო დანარჩენი ოთხი მონაცემთა ნაკრები დახურულია. ამ ოთხი ამოცანისთვის ჩვენ ვაქვეყნებთ ვალიდაციის კომპლექტს, რათა მომხმარებლებმა უკეთ გაიგონ თავად ამოცანა. მაგალითად: შეფასების მეტრიკა: სისწორე. შეფასების მეტრიკა: სიზუსტე. შეფასების მეტრიკა: თანმიმდევრულობა, ჩართულობა. შეფასების მეტრიკა: ჩართულობა, თანმიმდევრულობა, საუბრის სიღრმე. შეფასების მეტრიკა: ტოქსიკურობის ქულა. შეფასების მეტრიკა: Enterprise PII კლასიფიკატორი. ლიდერბორდზე მოდელის წარდგენამდე დარწმუნდით, რომ მოდელი საჯაროა და მისი ჩატვირთვა შესაძლებელია HuggingFace-ზე AutoClasses-ის გამოყენებით. თუ შეფერხებას წააწყდებით, გთხოვთ, გახსნათ ახალი დისკუსია ლიდერბორდის საზოგადოების განყოფილებაში. მიუხედავად იმისა, რომ შეფასების კოდი არ არის ღია წყარო, მოდელების გენერაციები და შეფასებები ვალიდაციის ნაკრებებზე ხელმისაწვდომი იქნება აქ, ლიდერბორდზე წარდგენილი ყველა მოდელისთვის. დამატებითი სტატიებისთვის ეწვიეთ ჩვენს ბლოგს. კომენტარების დასატოვებლად, გთხოვთ, დარეგისტრირდეთ ან შეხვიდეთ სისტემაში.