ინიციატივა იწვევს დეველოპერებსა და მკვლევრებს, რათა შეიქმნას ახალი ბენჩმარკები, რომლებიც შეაფასებენ დიდი ენობრივი მოდელების (LLM) ადრეულ მსჯელობის უნარსა და სამეცნიერო ცოდნას. დიდი ენობრივი მოდელების (LLM) განვითარება, როგორც წესი, იწყება აბლაციის ექსპერიმენტების სერიით, სადაც სისტემატურად ფასდება მოდელის სხვადასხვა არქიტექტურა, მონაცემთა შერევა და ტრენინგის ჰიპერპარამეტრები. ამ ფაზას ჩვეულებრივ მოიხსენიებენ როგორც ტრენინგის ადრეულ ეტაპებს. ამ პერიოდში მკვლევრები ძირითადად აკვირდებიან ორ ძირითად მეტრიკას: ტრენინგის დანაკარგის მრუდს და შეფასების ქულებს. თუმცა, არსებული შეფასების ბენჩმარკები ხშირად ვერ უზრუნველყოფენ მნიშვნელოვან ან დისკრიმინაციულ სიგნალებს ამ საწყის ეტაპებზე, როდესაც LLM-ები გაწვრთნილია შედარებით მცირე (დაახლოებით 200 მილიარდ) ტოკენზე, რაც ართულებს მიმდინარე ექსპერიმენტებიდან დამაჯერებელი დასკვნების გამოტანას. ამ კონკურსში ჩვენ გვსურს ერთობლივად შევქმნათ ახალი ბენჩმარკები, რათა ეფექტურად დავაფიქსიროთ შესაბამისი სიგნალები LLM-ების ადრეულ ტრენინგის ეტაპებზე, განსაკუთრებით სამეცნიერო ცოდნის დომენში. კონკურსი ჩატარდება Hugging Face-ის სპეციალურ ორგანიზაციაში. კონკურსში დასარეგისტრირებლად გთხოვთ მიჰყვეთ ამ რეგისტრაციის ბმულს 👉 https://e2lmc.github.io/registration. მონაწილეებმა უნდა წარმოადგინონ თავიანთი გადაწყვეტილებები, რომლებიც დაფუძნებული იქნება lm-evaluation-harness ბიბლიოთეკაზე HuggingFace Space-ის მეშვეობით. კონკურსის განმავლობაში შენარჩუნდება აქტიური ლიდერბორდი, რათა თვალყური ადევნოს პერსპექტიულ წარდგენებს. მოდელების ზომა მათ მარტივად გასაშვებად ხდის ყველასთვის, უფასო Google Colab GPU-ებზე. ჩვენ ასევე გთავაზობთ სრულყოფილ საწყის კომპლექტს, რომელიც მოიცავს რამდენიმე ნოუთბუქს კონკურსში ჩართვისთვის. თითოეული წარდგენა შეფასდება სამი სხვადასხვა ქულის გამოყენებით: სიგნალის ხარისხის ქულა (ScoreSQ), რანჟირების თანმიმდევრულობის ქულა (ScoreRC) და სამეცნიერო ცოდნასთან შესაბამისობის ქულა (ScoreCS). ეს კრიტერიუმები გაერთიანდება გლობალურ ქულაში, რომელიც გამოყენებული იქნება საბოლოო რანჟირებისთვის. გარდა ამისა, ყველა წარდგენაზე სისტემატურად განხორციელდება ორი ვალიდაციის პროცედურა: (i) დადგენილ სამეცნიერო ცოდნის დომენებთან შესაბამისობის შემოწმება და (ii) პოტენციური ინფორმაციის გაჟონვის გამოვლენა, კერძოდ, პასუხის არსებობა კითხვის მოთხოვნაში. საერთო ქულა გამოითვლება შეწონილი ჯამის სახით, სადაც αSQ, αRC და αCS არის შეწონილი კოეფიციენტები, რომლებიც ასახავს თითოეული კრიტერიუმის შედარებით მნიშვნელობას. ჩვენ დავადგინეთ წონები: α1 = 0.5, α2 = 0.1 და α3 = 0.4, რითაც უფრო მეტი აქცენტი კეთდება სიგნალის ხარისხსა და სამეცნიერო ცოდნასთან შესაბამისობაზე, რასაც წარდგენების შეფასების ყველაზე მნიშვნელოვან მეტრიკებად მივიჩნევთ. მონაწილეებს შეეძლებათ ლოკალურად გამოთვალონ სიგნალის ხარისხის ქვექულა სამი მცირე ენობრივი მოდელის (0.5B, 1B და 3B, 0-დან 200 მილიარდ ტოკენამდე) მოწოდებული მოდელის ჩეკპოინტების გამოყენებით, თანმხლებ შეფასების ალგორითმთან ერთად (მოწოდებულია ნოუთბუქში საწყის კომპლექტში). ამის საპირისპიროდ, დანარჩენი ორი ქვექულა დამოუკიდებლად ვერ გამოითვლება, რადგან შესაბამისი ჩეკპოინტები – 200 გიგატოკენიდან 1 ტერატოკენამდე, ისევე როგორც 0.5 მილიარდი პარამეტრის მოდელი, რომელიც ექსკლუზიურად ვებ მონაცემებზეა გაწვრთნილი – კონკურსის განმავლობაში დამალული დარჩება. თუმცა, გლობალური ქულა ავტომატურად გამოითვლება Hugging Face-ის საკონკურსო სივრცეში წარდგენისთანავე, რაც მონაწილეებს საშუალებას მისცემს თვალყური ადევნონ თავიანთ საერთო შესრულებას. ეს დაყენება მიზნად ისახავს თავიდან აიცილოს ზედმეტად მორგებული გადაწყვეტილებები, რომლებიც სპეციალურად გამოშვებული ჩეკპოინტებისთვის არის შექმნილი. თითოეული შეფასების მეტრიკის შესახებ დამატებითი დეტალები, უახლესი ბენჩმარკების სრულ შეფასების შედეგებთან ერთად, ხელმისაწვდომია კონკურსის წინადადებაში. კითხვებისა და მხარდაჭერისთვის დაუკავშირდით დავალების კოორდინატორებს: [email protected]. თქვენ ასევე შეგიძლიათ შემოუერთდეთ ჩვენს Discord არხს აქ, რათა უშუალოდ დაგვიკავშირდეთ.