მონაცემთა ნაკრებების შექმნა: საზოგადოების ძალისხმევა და მრავალენოვანი ინიციატივები Hugging Face-ისგან
სტატია აღწერს Hugging Face-ის საზოგადოების მიერ მონაცემთა ნაკრებების შექმნის მიზნით გაწეულ ძალისხმევას. ინიციატივა მოიცავს მოთხოვნების (prompts) რანჟირების პროექტსა და მრავალენოვანი მოთხოვნების შეფასების პროექტს (MPEP), რომელიც მიზნად ისახავს ღია LLM-ებისთვის ენობრივი ბენჩმარკების გაუმჯობესებას. ხაზგასმულია საზოგადოების წვლილის მნიშვნელობა მყარი და ყოვლისმომცველი რესურსების შესაქმნელად.
ახლა, ჩვენ გადავწყვიტეთ, იმავე მიზნით გავაგრძელოთ წინსვლა. იმისათვის, რომ წარმოგვედგინა ჩვენი მიღწევებისა და ამოცანების მიმოხილვა, სადაც ყველას შეუძლია წვლილის შეტანა, ის ორ ნაწილად დავყავით: საზოგადოების ძალისხმევა და მეთოდოლოგიური (cookbook) ძალისხმევა. ამ ინიციატივის ფარგლებში ჩვენი პირველი ნაბიჯები მიმართული იყო მოთხოვნების (prompts) რანჟირების პროექტისკენ. ჩვენი მიზანი იყო 10K მოთხოვნისგან შემდგარი მონაცემთა ნაკრების შექმნა, როგორც სინთეზური, ასევე ადამიანის მიერ გენერირებული, ხარისხის მიხედვით რანჟირებული. საზოგადოების გამოხმაურება მყისიერი იყო! საზოგადოების მხრიდან გლობალური მხარდაჭერის დანახვით, ჩვენ მივხვდით, რომ მხოლოდ ინგლისურზე ორიენტირებული მონაცემები არასაკმარისია და ღია LLM-ებისთვის არ არის საკმარისი ენობრივ-სპეციფიკური ეტალონები. ამიტომ, ჩვენ შევქმენით მრავალენოვანი მოთხოვნების შეფასების პროექტი (MPEP), რომლის მიზანია მრავალი ენისთვის ლიდერთა დაფის შექმნა. ამისათვის, DIBT/10k_prompts_ranked-დან შეირჩა 500 მაღალი ხარისხის მოთხოვნის ქვეჯგუფი, რომელიც სხვადასხვა ენაზე უნდა ითარგმნოს. მომავალში, ჩვენ გავაგრძელებთ საზოგადოების ძალისხმევის მხარდაჭერას, რომელიც მიმართულია მონაცემთა ნაკრებების შექმნაზე ხელსაწყოებისა და დოკუმენტაციის მეშვეობით. DIBT-ის ფარგლებში, ჩვენ ასევე შევქმენით გაიდები და ხელსაწყოები, რომლებიც საზოგადოებას ეხმარება დამოუკიდებლად შექმნას ღირებული მონაცემთა ნაკრებები. თქვენ კვლავ შეგიძლიათ წვლილი შეიტანოთ მეთოდოლოგიურ (cookbook) ძალისხმევაში, მიჰყვეთ იმ პროექტის README-ში მოცემულ ინსტრუქციებს, რომლითაც დაინტერესებული ხართ, გაუზიაროთ თქვენი მონაცემთა ნაკრებები და შედეგები საზოგადოებას, ან მიაწოდოთ ახალი გაიდები და ხელსაწყოები ყველასთვის. თქვენი წვლილი ფასდაუდებელია მყარი და ყოვლისმომცველი რესურსის შესაქმნელად ყველასთვის. თუ გსურთ ამის ნაწილი გახდეთ, შემოგვიერთდით #data-is-better-together არხში Hugging Face Discord-ზე და შეგვატყობინეთ, რისი შექმნა გსურთ ერთად! ჩვენ მოუთმენლად ველით თქვენთან ერთად უკეთესი მონაცემთა ნაკრებების შექმნას!
თეგები:
#ai
#ტექნოლოგიები
#llm
#hugging face
#მონაცემთა ნაკრებები
#მრავალენოვანი
#საზოგადოება
#dibt
#mpep
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი