LLM შეფასების კრიტიკული ხარვეზები DROP ბენჩმარკში: ნორმალიზაციისა და „გაჩერების ტოკენების“ პრობლემა
Open LLM Leaderboard-ზე DROP ბენჩმარკის დამატების შემდეგ, მოდელების f1-ქულებმა მოულოდნელად დაბალი შედეგები აჩვენა. გამოკვლევამ გამოავლინა ორი ძირითადი პრობლემა: არასწორი ნორმალიზაცია, რომელიც უგულებელყოფდა რიცხვით პასუხებს არასტანდარტული სიცარიელის სიმბოლოების გამო, და წერტილის (.) „გაჩერების ტოკენად“ გამოყენება. ამ ხარვეზების აღმოფხვრა, მათ შორის \n სიმბოლოზე დაყოფა, მნიშვნელოვნად აუმჯობესებს ქულების კორელაციას საერთო შესრულებასთან. თუმცა, სრული ხელახალი შეფასება ძვირი და შრომატევადია, რაც მიუთ
ახალი კვლევა AI-ს მტკიცებებს ძირს უთხრის: მოდელები საავტორო უფლებებით დაცულ კონტენტს ინახავენ და იმეორებენ
სტენფორდისა და იელის უნივერსიტეტების ახალმა კვლევამ აჩვენა, რომ წამყვანი AI კომპანიების ენობრივი მოდელები, როგორიცაა OpenAI, Anthropic და Google, საავტორო უფლებებით დაცული სავარჯიშო მონაცემების ასლებს ინახავენ და არა მხოლოდ „შაბლონებს სწავლობენ“. ეს აღმოჩენა ფუნდამენტურად ეჭვქვეშ აყენებს კომპანიების იურიდიულ არგუმენტებს „კეთილსინდისიერი გამოყენების“ (fair use) შესახებ, ვინაიდან მოდელებს მარტივი მოთხოვნებით შეუძლიათ ცნობილი ნაწარმოებებიდან ათასობით სიტყვის სიტყვასიტყვით რეპროდუცირება.