სამომხმარებლო აპლიკაციებისა და ჩატის გამოცდილებისთვის, სიჩქარე და რეაგირების უნარი გადამწყვეტია მომხმარებლის ჩართულობისთვის. მომხმარებლები ელოდებიან თითქმის მყისიერ პასუხებს, ხოლო შეფერხებებმა შეიძლება პირდაპირ გამოიწვიოს ჩართულობის შემცირება. უფრო რთული აპლიკაციების შექმნისას, რომლებიც მოიცავს ხელსაწყოების გამოყენებას ან აგენტურ სისტემებს, სიჩქარე და ღირებულება კიდევ უფრო მნიშვნელოვანი ხდება და შეიძლება გახდეს სისტემის საერთო შესაძლებლობების შემზღუდველი ფაქტორი. LLM-ებთან თანმიმდევრული მოთხოვნების დრო სწრაფად იზრდება თითოეული მომხმარებლის მოთხოვნისთვის, რაც ზრდის ხარჯებს. სწორედ ამიტომ, Artificial Analysis-მა (@ArtificialAnlys) შექმნა ლიდერბორდი, რომელიც აფასებს ფასს, სიჩქარესა და ხარისხს 100-ზე მეტი უსერვერო LLM API ენდპოინტის მასშტაბით, რომელიც ახლა Hugging Face-ზეა ხელმისაწვდომი. LLM-ის მუშაობის ლიდერბორდის მიზანია უზრუნველყოს ყოვლისმომცველი მეტრიკა, რათა დაეხმაროს AI ინჟინრებს გადაწყვეტილებების მიღებაში, თუ რომელი LLM-ები (როგორც ღია, ასევე საკუთრებად) და API პროვაიდერები გამოიყენონ AI-ზე დაფუძნებულ აპლიკაციებში. AI ტექნოლოგიების არჩევისას, ინჟინრებმა უნდა გაითვალისწინონ ხარისხი, ფასი და სიჩქარე (დაყოვნება და გამტარუნარიანობა). LLM-ის მუშაობის ლიდერბორდი აერთიანებს სამივე ფაქტორს ერთ ადგილას, რათა ხელი შეუწყოს გადაწყვეტილების მიღებას როგორც საკუთრებად, ასევე ღია მოდელების შემთხვევაში. მოწოდებული მეტრიკაა: ხარისხი, ფასი და სიჩქარე (დაყოვნება და გამტარუნარიანობა). დამატებითი განმარტებებისთვის იხილეთ ჩვენი სრული მეთოდოლოგიის გვერდი. ლიდერბორდი საშუალებას იძლევა შეისწავლოთ მუშაობის მაჩვენებლები რამდენიმე სხვადასხვა დატვირთვის პირობებში (ჯამში 6 კომბინაცია). ჩვენ ვამოწმებთ ლიდერბორდზე არსებულ თითოეულ API ენდპოინტს დღეში 8-ჯერ, ხოლო ლიდერბორდის მონაცემები წარმოადგენს ბოლო 14 დღის საშუალო (მედიანურ) გაზომვას. ასევე ხელმისაწვდომია პროცენტული განაწილებები ჩამონგრეულ ჩანართებში. ხარისხის მეტრიკა ამჟამად გროვდება მოდელების მიხედვით და აჩვენებს მოდელის შემქმნელების მიერ მოწოდებულ ანგარიშებს, მაგრამ ადევნეთ თვალი სიახლეებს, რადგან დავიწყებთ დამოუკიდებელი ხარისხის შეფასებების შედეგების გაზიარებას თითოეული ენდპოინტისთვის. დამატებითი განმარტებებისთვის იხილეთ ჩვენი სრული მეთოდოლოგიის გვერდი. ჩვენი ხარისხის vs. გამტარუნარიანობის (ტოკენი/წმ) დიაგრამა აჩვენებს ვარიანტების სპექტრს სხვადასხვა ხარისხისა და მუშაობის მახასიათებლებით. ზოგიერთ შემთხვევაში, დიზაინის შაბლონები, რომლებიც მოიცავს მრავალ მოთხოვნას უფრო სწრაფი და იაფი მოდელებით, შეიძლება გამოიწვიოს არა მხოლოდ დაბალი ღირებულება, არამედ უკეთესი სისტემის საერთო ხარისხი, შედარებით ერთი დიდი მოდელის გამოყენებასთან. მაგალითად, განვიხილოთ ჩატბოტი, რომელსაც სჭირდება ინტერნეტში ძებნა უახლესი ამბების სტატიებიდან შესაბამისი ინფორმაციის მოსაძებნად. ერთი მიდგომა იქნებოდა დიდი, მაღალი ხარისხის მოდელის, როგორიცაა GPT-4 Turbo, გამოყენება ძიების ჩასატარებლად, შემდეგ კი რამდენიმე საუკეთესო სტატიის წაკითხვა და დამუშავება. მეორე მიდგომა იქნებოდა უფრო მცირე, სწრაფი მოდელის, როგორიცაა Llama 3 8B, გამოყენება ათობით ვებ გვერდიდან ძირითადი მომენტების პარალელურად წასაკითხად და ამოსაღებად, შემდეგ კი GPT-4 Turbo-ს გამოყენება ყველაზე რელევანტური შედეგების შესაფასებლად და შესაჯამებლად. მეორე მიდგომა უფრო ეფექტური იქნება ღირებულების თვალსაზრისით, თუნდაც 10-ჯერ მეტი კონტენტის წაკითხვის გათვალისწინებითაც კი, და შესაძლოა გამოიწვიოს უფრო მაღალი ხარისხის შედეგები.