ამ გამოწვევის გადასაჭრელად, Adyen-მა და Hugging Face-მა ერთობლივად შექმნეს მონაცემთა აგენტების ბენჩმარკი მრავალსაფეხურიანი აზროვნებისთვის (DABstep). DABstep მოიცავს 450-ზე მეტ მონაცემთა ანალიზის ამოცანას, რომლებიც შექმნილია უახლესი დიდი ენობრივი მოდელებისა (LLMs) და AI აგენტების შესაძლებლობების შესაფასებლად. ჩვენი მიგნებები ცხადყოფს, რომ DABstep მნიშვნელოვან გამოწვევას წარმოადგენს ამჟამინდელი AI მოდელებისთვის, სადაც ყველაზე მოწინავე აზროვნებაზე დაფუძნებული აგენტები მხოლოდ 16%-იან სიზუსტეს აღწევენ, რაც ხაზს უსვამს სფეროში მნიშვნელოვანი პროგრესის აუცილებლობას. DABstep AI მოდელებისგან მოითხოვს: ამ ბლოგ-პოსტში განვიხილავთ ბენჩმარკის დიზაინსა და აგებას, შევაფასებთ შედეგებს და ვისაუბრებთ არსებულ მოდელებსა და რთული მონაცემთა ანალიზის ამოცანების ეფექტურად გადაჭრის უნარს შორის არსებულ მნიშვნელოვან უფსკრულზე. მონაცემთა ანალიზი ერთდროულად ხელოვნებაც არის და მეცნიერებაც, რომელიც მოითხოვს ტექნიკურ უნარებს, დომენურ ცოდნასა და კრეატიულობას, ამიტომაც ის იშვიათად არის მარტივი. გამოცდილი მონაცემთა ანალიტიკოსებიც კი აწყდებიან გამოწვევებს, მაგალითად: Adyen-ის მსგავს კომპანიებში ანალიტიკოსები წყვეტენ პრობლემების მთელ სპექტრს, რუტინული მოთხოვნებიდან დაწყებული, რთული სამუშაო პროცესებით დამთავრებული, რომლებიც კრეატიულობას, სიზუსტესა და იტერაციულ აზროვნებას მოითხოვს. უნარიანი მონაცემთა ანალიზის აგენტზე წვდომა, რომელსაც შეუძლია მარტივი და განმეორებადი ამოცანების ავტომატიზაცია და რთულ ამოცანებში დახმარება, ანალიტიკოსებს საშუალებას მისცემს იმუშაონ უფრო სწრაფად, შეამცირონ გონებრივი დატვირთვა და ფოკუსირდნენ უფრო მნიშვნელოვანი პრობლემების გადაჭრაზე. ეს გადამწყვეტი მომენტი იქნება მრავალი ინდუსტრიისთვის, რომლებსაც მონაცემთა ანალიზი და ინსაიტები სჭირდებათ, მაგალითად, ფინანსებისთვის. აგენტურ სამუშაო პროცესებში — სადაც ინსტრუმენტებით აღჭურვილი LLM-ები დამოუკიდებლად ასრულებენ მრავალსაფეხურიან ამოცანებს — ბოლო მიღწევებმა უდიდესი პერსპექტივა აჩვენა ისეთ სფეროებში, როგორიცაა კოდირება, ღია QA, პროგრამული უზრუნველყოფის ინჟინერია და Kaggle-ის კონკურსებიც კი. ეს სისტემები მხოლოდ თეორიული არ არის; მათ რეალურ სამყაროში პროდუქტიულობის ზრდა გამოიწვიეს. ამრიგად, ჩნდება კითხვა: შეუძლიათ თუ არა აგენტურ სამუშაო პროცესებს შეცვალონ მონაცემთა ანალიზისადმი ჩვენი მიდგომა? მანქანურ სწავლებაში პროგრესს ხელს უწყობს მაღალი ხარისხის ბენჩმარკები, რომლებიც საიმედო პროგრესის სიგნალებს იძლევა. ამიტომ, სიხარულით წარმოგიდგენთ მონაცემთა აგენტების ბენჩმარკს მრავალსაფეხურიანი აზროვნებისთვის (DABstep), ახალ ბენჩმარკს მონაცემთა ანალიზში აგენტური სამუშაო პროცესების შესაფასებლად და გასაუმჯობესებლად. აი, რა ხდის DABstep-ს უნიკალურს: როგორ აღწევს DABstep ყოველივე ამას და ამავე დროს რჩება მარტივად გასაშვებ ბენჩმარკად? მოდით, გადავხედოთ მის დიზაინს! DABstep შექმნილია დაბალი ბარიერით სარგებლობისთვის, ხარისხიანი შეფასებისთვის და სირთულის მზარდი დონეებისთვის. ამ მიზნით, DABstep-ის ნაწილად ხელმისაწვდომი ხდება შემდეგი ელემენტები: მონაცემთა ნაკრებები (Datasets), ამოცანები (Tasks), შეფასებები (Evals), რეალურ დროში ლიდერბორდი (Real-time Leaderboard) და ბაზისური მოდელები (Baselines). ერთ-ერთი უდიდესი გამოწვევა, რომელსაც ანალიტიკოსები რეალურ პრობლემებზე მუშაობისას უნდა გადალახონ, არის დომენური ცოდნისა და ტექნიკური უნარების დაბალანსება. ამ მიზნით, DABstep მოიცავს როგორც არასტრუქტურირებულ, ისე სტრუქტურირებულ მონაცემებს დომენური ცოდნისა და ტექნიკური უნარების შესაბამისად გასაზომად. ცხრილი 1 გვიჩვენებს ზოგიერთი მონაცემთა ნაკრების ამონარიდს, რომელსაც ბენჩმარკთან ერთად ვაქვეყნებთ. ცხრილი 1: ბენჩმარკი შედგება სხვადასხვა მონაცემთა ნაკრებისგან, რომელიც მოიცავს სხვადასხვა ამოცანას, მათ შორის ფინანსური გადახდების სექტორს. ზოგიერთი სტრუქტურირებული მონაცემთა ნაკრები მოიცავს CSV და JSON ფაილებს, რომლებიც წარმოადგენს რეალურ მონაცემებს, როგორიცაა ტრანზაქციების ტელემეტრია და ბიზნეს მეტამონაცემები (მაგ., ვაჭრის კატეგორიის კოდები). გარდა ამისა, გვაქვს არასტრუქტურირებული მონაცემები, როგორიცაა დოკუმენტაცია, ვრცელი სახელმძღვანელოები და დეტალური ინსტრუქციები, რომლებიც, მაგალითად, გაცემულია ქსელების, მარეგულირებლებისა და პროცესორების მიერ. ყველა ეს მონაცემთა ნაკრები ამოღებულია Adyen-ში არსებული რეალური ამოცანებიდან. DABstep-ში შემავალი ახალი მონაცემთა ნაკრებების საფუძველზე, ჩვენ ვაქვეყნებთ რამდენიმე ამოცანას სირთულის მზარდი დონეებით, რომლებიც შექმნილია AI აგენტის სიზუსტის შესამოწმებლად. თითოეული ამოცანა შეიცავს შემდეგ ელემენტებს: არცერთი ამოცანის ამოხსნა შეუძლებელია კოდის ერთი შოტით; სხვა სიტყვებით რომ ვთქვათ, მათი გადაჭრა მხოლოდ აზროვნებით არ შეიძლება, არამედ ისინი საჭიროებენ პრობლემის გადაჭრის იტერაციული თანმიმდევრული ნაბიჯებს. მაგალითად, მინიმუმ, აგენტმა უნდა იცოდეს, თუ რომელი სვეტები არსებობს შესაბამის მონაცემთა ნაკრებში, რათა უპასუხოს შეკითხვას. ეს განსხვავდება პოპულარული ბენჩმარკებისგან, როგორიცაა GAIA, MATH და SimpleQA, სადაც შესაძლებელია მრავალ შეკითხვაზე სწორად პასუხის გაცემა კოდის ერთი შოტით. ორი მაგალითი ამოცანა მოცემულია სურათი 1-ზე, ხოლო ადამიანის მიერ შექმნილი საცნობარო ამოხსნის მაგალითი მოცემულია სურათი 2-ზე. სურათი 1: მარცხნივ მოცემულია რისკის/თაღლითობის კითხვის მაგალითი მარტივი ნაკრებიდან. ამოხსნა მოითხოვს მინიმუმ 2 მონაცემთა წყაროს მითითებას და კოდის 3 შოტს. მარჯვნივ მოცემულია სქემის საკომისიოს კითხვის მაგალითი რთული ნაკრებიდან. ამოხსნა მოითხოვს მინიმუმ 2 მონაცემთა წყაროს მითითებას და კოდის მრავალ შოტს. მოცემული პასუხები მხოლოდ დემონსტრაციისთვის არის განკუთვნილი და არ არის შეტანილი მონაცემთა ნაკრებში. ბენჩმარკი შედგება სირთულის ორი დონისგან: როგორც მრავალსაფეხურიანი აზროვნების პრობლემის მაგალითი, შემდეგი კოდი გვიჩვენებს ადამიანის მიერ შექმნილი საცნობარო ამოხსნის ფრაგმენტს რთული დონის ამოცანისთვის. მთლიანობაში, ის იყოფა ოთხ (4) თანმიმდევრულ ნაბიჯად, მათ შორის სხვადასხვა დამხმარე მაკროსის შემუშავებას. ამ ამოხსნის დასაკოდირებლად, აგენტს უნდა ჰქონოდა სპეციფიკური დომენური ცოდნა და იტერაციული აზროვნების თანმიმდევრული ნაბიჯებით მუშაობის უნარი.