ScreenSuite: ახალი სტანდარტი GUI აგენტებისა და VLM-ების შეფასებაში
ბოლო კვირების განმავლობაში, ინტენსიური მუშაობის შედეგად, შევქმენით GUI აგენტების მუშაობის შეფასების უმსხვილესი ბენჩმარკინგ პლატფორმა – ScreenSuite. ეს არის ყველაზე ყოვლისმომცველი და მარტივი გზა Vision Language Models (VLM)-ების მრავალ აგენტურ შესაძლებლობაზე შესაფასებლად, რაც მიზნად ისახავს AI აგენტების ხელმისაწვდომობისა და ინტეგრაციის გაუმჯობესებას.
ბოლო რამდენიმე კვირის განმავლობაში ჩვენ დაუღალავად ვმუშაობდით იმისათვის, რომ GUI აგენტები გამხდარიყო უფრო ღია, ხელმისაწვდომი და მარტივი ინტეგრაციისთვის. ამ პროცესში ჩვენ შევქმენით GUI აგენტების მუშაობის შეფასების უმსხვილესი ბენჩმარკინგ პლატფორმა – წარმოგიდგენთ ScreenSuite-ს. მოხარულნი ვართ გაგიზიაროთ ის დღეს: ScreenSuite არის ყველაზე ყოვლისმომცველი და მარტივი გზა Vision Language Models (VLM)-ების შესაფასებლად მრავალ აგენტურ შესაძლებლობაზე!
**GUI აგენტები მოქმედებაში - OSWorld-ის თავაზიანობით**
მოკლედ, AI აგენტი არის რობოტი, რომელიც მოქმედებს ვირტუალურ სამყაროში. კერძოდ, „GUI აგენტი“ არის აგენტი, რომელიც მოქმედებს გრაფიკულ მომხმარებლის ინტერფეისში (GUI). წარმოიდგინეთ „აგენტი, რომელსაც შეუძლია დააწკაპუნოს და ნავიგაცია გაუწიოს ჩემს დესკტოპზე ან ტელეფონზე“, Claude Computer Use-ის მსგავსად. ეს არსებითად ნიშნავს, რომ აგენტის მამოძრავებელ AI მოდელს მიეცემა დავალება, როგორიცაა „შეავსეთ ამ Excel-ის სვეტის დარჩენილი ნაწილი“, GUI-ს ეკრანის ანაბეჭდებთან ერთად. ამ ინფორმაციის გამოყენებით, ის შემდეგ გადაწყვეტს სისტემაზე მოქმედებას: დაწკაპუნება (x=130, y=540) ვებ ბრაუზერის გასახსნელად, აკრეფა („XYZ-ის ღირებულება 2025 წელს“), გადახვევა (ქვემოთ=2) შემდგომი წასაკითხად…
GUI აგენტის მოქმედებაში სანახავად, შეგიძლიათ სცადოთ ჩვენი Open Computer Agent, რომელიც Qwen2.5-VL-72B-ით არის გამართული. კარგ GUI აგენტს შეეძლება კომპიუტერში ნავიგაცია ისევე, როგორც ჩვენ შეგვიძლია, რითაც ყველა კომპიუტერული დავალება განბლოკავს: Google Maps-ში გადახვევა, ფაილის რედაქტირება, ნივთის ონლაინ ყიდვა. ეს მოიცავს მრავალფეროვან შესაძლებლობებს, რომელთა შეფასება რთულია. ლიტერატურა, მაგალითად Xu et al. (2025) ან Qin et al. (2025), ზოგადად GUI აგენტის შესაძლებლობებს რამდენიმე კატეგორიად ყოფს:
ასე რომ, ჩვენი პირველი წვლილი არის ამ GUI აგენტის შესაძლებლობების სრული სპექტრის მოცული 13 ბენჩმარკის ყოვლისმომცველი ნაკრების შეგროვება და გაერთიანება. თუ გადახედავთ ზემოთ ჩამოთვლილ ბოლო კატეგორიას, მრავალსაფეხურიანი აგენტური შესაძლებლობების შეფასება განსაკუთრებით რთულია, რადგან ის მოითხოვს ვირტუალურ მანქანებს აგენტის გარემოს გასაშვებად, იქნება ეს Windows, Android, Ubuntu... ამ პრობლემის გადასაჭრელად, ჩვენ მხარს ვუჭერთ როგორც E2B დესკტოპის დისტანციურ სენდბოქსებს, ასევე ნულიდან შევქმენით ახალი ვარიანტი Ubuntu ან Android ვირტუალური მანქანების მარტივად გასაშვებად Docker-ში!
**განხორციელების დეტალები**
ჩვენ საგულდაგულოდ შევქმენით ჩვენი ბენჩმარკინგის ნაკრები მოდულარობისა და თანმიმდევრულობის გათვალისწინებით, რაც უზრუნველყოფს ძლიერ შესაბამისობას ამოცანებსა და გარემოებებს შორის. საჭიროების შემთხვევაში, განსაკუთრებით ონლაინ ბენჩმარკებისთვის, ჩვენ ვიყენებთ smolagents-ს, როგორც ფრეიმვორკის ფენას აგენტების შესრულებისა და ორკესტრირების გასამარტივებლად. რეპროდუცირებადობისა და გამოყენების სიმარტივის უზრუნველსაყოფად, ჩვენ ავაშენეთ მორგებული Docker-ში ინტეგრირებული კონტეინერები, რომლებიც იძლევა სრული Ubuntu Desktop ან Android გარემოს ლოკალურ განთავსების საშუალებას.
მრავალი არსებული GUI ბენჩმარკისგან განსხვავებით, რომლებიც ვიზუალური შეყვანის გარდა, ეყრდნობიან ხელმისაწვდომობის ხეებს ან სხვა მეტამონაცემებს, ჩვენი სისტემა მიზანმიმართულად მხოლოდ ვიზუალურია. მიუხედავად იმისა, რომ ამან შეიძლება გამოიწვიოს განსხვავებული ქულები ზოგიერთ არსებულ ლიდერბორდზე, ჩვენ მიგვაჩნია, რომ ეს ქმნის უფრო რეალისტურ და რთულ გარემოს, რომელიც უკეთ ასახავს, თუ როგორ აღიქვამენ და ურთიერთქმედებენ ადამიანები გრაფიკულ ინტერფეისებთან.
* ყველა აგენტური ფრეიმვორკი (Android World, OSWorld, GAIAWeb, Mind2Web) იყენებს smolagents-ს და ეყრდნობა მხოლოდ ვიზუალურ ინფორმაციას, ყოველგვარი ხელმისაწვდომობის ხის ან DOM-ის დამატების გარეშე (განსხვავებით სხვა წყაროებში მოხსენებული შეფასების პარამეტრებისგან).
* Mind2Web (მულტიმოდალური) თავდაპირველად იყენებდა ელემენტის სახელზე დაფუძნებულ მრავალჯერად არჩევანს ხელმისაწვდომობის ხისა და ეკრანის ანაბეჭდების საფუძველზე, მაგრამ მოგვიანებით ადაპტირდა დაწკაპუნების სიზუსტეზე საზღვრების შიგნით მხოლოდ ვიზუალური ინფორმაციის გამოყენებით, რამაც მნიშვნელოვნად გაზარდა ამოცანის სირთულე.
**წამყვანი VLM-ების შეფასება ბენჩმარკზე**
ჩვენი ქულები ზოგადად შეესაბამება სხვადასხვა წყაროში მოხსენებულ ქულებს! იმ გაფრთხილებით, რომ ჩვენ ვაფასებთ მხოლოდ ვიზუალური ინფორმაციის საფუძველზე, რაც იწვევს გარკვეულ განსხვავებებს; იხილეთ განხორციელების დეტალები ზემოთ.
💡 გაითვალისწინეთ, რომ ScreenSuite მიზნად არ ისახავს ინდუსტრიაში გამოქვეყნებული ბენჩმარკების ზუსტად გამეორებას: ჩვენ ვაფასებთ მოდელებს GUI აგენტურ შესაძლებლობებზე ვიზუალური ინფორმაციის საფუძველზე. შედეგად, Mind2Web-ის მსგავს ბენჩმარკებზე, სადაც სხვა ბენჩმარკები აგენტს აწვდიდნენ ინფორმაციულ კონტექსტს, როგორიცაა DOM ან ხელმისაწვდომობის ხე, ჩვენი შეფასების პარამეტრი გაცილებით რთულია, ამიტომ ScreenSuite-ის შედეგები არ ემთხვევა სხვა წყაროების შედეგებს.
მრავალსაფეხურიანი ბენჩმარკები საჭიროებს bare-metal მანქანას დესკტოპის/მობილური* გარემოს *ემულატორების გასაშვებად და დასანერგად (იხილეთ README.md). თანმიმდევრული და მნიშვნელოვანი შეფასებების მარტივად ჩატარება საზოგადოებას საშუალებას აძლევს სწრაფად განავითაროს და მიაღწიოს პროგრესს ამ სფეროში, როგორც ეს ვნახეთ Eleuther LM evaluation harness-ის, Open LLM Leaderboard-ისა და Chatbot Arena-ს შემთხვევაში. ვიმედოვნებთ, რომ მომდევნო თვეებში ვიხილავთ ბევრად უფრო ქმედითუნარიან ღია მოდელებს, რომლებსაც შეუძლიათ ამოცანების ფართო სპექტრი სანდოდ შეასრულონ და გაეშვან ლოკალურად!
თეგები:
#ხელოვნური ინტელექტი
#კომპიუტერული ხედვა
#vlm
#მოდელის შეფასება
#screensuite
#gui აგენტები
#ai ბენჩმარკინგი
წყარო: huggingface.co
AI-ით გადამუშავებული