ITBench HF Space ITBench HF Dataset MAST HF Dataset ITBench Github MAST Github IBM Research-მა და UC Berkeley-მ ითანამშრომლეს, რათა შეესწავლათ, თუ როგორ იშლება აგენტური LLM სისტემები რეალურ IT ავტომატიზაციის პირობებში, ისეთი ამოცანებისთვის, რომლებიც მოიცავს ინციდენტების სორტირებას, ლოგებისა/მეტრიკების მოთხოვნებს და Kubernetes-ის ოპერაციებს გრძელვადიანი ხელსაწყოების მარყუჟებში. ბენჩმარკები, როგორც წესი, ამცირებენ შესრულებას ერთ რიცხვამდე, გვეუბნებიან, ჩავარდა თუ არა აგენტი, მაგრამ არასოდეს - რატომ. ამ 'შავი ყუთის' პრობლემის გადასაჭრელად, ჩვენ გამოვიყენეთ MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია), რომელიც არის განვითარებადი პრაქტიკა აგენტური სანდოობის დიაგნოსტიკისთვის. MAST-ის გამოყენებით ITBench-ის გასაანალიზებლად — ინდუსტრიული ეტალონი SRE, უსაფრთხოებისა და FinOps ავტომატიზაციისთვის — ჩვენ გადავაქციეთ შესრულების პირველადი კვალი სტრუქტურირებულ წარუმატებლობის ნიშნებად, რაც ზუსტად გვიჩვენებს, რა გაფუჭდა და როგორ გამოსწორდეს ის. ჩვენ აღვნიშნეთ 310 ITBench SRE კვალი სამი განსხვავებული მოდელის კლასის მასშტაბით: Gemini-3-Flash, Kimi-K2 და GPT-OSS-120B. ძირითადი მიგნებები: ჩვენი ანალიზის დასკვნები აგენტების აშენებისას: თუ თქვენ აშენებთ აგენტებს საწარმოს IT სამუშაო პროცესებისთვის, ეს არის შეფასების ის ტიპი, რაც გსურთ: არა მხოლოდ „გაიარა თუ არა?“, არამედ „რა გაფუჭდა, სად და რა ინტერვენციაა ყველაზე ეფექტური?“ ITBench-ის მსგავსი ბენჩმარკები ხდება სტანდარტი აგენტური შესრულების გასაზომად მაღალი რისკის შემცველ IT ავტომატიზაციის ამოცანებში. ITBench-ში აგენტები მოქმედებენ როგორც სისტემის სანდოობის ინჟინრები (SREs) ან უსაფრთხოების ანალიტიკოსები, რომელთა ამოცანაა Kubernetes-ის შეფერხებების დიაგნოსტიკა, დაუცველობის გამოსწორება ან ღრუბლოვანი ხარჯების მართვა საწარმოო გარემოში. ეს ბენჩმარკები წარმატების მაჩვენებელს იყენებენ, როგორც აგენტების შესაფასებლად მთავარ მეტრიკას. თუმცა, ეს მეტრიკა არასაკმარისია მყარი სისტემების შესაქმნელად. იმის ცოდნა, რომ აგენტური სისტემა ITBench-ზე 14%-იან წარმატების მაჩვენებელს აღწევს, გვეუბნება, რომ ის ჩავარდა, მაგრამ არა რატომ: ჩავარდა იმიტომ, რომ დაავიწყდა კონტექსტი? იმიტომ, რომ მან მოიგონა ბრძანება? თუ იმიტომ, რომ ის უბრალოდ არ დასრულდა? ამ წარუმატებლობების დიაგნოსტიკისთვის ყოვლისმომცველი მიდგომის გარეშე, დეველოპერები გამოცნობაზე არიან დამოკიდებულნი, ხშირად მიმართავენ ბრმა პრომპტინგის შესწორებებს, რომლებიც ერთ პრობლემას აგვარებენ, რათა მეორე შექმნან. როგორც რთული აგენტური სისტემების წარუმატებლობის რეჟიმების ანალიზის ახალი სტანდარტი, ჩვენ შევიმუშავეთ MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია). MAST მოაქვს მეტ შეხედულებას და ხსნის ამ ბენჩმარკების გაუმჭვირვალე შეფასებას. შვიდი სხვადასხვა ფრეიმვორკის 1,600-ზე მეტი კვალის საფუძვლიანი ანალიზის შედეგად მიღებული MAST უზრუნველყოფს აგენტების წარუმატებლობის სტანდარტიზებულ ტაქსონომიას. MAST გარდაქმნის არასტრუქტურირებულ შესრულების ლოგებს სტრუქტურირებულ „წარუმატებლობის ვექტორებად“, 14 განსხვავებული შაბლონის საფუძველზე სამ ძირითად კატეგორიაში. ჩვენ გამოვცადეთ MAST-ის გამოყენების იდეა აგენტების შეფასებების პრაქტიკულად გამოსადეგად გადაქცევისა და წარუმატებლობის რეჟიმების შესახებ შეხედულებების მისაღებად, მისი გამოყენებით ITBench-ზე, პოპულარულ შეფასების კომპლექტზე IT ავტომატიზაციის ამოცანებისთვის SRE, უსაფრთხოების/კომპლაინსის და FinOps-ის მასშტაბით. ჩვენ აღვნიშნეთ 310 ITBench SRE შესრულების კვალი, რომელიც წარმოებულია Codex-ით აგებული SRE აგენტის მიერ რეალისტურ გარემოში. ეს კვალი აღბეჭდავს ბუნებრივი ენის ინტერაქციებს აგენტებსა და მათ ინსტრუმენტებს შორის სამი მოდელის მასშტაბით, რომლებიც წარმოადგენენ შესაძლებლობების სხვადასხვა დონეს: Gemini-3-Flash, Kimi-K2 და GPT-OSS-120B. ეს საშუალებას გვაძლევს, გასცდეთ მარტივ წარმატების მეტრიკებს და გამოვიკვლიოთ ის განსხვავებული წარუმატებლობის ნიშნები, რომლებიც განაპირობებენ ამ შედეგებს. ამისთვის ვიყენებთ Recall მაჩვენებლებს, რადგან მოდელები დიზაინით მხოლოდ მაქსიმუმ 3-5 გამომავალს წარმოადგენენ და SRE-ები F-1 ქულას ამჯობინებენ Recall მაჩვენებლებს. ქვემოთ დეტალურად აღვწერთ ამ დიაგნოსტიკური ანალიზის მიგნებებს. როდესაც ვცდილობთ ჩავარდნილი კვალის გამოკვლევას, სამ მოდელში სირთულის მკაფიო იერარქია ხდება აშკარა. ეს იზომება წარუმატებელი გაშვების დროს დაკვირვებული წარუმატებლობის რეჟიმების განსხვავებული რაოდენობით. წარუმატებლობის რეჟიმების სიმკვრივის ეს უთანასწორობა ავლენს ფუნდამენტურ განსხვავებას იმაში, თუ როგორ იშლება ეს სისტემები. Gemini-3-Flash ავლენს ქირურგიული სიზუსტის წარუმატებლობის პროფილს. წარუმატებელი გაშვებების დროსაც კი, ის ინარჩუნებს მაღალ შიდა თანმიმდევრულობას და, როგორც წესი, იშლება ერთი იზოლირებული წარუმატებლობის გამო, როგორიცაა არასწორი გადამოწმების ნაბიჯი. ეს წარუმატებლობები ზუსტია და გაცილებით ადვილია მათი დიაგნოსტიკა. სპექტრის საპირისპირო ბოლოზე, GPT-OSS-120B განიცდის კასკადურ კოლაფსს. ამ კვალში ჩვენ ვამჩნევთ, რომ შეცდომები დროთა განმავლობაში გროვდება. მცირე მსჯელობის შეუსაბამობა პროცესის დასაწყისში ხშირად იწვევს ამოცანის სპეციფიკაციიდან გადახვევას, რაც თავის მხრივ იწვევს აგენტის სრულ რელსებიდან გადასვლას. Kimi-K2 წარმოადგენს შუალედურ პოზიციას, სადაც წარუმატებლობები უფრო ხშირი და რთულია, ვიდრე ფრონტიერ მოდელში, მაგრამ არ აღწევს სისტემურ არასტაბილურობას, რაც შეინიშნება 120B ღია წონის მოდელში. ამ მიგნებათა მნიშვნელობა იმაში მდგომარეობს, რომ უფრო მაღალ წარმატების მაჩვენებელს ხშირად თან ახლავს იზოლირებული წარუმატებლობა. სისტემები, რომლებიც ნაკლები ერთდროული პრობლემით იშლება, გაცილებით უფრო პროგნოზირებადი და მარტივია გასაუმჯობესებლად მიზნობრივი საინჟინრო ინტერვენციების მეშვეობით. შესაძლოა, MAST-დან ყველაზე კრიტიკული შეხედულება არის წარუმატებლობების გარჩევა, რომელთა ატანა სისტემას შეუძლია, იმ წარუმატებლობებისგან, რომლებიც ფატალურია შემდგომი ამოცანის წარმატებისთვის. წარუმატებლობის რეჟიმების განაწილების შედარებით წარმატებულ კვალში წარუმატებელ კვალთან მიმართებაში, ჩვენ შეგვიძლია მათი კლასიფიცირება სამ კატეგორიად. სამივე მოდელის მასშტაბით