IBM Research-მა და კალიფორნიის უნივერსიტეტის ბერკლის ფილიალმა ითანამშრომლეს კვლევის ფარგლებში, რათა შეესწავლათ, თუ როგორ იშლება აგენტური დიდი ენობრივი მოდელების (LLM) სისტემები რეალური სამყაროს IT ავტომატიზაციაში, ისეთი ამოცანების შესრულებისას, როგორიცაა ინციდენტების ტრიაჟი, ლოგებისა და მეტრიკების მოთხოვნები და Kubernetes-ის ოპერაციები გრძელვადიანი ინსტრუმენტების ციკლებში. ბენჩმარკები, როგორც წესი, ამცირებენ შესრულებას ერთ ციფრამდე, რაც გეუბნებათ, წარუმატებელი იყო თუ არა აგენტი, მაგრამ არა – რატომ. ამ „შავი ყუთის“ პრობლემის გადასაჭრელად, ჩვენ გამოვიყენეთ MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია), განვითარებადი პრაქტიკა აგენტური სისტემების საიმედოობის დიაგნოსტიკისთვის. MAST-ის გამოყენებით ITBench-ის გასაანალიზებლად – ინდუსტრიული ბენჩმარკი SRE (Site Reliability Engineering), უსაფრთხოებისა და FinOps ავტომატიზაციისთვის – ჩვენ დაუმუშავებელი შესრულების ტრანზაქციები ვაქციეთ სტრუქტურირებულ წარუმატებლობის ხელმოწერებად, რამაც გამოავლინა ზუსტად რა გაფუჭდა და როგორ უნდა გამოსწორდეს. ჩვენ მოვნიშნეთ ITBench SRE-ის 310 ტრანზაქცია სამი სხვადასხვა მოდელის კლასის მასშტაბით: Gemini-3-Flash, Kimi-K2 და GPT-OSS-120B. **ძირითადი დასკვნები:** ჩვენი ანალიზის შედეგები აგენტების შექმნისას: თუ თქვენ აშენებთ აგენტებს საწარმოო IT სამუშაო პროცესებისთვის, ეს არის შეფასების ის სახეობა, რაც გჭირდებათ: არა მხოლოდ „გაიარა თუ არა ტესტი?“, არამედ „რა გაფუჭდა, სად და რა ინტერვენციაა ყველაზე ეფექტიანი?“. ITBench-ის მსგავსი ბენჩმარკები სტანდარტად იქცევა აგენტური სისტემების მუშაობის გასაზომად მაღალი რისკის შემცველ IT ავტომატიზაციის ამოცანებში. ITBench-ში აგენტები მოქმედებენ როგორც Site Reliability Engineer-ები (SREs) ან უსაფრთხოების ანალიტიკოსები, რომელთა ამოცანაა Kubernetes-ის გაუმართაობის დიაგნოსტიკა, დაუცველობების გამოსწორება ან ღრუბლოვანი ხარჯების მართვა საწარმოო გარემოში. ეს ბენჩმარკები წარმატების მაჩვენებელს იყენებენ, როგორც აგენტების შეფასების მთავარ მეტრიკას. თუმცა, ეს მეტრიკა არასაკმარისია მდგრადი სისტემების შესაქმნელად. იმის ცოდნა, რომ აგენტური სისტემა ITBench-ზე 14%-იან წარმატებას აღწევს, გვეუბნება, რომ ის წარუმატებელი იყო, მაგრამ არა – რატომ: წარუმატებელი იყო იმიტომ, რომ კონტექსტი დაავიწყდა? იმიტომ, რომ ბრძანება „აჰალუცინირა“? თუ იმიტომ, რომ უბრალოდ არ დასრულებულა? ამ წარუმატებლობების დიაგნოსტიკის ყოვლისმომცველი მიდგომის გარეშე, დეველოპერები გამოცნობის რეჟიმში რჩებიან, ხშირად მიმართავენ ბრმა პრომპტინგის ცვლილებებს, რომლებიც ერთ პრობლემას აგვარებენ, მაგრამ მეორეს ქმნიან. როგორც ახალი სტანდარტი რთული აგენტური სისტემების წარუმატებლობის რეჟიმების გასაანალიზებლად, ჩვენ შევიმუშავეთ MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია). MAST უფრო მეტ გამჭრიახობას გვთავაზობს და ხსნის ამ ბენჩმარკების გაუმჭვირვალე შეფასებას. 1,600-ზე მეტი ტრანზაქციის მკაცრი ანალიზის საფუძველზე, რომელიც მოიცავს შვიდ სხვადასხვა ფრეიმვორკს, MAST უზრუნველყოფს აგენტების წარუმატებლობის სტანდარტიზებულ ტაქსონომიას. MAST გარდაქმნის არასტრუქტურირებულ შესრულების ლოგებს სტრუქტურირებულ „წარუმატებლობის ვექტორებად“ 14 გამორჩეული ნიმუშის საფუძველზე სამ ძირითად კატეგორიაში. ჩვენ გამოვცადეთ MAST-ის გამოყენების იდეა აგენტების შეფასებების უფრო ქმედითი გახდომისთვის და წარუმატებლობის რეჟიმების შესახებ ინფორმაციის მისაღებად ITBench-ზე მისი გამოყენებით – პოპულარული შეფასების კომპლექტი IT ავტომატიზაციის ამოცანებისთვის SRE, უსაფრთხოება/კომპლაინსი და FinOps სფეროებში. ჩვენ მოვნიშნეთ ITBench SRE-ის 310 შესრულების ტრანზაქცია, რომელიც გენერირებულია Codex-ით აგებული SRE აგენტის მიერ რეალისტურ გარემოში. ეს ტრანზაქციები აღწერს ბუნებრივი ენის ინტერაქციებს აგენტებსა და მათ ინსტრუმენტებს შორის სამი მოდელის მასშტაბით, რომლებიც წარმოადგენენ სხვადასხვა შესაძლებლობების დონეს: Gemini-3-Flash, Kimi-K2 და GPT-OSS-120B. ეს საშუალებას გვაძლევს, გასცდეთ მარტივ წარმატების მეტრიკას და გამოვიკვლიოთ წარუმატებლობის გამორჩეული ნიშნები, რომლებიც ამ შედეგებს განაპირობებს. ამისთვის ვიყენებთ recall-ის ქულებს, რადგან მოდელები დიზაინით მხოლოდ მაქსიმუმ 3-5 გამომავალს იძლევიან და SRE-ები F-1 ქულაზე recall-ის ქულებს ამჯობინებენ. ქვემოთ დეტალურად აღვწერთ ამ დიაგნოსტიკური ანალიზის შედეგებს. წარუმატებელი ტრანზაქციების განხილვისას, სამივე მოდელში სირთულის მკაფიო იერარქია ვლინდება. ეს იზომება წარუმატებელ გაშვებაზე დაფიქსირებული გამორჩეული წარუმატებლობის რეჟიმების რაოდენობით. წარუმატებლობის რეჟიმის სიმკვრივის ეს განსხვავება ავლენს ფუნდამენტურ სხვაობას იმაში, თუ როგორ იშლება ეს სისტემები. Gemini-3-Flash ავლენს „ქირურგიული“ წარუმატებლობის პროფილს. წარუმატებელი გაშვებების დროსაც კი, ის ინარჩუნებს მაღალ შიდა თანმიმდევრულობას და, როგორც წესი, იშლება ერთი იზოლირებული წარუმატებლობის გამო, როგორიცაა არასწორი ვერიფიკაციის ნაბიჯი. ეს წარუმატებლობები ზუსტია და გაცილებით ადვილია მათი დიაგნოსტიკა. სპექტრის მეორე მხარეს, GPT-OSS-120B განიცდის კასკადურ კოლაფსს. ამ ტრანზაქციებში ვამჩნევთ, რომ შეცდომები დროთა განმავლობაში გროვდება. მცირე ლოგიკური შეუსაბამობა პროცესის დასაწყისში ხშირად იწვევს დავალების სპეციფიკაციიდან გადახრას, რაც თავის მხრივ აგენტის სრულ დერეილმენტს იწვევს. Kimi-K2 წარმოადგენს შუალედურ პოზიციას, სადაც წარუმატებლობები უფრო ხშირი და რთულია, ვიდრე მოწინავე მოდელში, მაგრამ არ აღწევს ისეთ სისტემურ არასტაბილურობას, როგორიც შეინიშნება 120B ღია წონის მოდელში. ამ დასკვნის მნიშვნელობა ის არის, რომ წარმატების უფრო მაღალ მაჩვენებელს ხშირად თან ახლავს იზოლირებული წარუმატებლობები. სისტემები, რომლებიც ნაკლები ერთდროული პრობლემით იშლება, ბევრად უფრო პროგნოზირებადი და ადვილია გასაუმჯობესებლად მიზანმიმართული საინჟინრო ინტერვენციების მეშვეობით. MAST-ის ალბათ ყველაზე კრიტიკული დასკვნა არის იმ წარუმატებლობების გარჩევა, რომლებსაც სისტემა უძლებს, იმ წარუმატებლობებისგან, რომლებიც საბედისწეროა შემდგომი ამოცანის წარმატებისთვის. წარმატებულ ტრანზაქციებსა და წარუმატებელ ტრანზაქციებში წარუმატებლობის რეჟიმების განაწილების შედარებით, ჩვენ შეგვიძლია მათი სამ კატეგორიად კლასიფიკაცია. სამივე მოდელის მასშტაბით...