ხელოვნური ინტელექტის აგენტების წარუმატებლობის დიაგნოსტიკა IT ავტომატიზაციაში: MAST და ITBench-ის კვლევა
IBM Research-ისა და UC Berkeley-ის თანამშრომლობით ჩატარებულმა კვლევამ აჩვენა, თუ როგორ იშლება აგენტური LLM სისტემები რეალურ IT ავტომატიზაციის ამოცანებში. ტრადიციული ბენჩმარკები მხოლოდ წარუმატებლობის ფაქტს აფიქსირებენ, მაგრამ არა მიზეზს. ამ პრობლემის გადასაჭრელად, მკვლევრებმა გამოიყენეს MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია) ITBench-თან ერთად, რათა დაედგინათ წარუმატებლობის სტრუქტურირებული ნიშნები. კვლევამ გამოავლინა, რომ ზოგიერთი მოდელი, როგორიცაა Gemini-3-Flash, ავლენს იზოლირ
IT ავტომატიზაციაში AI აგენტების წარუმატებლობის ანალიზი: IBM-ისა და UC Berkeley-ის ახალი კვლევა
IBM Research-მა და კალიფორნიის უნივერსიტეტის ბერკლის ფილიალმა ითანამშრომლეს, რათა შეესწავლათ, თუ როგორ იშლება აგენტური დიდი ენობრივი მოდელების (LLM) სისტემები რეალური სამყაროს IT ავტომატიზაციის ამოცანებში. მათ შეიმუშავეს MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია), ინსტრუმენტი, რომელიც საშუალებას იძლევა დადგინდეს, თუ 'რატომ' ვერ ასრულებს აგენტი დავალებას და არა მხოლოდ 'შეძლო თუ არა'. ITBench-ზე MAST-ის გამოყენებით, მათ გაანალიზეს 310 SRE ტრანზაქცია სამი სხვადასხვა მოდელისგან (Gemi