ხელოვნური ინტელექტის აგენტების წარუმატებლობის დიაგნოსტიკა IT ავტომატიზაციაში: MAST და ITBench-ის კვლევა
IBM Research-ისა და UC Berkeley-ის თანამშრომლობით ჩატარებულმა კვლევამ აჩვენა, თუ როგორ იშლება აგენტური LLM სისტემები რეალურ IT ავტომატიზაციის ამოცანებში. ტრადიციული ბენჩმარკები მხოლოდ წარუმატებლობის ფაქტს აფიქსირებენ, მაგრამ არა მიზეზს. ამ პრობლემის გადასაჭრელად, მკვლევრებმა გამოიყენეს MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია) ITBench-თან ერთად, რათა დაედგინათ წარუმატებლობის სტრუქტურირებული ნიშნები. კვლევამ გამოავლინა, რომ ზოგიერთი მოდელი, როგორიცაა Gemini-3-Flash, ავლენს იზოლირ
IT ავტომატიზაციაში AI აგენტების წარუმატებლობის ანალიზი: IBM-ისა და UC Berkeley-ის ახალი კვლევა
IBM Research-მა და კალიფორნიის უნივერსიტეტის ბერკლის ფილიალმა ითანამშრომლეს, რათა შეესწავლათ, თუ როგორ იშლება აგენტური დიდი ენობრივი მოდელების (LLM) სისტემები რეალური სამყაროს IT ავტომატიზაციის ამოცანებში. მათ შეიმუშავეს MAST (მრავალაგენტური სისტემების წარუმატებლობის ტაქსონომია), ინსტრუმენტი, რომელიც საშუალებას იძლევა დადგინდეს, თუ 'რატომ' ვერ ასრულებს აგენტი დავალებას და არა მხოლოდ 'შეძლო თუ არა'. ITBench-ზე MAST-ის გამოყენებით, მათ გაანალიზეს 310 SRE ტრანზაქცია სამი სხვადასხვა მოდელისგან (Gemi
LLaMA-ს MMLU შეფასება: უთანხმოება ხელოვნური ინტელექტის მოდელების რეიტინგში
Open LLM ლიდერბორდზე LLaMA მოდელის MMLU (Massive Multitask Language Understanding) შეფასების ქულები გაცილებით დაბალი აღმოჩნდა, ვიდრე მის გამოქვეყნებულ ნაშრომში იყო მითითებული. ამან საზოგადოებაში გაკვირვება გამოიწვია. გამოძიებამ გამოავლინა MMLU შეფასების სხვადასხვა იმპლემენტაცია, მათ შორის EleutherAI Harness, ორიგინალი UC Berkeley-ის კოდი და Stanford HELM, რომლებიც განსხვავებულ შედეგებს იძლევა და მოდელების რეიტინგსაც კი ცვლის. სტატია დეტალურად განმარტავს ამ შეუსაბამობის მიზეზებს და დიდი ენობრივი