ხელოვნური ინტელექტის აუდიტორი: ახალი გადამწყვეტი როლი ბიზნესისა და ტექნოლოგიებისთვის
ხელოვნური ინტელექტის (AI) აღმავლობასთან ერთად, ბიზნესისა და ტექნოლოგიების სფეროში ახალი, გადამწყვეტი როლი ჩნდება: AI აუდიტორი. ფინანსური აუდიტორების მსგავსად, ისინი აკონტროლებენ და აანალიზებენ AI ტრანზაქციების ქცევას, ფულადი ტრანზაქციების ნაცვლად. ეს როლი განსაკუთრებით მნიშვნელოვანია, რადგან AI სისტემები ხშირად აწყდება მონაცემთა ხარისხის, მიკერძოების, „ჰალუცინაციებისა“ და სხვა პრობლემებს. AI აუდიტორები უზრუნველყოფენ ხელოვნური ინტელექტის სიზუსტეს, სიცოცხლისუნარიანობას კანონის, ეთიკის, უსაფრთხოები
AI აგენტებისთვის ვებ-მონაცემების დასასტრუქტურირებლად, ვებ-ძიების სტარტაპმა Nimble-მა 47 მილიონი დოლარის ინვესტიცია მოიზიდა
ვებ-ძიების სტარტაპმა Nimble-მა, Norwest-ის ხელმძღვანელობით, B სერიის 47 მილიონი დოლარის ინვესტიცია მოიზიდა. კომპანია იყენებს AI აგენტებს ვებ-გვერდების რეალურ დროში მოსაძიებლად, შედეგების შესამოწმებლად და ინფორმაციის სტრუქტურირებულ ცხრილებად გადასაქცევად, რაც აადვილებს საწარმოებისთვის მონაცემთა ინტეგრაციას არსებულ საცავებთან. ეს მიდგომა აგვარებს ისეთ პრობლემებს, როგორიცაა უბრალო ტექსტური შედეგები და AI-ის „ჰალუცინაციები“, რაც საშუალებას აძლევს ბიზნესებს გამოიყენონ სანდო, სტრუქტურირებული ვებ-მონაც
Vectara-ს HHEM ლიდერბორდი Hugging Face-ის შაბლონით LLM-ის „ჰალუცინაციის“ შესაფასებლად
კომპანია Vectara-მ წარმოადგინა ჰიუზის ჰალუცინაციის შეფასების მოდელი (HHEM), ღია კოდის ინსტრუმენტი, რომელიც ზომავს დიდი ენობრივი მოდელების (LLM) მიერ „ჰალუცინაციის“ (უაზრო ტექსტის გენერირება) ხარისხს. მოდელი აფასებს როგორც ღია კოდის, ასევე კომერციულ LLM-ებს, ხაზს უსვამს მათ შორის არსებულ განსხვავებებს. HHEM ლიდერბორდის მართვის საჭიროების გამო, Vectara-მ Hugging Face-ის ახალი ლიდერბორდის შაბლონები გამოიყენა და გამოუშვა HHEM ლიდერბორდი. ეს ინიციატივა მიზნად ისახავს LLM „ჰალუცინაციების“ შეფასების დე
დიდი ენობრივი მოდელების „ჰალუცინაციების“ საზომი ლიდერბორდი
„ჰალუცინაციების ლიდერბორდი“ წარმოადგენს ყოვლისმომცველ ღია პლატფორმას, რომელიც კონტექსტური სწავლების მეშვეობით აფასებს დიდი ენობრივი მოდელების (LLMs) მიერ გენერირებულ კონტენტში არსებულ „ჰალუცინაციებს“. ეს პროექტი, რომელზეც უკვე გამოქვეყნებულია სამეცნიერო ნაშრომი, მიზნად ისახავს ხელოვნური ინტელექტის სანდოობის გაუმჯობესებას. „ჰალუცინაციები“ იყოფა ფაქტობრივ (როცა მოდელი რეალურ ფაქტებს ეწინააღმდეგება) და ერთგულების (როცა კონტენტი არ ემთხვევა მომხმარებლის ინსტრუქციებს ან კონტექსტს) ტიპებად. ლიდერბორდი
TextQuests: ახალი ბენჩმარკი ხელოვნური ინტელექტის აგენტების შესაძლებლობების შესაფასებლად
ახალი ბენჩმარკი, TextQuests, იყენებს 25 კლასიკურ Infocom-ის ინტერაქციულ მხატვრულ თამაშს, რათა შეაფასოს ხელოვნური ინტელექტის აგენტების უნარი, იმუშაონ ავტონომიურად რთულ საძიებო გარემოში. იგი ავლენს LLM-ების გამოწვევებს ხანგრძლივი კონტექსტის გაგებაში, როგორიცაა ჰალუცინაციები და სივრცითი მსჯელობის სირთულეები.