ხელოვნური ინტელექტის (AI) შეფასების უმეტესი თანამედროვე ბენჩმარკი ფოკუსირებულია წარსულის შესახებ კითხვებზე პასუხის გაცემაზე, მოდელების არსებულ ცოდნაზე (სტატიკური სახით, როგორიცაა HLE ან GPQA, ან გაფართოებული, როგორიცაა BrowseComp ან GAIA) ან ადრე გადაჭრილ პრობლემებზე (როგორიცაა PaperBench, DABStep, ან კოდირების უმეტესი შეფასებები) ტესტირებით. თუმცა, ჩვენ გვჯერა, რომ უფრო ღირებული AI და საბოლოოდ ხელოვნური ზოგადი ინტელექტი (AGI) გამოირჩევა იმით, რომ მას შეუძლია გამოიყენოს ეს წარსული მომავლის საინტერესო ასპექტების პროგნოზირებისთვის, ვიდრე უბრალოდ ძველი ფაქტების გამეორებისთვის. მომავალი მოვლენების პროგნოზირება რთული და ჰოლისტური ამოცანაა: ის მოითხოვს დახვეწილ მსჯელობას, სინთეზს, ალბათობების შეწონვას და რეალურ გაგებას, ვიდრე არსებული ინფორმაციის შაბლონების შეხამებას ან ძიებას. მოდელების შეფასება მათი უნარის მიხედვით, იწინასწარმეტყველონ მომავალი შედეგები, იქნება ეს მეცნიერებაში, ეკონომიკაში, გეოპოლიტიკაში თუ ტექნოლოგიაში, ამოწმებს იმ ინტელექტს, რომელიც რეალურ ღირებულებას ქმნის. მისი თანდაყოლილი მნიშვნელობის მიღმა, პროგნოზირებაზე დაფუძნებული ეს მიდგომა ასევე წყვეტს მრავალ მეთოდოლოგიურ პრობლემას, რომელთა წინაშეც დგანან მიმდინარე შეფასებები და ბენჩმარკები. ტრადიციული ბენჩმარკები, რომლებიც ზომავენ სიზუსტეს ფიქსირებულ სატესტო ნაკრებებზე, გარდაუვლად ექვემდებარება მონაცემთა შესაძლო დაბინძურებას, და მოდელის სრული რეპროდუცირებადი სასწავლო პროცესზე წვდომის გარეშე, ძნელია შედეგების ნდობა. შეფასების ყველაზე სერიოზული მცდელობები ახლა ინახავს თავიანთ სატესტო ნაკრებებს სრულად კონფიდენციალურად, რაც ქმნის დამთრგუნველ შეიარაღების რბოლას შემფასებლებსა და პოტენციურ „ლიდერბორდის მოტყუების“ მექანიზმებს შორის (Singh et al., 2025). პროგნოზირება დაბინძურებას შეუძლებელს ხდის დიზაინით, რადგან არ შეგიძლიათ ავარჯიშოთ მონაცემებზე, რომლებიც ჯერ არ არსებობს! ეს ქმნის თანაბარ სათამაშო მოედანს, სადაც წარმატება დამოკიდებულია მსჯელობის უნარზე და არა დამახსოვრებაზე. ალბათ ყველაზე მნიშვნელოვანია, რომ მომავლის პროგნოზები თავისთავად გადამოწმებადია. ჩვენ შეგვიძლია დაველოდოთ და ვნახოთ ვინ იყო მართალი, რაც ქმნის მოდელის მუშაობის ობიექტურ, დროის ნიშნულით აღნიშნულ საზომს. ამიტომ, ჩვენ ვთავაზობთ აგენტების შეფასებას მომავალი მოვლენების პროგნოზირების უნარის მიხედვით (Ye et al., 2024; Karger et al., 2025). FutureBench ეყრდნობა რეალური სამყაროს საპროგნოზო ბაზრებსა და ახალ ამბებს, რათა შექმნას საინტერესო საპროგნოზო ამოცანები, რომლებიც დაფუძნებულია რეალურ მომავალ შედეგებზე. ჩვენ ვაგროვებთ მოვლენებს პლატფორმებიდან, ცოცხალი საინფორმაციო გაშუქებებიდან და მრავალი ბაზრიდან, ვფილტრავთ მათ, რათა ფოკუსირება მოვახდინოთ იმ განვითარებად მოვლენებზე, რომლებიც ღირს პროგნოზირებად. აგენტზე დაფუძნებული მიდგომის გამოყენებით, ჩვენ ვქმნით სცენარებს, რომლებიც საჭიროებენ რეალურ მსჯელობას და არა მარტივ შაბლონურ შეხამებას. იფიქრეთ გეოპოლიტიკურ მოვლენებზე, ბაზრის მოძრაობებზე ან ტექნოლოგიების დანერგვის ტენდენციებზე – მოვლენებზე, სადაც ინფორმირებულ ანალიზს რეალური მნიშვნელობა აქვს. ეს არის აშკარა კითხვა, და ის დევს ამ ბენჩმარკის საინტერესოობის გულში! ჩვენ გვჯერა, რომ პასუხი არ შეიძლება იყოს მარტივი „დიახ“ ან „არა“, რადგან ის ძირითადად დამოკიდებულია რეალურ კითხვებზე; ყოველთვის არის მნიშვნელოვანი გაფრთხილებები გასათვალისწინებელი. ადამიანები მუდმივად იყენებენ თავიანთ უნარს, აწონ-დაწონონ მიმდინარე ინფორმაცია მომავალი მოვლენების პროგნოზირებისთვის. განა კარიერული ნაბიჯების უმეტესობა, ურთიერთობების არჩევანი, ან თუნდაც ბიზნეს სტრატეგიები არსებითად ფსონები არ არის მომავალ შედეგებზე? ზოგიერთი პროგნოზი მოიცავს შეუცვლელ გაურკვევლობას (იწვიმებს თუ არა 2027 წლის 17 დეკემბერს შუადღისას?), მაგრამ ბევრი არა. როდესაც გამოცდილი ანალიტიკოსი პროგნოზირებს კომპანიის კვარტალურ შემოსავალს ან პოლიტიკის ექსპერტი არჩევნების შედეგებს, ისინი იყენებენ არსებულ ინფორმაციას ინფორმირებული გადაწყვეტილებების მისაღებად. სწორედ ამას ვთხოვთ AI აგენტებს FutureBench-ის მეშვეობით! ამოცანა არ არის აგენტებს ვასწავლოთ ბედის წინასწარმეტყველება, არამედ ინფორმაციის სინთეზირება და მსჯელობა უფრო ძლიერი გაურკვევლობის პირობებში, ვიდრე სხვა ბენჩმარკების უმეტესობა. აგენტის პროგნოზირების ხარისხი პირდაპირ ასახავს მის უნარს, მოიძიოს შესაბამისი ინფორმაცია, მოახდინოს რთული მონაცემების სინთეზი და იმსჯელოს მიზეზ-შედეგობრივ კავშირებზე. სწორედ ეს შესაძლებლობები გვინდა გავზომოთ რეალურ სამყაროს აპლიკაციებში. DeepResearch-ის მსგავსი ხელსაწყოები უკვე გამოიყენება ბაზრის ანალიზისა და სტრატეგიული დაგეგმვისთვის. ინფორმაციის შეგროვების ხარისხი მჭიდრო კავშირშია გადაწყვეტილების მიღების ეფექტურობასთან. FutureBench შთაგონებულია ამ შეფასების პროცესით და ცდილობს აგენტების ხარისხის გამოთვლას ობიექტური, გადამოწმებადი შედეგებით. ბენჩმარკის შექმნა, რომელიც ამოწმებს რეალურ საპროგნოზო შესაძლებლობებს, მოითხოვს აზრიანი კითხვების მუდმივ ნაკადს. ჩვენ შევიმუშავეთ ორი ურთიერთშემავსებელი მიდგომა, რომლებიც აღბეჭდავენ მომავალი მოვლენების სხვადასხვა ტიპებს: ჩვენი პირველი მიდგომა იყენებს AI-ს, რათა მიმდინარე მოვლენებიდან მოიძიოს პროგნოზირების შესაძლებლობები. ჩვენ ვიყენებთ smolagents-ზე დაფუძნებულ აგენტს რამდენიმე ძირითადი საინფორმაციო ვებსაიტის გასაანალიზებლად, პირველი გვერდის სტატიების შესასწავლად და მათი სავარაუდო შედეგების შესახებ საპროგნოზო კითხვების გენერირებისთვის. აგენტი კითხულობს და იდენტიფიცირებს საინტერესო სტატიებს და აყალიბებს კონკრეტულ, დროში შეზღუდულ კითხვებს მათი შინაარსიდან, მაგალითად: "შეამცირებს თუ არა ფედერალური რეზერვი საპროცენტო განაკვეთებს მინიმუმ 0.25%-ით 2025 წლის 1 ივლისამდე?" ჩვენ ვმართავთ ამ პროცესს გულდასმით შემუშავებული მოთხოვნებით, რომლებიც აკონკრეტებენ, რა ხდის პროგნოზის კითხვას კარგს – მოვლენებს, რომლებიც არის აზრიანი, გადამოწმებადი და გაურკვეველი ამოღების დროის მიხედვით. ტექნიკური სტეკი: აგენტი, როგორც წესი, აგენერირებს 5 კითხვას თითოეული სკრეპინგის სესიის დროს, ერთჯერადი დროის ჰორიზონტით...