Meta-მ Gaia2 წარმოადგინა: ახალი ბენჩმარკი AI აგენტებისთვის
კომპანია Meta-მ წარმოადგინა Gaia2, ახალი აგენტური ბენჩმარკი, რომელიც GAIA-ს გაგრძელებაა და მიზნად ისახავს ხელოვნური ინტელექტის აგენტების მნიშვნელოვნად უფრო რთული ქცევების ანალიზს. Gaia2 გამოვიდა Meta-ს ღია Agents Research Environments (ARE) ფრეიმვორქთან ერთად, რაც საშუალებას იძლევა აგენტების გაშვებას, გამართვას და შეფასებას რეალური სამყაროს მსგავს პირობებში. ბენჩმარკი აფასებს აგენტებს ინტერაქციულ ქცევაში, ბუნდოვანი ან დროში შეზღუდული მოთხოვნების შესრულებაში, ხმაურიან გარემოში ადაპტირებასა და ხელ
ამიტომაც, მოხარული ვართ წარმოგიდგინოთ Gaia2 – აგენტური ბენჩმარკ GAIA-ს გაგრძელება, რომელიც მნიშვნელოვნად უფრო რთული ქცევების ანალიზის საშუალებას იძლევა. Gaia2 გამოვიდა Meta-ს ღია Agents Research Environments (ARE) ფრეიმვორქთან ერთად, აგენტების გასაშვებად, გამართვისა და შესაფასებლად. ARE ახდენს რეალური სამყაროს მსგავსი რთული პირობების სიმულაციას და მისი მორგება შესაძლებელია აგენტების ქცევების შემდგომი შესწავლისთვის. Gaia2-ის მონაცემთა ნაკრები გამოქვეყნებულია CC by 4.0 ლიცენზიით, ხოლო ARE – MIT ლიცენზიით. GAIA არის აგენტური ბენჩმარკი, რომელიც 2023 წელს გამოქვეყნდა და მოიცავს ინფორმაციის მოძიების 3 დონის კითხვებს, რომელთა გადასაჭრელად საჭიროა ხელსაწყოები, ვებ-დათვალიერება და მსჯელობის უნარი. ორ წელიწადში ყველაზე მარტივი დონეები მოდელებისთვის ზედმეტად იოლი გახდა, საზოგადოება კი ყველაზე რთული კითხვების გადაჭრას უახლოვდება, ამიტომაც დადგა დრო სრულიად ახალი და უფრო რთული აგენტური ბენჩმარკისთვის!
წარმოგიდგენთ Gaia2-ს, GAIA-ს გაგრძელებას, რომელიც მნიშვნელოვნად სცილდება წინამორბედს შესწავლილი შესაძლებლობების თვალსაზრისით! მაშინ, როცა GAIA მხოლოდ წასაკითხი იყო, Gaia2 არის წაკითხვა-დაწერა ბენჩმარკი, რომელიც ორიენტირებულია ინტერაქციულ ქცევასა და სირთულის მართვაზე. აგენტები ახლა ფასდებიან არა მხოლოდ ძიებასა და ინფორმაციის მოძიებაზე, არამედ ბუნდოვანი ან დროში შეზღუდული მოთხოვნების ინსტრუქციების შესრულებაზე, ხმაურიან გარემოში კონტროლირებული შეფერხებებით – რაც ნებისმიერ სხვა სიმულირებულ გარემოზე მეტად ასახავს რეალურ სამყაროს პირობებს. ჩვენ გვსურს შევამოწმოთ, თუ როგორ მართავენ აგენტები ხელსაწყოებს ან API-ებს, რომლებიც ზოგჯერ არ მუშაობს, როგორ გეგმავენ მოქმედებების თანმიმდევრობას ძალიან კონკრეტული ვადებით და როგორ ეგუებიან ახალ მოვლენებს – სირთულის სრულიად ახალი დიაპაზონი! ამისათვის ვიყენებთ დავალებების შემდეგ ჯგუფებს (მადლობა 1000 სრულიად ახალი, ადამიანების მიერ შექმნილი სცენარისთვის): GAIA-ს სულისკვეთებით, სცენარები არ საჭიროებს სპეციალიზებულ ცოდნას: ადამიანებმა პრინციპში უნდა შეძლონ 100%-იანი შედეგის მიღწევა, რაც მოდელის დეველოპერებისთვის გამართვის გამარტივებას უზრუნველყოფს. გსურთ ბენჩმარკის შესწავლა? იხილეთ ჩვენი მონაცემთა ნაკრები, რომლის უკეთ ჩვენება შეგიძლიათ ჩვენს დემო ვერსიაში.
Gaia2 მუშაობს ARE-სთან ერთად, რაც არის შესრულების გარემო, სადაც თქვენს მიერ არჩეულ აგენტს აქვს წვდომა აპლიკაციების კომბინაციასა და მასთან დაკავშირებულ წინასწარ შევსებულ მონაცემებზე. Gaia2-სთვის ჩვენ შევქმენით სმარტფონის მაკეტის გარემო, რომელიც სიმულაციას უკეთებს იმას, რასაც ადამიანი გამოიყენებდა ყოველდღიურ ცხოვრებაში. იგი მოიცავს რეალური სამყაროს აპლიკაციებს, როგორიცაა შეტყობინებები (ელ. ფოსტა), კომუნალური საშუალებები (კალენდარი, კონტაქტები, შოპინგი, ფაილური სისტემა, …) და ჩატის ინტერფეისი აგენტთან სასაუბროდ. ყველა აპლიკაცია ასევე ხელმისაწვდომია აგენტებისთვის ხელსაწყოების გამოძახების (tool calling) საშუალებით. და ბოლოს, დემო ვერსია ასევე შეიცავს სიმულირებული პერსონის საუბრებისა და აპლიკაციებთან ინტერაქციების ისტორიას. აგენტების ყველა ინტერაქცია ავტომატურად იწერება სტრუქტურირებული ტრასების სახით შესრულების დროს, სიღრმისეული შესწავლისა და ანალიზისთვის: ისინი მოიცავს ხელსაწყოების გამოძახებებს, API პასუხებს, მოდელის აზრებს, დროის მეტრიკას (მაგ., პასუხის შეყოვნება), მომხმარებლის ინტერაქციებს და ა.შ. – და ყველაფერი შეიძლება ექსპორტირებული იყოს JSON ფორმატში.
ცნობისთვის, ჩვენ ვადარებთ ღია და დახურული წყაროს მოდელების მთელ რიგს: Llama 3.3-70B Instruct, Llama-4-Maverick, GPT-4o, Qwen3-235B-MoE, Grok-4, Kimi K2, Gemini 2.5 Pro, Claude 4 Sonnet და GPT-5 მსჯელობის ყველა რეჟიმში. ყველა მოდელი ფასდება ერთი და იგივე კონფიგურაციით (უნიფორმული ReAct ციკლი თანმიმდევრულობისთვის, ტემპერატურა 0.5, გენერაციის ლიმიტი 16K ტოკენი), "მოდელი-როგორც-მოსამართლე" (Llama 3.3 Instruct 70B) და ზუსტი შესატყვისის შეფასების კომბინაციით, კონკრეტული დავალების მიხედვით. ყველა 101 ხელსაწყო (და ზოგადი გარემოს აღწერა) მოცემულია სისტემის მოთხოვნაში (system prompt).
შეფასებულ მოდელებს შორის, 2025 წლის სექტემბრის მდგომარეობით, ყველაზე მაღალი ქულის მქონე მოდელი საერთო ჯამში არის GPT-5 მაღალი მსჯელობის უნარით, ხოლო საუკეთესო ღია წყაროს მოდელი არის Kimi K2. ზოგიერთი შესაძლებლობა, როგორც ჩანს, უკვე ახლოსაა საუკეთესო მოდელების მიერ გადაჭრასთან: მარტივი ხელსაწყოების გამოძახება და ინსტრუქციების შესრულება (execution), და საერთო ძებნა (როგორც შეგვეძლო გამოგვეცნო GAIA-ზე მიმდინარე შედეგებიდან). ბუნდოვანება, ადაპტირება და ხმაურის კომპონენტები ამ დროისთვის რჩება გამოწვევად ყველა მოდელისთვის, და საინტერესოა, რომ შესრულება იმ, ოდესღაც რთულ აგენტურ დავალებებზე (ინსტრუქციების შესრულება და ძებნა), არ არის კარგი საზომი რეალურ სამყაროსთან მიახლოებულ დავალებებზე შესრულებისთვის. და ბოლოს, ამ დროისთვის ყველა მოდელისთვის ყველაზე რთული კომპონენტი დროის მართვაა: მოდელებისთვის ძალიან რთულია დროში მგრძნობიარე მოქმედებების სწორად დამუშავება (თუმცა ეს, სავარაუდოდ, შეიძლება შემცირდეს სპეციალიზებული ხელსაწყოების და უკეთესი დროითი მსჯელობის გამოყენებით). ამ შედეგების დეტალური ანალიზი შეგიძლიათ იხილოთ ნაშრომში.
თუმცა, მიგვაჩნია, რომ მნიშვნელოვანია ანგარიშგების გაფართოება ნედლი ქულების მიღმა: თუ მოდელი სწორია, მაგრამ სწორ გადაწყვეტამდე მისასვლელად რამდენიმე ათასი ტოკენი დასჭირდა, ან რამდენიმე საათი იმუშავა, ის „არ არის ისეთი კარგი“, როგორც მოდელი, რომელმაც ამოცანა ბევრად უფრო სწრაფად შეასრულა. ამიტომ, ჩვენ ასევე ვახდენთ ქულების ნორმალიზებას ღირებულების მიხედვით, რომელიც რაოდენობრივად განისაზღვრება LLM-ის გამოძახებების საშუალო რაოდენობითა და გამომავალი ტოკენებით (რომლებიც ერთად განსაზღვრავენ ხარჯი-ეფექტურობის პარეტოს საზღვარს). ნაშრომში ნახავთ ქულას ფულად ხარჯთან და დროსთან მიმართებაში. თუ გსურთ თქვენი მოდელის შეფასება Gaia2-ზე, შეგიძლიათ მიჰყვეთ ამ ნაბიჯებს: პირველ რიგში, დააინსტალირეთ Meta-ს Agent Research Environment თქვენთვის სასურველ Python გარემოში (uv, conda, virtualenv, ...). შემდეგ, გაუშვით...
თეგები:
#ხელოვნური ინტელექტი
#meta
#ai აგენტები
#ბენჩმარკი
#gaia2
#gpt-5
#kimi k2
#are
#მოდელის შეფასება
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები