Transformers Agents-ის ტრიუმფი GAIA ბენჩმარკზე: აგენტური სისტემების ახალი ერა
ექსპერიმენტების სერიის შემდეგ, ჩვენზე დიდი შთაბეჭდილება მოახდინა Transformers Agents-ის შესაძლებლობებმა აგენტური სისტემების შექმნაში. GAIA ბენჩმარკზე, რომელიც ყველაზე რთულ და ყოვლისმომცველ აგენტურ ბენჩმარკად ითვლება, ბიბლიოთეკის გამოყენებით შექმნილმა Code Agent-მა მოწინავე პოზიციები დაიკავა. აღნიშნული ფრეიმვორკი, transformers.agents, ახლა განახლებულია და ფუნქციონირებს, როგორც დამოუკიდებელი ბიბლიოთეკა smolagents. სტატია განმარტავს აგენტების კონცეფციას, როგორც LLM-ზე დაფუძნებულ სისტემებს, რომლებსა
ექსპერიმენტების სერიის შემდეგ, ჩვენზე დიდი შთაბეჭდილება მოახდინა Transformers Agents-ის შესაძლებლობებმა აგენტური სისტემების შექმნაში, ამიტომ გვსურდა უკეთ შეგვემოწმებინა მისი ეფექტურობა. ჩვენ ჩავატარეთ ტესტირება ბიბლიოთეკის გამოყენებით შექმნილი Code Agent-ის საშუალებით GAIA ბენჩმარკზე, რომელიც უდავოდ ყველაზე რთულ და ყოვლისმომცველ აგენტურ ბენჩმარკად ითვლება... და საბოლოოდ მოწინავე პოზიციები დავიკავეთ! ამ ბლოგპოსტში გამოყენებული ფრეიმვორკი transformers.agents ახლა განახლებულია და წარმოადგენს დამოუკიდებელ ბიბლიოთეკას smolagents! ორ ბიბლიოთეკას ძალიან მსგავსი API-ები აქვს, ამიტომ მათ შორის გადართვა მარტივია.
შეგიძლიათ გაეცნოთ smolagents-ის შესავალ ბლოგს აქ. რა არის აგენტები? ერთი წინადადებით: აგენტი არის ნებისმიერი LLM-ზე დაფუძნებული სისტემა, რომელსაც შეუძლია გამოიძახოს გარე ინსტრუმენტები (ან არ გამოიძახოს, მიმდინარე გამოყენების შემთხვევის საჭიროებიდან გამომდინარე) და გააგრძელოს მოქმედებები LLM-ის გამომავალზე დაყრდნობით. ინსტრუმენტები შეიძლება მოიცავდეს ყველაფერს, ვებ ძიების API-დან Python ინტერპრეტატორამდე. ვიზუალური ანალოგიისთვის: ყველა პროგრამა შეიძლება აღიწეროს როგორც გრაფიკი. გააკეთე A, შემდეგ გააკეთე B. if/else კონსტრუქციები არის განშტოებები გრაფიკში, მაგრამ ისინი არ ცვლიან მის სტრუქტურას. ჩვენ განვსაზღვრავთ აგენტებს, როგორც სისტემებს, სადაც LLM-ის გამომავალი ცვლის გრაფიკის სტრუქტურას. აგენტი წყვეტს, გამოიძახოს ინსტრუმენტი A თუ ინსტრუმენტი B, თუ არაფერი; ის წყვეტს, შეასრულოს თუ არა კიდევ ერთი ნაბიჯი: ეს ყველაფერი ცვლის გრაფიკის სტრუქტურას. LLM-ის ინტეგრირება შესაძლებელია ფიქსირებულ სამუშაო პროცესში, მაგალითად, LLM judge-ში, ისე, რომ ის არ იყოს აგენტური სისტემა, რადგან LLM-ის გამომავალი არ ცვლის გრაფიკის სტრუქტურას. აი, ილუსტრაცია ორი განსხვავებული სისტემისთვის, რომლებიც ასრულებენ „ინფორმაციის მოძიებით გაძლიერებულ გენერაციას“ (Retrieval Augmented Generation): ერთი კლასიკურია, მისი გრაფიკი ფიქსირებულია. მეორე კი აგენტურია, გრაფიკში ერთი ციკლი შეიძლება განმეორდეს საჭიროებისამებრ.
აგენტური სისტემები LLM-ებს ზეძალებს ანიჭებს. დეტალებისთვის, წაიკითხეთ ჩვენი წინა ბლოგპოსტი Transformers Agents 2.0-ის გამოშვების შესახებ. GAIA აგენტებისთვის ყველაზე ყოვლისმომცველი ბენჩმარკია. GAIA-ში დასმული კითხვები ძალიან რთულია და ხაზს უსვამს LLM-ზე დაფუძნებული სისტემების გარკვეულ სირთულეებს. გთავაზობთ რთული კითხვის მაგალითს: რომელი ხილი, რომელიც ნაჩვენებია 2008 წლის ნახატზე „ნაქარგობა უზბეკეთიდან“, შედიოდა 1949 წლის ოქტომბრის საუზმის მენიუში იმ ოკეანის ლაინერისთვის, რომელიც მოგვიანებით გამოყენებული იყო, როგორც მცურავი რეკვიზიტი ფილმისთვის „ბოლო მოგზაურობა“? ჩამოთვალეთ ნივთები მძიმით გამოყოფილ სიაში, დალაგებული საათის ისრის მიმართულებით, ნახატში მათი განლაგების მიხედვით, 12 საათის პოზიციიდან დაწყებული. გამოიყენეთ თითოეული ხილის მრავლობითი ფორმა. ხედავთ, რომ ეს კითხვა რამდენიმე სირთულეს მოიცავს: მის გადასაჭრელად საჭიროა, როგორც მაღალი დონის დაგეგმვის უნარები, ასევე მკაცრი შესრულება, რაც ზუსტად ის ორი სფეროა, სადაც LLM-ებს უჭირთ. ამიტომ, ის შესანიშნავი სატესტო ნაკრებია აგენტური სისტემებისთვის! GAIA-ს საჯარო ლიდერბორდზე, GPT-4-Turbo საშუალოდ 7%-ს არ აღწევს. საუკეთესო წარდგენილი გადაწყვეტა არის (იყო) Autogen-ზე დაფუძნებული კომპლექსური მრავალაგენტური სისტემა, რომელიც იყენებს OpenAI-ის ინსტრუმენტების გამოძახების ფუნქციებს, და ის 40%-ს აღწევს. მოდით, ჩვენც შევეჯიბროთ მათ. 🥊
GAIA-ს კითხვების გადასაჭრელად ჩვენ სამი ძირითადი ინსტრუმენტი გამოვიყენეთ:
ა. **ვებ ბრაუზერი**. ვებ ბრაუზინგისთვის, ძირითადად, Autogen-ის გუნდის მიერ წარდგენილი Markdown ვებ ბრაუზერი გამოვიყენეთ. ის მოიცავს Browser კლასს, რომელიც ინახავს ბრაუზერის მიმდინარე მდგომარეობას, და რამდენიმე ინსტრუმენტს ვებ ნავიგაციისთვის, როგორიცაა `visit_page`, `page_down` ან `find_in_page`. ეს ინსტრუმენტი აბრუნებს მიმდინარე ხედვის არეალის (viewport) markdown წარმოდგენებს. markdown-ის გამოყენება მნიშვნელოვნად კუმშავს ვებ გვერდების ინფორმაციას, რამაც შეიძლება გამოიწვიოს გარკვეული გამოტოვებები, სხვა გადაწყვეტილებებთან შედარებით, როგორიცაა ეკრანის ანაბეჭდის გადაღება და ვიზუალური მოდელის გამოყენება. თუმცა, ჩვენ აღმოვაჩინეთ, რომ ინსტრუმენტი მთლიანობაში კარგად მუშაობდა, მისი გამოყენება ან რედაქტირება ზედმეტად რთული არ იყო. შენიშვნა: ვფიქრობთ, რომ ამ ინსტრუმენტის გასაუმჯობესებლად მომავალში კარგი გზა იქნებოდა გვერდების ჩატვირთვა selenium პაკეტის გამოყენებით, requests-ის ნაცვლად. ეს საშუალებას მოგვცემს ჩავტვირთოთ javascript (ბევრი გვერდი სწორად არ იტვირთება javascript-ის გარეშე) და მივიღოთ ქუქიები ზოგიერთი გვერდის მისაწვდომად.
ბ. **ფაილის ინსპექტორი**. GAIA-ს მრავალი კითხვა ეყრდნობა სხვადასხვა ტიპის დართულ ფაილებს, როგორიცაა .xls, .mp3, .pdf და ა.შ. ეს ფაილები სწორად უნდა იყოს გაანალიზებული. კიდევ ერთხელ, ჩვენ Autogen-ის ინსტრუმენტს ვიყენებთ, რადგან ის ნამდვილად კარგად მუშაობს. დიდი მადლობა Autogen-ის გუნდს მათი ნაშრომის ღია კოდით გაზიარებისთვის. ამ ინსტრუმენტების გამოყენებამ ჩვენი განვითარების პროცესი კვირებით დააჩქარა! 🤗
გ. **კოდის ინტერპრეტატორი**. ამის საჭიროება არ გვექნება, რადგან ჩვენი აგენტი ბუნებრივად აგენერირებს და ასრულებს Python კოდს: იხილეთ მეტი ქვემოთ. როგორც ვანგმა და სხვებმა (2024) აჩვენეს, აგენტისთვის მისი მოქმედებების კოდში გამოხატვის ნება დართვას რამდენიმე უპირატესობა აქვს ლექსიკონის მსგავსი გამომავალის, მაგალითად JSON-ის, გამოყენებასთან შედარებით. ჩვენთვის მთავარი უპირატესობა ის არის, რომ კოდი არის ძალიან ოპტიმიზებული გზა მოქმედებების კომპლექსური თანმიმდევრობის გამოსახატავად. სავარაუდოდ, თუ დეტალური მოქმედებების მკაცრად გამოსახატავად უკეთესი გზა იქნებოდა, ვიდრე ჩვენი ამჟამინდელი პროგრამირების ენები, ის ახალ პროგრამირების ენად იქცეოდა! განვიხილოთ მათ ნაშრომში მოცემული მაგალითი: ის ხაზს უსვამს კოდის გამოყენების რამდენიმე უპირატესობას: ჩვენ დავადასტურეთ ეს პუნქტები agent_reasoning_benchmark-ზე ჩატარებული ექსპერიმენტების დროს. Transformers agents-ის შექმნის ჩვენი უახლესი ექსპერიმენტებიდან, ჩვენ ასევე შევნიშნეთ დამატებითი უპირატესობები: LLM-ის მიერ გენერირებული კოდის მინუსი ის არის, რომ მისი შესრულება შეიძლება მართლაც სახიფათო იყოს, რადგან
თეგები:
#ხელოვნური ინტელექტი
#llm
#პროგრამირება
#მანქანური სწავლა
#აგენტური სისტემები
#gaia ბენჩმარკი
#smolagents
#transformers agents
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი