OpenAI-მ Deep Research გამოუშვა: ვებ-დათვალიერების სისტემა და ღია კოდით მისი რეპროდუცირების მცდელობები
OpenAI-მ წარმოადგინა „Deep Research“ – ინოვაციური სისტემა, რომელიც ვებ-კონტენტს აჯამებს და კითხვებზე პასუხობს. სისტემამ შთამბეჭდავი შედეგები აჩვენა General AI Assistants (GAIA) ბენჩმარკზე, მიაღწია თითქმის 67%-იან სიზუსტეს საშუალოდ და 47.6%-ს რთულ „დონე 3“ კითხვებზე. Deep Research აგებულია დიდ ენობრივ მოდელზე (LLM) და აგენტურ ჩარჩოზე, რომელიც მას ინსტრუმენტების გამოყენებაში ეხმარება. მიუხედავად OpenAI-ს მიერ აგენტური ჩარჩოს დეტალების არგამჟღავნებისა, ღია კოდის საზოგადოებამ 24-საათიანი მისია დაიწყ
გუშინ OpenAI-მ გამოუშვა Deep Research – სისტემა, რომელიც ვებს ათვალიერებს კონტენტის შესაჯამებლად და ამ შეჯამების საფუძველზე კითხვებზე პასუხის გასაცემად. სისტემა შთამბეჭდავია და პირველივე ცდაზე გაგვაოცა. ბლოგ-პოსტის ერთ-ერთი მთავარი შედეგი არის General AI Assistants (GAIA) ბენჩმარკზე მუშაობის შესამჩნევი გაუმჯობესება, ბენჩმარკზე, რომლითაც ჩვენც ვთამაშობდით ბოლო დროს. Deep Research-მა წარმატებით მიაღწია თითქმის 67%-იან სწორ პასუხს 1-კადრიან (1-shot) საშუალოზე და 47.6%-ს განსაკუთრებით რთულ „დონე 3“ კითხვებზე, რომლებიც მოიცავს მსჯელობის მრავალ საფეხურს და ინსტრუმენტების გამოყენებას (იხილეთ ქვემოთ GAIA-ს პრეზენტაცია). DeepResearch შედგება დიდი ენობრივი მოდელისგან (LLM), რომელიც შეიძლება შეირჩეს OpenAI-ს მიერ მოწოდებული LLM-ების ამჟამინდელი სიიდან (4o, o1, o3 და ა.შ.), და შიდა „აგენტური ჩარჩოსგან“, რომელიც LLM-ს ხელმძღვანელობს ინსტრუმენტების გამოსაყენებლად, როგორიცაა ვებ-ძიება და მისი მოქმედებების საფეხურებად ორგანიზება. მიუხედავად იმისა, რომ ძლიერი LLM-ები ახლა თავისუფლად ხელმისაწვდომია ღია კოდით (იხ. მაგალითად, ბოლო DeepSeek R1 მოდელი), OpenAI-მ არ გაამჟღავნა ბევრი რამ Deep Research-ის საფუძვლად არსებული აგენტური ჩარჩოს შესახებ... ამიტომ ჩვენ გადავწყვიტეთ 24-საათიანი მისია დაგვეწყო მათი შედეგების რეპროდუცირებისთვის და ამ პროცესში საჭირო ჩარჩოს ღია კოდით გამოსაქვეყნებლად! საათი წიკწიკებს, დავიწყოთ! ⏱️
აგენტური ჩარჩო არის ფენა LLM-ის თავზე, რათა ამ LLM-მა შეასრულოს მოქმედებები (როგორიცაა ვებ-გვერდების დათვალიერება ან PDF დოკუმენტების წაკითხვა) და მოახდინოს თავისი ოპერაციების სერიული ნაბიჯებით ორგანიზება.
აგენტების სწრაფი გაცნობისთვის იხილეთ ენდრიუ ნგ-ს ეს შესანიშნავი ინტერვიუ და ჩვენი შესავალი ბლოგ-პოსტი smolagents ბიბლიოთეკის შესახებ. აგენტებში უფრო დეტალური ჩაღრმავებისთვის შეგიძლიათ გამოიწეროთ ჩვენი აგენტების კურსი, რომელიც რამდენიმე დღეში იწყება: ლინკი აქ.
თითქმის ყველას უკვე გამოუცდია, თუ რამდენად ძლიერი შეიძლება იყოს LLM-ები უბრალოდ ჩატბოტებთან თამაშით. თუმცა, ის, რაც ყველასთვის ჯერ კიდევ უცნობია, არის ის, რომ ამ LLM-ების აგენტურ სისტემებში ინტეგრაციას შეუძლია მათ ნამდვილი ზესახელმწიფოები მიანიჭოს!
აქ მოცემულია ბოლო მაგალითი, რომელიც ადარებს რამდენიმე წამყვანი LLM-ის მუშაობას აგენტური ჩარჩოს გარეშე და მასთან ერთად (ამ შემთხვევაში მარტივი smolagents ბიბლიოთეკა) - აგენტური ჩარჩოს გამოყენება ზრდის შესრულებას 60 ქულამდე! სინამდვილეში, OpenAI-მ თავის გამოცემის ბლოგ-პოსტშიც ხაზგასმით აღნიშნა, თუ რამდენად დრამატულად უკეთესად მუშაობდა Deep Research დამოუკიდებელ LLM-ებზე ცოდნაზე ინტენსიურ ბენჩმარკზე „Humanity’s Last Exam“. მაშ, რა მოხდება, თუ ჩვენს ამჟამინდელ საუკეთესო LLM-ს ინტეგრირებთ აგენტურ ჩარჩოში, რათა ვიმუშაოთ ღია Deep Research-ისკენ?
მოკლე შენიშვნა: ჩვენ შევაფასებთ ჩვენს შედეგებს იმავე GAIA გამოწვევაზე, მაგრამ გაითვალისწინეთ, რომ ეს არის მიმდინარე სამუშაო. Deep Research არის უზარმაზარი მიღწევა და მისი ღია რეპროდუცირება დროს მოითხოვს. კერძოდ, სრული ეკვივალენტობა საჭიროებს ბრაუზერის გაუმჯობესებულ გამოყენებას და ინტერაქციას, რასაც OpenAI Operator უზრუნველყოფს, ანუ სცილდება ამჟამინდელ მხოლოდ ტექსტზე დაფუძნებულ ვებ-ინტერაქციას, რომელსაც ამ პირველ ნაბიჯში ვიკვლევთ.
მოდით, ჯერ გავიგოთ გამოწვევის მასშტაბი: GAIA. GAIA, ალბათ, ყველაზე ყოვლისმომცველი ბენჩმარკია აგენტებისთვის. მისი კითხვები ძალიან რთულია და LLM-ზე დაფუძნებული სისტემების მრავალ გამოწვევას ეხება. აქ მოცემულია რთული კითხვის მაგალითი: რომელი ხილი, რომელიც ნაჩვენებია 2008 წლის ნახატში „ქარგვა უზბეკეთიდან“, იყო მიწოდებული 1949 წლის ოქტომბრის საუზმის მენიუს ნაწილად იმ ოკეანის ლაინერისთვის, რომელიც მოგვიანებით გამოიყენეს როგორც მცურავი რეკვიზიტი ფილმისთვის „უკანასკნელი მოგზაურობა“? ჩამოთვალეთ ნივთები მძიმით გამოყოფილი სიის სახით, დაალაგეთ ისინი საათის ისრის მიმართულებით, ნახატში მათი განლაგების მიხედვით, 12 საათის პოზიციიდან დაწყებული. გამოიყენეთ თითოეული ხილის მრავლობითი ფორმა. ხედავთ, რომ ეს კითხვა რამდენიმე გამოწვევას მოიცავს:
ამ პრობლემის გადაჭრა მოითხოვს როგორც მაღალი დონის დაგეგმვის უნარებს, ასევე მკაცრ შესრულებას, რაც ორივე სფეროა, სადაც LLM-ები მარტო გამოყენებისას უჭირთ. ამიტომ, ეს შესანიშნავი სატესტო ნაკრებია აგენტური სისტემებისთვის! GAIA-ს საჯარო ლიდერბორდზე, GPT-4 ვერ აღწევს 7%-ს ვალიდაციის ნაკრებზე, როდესაც გამოიყენება ყოველგვარი აგენტური მოწყობის გარეშე. სპექტრის მეორე მხარეს, Deep Research-ით, OpenAI-მ მიაღწია 67.36%-იან ქულას ვალიდაციის ნაკრებზე, ანუ მასშტაბით უკეთესი შედეგი! (თუმცა არ ვიცით, როგორ იმოქმედებდნენ ისინი რეალურად კერძო სატესტო ნაკრებზე.) ვნახოთ, შეგვიძლია თუ არა უკეთესი შედეგის მიღწევა ღია კოდის ხელსაწყოებით!
ტრადიციულ AI აგენტურ სისტემებთან შედარებით პირველი გაუმჯობესება, რომელსაც ჩვენ განვიხილავთ, არის ე.წ. „კოდის აგენტის“ გამოყენება. როგორც Wang et al. (2024)-ის ნაშრომშია ნაჩვენები, აგენტს თავისი მოქმედებების კოდით გამოხატვის ნება დართვა რამდენიმე უპირატესობას იძლევა, მაგრამ ყველაზე აღსანიშნავია ის, რომ კოდი სპეციალურად შექმნილია მოქმედებების რთული თანმიმდევრობების გამოსახატავად.
ეს ხაზს უსვამს კოდის გამოყენების რამდენიმე უპირატესობას: ზემოთ მოყვანილი უპირატესობები დადასტურდა ჩვენი ექსპერიმენტებით agent_reasoning_benchmark-ზე. smolagents-ის შექმნისას ასევე შეგვიძლია აღვნიშნოთ ერთი მნიშვნელოვანი დამატებითი უპირატესობა, რაც არის მდგომარეობის უკეთესი მართვა: ეს განსაკუთრებით გამოსადეგია მულტიმოდალური ამოცანებისთვის. გჭირდებათ ამ სურათის/აუდიოს/სხვა ნივთის შენახვა მოგვიანებით გამოსაყენებლად? პრობლემა არ არის, უბრალოდ მიანიჭეთ მას ცვლადის სახით თქვენს მდგომარეობაში და შეგიძლიათ ხელახლა გამოიყენოთ 4 ნაბიჯის შემდეგ, თუ საჭირო იქნება.
თეგები:
#ხელოვნური ინტელექტი
#openai
#llm
#ღია კოდი
#აგენტური სისტემები
#deep research
#gaia
#ვებ-დათვალიერება
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი