TimeScope: ახალი ბენჩმარკი ხელოვნური ინტელექტის გრძელი ვიდეოების აღქმის სიღრმის შესამოწმებლად
TimeScope არის ახალი ღია კოდის ბენჩმარკი, რომელიც შექმნილია იმის შესაფასებლად, თუ რამდენად კარგად ესმით ვიზუალურ-ლინგვისტურ მოდელებს გრძელი ვიდეოები. ის ვიდეოებში (1 წუთიდან 8 საათამდე) მოკლე „ნემსის“ კლიპების ჩართვით აფასებს მოდელების უნარს არა მხოლოდ ინფორმაციის მოძიებაში, არამედ მის სინთეზში, ლოკალიზაციასა და წვრილმარცვლოვან მოძრაობის ანალიზში, რითაც არსებულ ტესტებში არსებულ ხარვეზებს ავსებს და AI-ს გრძელი ვიდეოების გაგების ნამდვილ შესაძლებლობებს ავლენს.
TimeScope, ახალი ღია კოდის ბენჩმარკი, მიზნად ისახავს შეაფასოს, თუ რამდენად კარგად ესმით ვიზუალურ-ლინგვისტურ (vision-language) მოდელებს გრძელი ვიდეოები. 1 წუთიდან 8 საათამდე ხანგრძლივობის ვიდეოებში მოკლე „ნემსის“ კლიპების ჩართვით, ის სამ ძირითად უნარს აფასებს. მულტიმოდალური ხელოვნური ინტელექტის ბოლოდროინდელმა მიღწევებმა შექმნა მოდელები, რომლებიც აცხადებენ, რომ ესმით მრავალსაათიანი ვიდეოები. ეს ტენდენცია ასახავს პროგრესს გრძელკონტექსტურ ენობრივ მოდელებში, რომლებიც წარმატებით ახდენენ მსჯელობას ვრცელ ტექსტებზე.
ამ ტენდენციის კვალდაკვალ, ვიზუალურ-ლინგვისტური სისტემები ახლა აცხადებენ, რომ აქვთ კონტექსტური ფანჯრები, რომლებსაც შეუძლიათ ათასობით კადრის დამუშავება. თუმცა, ამ განცხადებებს უფრო დეტალური შემოწმება სჭირდება: ნამდვილად აჩვენებენ თუ არა ეს მოდელები მოვლენათა თანმიმდევრობის გაგებას? შემოიფარგლებიან თუ არა ისინი მხოლოდ ზედაპირული მოძიებითა და ამოცნობით? გადამწყვეტია კითხვა, ხომ არ არის მათი შესაძლებლობები გადაჭარბებული.
ტექსტური ბენჩმარკები, როგორიცაა HELM და RULER, გამოაშკარავდა გრძელკონტექსტური შესაძლებლობების სისუსტე, რადგან მოდელებს ხშირად უჭირთ ამოცანები, რომლებიც მარტივ მოძიებაზე მეტს, მაგალითად, მსჯელობას ან აგრეგაციას მოითხოვს. ვიდეო დომენში კი ამ მხრივ ჩამორჩენა შეინიშნება. ყველაზე გავრცელებული ტესტი, Video Needle in a Haystack (VideoNIAH), სტატიკურ გამოსახულებებს იყენებს „ნემსებად“ ვიდეოებში, რაც არსებითად ვიზუალურ ძიებას ზომავს და არა ნამდვილ დროით დინამიკას. შედეგად, საუკეთესო მოდელებიც კი, რომლებიც აცხადებენ კადრების მასშტაბურ დამუშავების შესაძლებლობებს, იშვიათად გადიან წვრთნას 256 კადრზე მეტზე და Video-MME-ის მსგავს ბენჩმარკებზე მკვეთრ ვარდნას აჩვენებენ, როცა უფრო დიდ მონაცემებთან უწევთ მუშაობა. ეს გაზომვის ხარვეზი გვაფიქრებინებს: რას ნიშნავს სინამდვილეში, რომ მოდელს „ესმის“ გრძელი ვიდეოები?
ამ პრობლემის მოსაგვარებლად, წარმოდგენილია TimeScope – ახალი ღია კოდის ბენჩმარკი, რომელიც Hugging Face-ზეა განთავსებული. TimeScope იკვლევს გრძელი ვიდეოების შესაძლებლობების ზღვარს რამდენიმე მოკლე (~5-10 წამიანი) ვიდეო კლიპის – „ნემსების“ – ჩასმით საბაზისო ვიდეოებში, რომელთა ხანგრძლივობა 1 წუთიდან 8 საათამდე მერყეობს. სამი განსხვავებული ამოცანის ტიპით, ის აფასებს არა მხოლოდ მოძიებას, არამედ სინთეზს, ლოკალიზაციას და წვრილმარცვლოვან მოძრაობის ანალიზს, რაც დროითი აღქმის უფრო ჰოლისტურ ხედვას გვთავაზობს.
გრძელი ვიდეოების ხელოვნური ინტელექტის პერსპექტივა ტრანსფორმაციულია — ის საშუალებას მისცემს აგენტებს, შეაჯამონ საათობით კადრები, აღმოაჩინონ უმნიშვნელო ანომალიები და უპასუხონ კომპლექსურ კითხვებს ვრცელი ნარატივების შესახებ. რობოტიკაში ინტეგრირებული ეს მოდელები შეძლებენ ხანგრძლივი ოპერაციების ანალიზს, რეალურ დროში ადაპტაციას და ავტონომიური გადაწყვეტილების მიღების ხელშეწყობას. არანაკლებ შთამბეჭდავია პირადი ასისტენტის ხედვა, რომელსაც ესმის ყოველდღიური ცხოვრება და გთავაზობთ უწყვეტ, ქმედით უკუკავშირს.
პრაქტიკაში, ეს ხშირად იწვევს გადაჭარბებულ შესაძლებლობებს. მოდელებს შეუძლიათ განაცხადონ, რომ ამუშავებენ 10,000-ზე მეტ კადრს, მაგრამ სასწავლო მონაცემები ხშირად შემოიფარგლება 256 კადრით თითო კლიპზე, რაც ამცირებს შესრულებას უფრო გრძელ მონაცემებთან მუშაობისას. ეს გამოჩნდა შეფასებებში, სადაც კადრების შერჩევის სიჩქარის გაზრდა ამცირებდა სიზუსტეს ამოცანებზე, რომლებიც დროით გააზრებას მოითხოვდა. TimeScope ცვლის ამ სცენარს გრძელი ვიდეოების გაგების სამ ძირითად ასპექტზე ფოკუსირებით:
TimeScope-ის მთავარი იდეა არის მოკლე ვიდეო კლიპების, როგორც „ნემსების“ გამოყენება, და მხოლოდ „ნემსის“ აღმოჩენის ნაცვლად, ის მოდელებს მთელი ვიდეოს ღრმა გაგებისკენ უბიძგებს. ის იყენებს მოკლე ვიდეო კლიპებს, როგორც „ნემსებს“, რომლებსაც გრძელ საბაზისო ვიდეოებში (1 წუთიდან 8 საათამდე) შემთხვევით პოზიციებზე ათავსებს. ეს „ნემსები“ შეიცავს ამოცანის ამოსახსნელად საჭირო ძირითად ინფორმაციას, რაც მოდელებს აიძულებს დაამუშაონ მთელი შეყვანა ისეთი მალსახმობების გარეშე, როგორიცაა იშვიათი შერჩევა. TimeScope აფასებს გრძელი ვიდეოს გაგების სამ განსხვავებულ ასპექტს სამი ტიპის „ნემსის“ გამოყენებით:
1. **ლოკალიზაცია:** ეს ამოწმებს ლოკალიზებული მოვლენის ძირითად მოძიებასა და გაგებას. კითხვები ისეა დასმული, რომ „ნემსიდან“ შესაბამისი კადრის შერჩევა საკმარისი უნდა იყოს — მაგალითად, გრძელ ვიდეოში მოკლე ნაწილის შესახებ კითხვა. მაგალითი: ტრანსპორტის რა საშუალებაა ნაჩვენები ვიდეოში?
2. **სინთეზი:** ამ შემთხვევაში, ვიდეოს სხვადასხვა წერტილში ვათავსებთ მრავალ ტექსტურ „ნემსს“ (მაგალითად, 2-4 მოკლე კლიპი, რომელიც ეკრანზე ტექსტის სახით აჩვენებს „საიდუმლო სიტყვებს“). მოდელმა უნდა ამოიცნოს ყველა სიტყვა და მოახდინოს მათი ქრონოლოგიური თანმიმდევრობით მოხსენება, რაც ახდენს ისეთი ამოცანების სიმულაციას, როგორიცაა დროის ნიშნულების ან საკვანძო ფაქტების ამოღება გაფანტული სცენებიდან. ეს მოითხოვს მთელი ქრონოლოგიის სკანირებას და შედარებითი პოზიციონირების გაგებას.
3. **მოძრაობის ანალიზი:** კითხვებისთვის, რომლებიც ფოკუსირებულია მოძრაობაზე ან თანმიმდევრობაზე მოკლე კლიპის ფარგლებში, ერთი კადრის შერჩევა საკმარისი არ იქნება — მოდელმა უნდა აღიქვას დინამიკა კადრებს შორის. ეს ამოწმებს, ინარჩუნებს თუ არა გრძელი კონტექსტის დამუშავება დროით სიზუსტეს. მაგალითი: რამდენჯერ მოიქნია კაცმა ნაჯახი? (ა) ერთხელ (ბ) ორჯერ (გ) სამჯერ (დ) ოთხჯერ (ე) ხუთჯერ (ვ) ექვსჯერ
ვიდეოს განსხვავებული სიგრძისა და „ნემსების“ სხვადასხვა განლაგების გამოყენებით, TimeScope ზომავს, თუ რამდენ ვიდეოს ნამდვილად შეუძლია მოდელს დამუშავება — და აჩვენებს, რომ შესრულება მცირდება ვიდეოს გახანგრძლივებასთან ერთად. დასაწყისისთვის, TimeScope გამოსცადეს წამყვან ვიზუალურ-ლინგვისტურ მოდელებზე, ღია კოდის ფავორიტებიდან დაწყებული ისეთ გიგანტებამდე, როგორიცაა Gemini 2.
თეგები:
#ai
#ხელოვნური ინტელექტი
#მულტიმოდალური ai
#ბენჩმარკი
#მოდელები
#timescope
#ვიდეო ანალიზი
#გრძელი ვიდეოები
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი