ციფრული ინტერაქციის მომავალი: GUI ავტომატიზაცია ხედვა-ენის მოდელებით
ეს ბლოგ-პოსტი წარმოგიდგენთ მრავალფაზიან სტრატეგიას ხედვა-ენის მოდელების გასაწვრთნელად, რათა მიღწეულ იქნას გრაფიკული ინტერფეისის (GUI) ავტომატიზაცია. განხილულია, თუ როგორ შეიძლება მოდელების ტრანსფორმაცია, საწყისი დამიწების შესაძლებლობების გარეშე, აგენტურ კოდერებად, რომლებსაც შეუძლიათ ინტერფეისების გაგება და მათთან ურთიერთობა. ხაზგასმულია მონაცემთა დამუშავებიდან მოდელის ტრენინგამდე მიმავალი ყოვლისმომცველი პროცესი. მიდგომა ეფუძნება SmolVLM2-2.2B-Instruct მოდელს და მოიცავს მონაცემთა გაერთიანების პაი
გრაფიკული მომხმარებლის ინტერფეისის (GUI) ავტომატიზაცია კომპიუტერული ხედვის ერთ-ერთი ყველაზე რთული სფეროა. მოდელების შექმნა, რომლებსაც შეუძლიათ მომხმარებლის ინტერფეისების დანახვა და მათთან ურთიერთობა, ხელოვნური ინტელექტის აგენტებს საშუალებას აძლევს იმოქმედონ მობილურ, დესკტოპ და ვებ პლატფორმებზე. ეს ციფრული ინტერაქციის მომავალს შეცვლის.
ამ ბლოგ-პოსტში, ჩვენ წარმოგიდგენთ ყოვლისმომცველ მიდგომას ხედვა-ენის მოდელების (VLM) გასაწვრთნელად GUI ავტომატიზაციისთვის, მრავალფაზიანი ტრენინგის სტრატეგიის გამოყენებით. ჩვენ ვაჩვენებთ, თუ როგორ შეიძლება მოდელის, რომელსაც თავდაპირველად არ აქვს დამიწების შესაძლებლობები, ტრანსფორმაცია აგენტურ კოდერად, რომელსაც შეუძლია გრაფიკული ინტერფეისების გაგება და მათთან ურთიერთობა. ჩვენი მიზანი არ არის SOTA (State-of-the-Art) მოდელის შექმნა, არამედ მთელი პროცესის დემონსტრირება, მონაცემთა დამუშავებიდან მოდელის ტრენინგამდე, და ამით იმის ჩვენება, თუ როგორ შეიძლება GUI-ის დამიწების შესაძლებლობების განბლოკვა VLM-ებში.
GUI შესაძლებლობები მოიცავს ინტერფეისის გაგებას და ელემენტების ზუსტ ლოკალიზაციას. ეს უნარები მოდელს საშუალებას აძლევს მაღალი დონის ამოცანები გადააქციოს დაბალი დონის GUI მოქმედებებად, როგორიცაა დაწკაპუნება, აკრეფა და ა.შ. ჩვენი მიდგომა იყენებს SmolVLM2-2.2B-Instruct-ს, როგორც საბაზისო მოდელს – პატარა, მძლავრ ხედვა-ენის მოდელს, რომელსაც თავდაპირველად არ გააჩნია დამიწების შესაძლებლობები GUI ამოცანებისთვის. ეს მას იდეალურ კანდიდატად აქცევს ჩვენი ტრენინგის მეთოდოლოგიის ეფექტურობის დემონსტრირებისთვის.
ჩვენი ორფაზიანი ტრენინგის პროცესის მეშვეობით, პირველ რიგში მოდელს ვუნერგავთ დამიწების შესაძლებლობებს, შემდეგ კი ვამაგრებთ მას აგენტური მსჯელობის უნარებით ზედამხედველობითი დაზუსტებული ტრენინგის (SFT) გამოყენებით. ჩვენი მიდგომის ეფექტურობას ვაფასებთ აღიარებული აღქმის ბენჩმარკზე: ScreenSpot-v2-ზე, რომელიც ამოწმებს მოდელის უნარს გაიგოს და მოძებნოს ელემენტები სქრინშოტებში. ჩვენი პროცესი შთაგონებულია AGUVIS-ის კვლევით და ჩვენ ვიყენებთ მათ მიერ საგულდაგულოდ მომზადებულ მონაცემთა ნაკრებებს, რათა განვავითაროთ მათი ფუნდამენტური ნაშრომი.
ScreenSpot-v2-ის შესრულების ევოლუცია საბაზისო მოდელის SmolVLM2-2.2B-Instruct-ის ტრენინგის ფაზაში. ეს სექცია განმარტავს, თუ როგორ ვახდენთ არაერთგვაროვანი GUI მოქმედებების ფორმატის კონვერტაციას მრავალი მონაცემთა ნაკრებიდან ერთიან, გაერთიანებულ ფორმატში. ფუნქციების სახელების, ხელმოწერების და პარამეტრების სტანდარტიზაციით, ჩვენ ვქმნით თანმიმდევრულ, მაღალი ხარისხის მონაცემებს, რომლებიც წარმოადგენს ეფექტური მოდელის ტრენინგის საფუძველს.
მრავალ GUI ავტომატიზაციის მონაცემთა ნაკრებთან მუშაობის ერთ-ერთი მთავარი გამოწვევა არის მოქმედებების წარმოდგენის სტანდარტიზაციის ნაკლებობა. სხვადასხვა მონაცემთა ნაკრები იყენებს განსხვავებულ ფუნქციურ ხელმოწერებს, პარამეტრების დასახელების კონვენციებს და მოქმედებათა ტაქსონომიებს, რაც ართულებს ერთიანი მოდელის გაწვრთნას მრავალფეროვანი მონაცემთა წყაროების გამოყენებით. ჩვენ ავიღეთ ღია კოდის მონაცემთა ნაკრებები (xlangai/aguvis-stage1, xlangai/aguvis-stage2), რომლებიც თავდაპირველად AGUVIS-ის მიერ იყო გამოყენებული, და განვახორციელეთ მონაცემთა ტრანსფორმაციის ყოვლისმომცველი პაიპლაინი ერთიანი მოქმედებათა სივრცის შესაქმნელად. ჩვენი მიდგომა მოიცავდა: აქ მოცემულია რეალური მაგალითები ჩვენი მოქმედებათა კონვერტაციის სისტემიდან (preprocessing/action_conversion.py), რომლებიც აჩვენებს, თუ როგორ ვახდენთ ჰეტეროგენული მოქმედებების წარმოდგენების ტრანსფორმაციას ჩვენს გაერთიანებულ ფორმატში (დამიწების კოორდინატები ნორმალიზებულია [0,1]-მდე):
მანამდე (ორიგინალური მოქმედებათა მონაცემთა ნაკრების ფორმატები):
შემდეგ (გაერთიანებული მოქმედებათა მონაცემთა ნაკრების ფორმატები):
ეს გაერთიანების პროცესი აუცილებელი იყო თანმიმდევრული სატრენინგო მონაცემების შესაქმნელად, რაც მოდელს საშუალებას აძლევს ისწავლოს თანმიმდევრული მოქმედებათა შაბლონები მრავალფეროვან GUI გარემოში. სხვადასხვა გამოყენების შემთხვევებისთვის მაქსიმალური მოქნილობის უზრუნველსაყოფად, ჩვენ შევიმუშავეთ მოქმედებათა სივრცის კონვერტორი (Action Space Converter) (utils/action_space_converter.py) – ინსტრუმენტი, რომელიც მომხმარებლებს საშუალებას აძლევს მარტივად მოარგონ მოქმედებათა სივრცე საკუთარ მორგებულ მოქმედებათა ლექსიკასა და დასახელების კონვენციებს.
ამ ხელსაწყოს გამოყენება შეგიძლიათ ერთი მოქმედების ხელმოწერის (ფუნქციის სახელები, პარამეტრების სახელები და პარამეტრების მნიშვნელობების ცვლილებები და ა.შ.) მეორეში გადასაყვანად:
მანამდე
შემდეგ
მოქმედებათა სივრცის კონვერტორი უზრუნველყოფს:
ეს ხელსაწყო მკვლევრებსა და პრაქტიკოსებს საშუალებას აძლევს:
მოქმედებათა სივრცის კონვერტორი განსაკუთრებით ღირებულია ტრენინგისთვის მონაცემთა ნაკრებების მომზადებისას, რადგან ის უზრუნველყოფს თანმიმდევრულ მოქმედებათა ლექსიკას სხვადასხვა განლაგების გარემოში, არსებულ ავტომატიზაციის ფრეიმვორკებთან თავსებადობის შენარჩუნებით.
ამ პაიპლაინის მეშვეობით, ჩვენ ვახდენთ ღია კოდის მონაცემთა ნაკრებების xlangai/aguvis-stage1, xlangai/aguvis-stage2 ტრანსფორმაციას ჩვენს გაერთიანებულ მოქმედებათა სივრცეში (იხილეთ აქ). ამ პროცესის შედეგად გამოქვეყნდა ორი ახალი, სრულად ფორმატირებული მონაცემთა ნაკრები: smolagents/aguvis-stage-1 და smolagents/aguvis-stage-2. პირველი ფაზა იყენებს smolagents/aguvis-stage-1 მონაცემთა ნაკრებს, რომელიც GUI-ის დამიწებას ახდენს დაბალი დონის ინსტრუქციების მრავალფეროვან შესრულებად მოქმედებებთან დაწყვილებით (კოდის სახით გამოხატული). მაგალითად, მომხმარებლის/ასისტენტის მიმართვა smolagents/aguvis-stage-1-ში მიჰყვება სტრუქტურას: თითოეული ნიმუში აკავშირებს სქრინშოტს მრავალმხრივ მომხმარებლის/ასისტენტის ინტერაქციებთან, რაც მოდელს საშუალებას აძლევს ისწავლოს დახვეწილი მოქმედებათა დამიწება დიალოგის თითოეულ ეტაპზე. დაზუსტებული ტრენინგის (fine-tuning) დროს, მონაცემთა კოლატორი ნიღბავს ყველაფერს, გარდა ასისტენტის პასუხებისა, დანაკარგის გამოთვლისას.
პირველი ფაზის სრულმასშტაბიანი ტრენინგის დაწყებამდე, ჩვენ ჩავატარეთ ყოვლისმომცველი აბლაციის კვლევები ოპტიმალური სატრენინგო კონფიგურაციების დასადგენად. ჩვენ ექსპერიმენტები ჩავატარეთ გამოსახულების სხვადასხვა ზომისა და კოორდინატების წარმოდგენის სისტემებით, რათა დაგვედგინა ოპტიმალური კონფიგურაცია SmolVLM2-ისთვის: ზოგიერთი SOTA GUI VLM (მაგალითად,
თეგები:
#ხელოვნური ინტელექტი
#მანქანური სწავლება
#კომპიუტერული ხედვა
#gui ავტომატიზაცია
#ხედვა-ენის მოდელები
#smolvlm2
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები