ხელოვნური ინტელექტი დოკუმენტების დამუშავებაში: ხედვა-ენის მოდელების აღზევება და სწორი არჩევანის გზამკვლევი
მძლავრი ხედვა-ენის მოდელების (VLM) განვითარებამ დოკუმენტების ხელოვნური ინტელექტის სფერო (Document AI) გარდაქმნა. თითოეულ მოდელს უნიკალური შესაძლებლობები აქვს, რაც მათ შორის არჩევანს ართულებს. ღია წონის მოდელები უკეთეს ხარჯთეფექტურობასა და კონფიდენციალურობას გვთავაზობს. ეს გზამკვლევი დაგეხმარებათ გაიგოთ, როგორ შეარჩიოთ სწორი ოპტიკური სიმბოლოების ამოცნობის (OCR) მოდელი, დაიწყოთ მისი გამოყენება და მიიღოთ ღრმა ცოდნა დოკუმენტების ხელოვნური ინტელექტის შესახებ. სტატია მიმოიხილავს OCR-ის განვითარებას, თ
მძლავრი ხედვა-ენის მოდელების აღზევებამ დოკუმენტის ხელოვნური ინტელექტი მთლიანად გარდაქმნა. თითოეულ მოდელს უნიკალური ძლიერი მხარეები აქვს, რაც არჩევანს ართულებს. ღია წონის მოდელები უკეთეს ხარჯთეფექტურობასა და კონფიდენციალურობას გვთავაზობს. მათთან მუშაობის დასაწყებად, ჩვენ ეს სახელმძღვანელო მოვამზადეთ. ამ სახელმძღვანელოში შეიტყობთ: დასასრულს, გეცოდინებათ, როგორ შეარჩიოთ სწორი OCR მოდელი, დაიწყოთ მისი გამოყენება და მიიღოთ უფრო ღრმა ცოდნა დოკუმენტის ხელოვნური ინტელექტის შესახებ. დავიწყოთ!
ოპტიკური სიმბოლოების ამოცნობა (OCR) კომპიუტერული ხედვის ერთ-ერთი უძველესი და ხანგრძლივი გამოწვევაა. ხელოვნური ინტელექტის მრავალი პირველი პრაქტიკული გამოყენება მიმართული იყო ნაბეჭდი ტექსტის ციფრულ ფორმატში გადაქცევაზე. ხედვა-ენის მოდელების (VLM) ზრდასთან ერთად, OCR მნიშვნელოვნად განვითარდა. ბოლო დროს, მრავალი OCR მოდელი შემუშავდა არსებული VLM-ების დაზუსტებით (fine-tuning). მაგრამ დღევანდელი შესაძლებლობები OCR-ს ბევრად სცდება: შეგიძლიათ დოკუმენტების მოძიება მოთხოვნის მიხედვით ან მათ შესახებ შეკითხვებზე პირდაპირ პასუხის გაცემა. უფრო ძლიერი ვიზუალური ფუნქციების წყალობით, ეს მოდელები ასევე უმკლავდებიან დაბალი ხარისხის სკანირებას, ინტერპრეტაციას უკეთებენ რთულ ელემენტებს, როგორიცაა ცხრილები, დიაგრამები და სურათები, და აერთიანებენ ტექსტს ვიზუალურ მასალასთან ღია კითხვებზე პასუხის გასაცემად სხვადასხვა დოკუმენტში. ბოლო მოდელები ტექსტებს მანქანურად წაკითხვად ფორმატში გარდაქმნიან. შეყვანა შეიძლება მოიცავდეს: OCR მოდელები მათ მანქანურად წაკითხვად ტექსტად აქცევენ, რომელიც მრავალი სხვადასხვა ფორმატით არსებობს, როგორიცაა HTML, Markdown და სხვა.
ტექსტის გარდა, ზოგიერთ მოდელს შეუძლია ამოიცნოს: ზოგიერთმა მოდელმა იცის, სად არის სურათები დოკუმენტში, ამოიღებს მათ კოორდინატებს და შესაბამისად ათავსებს ტექსტებს შორის. სხვა მოდელები ქმნიან სურათების წარწერებს და ათავსებენ მათ გამოჩენის ადგილას. ეს განსაკუთრებით გამოსადეგია, თუ მანქანურად წაკითხვად გამომავალ ინფორმაციას LLM-ს (დიდი ენობრივი მოდელი) აწვდით. მაგალითის სახით, შეგვიძლია დავასახელოთ OlmOCR AllenAI-ისგან, ან PaddleOCR-VL PaddlePaddle-ისგან. მოდელები იყენებენ სხვადასხვა მანქანურად წაკითხვად გამომავალ ფორმატს, როგორიცაა DocTags, HTML ან Markdown (ახსნილია შემდეგ განყოფილებაში „გამომავალი ფორმატები“). მოდელის მიერ ცხრილებისა და დიაგრამების დამუშავების მეთოდი ხშირად დამოკიდებულია მათ მიერ გამოყენებულ გამომავალ ფორმატზე. ზოგიერთი მოდელი დიაგრამებს სურათებივით აღიქვამს: ისინი უცვლელად ინახება. სხვა მოდელები დიაგრამებს გარდაქმნიან Markdown ცხრილებად ან JSON-ად, მაგალითად, სვეტოვანი დიაგრამა შეიძლება შემდეგნაირად გარდაიქმნას. ანალოგიურად, ცხრილებისთვის, უჯრედები გარდაიქმნება მანქანურად წაკითხვად ფორმატში, სათაურებიდან და სვეტებიდან კონტექსტის შენარჩუნებით.
სხვადასხვა OCR მოდელს აქვს სხვადასხვა გამომავალი ფორმატი. მოკლედ, წარმოგიდგენთ თანამედროვე მოდელების მიერ გამოყენებულ გავრცელებულ გამომავალ ფორმატებს. DocTag: DocTag არის XML-ის მსგავსი ფორმატი დოკუმენტებისთვის, რომელიც გამოხატავს მდებარეობას, ტექსტის ფორმატს, კომპონენტების დონის ინფორმაციას და სხვა. ქვემოთ მოცემულია DocTags-ად გაანალიზებული ნაშრომის ილუსტრაცია. ამ ფორმატს იყენებენ ღია Docling მოდელები. სწორი მოდელი დამოკიდებულია იმაზე, თუ როგორ აპირებთ მისი გამომავალი შედეგების გამოყენებას: დოკუმენტებს შეიძლება ჰქონდეთ რთული სტრუქტურები, როგორიცაა მრავალსვეტიანი ტექსტური ბლოკები და მოძრავი ფიგურები. ძველი OCR მოდელები ამ დოკუმენტებს ამუშავებდნენ სიტყვების ამოცნობით და შემდეგ გვერდების განლაგების ხელით განსაზღრით პოსტ-დამუშავების ეტაპზე, რათა ტექსტი წაკითხვის თანმიმდევრობით ყოფილიყო წარმოდგენილი, რაც მოწყვლადია. თანამედროვე OCR მოდელები, მეორე მხრივ, იყენებენ განლაგების მეტამონაცემებს (layout metadata) წაკითხვის თანმიმდევრობისა და სიზუსტის შესანარჩუნებლად. ამ მეტამონაცემებს „ღუზა“ (anchor) ეწოდება და ის შეიძლება იყოს შემოსაზღვრული ველების (bounding boxes) სახით. ამ პროცესს ასევე უწოდებენ „დაფუძნებას/დამაგრებას“ (grounding/anchoring), რადგან ის ხელს უწყობს „ჰალუცინაციის“ შემცირებას. OCR მოდელებს შეუძლიათ მიიღონ სურათები და არჩევითი ტექსტური მოთხოვნა (prompt), რაც დამოკიდებულია მოდელის არქიტექტურასა და წინასწარ მომზადების (pre-training) კონფიგურაციაზე. ზოგიერთი OCR მოდელი მხარს უჭერს მოთხოვნაზე დაფუძნებულ ამოცანების გადართვას (prompt-based task switching), მაგალითად, granite-docling-ს შეუძლია მთელი გვერდის გაანალიზება მოთხოვნით „ეს გვერდი Docling-ად გადააქციე“, ხოლო მას ასევე შეუძლია მიიღოს მოთხოვნები, როგორიცაა „ეს ფორმულა LaTeX-ად გადააქციე“, გვერდთან ერთად, რომელიც სავსეა ფორმულებით. სხვა მოდელები, თუმცა, მხოლოდ მთლიანი გვერდების გასაანალიზებლად არიან გაწვრთნილი და ისინი ამას სისტემური მოთხოვნის (system prompt) მეშვეობით აკეთებენ. მაგალითად, AllenAI-ის OlmOCR იღებს გრძელ პირობით მოთხოვნას (conditioning prompt). მრავალი სხვა მოდელის მსგავსად, OlmOCR ტექნიკურად არის VLM-ის (ამ შემთხვევაში Qwen2.5VL) OCR-ისთვის დაზუსტებული (fine-tuned) ვერსია, ასე რომ თქვენ შეგიძლიათ მისი გამოყენება სხვა ამოცანებისთვის, მაგრამ მისი შესრულება OCR შესაძლებლობების დონეზე არ იქნება.
გასულ წელს ახალი მოდელების წარმოუდგენელი ტალღა ვიხილეთ. რადგან ამდენი სამუშაო ღია ფორმატში მიმდინარეობს, ეს აქტორები ერთმანეთის ნამუშევრებზე აშენებენ და სარგებლობენ. ამ შესანიშნავი მაგალითია AllenAI-ის მიერ OlmOCR-ის გამოშვება, რომელმაც არა მხოლოდ მოდელი, არამედ მისი გაწვრთნისთვის გამოყენებული მონაცემთა ნაკრებიც გამოაქვეყნა. ამით სხვებს შეუძლიათ მათი გამოყენება ახალი მიმართულებებით განვითარებისთვის. ეს სფერო წარმოუდგენლად აქტიურია, მაგრამ ყოველთვის არ არის ნათელი, რომელი მოდელი უნდა გამოიყენოთ. საქმის გასაადვილებლად, ჩვენ ვაგროვებთ ჩვენი ამჟამინდელი ფავორიტი მოდელების არასრულყოფილ შედარებას. ქვემოთ მოცემული ყველა მოდელი ითვალისწინებს განლაგებას (layout-aware) და შეუძლია ცხრილების, დიაგრამების და მათემატიკური განტოლებების გაანალიზება. თითოეული მოდელის მიერ მხარდაჭერილი ენების სრული სია დეტალურადაა აღწერილი მათ „მოდელის ბარათებში“ (model cards), ასე რომ, თუ დაინტერესებული ხართ, აუცილებლად გადაამოწმეთ. ქვემოთ მოცემულ ყველა მოდელს აქვს ღია კოდის ლიცენზია, გარდა Chandra-ისა, რომელსაც OpenRAIL ლიცენზია აქვს, და Nanonets-ის ლიცენზია გაურკვეველია. საშუალო ქულები აღებულია Chandra-ის, OlmOCR-ის მოდელის ბარათებიდან, შეფასებული
თეგები:
#ხელოვნური ინტელექტი
#ტექნოლოგია
#vlm
#მონაცემთა ანალიზი
#ocr
#დოკუმენტის დამუშავება
#ღია მოდელები
#მანქანური ხედვა
წყარო: huggingface.co
AI-ით გადამუშავებული