მოკლედ: მძლავრი ვიზუალური-ლინგვალური მოდელების (VLM) გაჩენამ დოკუმენტების ხელოვნური ინტელექტის (AI) სფერო მთლიანად შეცვალა. თითოეულ მოდელს უნიკალური ძლიერი მხარეები აქვს, რაც ართულებს სწორის არჩევას. ღია წონის მოდელები უკეთეს ხარჯთეფექტურობასა და კონფიდენციალურობას გვთავაზობს. მათთან მუშაობის დასაწყებად, ჩვენ შევადგინეთ ეს სახელმძღვანელო. მისი დასრულების შემდეგ, თქვენ გეცოდინებათ, როგორ აირჩიოთ სწორი OCR მოდელი, დაიწყოთ მისი გამოყენება და მიიღოთ ღრმა ცოდნა დოკუმენტების AI-ს შესახებ. დავიწყოთ! ოპტიკური სიმბოლოების ამოცნობა (OCR) კომპიუტერული ხედვის ერთ-ერთი ადრეული და ხანგრძლივი გამოწვევაა. ხელოვნური ინტელექტის (AI) მრავალი პირველი პრაქტიკული გამოყენება მიმართული იყო ნაბეჭდი ტექსტის ციფრულ ფორმატში გადაყვანაზე. ვიზუალური-ლინგვალური მოდელების (VLM) ზრდასთან ერთად, OCR მნიშვნელოვნად განვითარდა. ბოლო დროს, მრავალი OCR მოდელი შემუშავდა არსებული VLM-ების დახვეწის გზით. მაგრამ დღევანდელი შესაძლებლობები სცილდება OCR-ის საზღვრებს: თქვენ შეგიძლიათ დოკუმენტების მოძიება მოთხოვნის საფუძველზე ან მათ შესახებ კითხვებზე პირდაპირ პასუხის გაცემა. გაძლიერებული ვიზუალური ფუნქციების წყალობით, ეს მოდელები ასევე ამუშავებენ დაბალი ხარისხის სკანირებულ დოკუმენტებს, ინტერპრეტირებენ კომპლექსურ ელემენტებს, როგორიცაა ცხრილები, დიაგრამები და სურათები, და აერთიანებენ ტექსტს ვიზუალურ მასალასთან, რათა უპასუხონ ღია კითხვებს დოკუმენტებში. ბოლო დროს შემუშავებული მოდელები ტექსტებს მანქანურად წაკითხვად ფორმატში გარდაქმნიან. შეყვანა შეიძლება მოიცავდეს (სკანირებულ გვერდებს, გამოსახულებებს და სხვ.): OCR მოდელები მათ გარდაქმნიან მანქანურად წაკითხვად ტექსტად, რომელიც მრავალი სხვადასხვა ფორმატით არის წარმოდგენილი, როგორიცაა HTML, Markdown და სხვა. ტექსტის გარდა, ზოგიერთ მოდელს შეუძლია ამოიცნოს: ზოგიერთმა მოდელმა იცის, სად არის გამოსახულებები დოკუმენტში, ამოიღოს მათი კოორდინატები და ჩასვას ისინი შესაბამისად ტექსტებს შორის. სხვა მოდელები ქმნიან წარწერებს გამოსახულებებისთვის და სვამენ მათ იქ, სადაც ისინი გვხვდება. ეს განსაკუთრებით გამოსადეგია, თუ მანქანურად წაკითხვად გამომავალს დიდ ენობრივ მოდელს (LLM) აწვდით. მაგალითი მოდელებია AllenAI-ის OlmOCR ან PaddlePaddle-ის PaddleOCR-VL. მოდელები იყენებენ სხვადასხვა მანქანურად წაკითხვად გამომავალ ფორმატებს, როგორიცაა DocTags, HTML ან Markdown (ახსნილია შემდეგ განყოფილებაში „გამომავალი ფორმატები“). ის, თუ როგორ ამუშავებს მოდელი ცხრილებსა და დიაგრამებს, ხშირად დამოკიდებულია მათ მიერ გამოყენებულ გამომავალ ფორმატზე. ზოგიერთი მოდელი დიაგრამებს გამოსახულებებად მიიჩნევს: ისინი უცვლელად ინახება. სხვა მოდელები დიაგრამებს Markdown ცხრილებად ან JSON-ად გარდაქმნიან, მაგალითად, სვეტოვანი დიაგრამა შეიძლება გარდაიქმნას შესაბამის ფორმატში. ანალოგიურად ცხრილებისთვის, უჯრედები გარდაიქმნება მანქანურად წაკითხვად ფორმატში სათაურებისა და სვეტების კონტექსტის შენარჩუნებით. სხვადასხვა OCR მოდელს აქვს სხვადასხვა გამომავალი ფორმატი. მოკლედ, აქ მოცემულია თანამედროვე მოდელების მიერ გამოყენებული საერთო გამომავალი ფორმატები. DocTag: DocTag არის დოკუმენტებისთვის XML-ის მსგავსი ფორმატი, რომელიც გამოხატავს მდებარეობას, ტექსტის ფორმატს, კომპონენტის დონის ინფორმაციას და სხვა. ქვემოთ მოცემულია DocTags-ად გარდაქმნილი ნაშრომის ილუსტრაცია (შენიშვნა: ილუსტრაცია არ არის მოწოდებული). ამ ფორმატს იყენებენ ღია Docling მოდელები. სწორი მოდელი დამოკიდებულია იმაზე, თუ როგორ აპირებთ მისი გამომავალი მონაცემების გამოყენებას: დოკუმენტებს შეიძლება ჰქონდეთ რთული სტრუქტურები, როგორიცაა მრავალსვეტიანი ტექსტური ბლოკები და მცურავი ფიგურები. ძველი OCR მოდელები ამ დოკუმენტებს ამუშავებდნენ სიტყვების ამოცნობით და შემდეგ გვერდების განლაგების ხელით განსაზღვრით პოსტ-დამუშავებისას, რათა ტექსტი წაკითხვის თანმიმდევრობით წარმოჩენილიყო, რაც მოუხერხებელია. თანამედროვე OCR მოდელები, თავის მხრივ, აერთიანებენ განლაგების მეტამონაცემებს, რათა შეინარჩუნონ წაკითხვის თანმიმდევრობა და სიზუსტე. ამ მეტამონაცემებს „ღუზა“ (anchor) ეწოდება და ის შეიძლება იყოს შემოსაზღვრული ველების (bounding boxes) სახით. ამ პროცესს ასევე უწოდებენ „დამიწებას“ (grounding) ან „დამაგრებას“ (anchoring), რადგან ის ხელს უწყობს „ჰალუცინაციების“ (hallucination) შემცირებას. OCR მოდელებს შეუძლიათ მიიღონ გამოსახულებები და სურვილისამებრ ტექსტური მოთხოვნა; ეს დამოკიდებულია მოდელის არქიტექტურასა და წინასწარ მომზადებაზე. ზოგიერთი OCR მოდელი მხარს უჭერს მოთხოვნაზე დაფუძნებულ ამოცანების შეცვლას, მაგალითად, granite-docling-ს შეუძლია მთელი გვერდის გაანალიზება მოთხოვნით „ეს გვერდი Docling-ად გარდაქმნა“, ხოლო მას ასევე შეუძლია მიიღოს მოთხოვნები, როგორიცაა „ეს ფორმულა LaTeX-ად გარდაქმნა“ გვერდთან ერთად, რომელიც სავსეა ფორმულებით. სხვა მოდელები, თუმცა, მომზადებულია მხოლოდ მთლიანი გვერდების გასაანალიზებლად და ისინი ამისთვის პირობითად არიან მომზადებულნი სისტემური მოთხოვნის მეშვეობით. მაგალითად, AllenAI-ის OlmOCR იღებს ხანგრძლივ პირობით მოთხოვნას. ბევრის მსგავსად, OlmOCR ტექნიკურად არის VLM-ის (ამ შემთხვევაში Qwen2.5VL) OCR-ისთვის დახვეწილი ვერსია, ასე რომ თქვენ შეგიძლიათ მისი გამოყენება სხვა ამოცანებისთვისაც, მაგრამ მისი შესრულება OCR შესაძლებლობებს არ გაუტოლდება. გასულ წელს ახალი მოდელების წარმოუდგენელი ტალღა ვიხილეთ. იმის გამო, რომ ამდენი სამუშაო ღიად მიმდინარეობს, ეს მოთამაშეები ერთმანეთის ნამუშევრებზე აგებენ და სარგებელს იღებენ. ამის შესანიშნავი მაგალითია AllenAI-ის OlmOCR-ის გამოშვება, რომელმაც არა მხოლოდ მოდელი, არამედ მისი მომზადებისთვის გამოყენებული მონაცემთა ნაკრებიც გამოაქვეყნა. ამით, სხვებს შეუძლიათ მათზე დაფუძნებული ახალი მიმართულებების განვითარება. სფერო წარმოუდგენლად აქტიურია, მაგრამ ყოველთვის არ არის აშკარა, რომელი მოდელი გამოიყენოს. საქმის ოდნავ გასამარტივებლად, ჩვენ ვაგროვებთ ჩვენი ამჟამინდელი ფავორიტი მოდელების არასრულ შედარებას. ქვემოთ მოცემული ყველა მოდელი განლაგების ამომცნობია და შეუძლია ცხრილების, დიაგრამების და მათემატიკური განტოლებების გაანალიზება. თითოეული მოდელის მიერ მხარდაჭერილი ენების სრული სია დეტალურადაა აღწერილი მათ მოდელის ბარათებში, ამიტომ აუცილებლად შეამოწმეთ ისინი, თუ დაინტერესებული ხართ. ქვემოთ მოცემულ ყველა მოდელს აქვს ღია კოდის ლიცენზია, გარდა Chandra-ს OpenRAIL ლიცენზიისა და Nanonets-ის გაურკვეველი ლიცენზიისა. საშუალო ქულები აღებულია Chandra-ს, OlmOCR-ის მოდელის ბარათებიდან, შეფასებული...