ამ მაგალითში, olmOCR უგულებელყოფს მნიშვნელოვან ინფორმაციას, რომელიც წითლად არის მონიშნული სათაურსა და ქვედა კოლონტიტულში. ოპტიკური სიმბოლოების ამოცნობას (OCR) ფართო გამოყენება აქვს სხვადასხვა ბიზნეს სფეროში. დიდი ხნის განმავლობაში, ხელოვნური ინტელექტზე დაფუძნებული OCR ძრავების დომინანტური პარადიგმა იყო კონვეიერულ-სისტემებზე დაფუძნებული მიდგომები. ისინი შედგება მრავალი მანქანური სწავლების კომპონენტისგან, მაგალითად, სექციების სეგმენტაცია, ცხრილების გაანალიზება, სიმბოლოების ამოცნობა და სხვა, რომლებიც ერთმანეთთან არის დაკავშირებული. თუმცა, ამ მიდგომის ერთ-ერთი ფუნდამენტური ნაკლი ის არის, რომ ამოღებული შედეგები ხშირად არ აბრტყელებს კონტექსტს ისე, რომ ის ლოგიკურ კითხვის თანმიმდევრობას (ასევე ცნობილია როგორც ხაზოვანი წარმოდგენა) ემთხვეოდეს. ეს განსაკუთრებით რთულია კომპლექსური განლაგების მქონე დოკუმენტებისთვის, მოტივტივე ელემენტებით, როგორიცაა მრავალკოლონიანი დოკუმენტები მოტივტივე დიაგრამებით, სათაურებით, ქვედა კოლონტიტულებით და ა.შ. მხედველობის ენის მოდელების (VLM) ბოლოდროინდელი განვითარების ფონზე, დიდი ძალისხმევა დაიხარჯა მათ გამოყენებაზე, როგორც ალტერნატიულ OCR სისტემებზე ამ პრობლემის გადასაჭრელად. Hugging Face-ზე გამოქვეყნებული olmOCR მოდელის ტესტირებისას, ბიზნეს აპლიკაციებისთვის, როგორიცაა ინვოისების გაანალიზება, ჩვენ შევამჩნიეთ მნიშვნელოვანი ინფორმაციის მუდმივი გამოტოვება სათაურებსა და ქვედა კოლონტიტულებში. ეს მოსალოდნელი იყო, რადგან olmOCR-ის საწვრთნელად გამოყენებული მონაცემთა ნაკრები, olmOCR-mix-0225, განზრახ გამორიცხავს ზედმეტ ინფორმაციას ამ არეებიდან ბუნებრივი კითხვის ნაკადის შესანარჩუნებლად, რადგან ასეთი ინფორმაციის მნიშვნელოვანი პროგნოზირება შეუძლებელია ტრენინგის კონტექსტში (next-token prediction). ამ შეზღუდვის აღმოსაფხვრელად და ინფორმაციის სრულყოფილი ამოღების უზრუნველსაყოფად, ჩვენ გამოვიყენეთ Qwen2.5-VL-72B-Instruct, რათა შეგვექმნა 8,000 დოკუმენტისგან შემდგარი მონაცემთა ბაზა, რომელიც აღბეჭდავს ყველა შესაბამის ინფორმაციას, როგორც ეს მოსალოდნელია სანდო OCR ძრავისგან. ჩვენი ტრენინგის კონფიგურაცია დავაფუძნეთ ღია კოდის olmOCR ტრენინგის კონვეიერზე, სადაც გამოვიყენეთ გრადიენტის აკუმულაციის 4 ნაბიჯი 8xH100 Nvidia კვანძზე, ჯამში 2.5 ეპოქის განმავლობაში. ნაგულისხმევმა ჰიპერპარამეტრებმა ჩვენთვის საკმაოდ კარგად იმუშავა, რამაც გააუქმა რესურსებით ინტენსიური ჰიპერპარამეტრების ძებნის საჭიროება. Mlflow-ით ექსპერიმენტის თვალყურის დევნამ აჩვენა შემდეგი შედეგები: შეფასებისთვის, ჩვენ გამოვიყენეთ olmOCR-mix-0225 შეფასების მონაცემთა ნაკრების მორგებული ვერსია, რომელიც მოიცავს სათაურისა და ქვედა კოლონტიტულის ინფორმაციას, ასევე მიღებულს Qwen2.5-VL-72B-Instruct-ის მეშვეობით. ტრენინგის დასრულების შემდეგ, დრო იყო ჩვენი მოდელი გამოგვეცადა. ჩვენ ჩავატარეთ დოკუმენტების თვისებრივი შეფასება, სადაც კონტენტის გაანალიზების შემდეგ მნიშვნელოვანი ინფორმაცია აკლდა. ჩვენი ინფერენციის კონფიგურაცია იდენტურია olmOCR-ის კონფიგურაციისა, რომელიც იყენებს სპეციალურ მოთხოვნის სტრატეგიას, სახელწოდებით „დოკუმენტის მიბმა“ (document anchoring), რომელიც ინარჩუნებს ნებისმიერ ციფრულად შექმნილ კონტენტს თითოეული გვერდიდან. ეს ტექნიკა იღებს უცვლელ ტექსტურ ბლოკებს და პოზიციურ ინფორმაციას, რათა VLM-ებს მიაწოდოს რასტერიზებულ გამოსახულებასთან ერთად. ქვემოთ წარმოგიდგენთ ორიგინალური და დაზუსტებული მოდელის პასუხების რამდენიმე მაგალითს. ჩვენ წითლად აღვნიშნეთ მნიშვნელოვანი დაკარგული ინფორმაცია. საერთო ჯამში, კმაყოფილი ვართ შედეგებით, რადგან ახლა მთელი ინფორმაცია, ზედმეტი მონაცემების ჩათვლით, იქნება ამოღებული და მოდელი კვლავაც ახერხებს მარტივი ცხრილების გაანალიზებას. აღსანიშნავია, რომ ზოგიერთი მაგალითისთვის, მიღებული შედეგის ხარისხი შეიძლება მნიშვნელოვნად შეიცვალოს სხვადასხვა „ტემპერატურით“. OCR გადამწყვეტია დოკუმენტებიდან სტრუქტურირებული ინფორმაციის ამოღებისთვის. olmOCR-ის მსგავსი ბოლოდან-ბოლომდე სისტემების უნარი, მოახდინონ კონტენტის ხაზოვანი წარმოდგენა, მათ ძლიერ უპირატესობას ანიჭებს ტრადიციულ სისტემებთან შედარებით. ჩვენი დაზუსტებული ვერსიით, ახლა შეგვიძლია ტექსტის, მათ შორის სათაურისა და ქვედა კოლონტიტულის მონაკვეთების, ზუსტად ამოღება სხვადასხვა დოკუმენტიდან, რაც გადამწყვეტია ბიზნეს აპლიკაციებისთვის, როგორიცაა ინვოისების გაანალიზება. გვაინტერესებს, როგორ განვითარდება მომავალი მოდელები ამ სწრაფად განვითარებად სფეროში. განსაკუთრებული მადლობა Allen Institute for AI-ს მათი მოდელის, მონაცემთა ნაკრებისა და კოდის ღია წყაროდ გამოქვეყნებისთვის. თუ გაინტერესებთ ჩვენი დაზუსტებული olmOCR-მოდელის გამოცდა, ის ღია წყაროდაა ხელმისაწვდომი HuggingFace-ზე.