Layout analysis — hujjat tasviridagi elementlarni sarlavha, paragraf, ustun, jadval, rasm, caption, header va footer kabi mantiqiy regionlarga ajratish hamda ularning o‘qish tartibini aniqlash jarayoni. U OCR’dan olingan matnni asl hujjat tuzilmasiga bog‘laydi. Layout noto‘g‘ri bo‘lsa belgilar to‘g‘ri tanilgan taqdirda ham mazmun aralashib ketadi.
Geometrik va mantiqiy tuzilma
Geometrik layout elementning sahifadagi koordinata, o‘lcham va yaqinligini ifodalaydi. Mantiqiy layout uning vazifasini bildiradi: yuqoridagi katta matn sarlavha, pastdagi kichik blok footnote bo‘lishi mumkin. Bir xil ko‘rinish turli hujjat janrida boshqa ma’no oladi.
Page segmentation background, text block, line va non-text regionlarni topadi. Reading order chapdan o‘ngga bitta ustunda sodda, gazeta, ilmiy maqola va yon izohli sahifada murakkab. Yozuv yo‘nalishi va vertikal matn ham hisobga olinadi. Header va footer har sahifada takrorlansa asosiy contentdan ajratiladi.
Usullar
Top-down usul sahifani katta regionlardan kichik bloklarga bo‘ladi. Projection profile bo‘sh gorizontal va vertikal chiziqlar orqali ustun hamda satrlarni topadi. Bottom-up usul character yoki connected componentlarni yaqinlik asosida so‘z, satr va blokka birlashtiradi. Qat’iy qoidalar bir xil template’da samarali.
Machine learning object detection yoki segmentation orqali region classini aniqlaydi. Vision transformer sahifa elementlari orasidagi uzoq bog‘lanishni o‘rganishi mumkin. Multimodal model visual feature bilan OCR token va koordinatalarni birga ishlatadi. Model natijasi document schema va biznes qoidalari bilan post-processing qilinadi.
Jadval tahlili
Table detection jadval regionini, structure recognition esa row, column va cell chegaralarini topadi. Chiziqli jadvalda ruling line yordam beradi, borderless jadvalda text alignment va bo‘shliqdan foydalaniladi. Merged cell va ko‘p qatorli header murakkab. Natija HTML table, CSV yoki cell graphga aylantirilishi mumkin.
Faqat OCR matnini tab bilan ajratish jadval semanticsini kafolatlamaydi. Cell coordinate, rowspan, colspan va reading order saqlanadi. Sonlar column turi, birlik va total qoidasi bilan tekshiriladi. Moliyaviy jadvalda bitta cellning boshqa ustunga siljishi jiddiy xato.
Form va key-value
Form analysis labelni uning qiymati, checkbox yoki imzo maydoni bilan bog‘laydi. Eng yaqin matn har doim label emas; alignment, separator va template anchor ishlatiladi. Ko‘p sahifali formada section va field ID barqaror schema’ga map qilinadi.
Checkbox detection visual holatni, OCR esa yonidagi labelni beradi. Qo‘lda chizilgan belgi confidence’ni pasaytiradi. Critical field human review queue’ga yuboriladi. Original coordinate reviewerga source cropni ko‘rsatish uchun saqlanadi.
Evaluation
Region detection precision, recall va IoU bilan, classification esa label aniqligi bilan o‘lchanadi. Reading order pairwise relation yoki sequence edit distance bilan baholanishi mumkin. Table structure uchun cell adjacency va tree similarity ishlatiladi. End-to-end metric extracted fieldning yakuniy to‘g‘riligini o‘lchaydi.
Dataset turli scan sifati, til, template va sahifa sonini qamrab oladi. Model bir tashkilot blankalarini yodlab, yangi layoutda ishlamasligi mumkin. Production monitoring unknown layout va confidence driftni aniqlaydi.
Output va accessibility
Layout natijasi ALTO, PAGE XML, hOCR, JSON yoki document tree sifatida saqlanadi. Coordinate original image o‘lchamiga bog‘lanadi; resize transform metadata’si yo‘qolmasligi kerak. PDF tag tree yaratishda heading, list va table semantics reading order bilan birga kerak.
Accessibility uchun faqat vizual joylashuv yetarli emas. Screen reader mantiqiy sarlavha iyerarxiyasi, alt text va table header associationga muhtoj. Avtomatik tahlil natijasi murakkab hujjatda inson tomonidan tekshirilishi mumkin.
Bog‘liq tushunchalar
Document AI, Optical Character Recognition, Page segmentation, Reading order, Table recognition, Text detection, Document structure