Bosh sahifa Wiki Document AI

Document AI

Document AI — hujjat tasviri, PDF va elektron fayllardan matn, tuzilma hamda biznesga tegishli fieldlarni avtomatik chiqarish uchun computer vision, natural language processing va machine learningni birlashtiradigan texnologiyalar sohasi. U invoice, shartnoma, anketa, chek va arxiv hujjatini classification, extraction, validation va workflow bosqichlariga tayyorlaydi.

Pipeline

Ingestion fayl type, hajm, sahifa soni va yaxlitlikni tekshiradi. Digital PDF’da embedded text bevosita olinishi, scan sahifada OCR ishlatilishi mumkin. Mixed PDF har sahifa uchun alohida qaror talab qiladi. Rendering resolutioni kichik yozuvni saqlashi, ammo resurs limitidan oshmasligi kerak.

Document classification hujjat turini aniqlaydi. Page splitting bitta fayldagi bir nechta invoice yoki qo‘shimchani ajratadi. Layout analysis paragraph, table, header va key-value regionlarini topadi. OCR matn va coordinate beradi. Extraction kerakli entity, sana, summa, tomon va bandlarni structured schema’ga map qiladi.

Extraction yondashuvlari

Template-based tizim stable forma koordinatalaridan foydalanadi. U bir xil blankda aniq va tushunarli, ammo layout o‘zgarsa buziladi. Anchor labelga nisbatan qiymat topish kichik siljishga chidamliroq. Rule va regex invoice number, sana yoki soliq ID kabi aniq formatda foydali.

Machine learning model text, coordinate va visual feature’larni birga ko‘radi. Named entity recognition matndagi qiymatni, relation extraction label-value bog‘lanishini topadi. Generative model hujjatdan schema bo‘yicha javob chiqarishi mumkin, lekin mavjud bo‘lmagan qiymatni uydirish xavfi sabab source grounding va validation zarur.

Schema va confidence

Output har field uchun value, normalized value, page, bounding region va confidence saqlashi mumkin. Original text 1 234,50, normalized qiymat decimal 1234.50 bo‘ladi; valyuta alohida field. Normalizatsiya source’ni o‘zgartirmaydi, ikkala ko‘rinish audit uchun saqlanadi.

Confidence avtomatik qabul, human review yoki rad etish thresholdini boshqaradi. Bitta umumiy threshold hamma fieldga mos emas: invoice total xatosi vendor address xatosidan qimmatroq bo‘lishi mumkin. Confidence calibration real probability bilan tekshiriladi. Business rule subtotal va tax yig‘indisini total bilan solishtiradi.

Human-in-the-loop

Reviewer original crop yonida extracted qiymatni ko‘radi. Low-confidence, rule conflict va yangi layout queue’ga tushadi. Tahrir kim tomonidan qilinganini audit saqlaydi. Correctionlar training data bo‘lishi mumkin, ammo noto‘g‘ri yoki maxfiy label avtomatik umumiy modelga qo‘shilmaydi.

Active learning eng foydali noaniq namunalarni annotationga tanlaydi. Review interface keyboard va accessibility’ga mos bo‘lsa throughput oshadi. Operator faqat qiymatni emas, noto‘g‘ri page split yoki document classni ham tuzata olishi kerak.

Integratsiya

Extraction natijasi ERP yoki workflow’ga yuborilishidan oldin schema va authorizationdan o‘tadi. Duplicate document hash, vendor ID, invoice number va sana kombinatsiyasi bilan aniqlanishi mumkin. Bitta hujjat qayta yuborilganda idempotency duplicate to‘lovni cheklaydi.

Asynchronous job status, page progress va error code beradi. Original, derived image, OCR text va structured output version bilan bog‘lanadi. Model yangilanganda oldingi hujjatni qayta ishlash yangi natija berishi mumkin; qaysi versiya biznes qarorida ishlatilgani saqlanadi.

Sifat va xavfsizlik

Field exact match, normalized accuracy, table structure va end-to-end straight-through processing rate alohida o‘lchanadi. Dataset hujjat turi, til, sifat va vendor bo‘yicha kesiladi. Faqat OCR CER extraction sifatini to‘liq bildirmaydi; matn to‘g‘ri bo‘lib, field noto‘g‘ri labelga bog‘lanishi mumkin.

Hujjatlar PII, bank rekviziti va imzo saqlaydi. Encryption, least privilege, retention va region talabi barcha hosila artefaktlarga ham tatbiq etiladi. PDF va image parser sandboxda ishlaydi. Hujjat ichidagi yozuv downstream agent uchun ishonchli instruction emas; u data sifatida ko‘riladi.

Bog‘liq tushunchalar

Optical Character Recognition, Layout analysis, Information extraction, Computer vision, Natural language processing, Human-in-the-loop, Intelligent document processing