Bosh sahifa Wiki Tabular data

Tabular data

Tabular data — ma’lumotlar satr va ustunlardan tashkil topgan jadval ko‘rinishida ifodalanadigan tuzilma. Har bir satr odatda bitta kuzatuv, obyekt yoki hodisani, ustun esa uning bir xil ma’nodagi atributini bildiradi. Jadval sodda ko‘rinsa-da, to‘g‘ri talqin uchun schema, ma’lumot turi, kalit, yetishmayotgan qiymat va birliklar aniq belgilanishi kerak.

Satr va ustun semantikasi

Mijozlar jadvalida bir satr bitta mijoz bo‘lishi mumkin; customer_id, created_at va region ustunlari har mijoz uchun ayni tushunchani ifodalaydi. Bir katakka bir nechta telefon raqamini vergul bilan yozish jadvalni ko‘rishga qulay qilsa ham, qidirish va validatsiyani qiyinlashtiradi. Relatsion modelda takroriy qiymatlar alohida bog‘langan jadvalga ajratiladi.

Wide formatda bir obyektga tegishli ko‘p o‘lchovlar ustunlarga yoyiladi. Long formatda har o‘lchov alohida satr bo‘lib, o‘lchov nomi va qiymati ustunlarda turadi. Statistik tahlil va vizualizatsiya vositalari ko‘pincha tidy data tamoyiliga mos long yoki tartibli shaklni afzal ko‘radi.

Schema va turlar

Schema ustun nomi, turi, null bo‘lishi, cheklov va ma’noni belgilaydi. CSV faylning o‘zi ko‘pincha turlarni saqlamaydi; o‘quvchi 00123ni son deb olib, boshidagi nollarni yo‘qotishi mumkin. Parquet kabi formatlar schema va ustun turlarini metadata bilan birga saqlaydi.

Sana-vaqt ustunida format, aniqlik va vaqt zonasi; o‘lchovda birlik; kategoriyada ruxsat etilgan qiymatlar ko‘rsatiladi. amount nomi valyutasiz, temperature esa Selsiy yoki Farengeyt ekanini bildirmasdan noaniq qoladi. Data dictionary shu semantikani hujjatlashtiradi.

Kalit va munosabatlar

Primary key satrni noyob aniqlaydi. Tabiiy kalit biznes qiymatidan, surrogate key esa tizim yaratgan identifikatordan olinadi. Foreign key boshqa jadval bilan bog‘lanishni ifodalaydi. Faylga asoslangan pipeline bu cheklovlarni avtomatik bajarmasa, sifat tekshiruvi dublikat va yetim havolalarni alohida qidiradi.

Jadval tartibi semantikaning bir qismi deb taxmin qilinmaydi. SQL natijasi ORDER BY bo‘lmasa barqaror tartibni kafolatlamaydi. CSVdagi satr pozitsiyasiga yashirin ma’no berish keyingi sort yoki parallel qayta ishlashda xato keltiradi; zarur ketma-ketlik alohida ustunda saqlanadi.

Yetishmayotgan va noto‘g‘ri qiymatlar

Bo‘sh katak, 0, N/A va bo‘sh satr bir xil emas. Null “qiymat noma’lum yoki mavjud emas” ma’nosini beradi, lekin sabablar turlicha bo‘lishi mumkin. Analizdan oldin missingness qoidasi belgilanadi; aks holda o‘rtacha, count va join natijalari noto‘g‘ri talqin qilinadi.

Validatsiya ustun turi, diapazon, uniqueness va jadvallararo invariantlarni tekshiradi. Profiling esa taqsimot, cardinality, null ulushi va noodatiy qiymatlarni ko‘rsatadi. Tabular data spreadsheetda saqlanishi mumkin, ammo formulalar, birlashtirilgan kataklar va bezaklar mashinaviy jadval chegarasini noaniq qiladi.

Saqlash va almashish

CSV oddiy va keng mos, lekin delimiter, quoting, encoding hamda schema masalalarini tashqi kelishuvga qoldiradi. JSON Lines ichki tuzilmaga mosroq, ammo ustun turlarini qat’iy boshqarmasligi mumkin. Parquet analitik o‘qish va ustunli siqish uchun, relatsion baza esa tranzaksiya, indeks va cheklovlar uchun qulay. Tanlov hajm, yangilanish, so‘rov va interoperabellik talablariga bog‘liq.

Pivot va unpivot

Pivot kategoriya qiymatlarini ustunlarga aylantirib, odatda agregatsiya bilan wide jadval yaratadi. Unpivot esa ko‘p o‘lchov ustunlarini nom–qiymat satrlariga qaytaradi. Bu amallar vizual hisobot va model kirishi orasida shaklni moslaydi, lekin kalitlar noyob bo‘lmasa pivot yig‘ish qoidasini talab qiladi. Transformatsiyadan oldin va keyin grain hujjatlashtirilmasa, satrlar soni o‘zgarishi ma’lumot yo‘qolishi deb noto‘g‘ri talqin qilinishi mumkin.

Bog‘liq tushunchalar

Schema, Record, Column, Primary key, CSV, Parquet, Tidy data