Big Data — hajmi, kelish tezligi yoki xilma-xilligi an’anaviy bitta tizim usullari bilan samarali saqlash va tahlil qilishni qiyinlashtiradigan ma’lumotlar hamda ularni qayta ishlash yondashuvlari majmuasidir. Atama faqat juda ko‘p baytni emas, taqsimlangan saqlash, parallel hisoblash, oqimli qayta ishlash va sifat boshqaruvini ham qamrab oladi.
Asosiy xususiyatlar
Volume ma’lumot hajmini, velocity uning hosil bo‘lish va qayta ishlanish tezligini, variety esa jadval, log, matn, rasm va sensor oqimi kabi formatlar xilma-xilligini bildiradi. Veracity ishonchlilik va sifatni, value esa ma’lumotdan olinadigan amaliy foydani ifodalaydi. Ushbu “V”lar marketing ro‘yxati emas; arxitektura qaroriga ta’sir qiluvchi talablarni ajratish vositasidir.
Bir terabayt strukturalangan jadval kuchli bitta database serverda qulay ishlashi mumkin. Aksincha, sekundiga yuz minglab kichik hodisani past kechikishda qayta ishlash hajm kichikroq bo‘lsa ham distributed stream tizimini talab qiladi. “Big” chegara texnologiya, budjet va SLAga qarab o‘zgaradi.
Saqlash va hisoblash
Distributed file system katta fayllarni bloklarga ajratib tugunlar bo‘ylab replikatsiya qiladi. Object storage hisoblashdan mustaqil kengayadi va immutable fayllar uchun qulay. Columnar Parquet kabi formatlar kerakli ustunlarni o‘qib, siqish va predicate pushdowndan foydalanadi. Metadata catalog datasetni topish, schema va lineage ni tushunishga yordam beradi.
Batch processing chegaralangan datasetni throughputga yo‘naltirib qayta ishlaydi. MapReduce tarixiy model bo‘lib, diskka yoziladigan bosqichlar bilan fault tolerance beradi. Zamonaviy DAG dvigatellari oraliq natijani xotirada tutishi mumkin. Stream processing hodisalarni kelishi bilan event time va window asosida tahlil qiladi.
Partition va shuffle
Dataset partition key bo‘yicha workerlarga bo‘linadi. Filter shu kalitga mos bo‘lsa kerakli bo‘limlar o‘qiladi. Join yoki group by kalitlari joriy joylashuvga mos kelmasa, shuffle data ni tarmoq orqali qayta taqsimlaydi. Shuffle ko‘pincha disk, tarmoq va serializationning asosiy xarajatidir.
Skewli kalit bitta partitionni boshqalardan ancha katta qiladi. Salt qo‘shish, heavy keyni alohida qayta ishlash yoki adaptive execution ishni muvozanatlashtiradi. Juda ko‘p mayda fayl esa metadata va task scheduling xarajatini oshiradi; compaction ularni maqsadli hajmga birlashtiradi.
Sifat va boshqaruv
Katta datasetdagi kichik foiz xato millionlab recordni anglatishi mumkin. Schema validation, reconciliation, freshness va distribution testlar pipelinega qo‘shiladi. Raw data saqlanishi qayta ishlashga imkon beradi, ammo shaxsiy ma’lumot, retention va access siyosati e’tiborsiz qolmaydi.
Ko‘p data avtomatik ravishda yaxshi model bermaydi. Selection bias, label xatosi va data leakage hajm bilan yo‘qolmaydi. Data minimization keraksiz yig‘ish, egress va compliance xarajatini kamaytiradi. Arxitektura avval biznes savoli, latency, aniqlik va narx bilan asoslanadi; taqsimlangan tizim faqat zarur bo‘lganda tanlanadi.
Batch va interaktiv so‘rov
Bir xil storage ustida ETL batchlari ham, interaktiv analyst so‘rovlari ham ishlasa resurs talashuvi yuz beradi. Workload manager queue, memory va CPU ulushini ajratadi. Preemption kritik dashboardni himoya qilishi, ammo uzoq batchni qayta boshlatib xarajatni oshirishi mumkin. Table statistics va cost-based optimizer join strategiyasini tanlaydi; eskirgan statistika ulkan shuffle yaratadi. Query budget o‘qilgan bayt, vaqt va parallelizmni cheklab, tasodifiy qimmat so‘rovdan himoya qiladi.
Data lifecycle
Issiq data tez storage va qisqa latency uchun, sovuq tarix arzonroq qatlam uchun saqlanadi. Retention yuridik va biznes talabi bilan belgilanadi; hamma raw eventni cheksiz tutish qiymat yaratmaydi. Partition expiration va compaction o‘chirishni boshqaradi, catalog esa deprecated dataset va egasini ko‘rsatadi.
Bog‘liq tushunchalar
Distributed computing, Data lake, Hadoop, Stream processing, Columnar storage, Data warehouse, Data quality