Bosh sahifa Wiki Recovery

Recovery

Recovery — nosozlik, ma’lumot buzilishi yoki xizmat uzilishidan keyin tizimni belgilangan to‘g‘ri va ishlaydigan holatga qaytarish jarayonidir. U restartdan kengroq: sababni izolyatsiya qilish, state ni tiklash, izchillikni tekshirish, trafikni qaytarish va yo‘qotish ko‘lamini hujjatlashtirishni qamrab oladi. Recovery rejasi aniq fault scenario, RTO va RPO bilan bog‘lanadi.

Recovery maqsadlari

Recovery Time Objective xizmat qancha vaqt ichida tiklanishi kerakligini bildiradi. Recovery Point Objective vaqt bo‘yicha qancha ma’lumot yo‘qotish qabul qilinishini belgilaydi. RPO nolga yaqin bo‘lsa synchronous replika yoki har commit uchun durable log talab qilinishi mumkin. Juda qisqa RTO standby infratuzilma va avtomatlashtirilgan failover xarajatini oshiradi.

Actual recovery time va actual data loss mashq hamda incidentdan o‘lchanadi. Hujjatdagi maqsad backupdan real restore sinovisiz kafolat emas.

Database recovery

Crash recovery checkpointdan keyingi WAL recordlarini redo qilib, commit bo‘lmagan o‘zgarishlarni undo yoki visibility qoidasi bilan yashiradi. Point-in-time recovery base backupni tiklab, arxiv loglarini tanlangan vaqt yoki transactiongacha qayta ijro etadi. Log zanjiridagi bitta yo‘q fayl keyingi tiklashni to‘xtatishi mumkin.

Replica failover xizmatni tez qaytaradi, ammo mantiqiy xato barcha replikaga tarqalgan bo‘lsa yordam bermaydi. Immutable backup va vaqt bo‘yicha snapshot ransomware, noto‘g‘ri delete yoki schema migratsiyasidan tiklash uchun kerak. Restore alohida muhitda bajarilib, record count, checksum va biznes invariantlar tekshiriladi.

Taqsimlangan state

Stream processor checkpointdan operator state va source offsetni tiklaydi. Sink transaction checkpointga bog‘lanmasa, recovery duplicate natija chiqarishi mumkin. Consensus tizimi logni quorumdagi eng yangi committed index bilan tiklaydi; eski tugun snapshot olib, yetakchiga yetib oladi.

Network partitiondan keyin ikki primary paydo bo‘lgan bo‘lsa, faqat ma’lumotni qo‘shib yuborish yetarli emas. Conflict resolution, fencing va audit orqali authoritative history tanlanadi. Recovery davomida stale tugun trafik qabul qilmasligi kerak.

Xizmatni qaytarish

Avval dependencylar: storage, database, identity, queue va application tartibda ishga tushiriladi. Health check faqat port emas, zarur read/write yo‘lini tekshiradi. Trafik birdan to‘liq berilmay, canary yoki foizli ramp bilan qaytariladi. Cache cold bo‘lgani uchun dastlabki latency va database yukiga alohida limit qo‘yiladi.

Read-only yoki degraded rejim muhim funksiyani oldinroq qaytarishi mumkin. Biroq foydalanuvchiga qaysi amal vaqtincha cheklangani aniq bildiriladi. Queue backlog qayta ishlanganda odatiy trafik bilan raqobat qilmasligi uchun throttle qilinadi.

Runbook va mashq

Runbook kontakt, credential olish, qaror nuqtasi, buyruq, expected output va rollbackni saqlaydi. U asosiy xizmat bilan bir joyda qolsa incidentda ochilmasligi mumkin; offline yoki alohida control plane nusxasi kerak. Secretlar hujjatga oddiy matn qilib yozilmaydi.

Game day va disaster recovery mashqi odam, avtomatizatsiya va capacityni tekshiradi. Har mashqdan keyin manual qadam kamaytiriladi, monitoring va ownership yangilanadi. Recovery “yakunlandi” deb trafik qaytganda emas, data reconciliation, backlog va foydalanuvchi ta’siri yopilganda hisoblanadi.

Korruptsiya chegarasi

Recovery source sog‘lom deb taxmin qilinmasligi kerak. Backup checksum o‘tishi mumkin, ammo biznes darajasidagi noto‘g‘ri qiymatni saqlagan bo‘lishi mumkin. Multiple restore point, immutable audit va application invariantlar qaysi nusxa ishonchli ekanini aniqlashga yordam beradi. Ransomware incidentida credential, build pipeline va boshqaruv tekisligi tozalanmasdan backupni ayni muhitga qaytarish yangi nusxani ham zararlashi mumkin.

Aloqa rejasi

Texnik tiklash bilan birga status yangilanishi, stakeholder, yuridik va xavfsizlik qarorlari yuritiladi. Vaqt chizig‘i fakt va taxminni ajratadi. Recovery buyrug‘i, natija va tasdiqlovchi shaxs auditda saqlanadi.

Bog‘liq tushunchalar

Disaster recovery, Crash recovery, Point-in-time recovery, Backup, RTO, RPO, Failover