Reservoir Sampling — Uzunligi oldindan noma’lum oqimdan har elementga teng tanlanish ehtimoli berib, belgilangan k hajmli namuna saqlash algoritmi. Uning to‘g‘ri qo‘llanishi ishlash mexanizmi, kirish shartlari va natija kafolatini birgalikda tushunishni talab qiladi.
Algoritmik tuzilish
Dastlabki k element reservoirga olinadi. i-chi keyingi element uchun 0…i oralig‘idan j tanlanadi; j<k bo‘lsa reservoir[j] almashtiriladi. Induksiya har element yakunda k/n ehtimol bilan qolishini ko‘rsatadi.
Reservoir Samplingni dasturda qo‘llashdan oldin kirish modeli aniq belgilanadi: ma’lumot turi, indekslash, graf yo‘nalishi, ehtimollik taqsimoti yoki arifmetik aniqlik haqidagi farazlar algoritm kafolatining bir qismidir. Nazariy shart bajarilmasa, tez va xatosiz ishlagan kod ham mazmunan noto‘g‘ri javob berishi mumkin. Shu sabab API kirishni tekshiradi yoki cheklovni hujjatida ochiq bildiradi.
Hisoblash xususiyatlari
Vaqt O(n), xotira O(k). Weighted reservoir uchun boshqa kalitlash usullari kerak. Distributed oqimlarda bo‘lak reservoirlarini to‘g‘ri vazn bilan birlashtirish oddiy konkatenatsiya emas.
Reservoir Sampling samaradorligi faqat Big O bilan baholanmaydi. Real natijaga graf zichligi, alphabet hajmi, cache lokaliteti, priority queue amallari, katta son arifmetikasi va tasodifiy generator xarajati ta’sir qilishi mumkin. Benchmark odatiy kirish bilan birga noqulay taqsimot, maksimal o‘lcham va ko‘p dublikatli holatlarni ham qamrab oladi. Natijaning to‘g‘riligi esa alohida etalon yoki invariant bilan tasdiqlanadi.
Amaliy vazifalar
Log, telemetry, stream preview, audit namuna va katta fayldan uniform subset olishda ishlatiladi.
Reservoir Sampling tanlanganda preprocessing narxi, bitta operatsiya yoki so‘rov vaqti, xotira sarfi va natijaning aniqligi birga baholanadi. Bir martalik kichik kirishda sodda usul afzal bo‘lishi mumkin; ko‘p takrorlanadigan yoki katta ma’lumotda esa tayyorlov xarajati keyingi amallar hisobiga qoplanadi. Nazariy ustunlik real ish yukida profil orqali tasdiqlanadi.
Nazorat mezoni
Ko‘p million takroriy tajribada har indeksning tanlanish chastotasi k/n ga yaqinligi va reservoirda dublikat indeks yo‘qligi tekshiriladi.
Reservoir Sampling implementatsiyasida xato holati ham interfeysning bir qismidir. Bo‘sh kirish, mavjud bo‘lmagan yechim, overflow, yetarli bo‘lmagan aniqlik yoki noto‘g‘ri parametr uchun qaytariladigan qiymat oldindan belgilanadi. Diagnostika foydali bo‘lishi uchun versiya va asosiy parametrlar qayd etiladi, lekin katta yoki maxfiy kirish to‘liq jurnalga chiqarilmaydi. Property-based test tasodifiy kichik misollarda matematik xususiyatlarni muntazam tekshiradi.
+## Muhim xususiyat
Reservoir Samplingning k=1 holatida i-chi element 1/i ehtimol bilan saqlangan qiymatni almashtiradi. Induksiya natijasida oqim tugaganda har bir oldingi element aynan 1/n ehtimol bilan reservoirda qoladi.
Reservoir Sampling ishlab chiqarish muhitida qo‘llanganda natija bilan birga algoritm versiyasi, asosiy parametrlar va kirishning muhim xususiyatlari qayd etiladi. Kuzatuv ko‘rsatkichlari mavzuga mos tanlanadi: DFS chuqurligi, kengaytirilgan tugunlar, hash collisionlari, qabul qilish ulushi, sample variance, interval aniqligi yoki kodlangan baytlar soni shular jumlasidandir. Chegara qiymati oshsa, avval correctness invariantlari tekshiriladi, keyin profiling orqali qimmat bosqich aniqlanadi. Bu yondashuv nazariy kafolat bilan amaldagi xatti-harakat orasidagi farqni ko‘rsatadi.
Reservoir Sampling bo‘yicha test ma’lumotlari faqat tasodifiy kirishdan iborat bo‘lmaydi. Nazariy eng yomon holat, ko‘p teng qiymat, minimal o‘lcham va chegaraga yaqin arifmetik qiymatlar alohida sinov to‘plamida saqlanadi.
Bog‘liq tushunchalar
reservoir sampling, streaming algorithm, uniform sampling, random sample, unknown stream length, probability