डेटा और डेटासेट क्या हैं?
डेटा दर्ज किए गए तथ्य हैं: संख्याएँ, शब्द, तारीख़ें, तस्वीरें, क्लिक। अकेले इनका ख़ास मतलब नहीं; व्यवस्थित करने पर ये सूचना बनते हैं, और समझकर उपयोग की गई सूचना ज्ञान बनती है।
डेटासेट डेटा का संग्रह है, आम तौर पर एक तालिका:
- पंक्ति (रिकॉर्ड, केस): एक व्यक्ति, वस्तु या घटना।
- स्तंभ (चर, फ़ील्ड): हर केस की एक मापी गई बात।
- चर के प्रकार: श्रेणीगत (बस, साइकिल, पैदल) या संख्यात्मक (उम्र 14, दूरी 2.5 km)।
डेटा प्रोसेसिंग यानी कच्चे डेटा को उपयोगी सूचना में बदलना: इकट्ठा → साफ़ (ग़लतियाँ ठीक, दोहराव हटाना, ख़ाली जगह सँभालना) → छाँटना और फ़िल्टर → गणना (गिनती, औसत, प्रतिशत) → चित्र (तालिका, स्तंभ चार्ट, रेखा ग्राफ़) → व्याख्या। यह ज़्यादातर स्प्रेडशीट से होता है।
डेटासेट अधूरी तस्वीर क्यों दिखाता है
कोई भी डेटासेट पूरा सच नहीं है। हमेशा पूछो कि क्या छूटा:
- कौन शामिल है? नमूना पूरी जनसंख्या का एक हिस्सा है। नमूना ठीक से न चुना जाए (सिर्फ़ एक स्कूल, सिर्फ़ ऑनलाइन पोल का जवाब देने वाले), तो नतीजा पक्षपाती होगा।
- नमूना कितना बड़ा? छोटे नमूने के नतीजे संयोग से उछलते हैं। बड़े, यादृच्छिक नमूने ज़्यादा भरोसेमंद हैं।
- क्या और कैसे मापा? सवाल के शब्द, सेंसर या इकट्ठा करने वाला जवाब बदल सकते हैं।
- कब? पाँच साल पुराना डेटा आज पुराना हो सकता है।
- क्या छूटा? जो चर दर्ज ही नहीं हुए, वे असली कारण छिपा सकते हैं।
साथ बढ़ना कारण नहीं है: गर्मी में आइसक्रीम की बिक्री और डूबने की घटनाएँ दोनों बढ़ती हैं, पर आइसक्रीम कारण नहीं; गर्म मौसम दोनों का कारण है।
चार्ट भी धोखा दे सकते हैं: अगर अक्ष 0 की बजाय 90 से शुरू हो, तो छोटा अंतर बहुत बड़ा दिखता है।
डेटासेट से शोध करना
- साफ़ सवाल पूछो जिसका जवाब डेटा दे सके: "हमारी कक्षा के कितने प्रतिशत बच्चे पैदल आते हैं?"
- डेटा इकट्ठा करो या ढूँढो: सर्वे, माप, या कोई मौजूदा (खुला) डेटासेट। स्रोत लिखो।
- साफ़ करो: असंभव मान हटाओ (उम्र 140), वर्तनी एक करो ("बस", "Bus"), ख़ाली जगह पर फ़ैसला करो।
- प्रोसेस करो: छाँटो, फ़िल्टर करो, समूह बनाकर गिनो, प्रतिशत और औसत निकालो।
- चित्र बनाओ: श्रेणियों के लिए स्तंभ चार्ट, समय के साथ बदलाव के लिए रेखा ग्राफ़, पूरे के हिस्सों के लिए पाई चार्ट, दो संख्याओं के संबंध के लिए बिंदु ग्राफ़।
- सावधानी से निष्कर्ष: डेटा क्या दिखाता है, तुम कितने पक्के हो, और उसकी सीमाएँ क्या हैं।
हल किया उदाहरण: 20 बच्चों के जवाब: पैदल 8, साइकिल 6, बस 4, कार 2। पैदल का प्रतिशत = 8 ÷ 20 × 100% = 40%। निष्कर्ष: "20 के इस नमूने में 40% पैदल आते हैं; हमने सिर्फ़ एक कक्षा से पूछा, पूरे स्कूल में अलग हो सकता है।"
खुला डेटा
खुला डेटा वह है जिसे कोई भी मुफ़्त में देख, उपयोग और साझा कर सकता है, आम तौर पर ऐसे लाइसेंस के साथ जो बस स्रोत का नाम देने को कहता है। सरकारें, नगर निगम, विश्वविद्यालय और वैज्ञानिक यातायात, मौसम, बजट, स्वास्थ्य, स्कूल और पर्यावरण का खुला डेटा देते हैं।
क्यों ज़रूरी: नागरिक देख सकते हैं कि सरकारी पैसा कैसे ख़र्च हुआ, डेवलपर उपयोगी ऐप बनाते हैं (बस कब आएगी, प्रदूषण नक्शा), और छात्र असली शोध कर सकते हैं।
लोगों की सुरक्षा: छापने से पहले निजी जानकारी हटाई या समूहों में बदली जाती है (गुमनामीकरण): नाम हटाना, पूरे पते की जगह इलाक़ा, उम्र की जगह उम्र-समूह। फिर भी कई डेटासेट जोड़कर कभी-कभी लोगों को पहचाना जा सकता है।
अच्छा खुला डेटा ढूँढने में आसान, मशीन से पढ़ने योग्य (CSV, तालिका की फ़ोटो नहीं), समझाया हुआ (हर स्तंभ का अर्थ) और ताज़ा होता है।
संस्थाएँ डेटा का उपयोग कैसे करती हैं
दुकानें, ऐप, बैंक, अस्पताल और सरकारें डेटा इकट्ठा करती हैं, अक्सर व्यक्तिगत डेटा (जो तुम्हें पहचान सके: नाम, फ़ोन नंबर, जगह, चेहरा, ख़रीदारी)।
- व्यापार ख़रीदारी देखकर सामान रखते हैं, दाम तय करते हैं और तुम्हारी प्रोफ़ाइल के आधार पर लक्षित विज्ञापन दिखाते हैं।
- वीडियो और सोशल ऐप तुम्हारे क्लिक और देखने का समय देखकर अगली चीज़ सुझाते हैं।
- सरकारें जनगणना और यातायात डेटा से स्कूल, अस्पताल और सड़कें योजना करती हैं।
- अस्पताल और वैज्ञानिक स्वास्थ्य डेटा से बेहतर इलाज ढूँढते हैं।
फ़ायदे: बेहतर सेवाएँ, कम बर्बादी। ख़तरे: निजता का नुक़सान, डेटा लीक, पक्षपाती डेटा से अन्यायपूर्ण फ़ैसले, निजी सामग्री से बहकाना।
तुम्हारे अधिकार: कई देशों में डेटा-सुरक्षा क़ानून हैं (जैसे यूरोप का GDPR और भारत का डिजिटल व्यक्तिगत डेटा संरक्षण अधिनियम, 2023)। आम बातें: संस्था को वैध कारण या तुम्हारी सहमति चाहिए, ज़रूरत भर डेटा ले, सुरक्षित रखे, और तुम उसे देख या मिटवा सको।
खुद करो: घर पर छोटा सर्वे
परिवार या दोस्तों में 10 लोगों से एक सवाल पूछो, जैसे "आज तुम कैसे आए-गए?" हर व्यक्ति की एक पंक्ति और उम्र-समूह व जवाब के स्तंभ वाली तालिका बनाओ। हर जवाब गिनो, स्तंभ चार्ट बनाओ और प्रतिशत निकालो। फिर एक वाक्य लिखो कि तुम्हारा डेटा क्या नहीं बता सकता (किससे नहीं पूछा)। आख़िरी 3D चरण से तुलना करो: क्या 10 का नमूना काफ़ी है?
मुख्य सूत्र और परिभाषाएँ
- पंक्ति = एक केस (रिकॉर्ड); स्तंभ = एक चर (फ़ील्ड)
- डेटा → (प्रोसेसिंग) → सूचना → (समझ) → ज्ञान
- प्रतिशत = भाग ÷ कुल × 100%
- माध्य (औसत) = मानों का योग ÷ मानों की संख्या
- नमूना = जनसंख्या का वह हिस्सा जिसे सच में मापा गया
- पक्षपात = ऐसी ग़लती जो नतीजे को एक ओर झुकाए
- खुला डेटा = देखने, उपयोग और साझा करने के लिए मुफ़्त
- व्यक्तिगत डेटा = कोई भी डेटा जो किसी व्यक्ति को पहचान सके
हल किए गए उदाहरण
1. एक डेटासेट में 250 पंक्तियाँ और 8 स्तंभ हैं। कितने केस और कितने चर?
250 केस (हर पंक्ति एक) और 8 चर (हर स्तंभ एक)। कुल ख़ाने = 250 × 8 = 2000।
2. 40 छात्रों में से 14 साइकिल से आते हैं। कितने प्रतिशत?
14 ÷ 40 × 100% = 35%।
3. गेमिंग वेबसाइट के ऑनलाइन पोल में 85% लोग रोज़ गेम खेलते हैं। क्या पूरे देश के 85% लोग खेलते हैं?
नहीं। नमूना पक्षपाती है: सिर्फ़ गेमिंग साइट पर आने वालों ने अपनी मर्ज़ी से जवाब दिया।
4. नगर निगम बस स्टॉप का नाम, जगह और रोज़ के यात्री छापता है। क्या यह खुला डेटा है, और क्या इसमें व्यक्तिगत डेटा है?
हाँ, अगर कोई भी डाउनलोड करके उपयोग कर सके तो खुला डेटा है। व्यक्तिगत डेटा नहीं, क्योंकि यह किसी को पहचाने बिना सिर्फ़ गिनती है।
आम गलतियाँ
- छोटे या एकतरफ़ा नमूने को सबकी आवाज़ मान लेना।
- मानना कि दो चीज़ों का साथ बढ़ना साबित करता है कि एक दूसरी का कारण है।
- सफ़ाई छोड़ देना, जिससे एक ही श्रेणी कई हिस्सों में बँट जाती है ("Bus" और "bus")।
- मानना कि गुमनाम डेटा से कभी किसी को पहचाना नहीं जा सकता। डेटासेट जोड़कर पहचान हो सकती है।