📘 CodingMarble Learn

डेटा साक्षरता: डेटा को पढ़ना, उपयोग करना और परखना

डेटा साक्षरता का मतलब है डेटा पढ़ पाना, उसके साथ काम करना और उस पर अच्छे सवाल पूछना। डेटासेट एक तालिका है: हर पंक्ति एक केस (व्यक्ति, दिन, दुकान) और हर स्तंभ एक चर (उम्र, आने का तरीक़ा, क़ीमत)। हर डेटासेट अधूरी तस्वीर दिखाता है: उसमें कुछ ही लोग, कुछ ही चर, कुछ ही समय होता है, और इकट्ठा करने का तरीक़ा पक्षपात ला सकता है। डेटा से शोध के चरण: सवाल, डेटा, सफ़ाई, छाँटना-गिनना, चार्ट, सावधान निष्कर्ष। खुला डेटा कोई भी मुफ़्त में उपयोग कर सकता है, आम तौर पर गुमनाम करके। संस्थाएँ हमारी ख़रीदारी, जगह और क्लिक से प्रोफ़ाइल बनाती हैं, विज्ञापन चुनती हैं और सेवाएँ योजना करती हैं; इसमें फ़ायदे भी हैं और निजता के ख़तरे भी।

🎬 कदम-दर-कदम कहानी

  1. डेटासेट एक तालिका है। हर पंक्ति एक केस है, जैसे एक छात्र। हर स्तंभ एक जानकारी है, जैसे उम्र या आने का तरीक़ा।
  2. शहर में 100 छात्र हैं। सिर्फ़ एक स्कूल के 20 से पूछा गया। धूसर वाले डेटा में नहीं हैं। इसलिए डेटा पूरी तस्वीर नहीं दिखाता।
  3. सवाल पूछो: बच्चे स्कूल कैसे आते हैं? हर जवाब गिनो। गिनती से स्तंभ चार्ट बनता है: पैदल 40, साइकिल 30, बस 20, कार 10।
  4. खुला डेटा सबके लिए मुफ़्त है। साझा करने से पहले नाम वाला स्तंभ हटाया जाता है। अब किसी को पहचाना नहीं जा सकता।
  5. हर छोटी ख़रीदारी एक रिकॉर्ड है। बहुत से रिकॉर्ड मिलकर एक प्रोफ़ाइल बनते हैं। प्रोफ़ाइल तय करती है कि तुम्हें कौन-सा विज्ञापन दिखे।
  6. अब तुम्हारी बारी। नमूने का आकार बदलो। कम बच्चों पर अनुमान उछलता है। ज़्यादा पर वह असली 40% के पास आता है।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

डेटा और सूचना में क्या अंतर है?

डेटा कच्चे तथ्य हैं; सूचना वह डेटा है जो किसी सवाल का जवाब देने के लिए व्यवस्थित हो, जैसे स्तंभ चार्ट की गिनती। चरण 2 देखो।

एक स्कूल पूरे शहर की बात क्यों नहीं कह सकता?

एक स्कूल के बच्चे एक इलाक़े में रहते हैं और अलग ढंग से आ सकते हैं। चरण 1 में 80 बच्चे डेटा से बाहर हैं।

लोगों के बारे में खुला डेटा क्या सुरक्षित है?

तभी, जब नाम और पहचान वाली बातें हटा दी जाएँ। चरण 3 में नाम वाला स्तंभ धुंधला होता है।

ऐप को कैसे पता कि मुझे कौन-सा विज्ञापन दिखाना है?

वह तुम्हारे बहुत से छोटे रिकॉर्ड जोड़कर प्रोफ़ाइल बनाता है। चरण 4 में ख़रीदारियाँ एक प्रोफ़ाइल में जाती हैं।

नमूना कितना बड़ा होना चाहिए?

इतना कि जवाब उछलना बंद कर दे। आख़िरी चरण में 10 से 100 करो और अंतर घटता देखो।

डेटा और डेटासेट क्या हैं?

डेटा दर्ज किए गए तथ्य हैं: संख्याएँ, शब्द, तारीख़ें, तस्वीरें, क्लिक। अकेले इनका ख़ास मतलब नहीं; व्यवस्थित करने पर ये सूचना बनते हैं, और समझकर उपयोग की गई सूचना ज्ञान बनती है।

डेटासेट डेटा का संग्रह है, आम तौर पर एक तालिका:

डेटा प्रोसेसिंग यानी कच्चे डेटा को उपयोगी सूचना में बदलना: इकट्ठा → साफ़ (ग़लतियाँ ठीक, दोहराव हटाना, ख़ाली जगह सँभालना) → छाँटना और फ़िल्टर → गणना (गिनती, औसत, प्रतिशत) → चित्र (तालिका, स्तंभ चार्ट, रेखा ग्राफ़) → व्याख्या। यह ज़्यादातर स्प्रेडशीट से होता है।

डेटासेट अधूरी तस्वीर क्यों दिखाता है

कोई भी डेटासेट पूरा सच नहीं है। हमेशा पूछो कि क्या छूटा:

साथ बढ़ना कारण नहीं है: गर्मी में आइसक्रीम की बिक्री और डूबने की घटनाएँ दोनों बढ़ती हैं, पर आइसक्रीम कारण नहीं; गर्म मौसम दोनों का कारण है।

चार्ट भी धोखा दे सकते हैं: अगर अक्ष 0 की बजाय 90 से शुरू हो, तो छोटा अंतर बहुत बड़ा दिखता है।

डेटासेट से शोध करना

  1. साफ़ सवाल पूछो जिसका जवाब डेटा दे सके: "हमारी कक्षा के कितने प्रतिशत बच्चे पैदल आते हैं?"
  2. डेटा इकट्ठा करो या ढूँढो: सर्वे, माप, या कोई मौजूदा (खुला) डेटासेट। स्रोत लिखो।
  3. साफ़ करो: असंभव मान हटाओ (उम्र 140), वर्तनी एक करो ("बस", "Bus"), ख़ाली जगह पर फ़ैसला करो।
  4. प्रोसेस करो: छाँटो, फ़िल्टर करो, समूह बनाकर गिनो, प्रतिशत और औसत निकालो।
  5. चित्र बनाओ: श्रेणियों के लिए स्तंभ चार्ट, समय के साथ बदलाव के लिए रेखा ग्राफ़, पूरे के हिस्सों के लिए पाई चार्ट, दो संख्याओं के संबंध के लिए बिंदु ग्राफ़।
  6. सावधानी से निष्कर्ष: डेटा क्या दिखाता है, तुम कितने पक्के हो, और उसकी सीमाएँ क्या हैं।

हल किया उदाहरण: 20 बच्चों के जवाब: पैदल 8, साइकिल 6, बस 4, कार 2। पैदल का प्रतिशत = 8 ÷ 20 × 100% = 40%। निष्कर्ष: "20 के इस नमूने में 40% पैदल आते हैं; हमने सिर्फ़ एक कक्षा से पूछा, पूरे स्कूल में अलग हो सकता है।"

खुला डेटा

खुला डेटा वह है जिसे कोई भी मुफ़्त में देख, उपयोग और साझा कर सकता है, आम तौर पर ऐसे लाइसेंस के साथ जो बस स्रोत का नाम देने को कहता है। सरकारें, नगर निगम, विश्वविद्यालय और वैज्ञानिक यातायात, मौसम, बजट, स्वास्थ्य, स्कूल और पर्यावरण का खुला डेटा देते हैं।

क्यों ज़रूरी: नागरिक देख सकते हैं कि सरकारी पैसा कैसे ख़र्च हुआ, डेवलपर उपयोगी ऐप बनाते हैं (बस कब आएगी, प्रदूषण नक्शा), और छात्र असली शोध कर सकते हैं।

लोगों की सुरक्षा: छापने से पहले निजी जानकारी हटाई या समूहों में बदली जाती है (गुमनामीकरण): नाम हटाना, पूरे पते की जगह इलाक़ा, उम्र की जगह उम्र-समूह। फिर भी कई डेटासेट जोड़कर कभी-कभी लोगों को पहचाना जा सकता है।

अच्छा खुला डेटा ढूँढने में आसान, मशीन से पढ़ने योग्य (CSV, तालिका की फ़ोटो नहीं), समझाया हुआ (हर स्तंभ का अर्थ) और ताज़ा होता है।

संस्थाएँ डेटा का उपयोग कैसे करती हैं

दुकानें, ऐप, बैंक, अस्पताल और सरकारें डेटा इकट्ठा करती हैं, अक्सर व्यक्तिगत डेटा (जो तुम्हें पहचान सके: नाम, फ़ोन नंबर, जगह, चेहरा, ख़रीदारी)।

फ़ायदे: बेहतर सेवाएँ, कम बर्बादी। ख़तरे: निजता का नुक़सान, डेटा लीक, पक्षपाती डेटा से अन्यायपूर्ण फ़ैसले, निजी सामग्री से बहकाना।

तुम्हारे अधिकार: कई देशों में डेटा-सुरक्षा क़ानून हैं (जैसे यूरोप का GDPR और भारत का डिजिटल व्यक्तिगत डेटा संरक्षण अधिनियम, 2023)। आम बातें: संस्था को वैध कारण या तुम्हारी सहमति चाहिए, ज़रूरत भर डेटा ले, सुरक्षित रखे, और तुम उसे देख या मिटवा सको।

खुद करो: घर पर छोटा सर्वे

परिवार या दोस्तों में 10 लोगों से एक सवाल पूछो, जैसे "आज तुम कैसे आए-गए?" हर व्यक्ति की एक पंक्ति और उम्र-समूह व जवाब के स्तंभ वाली तालिका बनाओ। हर जवाब गिनो, स्तंभ चार्ट बनाओ और प्रतिशत निकालो। फिर एक वाक्य लिखो कि तुम्हारा डेटा क्या नहीं बता सकता (किससे नहीं पूछा)। आख़िरी 3D चरण से तुलना करो: क्या 10 का नमूना काफ़ी है?

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. एक डेटासेट में 250 पंक्तियाँ और 8 स्तंभ हैं। कितने केस और कितने चर?

250 केस (हर पंक्ति एक) और 8 चर (हर स्तंभ एक)। कुल ख़ाने = 250 × 8 = 2000।

2. 40 छात्रों में से 14 साइकिल से आते हैं। कितने प्रतिशत?

14 ÷ 40 × 100% = 35%।

3. गेमिंग वेबसाइट के ऑनलाइन पोल में 85% लोग रोज़ गेम खेलते हैं। क्या पूरे देश के 85% लोग खेलते हैं?

नहीं। नमूना पक्षपाती है: सिर्फ़ गेमिंग साइट पर आने वालों ने अपनी मर्ज़ी से जवाब दिया।

4. नगर निगम बस स्टॉप का नाम, जगह और रोज़ के यात्री छापता है। क्या यह खुला डेटा है, और क्या इसमें व्यक्तिगत डेटा है?

हाँ, अगर कोई भी डाउनलोड करके उपयोग कर सके तो खुला डेटा है। व्यक्तिगत डेटा नहीं, क्योंकि यह किसी को पहचाने बिना सिर्फ़ गिनती है।

आम गलतियाँ

अभ्यास क्विज़

1. डेटासेट की तालिका में हर पंक्ति आम तौर पर दिखाती है…
2. पूरे शहर के बारे में सिर्फ़ एक स्कूल के छात्रों से पूछना देता है…
3. हफ़्ते भर में तापमान का बदलाव किस चार्ट से सबसे अच्छा दिखेगा?
4. डेटा छापने से पहले नाम हटाना कहलाता है…
5. दुकान तुम्हारी पुरानी ख़रीदारी से तुम्हारे लिए विज्ञापन चुनती है। यह है…

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

डेटा साक्षरता क्या है?

डेटा पढ़ने, उसके साथ काम करने, उसका विश्लेषण करने और उस पर सवाल उठाने की क्षमता, और यह समझाना कि वह क्या दिखाता है और क्या नहीं।

खुला डेटा क्या है?

ऐसा डेटा जिसे कोई भी मुफ़्त में देख, उपयोग और साझा कर सके, आम तौर पर सरकारें या शोधकर्ता खुले लाइसेंस के साथ छापते हैं।

डेटासेट अधूरी तस्वीर क्यों दिखाता है?

क्योंकि उसमें कुछ ही लोग, चर और समय होते हैं, और इकट्ठा करने का तरीक़ा पक्षपात या ग़लती ला सकता है।

यह कहाँ पढ़ाया जाता है

नीदरलैंडVWO 3 (onderbouw)Data, AI and society
सीबीएसई (भारत)कक्षा 9भाग ख: डेटा साक्षरता
सीबीएसई (भारत)कक्षा 10भाग ख: पैटर्न पहचानना
सीबीएसई (भारत)कक्षा 10भाग ख: डेटा मर्ज करना
सीबीएसई (भारत)कक्षा 11डेटा साक्षरता

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी कंप्यूटर विज्ञान पाठ