📘 CodingMarble Learn

डेटा विश्लेषण

डेटा विश्लेषण यानी कच्चे आँकड़ों को जवाब में बदलना। इसका एक चक्र है: सवाल पूछो, डेटा इकट्ठा करो, साफ़ करो (ग़लती, दोहराव और खाली जवाब हटाओ), व्यवस्थित करो, माध्य, माध्यिका, परास और पैटर्न से विश्लेषण करो, सही चार्ट बनाओ और सावधानी से निष्कर्ष निकालो। बाहरी मान, छोटे नमूने और पक्षपात पर नज़र रखो, और याद रखो कि दो चीज़ों का साथ बढ़ना (सहसंबंध) यह साबित नहीं करता कि एक दूसरे का कारण है। डेटा को सुरक्षित रखना और अनुमति से इस्तेमाल करना भी ज़रूरी है।

🎬 कदम-दर-कदम कहानी

  1. पहले डेटा इकट्ठा करो। 8 बच्चों से पूछा कि वे कितने घंटे सोए। हर जवाब डिब्बे में एक गेंद है।
  2. कुछ जवाब ग़लत हैं: एक दोहराया गया, एक "25 घंटे" जो हो ही नहीं सकता, एक खाली। सफ़ाई यानी इन्हें हटाना या ठीक करना।
  3. अब व्यवस्थित करो। जवाबों को छोटे से बड़े क्रम में लगाओ, हर जवाब एक खंभा बन जाता है।
  4. अब विश्लेषण। माध्य में सब मान जोड़कर गिनती से भाग देते हैं। माध्यिका बीच वाला मान है।
  5. चार्ट से पैटर्न दिखता है। ज़्यादा स्क्रीन-टाइम के साथ कम नींद। पर सिर्फ़ पैटर्न से कारण साबित नहीं होता।
  6. अब तुम्हारी बारी: स्लाइडर से एक नया बच्चा जोड़ो। बहुत बड़ा मान डालो। देखो माध्य उछलता है, माध्यिका शांत रहती है।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

जैसा डेटा आया वैसा ही क्यों न इस्तेमाल करें?

कच्चे डेटा में दोहराव, टाइपिंग की ग़लती और असंभव मान होते हैं। एक ग़लत मान जवाब बदल सकता है, इसलिए पहले सफ़ाई।

माध्यिका से पहले क्रम में क्यों लगाएँ?

माध्यिका क्रमबद्ध सूची का बीच है। बिना क्रम के बीच की जगह का कोई मतलब नहीं।

माध्य की जगह माध्यिका कब लें?

जब बाहरी मान हों या डेटा एक तरफ़ झुका हो। खेल वाले चरण में बड़ा मान डालो: माध्य उछलता है, माध्यिका नहीं।

रुझान रेखा नीचे जाती है, तो क्या स्क्रीन-टाइम कम नींद का कारण है?

हो सकता है, पर सिर्फ़ चार्ट से साबित नहीं होता। होमवर्क या तनाव दोनों पर असर डाल सकते हैं।

क्या गुणात्मक डेटा का विश्लेषण नहीं हो सकता?

हो सकता है। श्रेणियाँ गिन सकते हैं, बहुलक निकाल सकते हैं और दंड या पाई चार्ट बना सकते हैं।

डेटा विश्लेषण का चक्र

  1. पूछो: साफ़ सवाल ("क्या रात को फ़ोन चलाने वाले बच्चे कम सोते हैं?")।
  2. इकट्ठा करो: सर्वे, माप, सेंसर, प्रयोग या पहले से मौजूद डेटा।
  3. साफ़ करो।
  4. व्यवस्थित / रूपांतरित करो: क्रम, समूह, तालिका, इकाई बदलना।
  5. विश्लेषण करो: सारांश, पैटर्न, तुलना।
  6. चित्र और निष्कर्ष: चार्ट बनाओ, सवाल का जवाब दो, बताओ कितना पक्का है।

अक्सर जवाब से नया सवाल निकलता है और चक्र फिर शुरू होता है। औज़ार काग़ज़-कैलकुलेटर से लेकर स्प्रेडशीट और Python जैसी प्रोग्रामिंग भाषा तक हैं।

डेटा इकट्ठा करना और साफ़ करना

मात्रात्मक डेटा संख्या है (लंबाई 152 cm)। गुणात्मक डेटा शब्द या श्रेणी है (पसंदीदा खेल)। प्राथमिक डेटा ख़ुद इकट्ठा करते हो; द्वितीयक डेटा किसी और ने इकट्ठा किया।

नमूना (सैंपल) वह समूह है जिससे सच में पूछा। बड़ा और बेतरतीब चुना नमूना सही नतीजा देता है; सिर्फ़ दोस्तों से पूछने पर पक्षपात आता है।

सफ़ाई की सूची

डेटा की सुरक्षा

निजी डेटा के लिए अनुमति चाहिए, उसे सुरक्षित रखो, और बाँटने से पहले नाम हटा दो (गुमनाम करो)।

विश्लेषण: औसत, फैलाव, बाहरी मान

माध्य = सब मानों का जोड़ ÷ मानों की गिनती। माध्यिका = क्रम में लगाने के बाद बीच का मान (गिनती सम हो तो बीच के दो का औसत)। बहुलक = सबसे ज़्यादा बार आने वाला मान। परास = सबसे बड़ा − सबसे छोटा; यह फैलाव बताता है।

बाहरी मान (आउटलायर) बाकी से बहुत दूर का मान है। यह ग़लती भी हो सकता है या सच में दुर्लभ मामला। माध्य बाहरी मान से खिंचता है, माध्यिका नहीं, इसलिए आय जैसे टेढ़े डेटा में माध्यिका बेहतर है।

खोजपूर्ण डेटा विश्लेषण यानी कोई विचार परखने से पहले डेटा को तालिका, चार्ट और सारांश से हर तरफ़ से देखना। समूह बनाना (कक्षा या शहर के हिसाब से) और कई डेटासेट जोड़ना नए पैटर्न दिखाता है।

चित्र बनाना, निष्कर्ष और जाँच

काम के हिसाब से चार्ट चुनो: दंड आलेख समूहों की तुलना, रेखा ग्राफ़ समय के साथ बदलाव, बिंदु-चित्र (स्कैटर) दो संख्याओं का रिश्ता, पाई चार्ट पूरे के हिस्से, आयतचित्र (हिस्टोग्राम) मान कैसे फैले हैं।

बिंदु-चित्र में दोनों साथ बढ़ें तो धनात्मक सहसंबंध; एक बढ़े दूसरा घटे तो ऋणात्मक सहसंबंध। सहसंबंध कारण नहीं है: गर्मी में आइसक्रीम की बिक्री और डूबने की घटनाएँ दोनों बढ़ती हैं, गर्मी की वजह से, एक-दूसरे की वजह से नहीं।

निष्कर्ष की जाँच

क्या नमूना बड़ा और निष्पक्ष था? ग़लतियाँ साफ़ हुईं? उसी डेटा का दूसरा विश्लेषण अलग जवाब दे सकता है? सीमाएँ ईमानदारी से बताओ। बिग डेटा (लाखों पंक्तियाँ, जैसे शहर के प्रदूषण सेंसर) में कंप्यूटर यही चरण तेज़ी से करते हैं, पर सावधानी वही चाहिए।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. यह नींद डेटा साफ़ करो: 7, 8, 8 (एक ही बच्चा दो बार), 25, खाली, 6।

दोहराया 8, असंभव 25 और खाली हटाओ। साफ़ डेटा: 7, 8, 6।

2. 6, 7, 7, 8, 8, 8, 9, 10 का माध्य और माध्यिका निकालो।

जोड़ = 63, गिनती = 8, माध्य = 63 ÷ 8 = 7.875 ≈ 7.9। बीच के दो मान 8 और 8, तो माध्यिका = 8।

3. ऊपर वाले डेटा में बाहरी मान 24 जोड़ो। माध्य और माध्यिका का क्या होगा?

नया जोड़ = 87, गिनती = 9, माध्य = 87 ÷ 9 ≈ 9.67 (बड़ी छलांग)। क्रम में 5वाँ मान 8 है, तो माध्यिका = 8 (कोई बदलाव नहीं)। माध्यिका बाहरी मान से नहीं डगमगाती।

आम गलतियाँ

अभ्यास क्विज़

1. दोहराव और असंभव मान किस चरण में हटते हैं?
2. 2, 4, 6 का माध्य है:
3. बाहरी मान से सबसे कम कौन प्रभावित होता है?
4. दो संख्या वाले चरों के लिए सबसे अच्छा चार्ट:
5. "पसंदीदा रंग" किस तरह का डेटा है?

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

डेटा विश्लेषण आसान शब्दों में क्या है?

जानकारी इकट्ठा करना, उसे साफ़ और व्यवस्थित करना, फिर सारांश और चार्ट से किसी सवाल का जवाब ढूँढना।

डेटा विश्लेषण के चरण क्या हैं?

सवाल पूछना, इकट्ठा करना, साफ़ करना, व्यवस्थित करना, विश्लेषण, चित्र और निष्कर्ष, फिर जाँच।

माध्य और माध्यिका में क्या अंतर है?

माध्य जोड़ ÷ गिनती है; माध्यिका बीच वाला मान है। माध्यिका बाहरी मान से नहीं खिंचती।

यह कहाँ पढ़ाया जाता है

कनाडा (ओंटारियो)Grade 8D. Data
कनाडा (ओंटारियो)Grade 9A. Business Leadership, Project Management, and Connections
कनाडा (ओंटारियो)Grade 10A. Business Leadership, Project Management, and Connections
कनाडा (ओंटारियो)Grade 10B. Hardware, Software, and Innovations
कनाडा (ओंटारियो)Grade 11Productivity Software
कनाडा (ओंटारियो)Grade 11B. Spatial Geography: Concepts and Processes
कनाडा (ओंटारियो)Grade 11B. Design, Layout, and Planning Skills
कनाडा (ओंटारियो)Grade 11B. Computer Technology Skills
कनाडा (ओंटारियो)Grade 11A. Computer Technology Fundamentals
कनाडा (ओंटारियो)Grade 12B. Spatial Organization: Concepts and Processes
कनाडा (ओंटारियो)Grade 12B. Spatial Organization: Regional Similarities and Differences
कनाडा (ओंटारियो)Grade 12D. Data Management
कनाडा (ओंटारियो)Grade 12C. Organization of Data for Analysis
कनाडा (ओंटारियो)Grade 12D. Statistical Analysis
कनाडा (ओंटारियो)Grade 12E. Culminating Data Management Investigation
कनाडा (ओंटारियो)Grade 12A. Reasoning with Data
कनाडा (ओंटारियो)Grade 12C. Mechanical Systems
कनाडा (ओंटारियो)Grade 12B. Design, Layout, and Planning Skills
कनाडा (ओंटारियो)Grade 12B. Design, Layout, and Planning Skills
कनाडा (ओंटारियो)Grade 12A. Computer Technology Fundamentals
नीदरलैंडVWO 3 (onderbouw)Data and chance
नीदरलैंडHAVO 4 (bovenbouw, 2e fase)Statistics (part 1)
पोलैंडSzkoła podstawowa, klasa VIICross-cutting skills
स्पेन2º ESOScientific project
स्पेन3º ESOScientific project
स्पेन4º ESOScientific project
स्पेन1º BachilleratoScientific project
स्पेन1º BachilleratoNumber sense
इंग्लैंडYear 9Working scientifically
अमेरिकाGrade 8Data and Analysis
अमेरिकाGrade 9Data and Analysis
अमेरिकाGrade 10Big Idea 2: Data
अमेरिकाGrade 10Big Idea 3: Algorithms and Programming
अमेरिकाGrade 11Data Collections
अमेरिकाGrade 11Data and Analysis
जापान高校(専門学科)1〜3年Advanced Mathematics I
दक्षिण कोरिया중학교 2학년Data
दक्षिण कोरिया고등학교 1학년Foundations of science
दक्षिण कोरिया고등학교 1학년Processes of scientific inquiry
दक्षिण कोरिया고등학교 2학년The process of convergent inquiry
दक्षिण कोरिया고등학교 2학년Preparing and analysing data
दक्षिण कोरिया고등학교 2학년Data science project
दक्षिण कोरिया고등학교 2학년Data
दक्षिण कोरिया고등학교 2학년Society and mathematics
दक्षिण कोरिया고등학교 2학년Environment and mathematics
दक्षिण कोरिया고등학교 2학년Software for analysis
दक्षिण कोरिया고등학교 3학년Data and information
दक्षिण कोरिया고등학교 3학년Data
रूस10 классInformation technologies
रूस11 классInformation technologies
चीन高一Comp.1 Ch.3 Data processing
चीन高二Sel.3 Data management and analysis

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी कंप्यूटर विज्ञान पाठ