डेटा विश्लेषण का चक्र
- पूछो: साफ़ सवाल ("क्या रात को फ़ोन चलाने वाले बच्चे कम सोते हैं?")।
- इकट्ठा करो: सर्वे, माप, सेंसर, प्रयोग या पहले से मौजूद डेटा।
- साफ़ करो।
- व्यवस्थित / रूपांतरित करो: क्रम, समूह, तालिका, इकाई बदलना।
- विश्लेषण करो: सारांश, पैटर्न, तुलना।
- चित्र और निष्कर्ष: चार्ट बनाओ, सवाल का जवाब दो, बताओ कितना पक्का है।
अक्सर जवाब से नया सवाल निकलता है और चक्र फिर शुरू होता है। औज़ार काग़ज़-कैलकुलेटर से लेकर स्प्रेडशीट और Python जैसी प्रोग्रामिंग भाषा तक हैं।
डेटा इकट्ठा करना और साफ़ करना
मात्रात्मक डेटा संख्या है (लंबाई 152 cm)। गुणात्मक डेटा शब्द या श्रेणी है (पसंदीदा खेल)। प्राथमिक डेटा ख़ुद इकट्ठा करते हो; द्वितीयक डेटा किसी और ने इकट्ठा किया।
नमूना (सैंपल) वह समूह है जिससे सच में पूछा। बड़ा और बेतरतीब चुना नमूना सही नतीजा देता है; सिर्फ़ दोस्तों से पूछने पर पक्षपात आता है।
सफ़ाई की सूची
- दोहराव हटाओ (एक ही रिकॉर्ड दो बार)।
- असंभव मान ठीक करो या हटाओ (दिन में 25 घंटे नींद)।
- खाली मान का क्या करना है, तय करो।
- इकाई और वर्तनी एक जैसी करो (cm बनाम m)।
डेटा की सुरक्षा
निजी डेटा के लिए अनुमति चाहिए, उसे सुरक्षित रखो, और बाँटने से पहले नाम हटा दो (गुमनाम करो)।
विश्लेषण: औसत, फैलाव, बाहरी मान
माध्य = सब मानों का जोड़ ÷ मानों की गिनती। माध्यिका = क्रम में लगाने के बाद बीच का मान (गिनती सम हो तो बीच के दो का औसत)। बहुलक = सबसे ज़्यादा बार आने वाला मान। परास = सबसे बड़ा − सबसे छोटा; यह फैलाव बताता है।
बाहरी मान (आउटलायर) बाकी से बहुत दूर का मान है। यह ग़लती भी हो सकता है या सच में दुर्लभ मामला। माध्य बाहरी मान से खिंचता है, माध्यिका नहीं, इसलिए आय जैसे टेढ़े डेटा में माध्यिका बेहतर है।
खोजपूर्ण डेटा विश्लेषण यानी कोई विचार परखने से पहले डेटा को तालिका, चार्ट और सारांश से हर तरफ़ से देखना। समूह बनाना (कक्षा या शहर के हिसाब से) और कई डेटासेट जोड़ना नए पैटर्न दिखाता है।
चित्र बनाना, निष्कर्ष और जाँच
काम के हिसाब से चार्ट चुनो: दंड आलेख समूहों की तुलना, रेखा ग्राफ़ समय के साथ बदलाव, बिंदु-चित्र (स्कैटर) दो संख्याओं का रिश्ता, पाई चार्ट पूरे के हिस्से, आयतचित्र (हिस्टोग्राम) मान कैसे फैले हैं।
बिंदु-चित्र में दोनों साथ बढ़ें तो धनात्मक सहसंबंध; एक बढ़े दूसरा घटे तो ऋणात्मक सहसंबंध। सहसंबंध कारण नहीं है: गर्मी में आइसक्रीम की बिक्री और डूबने की घटनाएँ दोनों बढ़ती हैं, गर्मी की वजह से, एक-दूसरे की वजह से नहीं।
निष्कर्ष की जाँच
क्या नमूना बड़ा और निष्पक्ष था? ग़लतियाँ साफ़ हुईं? उसी डेटा का दूसरा विश्लेषण अलग जवाब दे सकता है? सीमाएँ ईमानदारी से बताओ। बिग डेटा (लाखों पंक्तियाँ, जैसे शहर के प्रदूषण सेंसर) में कंप्यूटर यही चरण तेज़ी से करते हैं, पर सावधानी वही चाहिए।
मुख्य सूत्र और परिभाषाएँ
- माध्य = मानों का जोड़ ÷ मानों की गिनती
- माध्यिका = क्रमबद्ध डेटा का बीच वाला मान (सम गिनती: बीच के दो का औसत)
- बहुलक = सबसे ज़्यादा बार आने वाला मान
- परास = अधिकतम − न्यूनतम
- सहसंबंध ≠ कारण
हल किए गए उदाहरण
1. यह नींद डेटा साफ़ करो: 7, 8, 8 (एक ही बच्चा दो बार), 25, खाली, 6।
दोहराया 8, असंभव 25 और खाली हटाओ। साफ़ डेटा: 7, 8, 6।
2. 6, 7, 7, 8, 8, 8, 9, 10 का माध्य और माध्यिका निकालो।
जोड़ = 63, गिनती = 8, माध्य = 63 ÷ 8 = 7.875 ≈ 7.9। बीच के दो मान 8 और 8, तो माध्यिका = 8।
3. ऊपर वाले डेटा में बाहरी मान 24 जोड़ो। माध्य और माध्यिका का क्या होगा?
नया जोड़ = 87, गिनती = 9, माध्य = 87 ÷ 9 ≈ 9.67 (बड़ी छलांग)। क्रम में 5वाँ मान 8 है, तो माध्यिका = 8 (कोई बदलाव नहीं)। माध्यिका बाहरी मान से नहीं डगमगाती।
आम गलतियाँ
- सफ़ाई छोड़ देना। एक असंभव मान पूरा माध्य बिगाड़ सकता है।
- माध्यिका निकालने से पहले क्रम में न लगाना।
- सिर्फ़ सहसंबंध देखकर कहना कि एक चीज़ दूसरी का कारण है।
- जो डेटा पूरा न बनाए उसके लिए पाई चार्ट, या श्रेणियों के लिए रेखा ग्राफ़ बनाना।