डेटा की सफ़ाई क्यों?
असली डेटा लोगों, सेंसरों और फ़ॉर्मों से आता है। उसमें टाइपिंग की ग़लतियाँ, ख़राब सेंसर, ख़ाली ख़ाने और अलग-अलग इकाइयाँ होती हैं। सफ़ाई न करें तो औसत, ग्राफ़ और AI मॉडल सब ग़लत हो जाते हैं। कंप्यूटर का सीधा नियम है: कचरा अंदर, कचरा बाहर।
डेटा प्रीप्रोसेसिंग के चरण: डेटा देखिए → ग़लत प्रविष्टियाँ ठीक कीजिए → लापता मान सँभालिए → आउटलायर सँभालिए → पैमाना बदलिए → इस्तेमाल कीजिए।
आउटलायर (अपवाद-मान)
आउटलायर वह मान है जो बाक़ी मानों से बहुत दूर हो। यह ग़लती हो सकती है (टाइपो, ख़राब सेंसर) या असली पर दुर्लभ मान (बहुत लंबा व्यक्ति, रिकॉर्ड-तोड़ दिन)।
कैसे पहचानें:
- ग्राफ़ बनाइए (पट्टी, बिंदु-आरेख, बॉक्स प्लॉट)। अजीब मान उभरकर दिखते हैं।
- IQR नियम: Q1 और Q3 निकालिए, IQR = Q3 − Q1। जो मान Q1 − 1.5 × IQR से नीचे या Q3 + 1.5 × IQR से ऊपर हो, उस पर निशान लगाइए।
- z-स्कोर: z = (x − औसत) ÷ मानक विचलन। बहुत लोग |z| > 3 पर निशान लगाते हैं।
क्या करें: पहले कारण खोजिए। साफ़ ग़लती हो तो सुधारिए (सही मान पता हो तो) या हटाइए। असली मान हो तो रखिए और औसत की जगह माध्यिका इस्तेमाल कीजिए, क्योंकि माध्यिका आउटलायर से लगभग नहीं हिलती। डेटा चुपचाप कभी मत हटाइए; जो किया वह लिख लीजिए।
लापता मान
लापता मान एक ख़ाली जगह है: बच्चा अनुपस्थित था, सेंसर फ़ेल हुआ, फ़ॉर्म ख़ाली छूटा।
- वह पंक्ति हटाइए (कुछ ही लापता हों तो ठीक)।
- भरिए (imputation): औसत से (ठीक-ठाक समान डेटा में), माध्यिका से (आउटलायर हों तो) या बहुलक से (सबसे आम मान, श्रेणियों के लिए)।
- निशान लगाइए कि यह लापता था, ताकि याद रहे कि भरा गया है।
- सबसे अच्छा: वापस जाकर दोबारा इकट्ठा कीजिए।
लापता का प्रतिशत = लापता ÷ कुल × 100। बहुत ज़्यादा लापता हों तो भरना भ्रम पैदा कर सकता है।
सामान्यीकरण: संख्याओं को एक पैमाने पर लाना
मान लीजिए ऊँचाई cm में है (150 से 170) और आय रुपयों में (10,000 से 90,000)। दूरी की तुलना करने वाली कंप्यूटर विधि सोचेगी कि आय हज़ारों गुना ज़्यादा मायने रखती है, सिर्फ़ इसलिए कि उसकी संख्याएँ बड़ी हैं। सामान्यीकरण (normalisation) हर विशेषता को एक समान सीमा पर लाता है।
मिन–मैक्स सामान्यीकरण (0–1 पर): x′ = (x − न्यूनतम) ÷ (अधिकतम − न्यूनतम)।
मानकीकरण (z-स्कोर): z = (x − औसत) ÷ मानक विचलन। मान 0 के आसपास केंद्रित होते हैं।
सामान्यीकरण आउटलायर ठीक करने के बाद कीजिए: आउटलायर बाक़ी सब मानों को 0 के पास दबा देता है।
सब मिलाकर: सफ़ाई की जाँच-सूची
- मूल प्रति सुरक्षित रखिए। प्रतिलिपि पर काम कीजिए।
- देखिए: सारांश संख्याएँ और ग्राफ़।
- ग़लत प्रकार, इकाइयाँ और टाइपो ठीक कीजिए।
- लापता मान सँभालिए और कैसे, यह लिखिए।
- आउटलायर जाँचिए (ग्राफ़ + IQR) और कारण के साथ निर्णय लीजिए।
- तरीक़े को ज़रूरत हो तो सामान्यीकरण कीजिए।
- हर बदलाव एक नोट में दर्ज कीजिए।
करके देखिए: अपनी कक्षा का डेटा साफ़ कीजिए
10 सहपाठियों से cm में उनकी ऊँचाई पूछकर सूची बनाइए। चुपके से एक बेतुका मान (जैसे 1650) जोड़िए और एक जगह ख़ाली छोड़िए। सूची किसी दोस्त से बदल लीजिए। दोस्त को करना है: आउटलायर ढूँढना, तय करना कि कैसे सुधारे, ख़ाली जगह को माध्यिका से भरना, फिर पहले और बाद का औसत निकालना। फिर ऊपर के 3D में बटन दबाकर तुलना कीजिए।
मुख्य सूत्र और परिभाषाएँ
- औसत = मानों का योग ÷ मानों की संख्या; माध्यिका = क्रम में लगाने पर बीच का मान
- IQR = Q3 − Q1; आउटलायर यदि x < Q1 − 1.5 × IQR या x > Q3 + 1.5 × IQR
- z = (x − औसत) ÷ मानक विचलन (|z| > 3 पर निशान)
- मिन–मैक्स: x′ = (x − न्यूनतम) ÷ (अधिकतम − न्यूनतम) (सीमा 0 से 1)
- लापता प्रतिशत = लापता ÷ कुल × 100
हल किए गए उदाहरण
1. 5 छात्रों के अंक: 12, 15, 14, 13, 90 (90 असल में 19 होना चाहिए)। टाइपो के साथ औसत और माध्यिका निकालिए।
औसत = (12 + 15 + 14 + 13 + 90) ÷ 5 = 144 ÷ 5 = 28.8, जो बेतुका है। क्रम में: 12, 13, 14, 15, 90, इसलिए माध्यिका = 14। माध्यिका आउटलायर से लगभग नहीं हिली।
2. 2, 4, 5, 6, 7, 8, 9, 50 पर IQR नियम लगाइए। क्या 50 आउटलायर है?
निचला आधा: 2, 4, 5, 6 इसलिए Q1 = 4.5। ऊपरी आधा: 7, 8, 9, 50 इसलिए Q3 = 8.5। IQR = 4। ऊपरी सीमा = 8.5 + 1.5 × 4 = 14.5। 50 > 14.5, इसलिए यह आउटलायर है।
3. लापता मान को बाक़ी मानों के औसत से भरिए: 10, 12, ?, 14, 16।
ज्ञात मान: 10 + 12 + 14 + 16 = 52 और ये 4 हैं। औसत = 52 ÷ 4 = 13। इसलिए लापता मान 13 होगा।
4. डेटा 20 से 50 तक है। मिन–मैक्स से मान 30 का सामान्यीकरण कीजिए।
x′ = (30 − 20) ÷ (50 − 20) = 10 ÷ 30 = 0.33 (दो दशमलव तक)।
5. एक टेस्ट में कक्षा का औसत 60 और मानक विचलन 10 है। 75 अंक का z-स्कोर क्या है? क्या यह असामान्य है?
z = (75 − 60) ÷ 10 = 1.5। यह औसत से ऊपर है पर असामान्य नहीं (|z| 3 से कम है)।
6. एक छात्र की ऊँचाई 160 cm (सीमा 150 से 170) और वज़न 55 kg (सीमा 40 से 70) है। दोनों का सामान्यीकरण कीजिए। आप क्या देखते हैं?
ऊँचाई: (160 − 150) ÷ 20 = 0.5। वज़न: (55 − 40) ÷ 30 = 0.5। दोनों 0.5 हैं, यानी अपनी-अपनी सीमा के ठीक बीच में, इसलिए उनकी ठीक से तुलना हो सकती है।
आम गलतियाँ
- आउटलायर क्यों आया, यह पूछे बिना उसे हटा देना। वह असली और महत्त्वपूर्ण हो सकता है।
- बड़े आउटलायर हों तब भी लापता मान औसत से भरना। तब माध्यिका इस्तेमाल कीजिए।
- आउटलायर ठीक करने से पहले सामान्यीकरण करना। एक आउटलायर बाक़ी सब मानों को 0 के पास दबा देता है।
- मूल डेटा न रखना और बदलाव दर्ज न करना।