📘 CodingMarble Learn

डेटा सफ़ाई: आउटलायर, लापता मान और सामान्यीकरण

असली डेटा गड़बड़ होता है। विश्लेषण से पहले हम उसकी सफ़ाई करते हैं: आउटलायर (अजीब मान) ढूँढकर ठीक करना, लापता मान (भरना या हटाना) सँभालना और संख्याओं को सामान्यीकृत (पुनः पैमाने पर) करना ताकि अलग-अलग माप ठीक से तुलना हो सकें। इसे डेटा प्रीप्रोसेसिंग कहते हैं।

🎬 कदम-दर-कदम कहानी

  1. 12 छात्रों की ऊँचाई cm में। पट्टियाँ देखिए। एक पट्टी बहुत ऊँची है (1650 cm) और एक जगह ख़ाली है। लाल रेखा औसत है: वह 296 cm बता रही है। इतना लंबा कोई छात्र नहीं होता!
  2. वह ऊँची पट्टी आउटलायर है: बाक़ी मानों से बहुत दूर का मान। यहाँ यह टाइपिंग की ग़लती है: किसी ने 165 की जगह 1650 लिख दिया।
  3. हम टाइपो ठीक करते हैं: 1650 से 165। पट्टी नीचे आती है और औसत घटकर 161 cm हो जाता है, जो समझ में आता है।
  4. एक छात्र की ऊँचाई दर्ज नहीं है: यह लापता मान है। हम ख़ाली जगह को माध्यिका (बीच के मान) 162 cm से भरते हैं। अब डेटा पूरा है।
  5. सामान्यीकरण संख्याओं को 0 (सबसे छोटा) से 1 (सबसे बड़ा) तक के पैमाने पर लाता है। पट्टियों का क्रम वही रहता है, बस पैमाना बदलता है, इसलिए ऊँचाई और वज़न की ठीक से तुलना हो सकती है।
  6. अब आपकी बारी। तीनों बटन किसी भी क्रम में दबाइए: आउटलायर ठीक करें, ख़ाली जगह भरें, सामान्यीकरण। औसत रेखा और संदेश देखिए।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

एक ग़लत मान औसत को इतना क्यों बदल देता है?

औसत सब मान जोड़ता है, इसलिए एक बहुत बड़ा मान कुल को ऊपर खींच देता है। लाल रेखा को 296 cm पर कूदते देखिए।

कैसे पता चले कि कोई मान आउटलायर है, असली नहीं?

उसे बाक़ियों और असली दुनिया की समझ से मिलाइए। 1650 cm असंभव है, इसलिए यह ग़लती है; कारण खोजिए।

ख़ाली जगह को शून्य से क्यों न भरें?

शून्य एक नक़ली, बहुत छोटी ऊँचाई होगी और औसत को नीचे खींचेगा। माध्यिका एक सुरक्षित, सामान्य मान है।

सामान्यीकरण करें ही क्यों?

ताकि बड़ी संख्याओं वाली विशेषताएँ (जैसे आय) छोटी संख्याओं वाली विशेषताओं (जैसे ऊँचाई) पर हावी न हों।

क्या सामान्यीकरण से डेटा का क्रम बदलता है?

नहीं। पट्टियों का क्रम वही रहता है; केवल पैमाना बदलता है।

डेटा की सफ़ाई क्यों?

असली डेटा लोगों, सेंसरों और फ़ॉर्मों से आता है। उसमें टाइपिंग की ग़लतियाँ, ख़राब सेंसर, ख़ाली ख़ाने और अलग-अलग इकाइयाँ होती हैं। सफ़ाई न करें तो औसत, ग्राफ़ और AI मॉडल सब ग़लत हो जाते हैं। कंप्यूटर का सीधा नियम है: कचरा अंदर, कचरा बाहर।

डेटा प्रीप्रोसेसिंग के चरण: डेटा देखिए → ग़लत प्रविष्टियाँ ठीक कीजिए → लापता मान सँभालिए → आउटलायर सँभालिए → पैमाना बदलिए → इस्तेमाल कीजिए।

आउटलायर (अपवाद-मान)

आउटलायर वह मान है जो बाक़ी मानों से बहुत दूर हो। यह ग़लती हो सकती है (टाइपो, ख़राब सेंसर) या असली पर दुर्लभ मान (बहुत लंबा व्यक्ति, रिकॉर्ड-तोड़ दिन)।

कैसे पहचानें:

क्या करें: पहले कारण खोजिए। साफ़ ग़लती हो तो सुधारिए (सही मान पता हो तो) या हटाइए। असली मान हो तो रखिए और औसत की जगह माध्यिका इस्तेमाल कीजिए, क्योंकि माध्यिका आउटलायर से लगभग नहीं हिलती। डेटा चुपचाप कभी मत हटाइए; जो किया वह लिख लीजिए।

लापता मान

लापता मान एक ख़ाली जगह है: बच्चा अनुपस्थित था, सेंसर फ़ेल हुआ, फ़ॉर्म ख़ाली छूटा।

लापता का प्रतिशत = लापता ÷ कुल × 100। बहुत ज़्यादा लापता हों तो भरना भ्रम पैदा कर सकता है।

सामान्यीकरण: संख्याओं को एक पैमाने पर लाना

मान लीजिए ऊँचाई cm में है (150 से 170) और आय रुपयों में (10,000 से 90,000)। दूरी की तुलना करने वाली कंप्यूटर विधि सोचेगी कि आय हज़ारों गुना ज़्यादा मायने रखती है, सिर्फ़ इसलिए कि उसकी संख्याएँ बड़ी हैं। सामान्यीकरण (normalisation) हर विशेषता को एक समान सीमा पर लाता है।

मिन–मैक्स सामान्यीकरण (0–1 पर): x′ = (x − न्यूनतम) ÷ (अधिकतम − न्यूनतम)।

मानकीकरण (z-स्कोर): z = (x − औसत) ÷ मानक विचलन। मान 0 के आसपास केंद्रित होते हैं।

सामान्यीकरण आउटलायर ठीक करने के बाद कीजिए: आउटलायर बाक़ी सब मानों को 0 के पास दबा देता है।

सब मिलाकर: सफ़ाई की जाँच-सूची

  1. मूल प्रति सुरक्षित रखिए। प्रतिलिपि पर काम कीजिए।
  2. देखिए: सारांश संख्याएँ और ग्राफ़।
  3. ग़लत प्रकार, इकाइयाँ और टाइपो ठीक कीजिए।
  4. लापता मान सँभालिए और कैसे, यह लिखिए।
  5. आउटलायर जाँचिए (ग्राफ़ + IQR) और कारण के साथ निर्णय लीजिए।
  6. तरीक़े को ज़रूरत हो तो सामान्यीकरण कीजिए।
  7. हर बदलाव एक नोट में दर्ज कीजिए।

करके देखिए: अपनी कक्षा का डेटा साफ़ कीजिए

10 सहपाठियों से cm में उनकी ऊँचाई पूछकर सूची बनाइए। चुपके से एक बेतुका मान (जैसे 1650) जोड़िए और एक जगह ख़ाली छोड़िए। सूची किसी दोस्त से बदल लीजिए। दोस्त को करना है: आउटलायर ढूँढना, तय करना कि कैसे सुधारे, ख़ाली जगह को माध्यिका से भरना, फिर पहले और बाद का औसत निकालना। फिर ऊपर के 3D में बटन दबाकर तुलना कीजिए।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. 5 छात्रों के अंक: 12, 15, 14, 13, 90 (90 असल में 19 होना चाहिए)। टाइपो के साथ औसत और माध्यिका निकालिए।

औसत = (12 + 15 + 14 + 13 + 90) ÷ 5 = 144 ÷ 5 = 28.8, जो बेतुका है। क्रम में: 12, 13, 14, 15, 90, इसलिए माध्यिका = 14। माध्यिका आउटलायर से लगभग नहीं हिली।

2. 2, 4, 5, 6, 7, 8, 9, 50 पर IQR नियम लगाइए। क्या 50 आउटलायर है?

निचला आधा: 2, 4, 5, 6 इसलिए Q1 = 4.5। ऊपरी आधा: 7, 8, 9, 50 इसलिए Q3 = 8.5। IQR = 4। ऊपरी सीमा = 8.5 + 1.5 × 4 = 14.5। 50 > 14.5, इसलिए यह आउटलायर है।

3. लापता मान को बाक़ी मानों के औसत से भरिए: 10, 12, ?, 14, 16।

ज्ञात मान: 10 + 12 + 14 + 16 = 52 और ये 4 हैं। औसत = 52 ÷ 4 = 13। इसलिए लापता मान 13 होगा।

4. डेटा 20 से 50 तक है। मिन–मैक्स से मान 30 का सामान्यीकरण कीजिए।

x′ = (30 − 20) ÷ (50 − 20) = 10 ÷ 30 = 0.33 (दो दशमलव तक)।

5. एक टेस्ट में कक्षा का औसत 60 और मानक विचलन 10 है। 75 अंक का z-स्कोर क्या है? क्या यह असामान्य है?

z = (75 − 60) ÷ 10 = 1.5। यह औसत से ऊपर है पर असामान्य नहीं (|z| 3 से कम है)।

6. एक छात्र की ऊँचाई 160 cm (सीमा 150 से 170) और वज़न 55 kg (सीमा 40 से 70) है। दोनों का सामान्यीकरण कीजिए। आप क्या देखते हैं?

ऊँचाई: (160 − 150) ÷ 20 = 0.5। वज़न: (55 − 40) ÷ 30 = 0.5। दोनों 0.5 हैं, यानी अपनी-अपनी सीमा के ठीक बीच में, इसलिए उनकी ठीक से तुलना हो सकती है।

आम गलतियाँ

अभ्यास क्विज़

1. आउटलायर है:
2. आउटलायर से सबसे कम प्रभावित क्या होता है?
3. मिन–मैक्स सामान्यीकरण डेटा को किस सीमा में लाता है?
4. आउटलायर हों तो लापता मान भरने का अच्छा तरीक़ा:
5. x = 40, न्यूनतम = 20, अधिकतम = 60 हो तो सामान्यीकृत x है:

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

डेटा सफ़ाई (data cleaning) आसान शब्दों में क्या है?

इस्तेमाल से पहले डेटा की ग़लतियाँ और ख़ाली जगहें ठीक करना: ग़लत मान सुधारना, ख़ाली को भरना या हटाना, अजीब मानों को सँभालना और संख्याओं का पैमाना बदलना।

क्या आउटलायर हमेशा हटाने चाहिए?

नहीं। केवल तब हटाइए या सुधारिए जब वे ग़लती हों। असली हों तो रखिए और माध्यिका जैसी विधियाँ लीजिए जो उनसे आसानी से नहीं हिलतीं।

सामान्यीकरण और मानकीकरण में क्या अंतर है?

सामान्यीकरण (मिन–मैक्स) मानों को 0 से 1 में दबाता है। मानकीकरण (z-स्कोर) औसत और मानक विचलन से मानों को 0 के आसपास केंद्रित करता है। दोनों विशेषताओं को एक समान पैमाने पर लाते हैं।

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी गणित पाठ