📘 CodingMarble Learn

प्रतिदर्श बंटन (Sampling Distribution) और केंद्रीय सीमा प्रमेय

नमूने से निकाली संख्या (जैसे नमूना माध्य x̄ या नमूना अनुपात p̂) हर नमूने में थोड़ी बदलती है। अगर हम बहुत सारे नमूने लें और हर बार यह संख्या लिखें, तो जो पैटर्न बनता है वह उसका प्रतिदर्श बंटन है। इसका केंद्र असली मान (μ या p) होता है, फैलाव मानक त्रुटि (माध्य के लिए σ/√n, अनुपात के लिए √(p(1−p)/n)) होता है, और केंद्रीय सीमा प्रमेय के अनुसार बड़ा n होने पर इसका आकार लगभग सामान्य (घंटी जैसा) हो जाता है।

🎬 कदम-दर-कदम कहानी

  1. यह पूरी आबादी है: हज़ारों लोगों का इंतज़ार का समय। आकार टेढ़ा है। औसत μ = 5 मिनट।
  2. 10 लोगों का एक नमूना लिया। उसका औसत x̄ 5 के पास है, पर ठीक 5 नहीं।
  3. 400 नमूने लिए। सारे औसतों का ढेर बनाया। यही प्रतिदर्श बंटन है। इसका केंद्र μ है।
  4. नमूना बड़ा किया (n = 40)। ढेर पतला हो गया। फैलाव = σ/√n।
  5. केंद्रीय सीमा प्रमेय: टेढ़ी आबादी से भी, बड़े n पर औसतों का ढेर घंटी जैसा बन जाता है।
  6. अब तुम खेलो: n बदलो, माध्य और अनुपात के बीच बदलो, और देखो सामान्य मॉडल कब ठीक है।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

क्या प्रतिदर्श बंटन और मेरे नमूने का बंटन एक ही है?

नहीं। तुम्हारा नमूना कुछ मान हैं (कदम 2)। प्रतिदर्श बंटन बहुत सारे नमूनों की सांख्यिकी का पैटर्न है (कदम 3)।

औसतों का फैलाव आँकड़ों से कम क्यों है?

नमूने में बड़े और छोटे मान एक-दूसरे को काटते हैं। इसलिए औसत बीच के पास जमा होते हैं। नमूना जितना बड़ा, उतना ज़्यादा।

क्या CLT मेरे आँकड़ों को सामान्य बना देता है?

नहीं। कदम 5 में नीली आबादी टेढ़ी ही रहती है। सिर्फ़ नारंगी औसतों का ढेर घंटी बनता है।

n नहीं, √n क्यों?

औसत का प्रसरण σ²/n है। मानक विचलन उसका वर्गमूल है, यानी σ/√n। इसलिए त्रुटि आधी करने को 4 गुना आँकड़े चाहिए।

p̂ के सामान्य मॉडल के लिए नमूना कब छोटा है?

जब np या n(1−p) 10 से कम हो। अनुपात मोड में p = 0.1, n = 30 करो, जाँच लाल हो जाएगी।

सांख्यिकी, प्राचल और नमूने की हलचल

प्राचल (parameter) पूरी आबादी की संख्या है, जैसे असली माध्य μ या असली अनुपात p। आम तौर पर हमें यह पता नहीं होता।

सांख्यिकी (statistic) वह संख्या है जो हम नमूने से निकालते हैं, जैसे x̄ या p̂। इससे हम प्राचल का अनुमान लगाते हैं।

अलग नमूने अलग जवाब देते हैं। इसे प्रतिचयन परिवर्तनशीलता (sampling variability) कहते हैं। यह गलती नहीं, बस संयोग है।

प्रतिदर्श बंटन क्या है?

सोचो, n आकार के हर संभव नमूने का x̄ निकाला। उन सब x̄ का पैटर्न x̄ का प्रतिदर्श बंटन है। 3D में हर नारंगी ब्लॉक एक नमूने का औसत है, और पूरा ढेर प्रतिदर्श बंटन है।

हर प्रतिदर्श बंटन को तीन बातों से बताते हैं: केंद्र, फैलाव और आकार।

नमूना माध्य का प्रतिदर्श बंटन

बड़ा नमूना क्यों बेहतर?

क्योंकि नीचे √n है। फैलाव आधा करना है तो नमूना 4 गुना करो। एक-तिहाई करना है तो 9 गुना।

केंद्रीय सीमा प्रमेय (CLT)

केंद्रीय सीमा प्रमेय कहता है: नमूना आकार n बड़ा हो तो x̄ का बंटन लगभग सामान्य होता है, आबादी का आकार कैसा भी हो। आम नियम: n ≥ 30। बहुत टेढ़ी आबादी के लिए और बड़ा n चाहिए।

इसीलिए आँकड़ों में सामान्य वक्र हर जगह मिलता है। फिर हम z निकाल सकते हैं: z = (x̄ − μ) ÷ (σ/√n)।

उदाहरण

इंतज़ार: μ = 5, σ = 5, n = 40। मानक त्रुटि = 5/√40 ≈ 0.79। x̄ के 6.5 से ज़्यादा होने की संभावना? z = 1.5/0.79 ≈ 1.90, तो P ≈ 0.029, लगभग 3%।

नमूना अनुपात का प्रतिदर्श बंटन

जब हर व्यक्ति का जवाब हाँ/ना हो, तो नमूना अनुपात p̂ = (हाँ की गिनती) ÷ n।

उदाहरण: p = 0.3, n = 100। SE = √(0.21/100) ≈ 0.046। np = 30, n(1−p) = 70, दोनों ≥ 10, तो सामान्य मॉडल ठीक है।

दो नमूनों का अंतर

अक्सर हम दो समूहों की तुलना करते हैं, जैसे दो स्कूल या दो दवाएँ। दोनों से अलग-अलग स्वतंत्र नमूने लेते हैं।

दो अनुपात: p̂₁ − p̂₂

केंद्र = p₁ − p₂। फैलाव = √(p₁(1−p₁)/n₁ + p₂(1−p₂)/n₂)। चारों गिनतियाँ ≥ 10 हों तो सामान्य।

दो माध्य: x̄₁ − x̄₂

केंद्र = μ₁ − μ₂। फैलाव = √(σ₁²/n₁ + σ₂²/n₂)।

मुख्य बात: घटाने पर भी प्रसरण (variance) जुड़ते हैं। इसलिए अंतर हमेशा ज़्यादा फैला होता है।

गुणवत्ता नियंत्रण: नियंत्रण चार्ट

फ़ैक्टरियाँ रोज़ प्रतिदर्श बंटन का इस्तेमाल करती हैं। वे तय समय पर छोटा नमूना लेकर उसका औसत नियंत्रण चार्ट (control chart) पर लगाती हैं।

एक बिंदु कार्रवाई सीमा से बाहर, या लगातार दो बिंदु चेतावनी सीमा से बाहर हों, तो मशीन रोककर जाँचो।

करके देखो: पासे का औसत खेल

एक पासा 20 बार फेंको और लिखो: पैटर्न सपाट होगा। अब 4 पासे एक साथ फेंककर उनका औसत निकालो, यह 20 बार करो। दोनों का डॉट-प्लॉट बनाओ। औसत 3.5 के पास जमा होकर टीले जैसे दिखेंगे। यही प्रतिदर्श बंटन है, और आकार का बदलना CLT है। फिर 3D में n = 1, n = 4 और n = 30 करके देखो।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. 15 साल के बच्चों की लंबाई: μ = 160 cm, σ = 8 cm। n = 16 के नमूने। x̄ का माध्य और मानक त्रुटि?

माध्य = 160 cm। SE = 8/√16 = 2 cm।

2. उसी आबादी में मानक त्रुटि 1 cm करने के लिए n कितना हो?

8/√n = 1 → √n = 8 → n = 64। (SE आधी करने के लिए नमूना 4 गुना: 16 → 64)

3. बोतलें μ = 500 mL, σ = 4 mL से भरी जाती हैं। 36 बोतलों का नमूना। P(x̄ < 498.5) ज्ञात करो।

SE = 4/6 = 0.667। z = −1.5/0.667 = −2.25। P ≈ 0.012, लगभग 1.2%।

4. एक बड़े शहर में 40% घरों पर सोलर पैनल हैं। 150 घरों का नमूना। p̂ का बंटन बताओ।

केंद्र 0.40। SE = √(0.24/150) = 0.04। np = 60, n(1−p) = 90, दोनों ≥ 10, तो लगभग N(0.40, 0.04)।

5. पिछले उदाहरण में P(p̂ > 0.48)?

z = 0.08/0.04 = 2। P ≈ 0.023, लगभग 2.3%। 48% या ज़्यादा आना काफ़ी असामान्य है।

6. स्कूल A: p₁ = 0.6, n₁ = 100। स्कूल B: p₂ = 0.5, n₂ = 100। p̂₁ − p̂₂ का केंद्र और SD?

केंद्र = 0.1। SD = √(0.0024 + 0.0025) = √0.0049 = 0.07।

7. मशीन का लक्ष्य 250 g, σ = 6 g, n = 9। नियंत्रण चार्ट की चेतावनी और कार्रवाई सीमाएँ?

SE = 6/3 = 2 g। चेतावनी: 246 g और 254 g। कार्रवाई: 244 g और 256 g।

आम गलतियाँ

अभ्यास क्विज़

1. x̄ के प्रतिदर्श बंटन का केंद्र है:
2. n को 4 गुना करने पर x̄ की मानक त्रुटि:
3. केंद्रीय सीमा प्रमेय कहता है कि बड़े n पर:
4. p = 0.5, n = 100 पर p̂ की मानक त्रुटि:
5. p̂ को लगभग सामान्य मानने के लिए चाहिए:

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

प्रतिदर्श बंटन आसान शब्दों में क्या है?

एक ही आकार के बहुत सारे नमूने लेकर हर एक का औसत (या कोई और सांख्यिकी) लिखने पर जो पैटर्न बनता है, वही प्रतिदर्श बंटन है।

मानक विचलन और मानक त्रुटि में क्या अंतर है?

मानक विचलन अकेले मानों का फैलाव है। मानक त्रुटि किसी सांख्यिकी (जैसे x̄) का नमूने-दर-नमूने फैलाव है: SE = σ/√n।

CLT के लिए n ≥ 30 क्यों?

यह अंगूठे का नियम है। ज़्यादातर आबादियों के लिए 30 या अधिक के नमूनों का औसत लगभग सामान्य हो जाता है।

यह कहाँ पढ़ाया जाता है

इंग्लैंडYear 112. Processing, representing and analysing data (part 2)
अमेरिकाGrade 12Probability, Random Variables, and Probability Distributions
अमेरिकाGrade 12Inference for Categorical Data: Proportions
अमेरिकाGrade 12Inference for Quantitative Data: Means
दक्षिण कोरिया고등학교 2학년Statistics
दक्षिण कोरिया고등학교 3학년Statistics

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी गणित पाठ