सांख्यिकी, प्राचल और नमूने की हलचल
प्राचल (parameter) पूरी आबादी की संख्या है, जैसे असली माध्य μ या असली अनुपात p। आम तौर पर हमें यह पता नहीं होता।
सांख्यिकी (statistic) वह संख्या है जो हम नमूने से निकालते हैं, जैसे x̄ या p̂। इससे हम प्राचल का अनुमान लगाते हैं।
अलग नमूने अलग जवाब देते हैं। इसे प्रतिचयन परिवर्तनशीलता (sampling variability) कहते हैं। यह गलती नहीं, बस संयोग है।
प्रतिदर्श बंटन क्या है?
सोचो, n आकार के हर संभव नमूने का x̄ निकाला। उन सब x̄ का पैटर्न x̄ का प्रतिदर्श बंटन है। 3D में हर नारंगी ब्लॉक एक नमूने का औसत है, और पूरा ढेर प्रतिदर्श बंटन है।
हर प्रतिदर्श बंटन को तीन बातों से बताते हैं: केंद्र, फैलाव और आकार।
नमूना माध्य का प्रतिदर्श बंटन
- केंद्र: सारे x̄ का औसत μ है। यानी x̄ अनभिनत (unbiased) है: औसतन सही निशाने पर।
- फैलाव: x̄ का मानक विचलन σ/√n है। इसे मानक त्रुटि (standard error) कहते हैं। यह तब लगाओ जब नमूना आबादी के 10% से कम हो।
- आकार: आबादी सामान्य हो तो x̄ हर n पर सामान्य है। वरना केंद्रीय सीमा प्रमेय लगाओ।
बड़ा नमूना क्यों बेहतर?
क्योंकि नीचे √n है। फैलाव आधा करना है तो नमूना 4 गुना करो। एक-तिहाई करना है तो 9 गुना।
केंद्रीय सीमा प्रमेय (CLT)
केंद्रीय सीमा प्रमेय कहता है: नमूना आकार n बड़ा हो तो x̄ का बंटन लगभग सामान्य होता है, आबादी का आकार कैसा भी हो। आम नियम: n ≥ 30। बहुत टेढ़ी आबादी के लिए और बड़ा n चाहिए।
इसीलिए आँकड़ों में सामान्य वक्र हर जगह मिलता है। फिर हम z निकाल सकते हैं: z = (x̄ − μ) ÷ (σ/√n)।
उदाहरण
इंतज़ार: μ = 5, σ = 5, n = 40। मानक त्रुटि = 5/√40 ≈ 0.79। x̄ के 6.5 से ज़्यादा होने की संभावना? z = 1.5/0.79 ≈ 1.90, तो P ≈ 0.029, लगभग 3%।
नमूना अनुपात का प्रतिदर्श बंटन
जब हर व्यक्ति का जवाब हाँ/ना हो, तो नमूना अनुपात p̂ = (हाँ की गिनती) ÷ n।
- केंद्र: p
- फैलाव: √(p(1−p)/n)
- आकार: लगभग सामान्य, जब बड़ी गिनती की शर्त पूरी हो: np ≥ 10 और n(1−p) ≥ 10।
उदाहरण: p = 0.3, n = 100। SE = √(0.21/100) ≈ 0.046। np = 30, n(1−p) = 70, दोनों ≥ 10, तो सामान्य मॉडल ठीक है।
दो नमूनों का अंतर
अक्सर हम दो समूहों की तुलना करते हैं, जैसे दो स्कूल या दो दवाएँ। दोनों से अलग-अलग स्वतंत्र नमूने लेते हैं।
दो अनुपात: p̂₁ − p̂₂
केंद्र = p₁ − p₂। फैलाव = √(p₁(1−p₁)/n₁ + p₂(1−p₂)/n₂)। चारों गिनतियाँ ≥ 10 हों तो सामान्य।
दो माध्य: x̄₁ − x̄₂
केंद्र = μ₁ − μ₂। फैलाव = √(σ₁²/n₁ + σ₂²/n₂)।
मुख्य बात: घटाने पर भी प्रसरण (variance) जुड़ते हैं। इसलिए अंतर हमेशा ज़्यादा फैला होता है।
गुणवत्ता नियंत्रण: नियंत्रण चार्ट
फ़ैक्टरियाँ रोज़ प्रतिदर्श बंटन का इस्तेमाल करती हैं। वे तय समय पर छोटा नमूना लेकर उसका औसत नियंत्रण चार्ट (control chart) पर लगाती हैं।
- बीच की रेखा = लक्ष्य औसत।
- चेतावनी सीमा ≈ लक्ष्य ± 2 मानक त्रुटि (लगभग 95% औसत अंदर)।
- कार्रवाई सीमा ≈ लक्ष्य ± 3 मानक त्रुटि (लगभग 99.8% अंदर)।
एक बिंदु कार्रवाई सीमा से बाहर, या लगातार दो बिंदु चेतावनी सीमा से बाहर हों, तो मशीन रोककर जाँचो।
करके देखो: पासे का औसत खेल
एक पासा 20 बार फेंको और लिखो: पैटर्न सपाट होगा। अब 4 पासे एक साथ फेंककर उनका औसत निकालो, यह 20 बार करो। दोनों का डॉट-प्लॉट बनाओ। औसत 3.5 के पास जमा होकर टीले जैसे दिखेंगे। यही प्रतिदर्श बंटन है, और आकार का बदलना CLT है। फिर 3D में n = 1, n = 4 और n = 30 करके देखो।
मुख्य सूत्र और परिभाषाएँ
- x̄ का माध्य = μ; मानक त्रुटि = σ/√n
- p̂ का माध्य = p; मानक त्रुटि = √(p(1−p)/n)
- z = (x̄ − μ) ÷ (σ/√n)
- x̄₁ − x̄₂: केंद्र μ₁ − μ₂, SD = √(σ₁²/n₁ + σ₂²/n₂)
- p̂₁ − p̂₂: केंद्र p₁ − p₂, SD = √(p₁(1−p₁)/n₁ + p₂(1−p₂)/n₂)
- शर्तें: यादृच्छिक नमूना; n ≤ आबादी का 10%; सामान्य आकार (n ≥ 30, या np ≥ 10 और n(1−p) ≥ 10)
हल किए गए उदाहरण
1. 15 साल के बच्चों की लंबाई: μ = 160 cm, σ = 8 cm। n = 16 के नमूने। x̄ का माध्य और मानक त्रुटि?
माध्य = 160 cm। SE = 8/√16 = 2 cm।
2. उसी आबादी में मानक त्रुटि 1 cm करने के लिए n कितना हो?
8/√n = 1 → √n = 8 → n = 64। (SE आधी करने के लिए नमूना 4 गुना: 16 → 64)
3. बोतलें μ = 500 mL, σ = 4 mL से भरी जाती हैं। 36 बोतलों का नमूना। P(x̄ < 498.5) ज्ञात करो।
SE = 4/6 = 0.667। z = −1.5/0.667 = −2.25। P ≈ 0.012, लगभग 1.2%।
4. एक बड़े शहर में 40% घरों पर सोलर पैनल हैं। 150 घरों का नमूना। p̂ का बंटन बताओ।
केंद्र 0.40। SE = √(0.24/150) = 0.04। np = 60, n(1−p) = 90, दोनों ≥ 10, तो लगभग N(0.40, 0.04)।
5. पिछले उदाहरण में P(p̂ > 0.48)?
z = 0.08/0.04 = 2। P ≈ 0.023, लगभग 2.3%। 48% या ज़्यादा आना काफ़ी असामान्य है।
6. स्कूल A: p₁ = 0.6, n₁ = 100। स्कूल B: p₂ = 0.5, n₂ = 100। p̂₁ − p̂₂ का केंद्र और SD?
केंद्र = 0.1। SD = √(0.0024 + 0.0025) = √0.0049 = 0.07।
7. मशीन का लक्ष्य 250 g, σ = 6 g, n = 9। नियंत्रण चार्ट की चेतावनी और कार्रवाई सीमाएँ?
SE = 6/3 = 2 g। चेतावनी: 246 g और 254 g। कार्रवाई: 244 g और 256 g।
आम गलतियाँ
- नमूना माध्य के लिए σ लगाना, σ/√n नहीं। औसतों का फैलाव अकेले मानों से कम होता है।
- सोचना कि CLT आबादी को सामान्य बना देता है। आबादी टेढ़ी ही रहती है, सिर्फ़ x̄ का बंटन सामान्य होता है।
- अंतर के लिए प्रसरण घटाना। x̄₁ − x̄₂ में जोड़ते हैं: √(σ₁²/n₁ + σ₂²/n₂)।
- शर्तें न जाँचना: यादृच्छिक नमूना, 10% शर्त और सामान्य आकार (n ≥ 30, या np ≥ 10 और n(1−p) ≥ 10) पहले जाँचो।