समष्टि, नमूना, प्राचल और प्रतिदर्शज
समष्टि (population) वह पूरा समूह है जिसके बारे में हम जानना चाहते हैं: देश के सभी मतदाता, आज बने सभी बल्ब। नमूना या प्रतिदर्श (sample) वह छोटा हिस्सा है जिसे हम सच में देखते हैं।
- प्राचल (parameter): समष्टि के बारे में संख्या। अक्सर पता नहीं होती। जैसे असली अनुपात p, असली माध्य μ।
- प्रतिदर्शज (statistic): नमूने से निकली संख्या। जैसे p̂, x̄।
याद रखो: Population ↔ Parameter, Sample ↔ Statistic (पहले अक्षर एक जैसे)।
नमूना क्यों?
सबको जाँचना (जनगणना, census) बहुत धीमा, महँगा या असंभव होता है (हर माचिस जलाकर जाँचोगे तो कुछ नहीं बचेगा)। अच्छा नमूना सस्ता पड़ता है।
अच्छा नमूना यादृच्छिक होता है
सरल यादृच्छिक नमूने में हर सदस्य के चुने जाने का मौका बराबर होता है। दूसरे तरीके: स्तरित (हर उम्र-समूह में से यादृच्छिक), क्रमबद्ध (हर 10वाँ व्यक्ति), गुच्छ (पूरी कक्षाएँ या गाँव चुनना)। अभिनति (bias) तब आती है जब कुछ लोगों के चुने जाने का मौका ज़्यादा हो, जैसे सिर्फ़ दोस्तों से पूछना, या ऑनलाइन पोल जहाँ सिर्फ़ उत्सुक लोग जवाब दें।
नमूना परिवर्तनशीलता और नमूना वितरण
एक ही समष्टि से लिए गए दो यादृच्छिक नमूने लगभग कभी एक जैसा उत्तर नहीं देते। यह स्वाभाविक डगमगाहट नमूना परिवर्तनशीलता है। यह ग़लती नहीं, संयोग है।
अगर एक ही आकार n के ढेर सारे नमूने लें और हर p̂ को बिंदु बनाएँ, तो नमूना वितरण मिलता है। बड़े नमूनों के लिए यह:
- असली मान पर केंद्रित होता है (p̂ अनभिनत आकलन है),
- घंटी जैसा होता है (लगभग प्रसामान्य बंटन),
- इसका फैलाव मानक त्रुटि है: SE(p̂) = √(p(1−p)/n), SE(x̄) = σ/√n।
n वर्गमूल के नीचे है, इसलिए नमूना 4 गुना करने पर फैलाव सिर्फ़ आधा होता है।
सिमुलेशन से दावे की जाँच
कंपनी कहती है उसके 40% ग्राहक विद्यार्थी हैं। तुम्हारे 50 के यादृच्छिक नमूने में सिर्फ़ 10 (20%) विद्यार्थी हैं। क्या दावा मानने लायक है? कंप्यूटर (या ऊपर का 3D) से p = 0.4 वाली समष्टि से 50-50 के बहुत सारे नकली नमूने लो। अगर 20% या कम लगभग कभी नहीं आता, तो आँकड़े दावे से मेल नहीं खाते। अगर अक्सर आता है, तो दावा ठीक बैठता है।
आकलन: बिंदु आकलन और विश्वास्यता अंतराल
बिंदु आकलन एक संख्या है: "p̂ = 0.42"। यह सबसे अच्छा एक अंदाज़ा है, पर लगभग कभी बिल्कुल सही नहीं होता।
अंतराल आकलन एक दायरा और भरोसे का स्तर देता है:
- अनुपात: p̂ ± z* √(p̂(1−p̂)/n)
- माध्य (σ ज्ञात या n बड़ा): x̄ ± z* · σ/√n
± के बाद वाला हिस्सा त्रुटि सीमा (margin of error) है। z* के मान: 90% के लिए 1.645, 95% के लिए 1.96, 99% के लिए 2.576।
"95% विश्वास" का मतलब?
अगर हम बार-बार नमूना लेकर हर बार अंतराल बनाएँ, तो लगभग 95% अंतराल असली मान को पकड़ेंगे। p स्थिर है; बदलता अंतराल है (चरण 4 की हरी और लाल पट्टियाँ देखो)।
अंतराल पतला कैसे करें
- बड़ा नमूना लो (n ↑ → SE ↓)।
- कम विश्वास स्तर स्वीकार करो (99% → 95%: पट्टी पतली, पर भरोसा कम)।
चाही गई त्रुटि सीमा E के लिए नमूना आकार (अनुपात, p = 0.5 मानकर): n ≈ (z*/(2E))²। E = 0.03, 95% पर: n ≈ (1.96/0.06)² ≈ 1068।
समूहों की तुलना और निष्कर्षों की परख
अनुमिति से दो समूहों की तुलना भी होती है, जैसे दो स्कूलों में पैदल आने वाले बच्चों का अनुपात।
- दोनों प्रतिदर्शजों का अंतर देखो (जैसे 0.55 − 0.40 = 0.15)।
- इसकी तुलना स्वाभाविक डगमगाहट से करो। अगर दोनों विश्वास्यता अंतराल बिल्कुल नहीं मिलते, तो अंतर सच में है। अगर बहुत मिलते हैं, तो अंतर संयोग भी हो सकता है।
- प्रभाव आकार (effect size) = अंतर ÷ सामान्य फैलाव; यह बताता है कि अंतर व्यवहार में कितना बड़ा है।
साथ बदलना कारण नहीं है
गर्मी में आइसक्रीम की बिक्री और डूबने की घटनाएँ दोनों बढ़ती हैं। ये संबद्ध हैं, पर आइसक्रीम डूबने का कारण नहीं; गर्म मौसम दोनों को बढ़ाता है (भ्रामक/छिपा चर, confounding variable)। कारण सिर्फ़ यादृच्छिक प्रयोग से साबित होता है, जहाँ संयोग तय करता है कि किसे उपचार मिलेगा।
किसी दावे को परखने की सूची
- क्या नमूना यादृच्छिक था? कौन छूट गया?
- n कितना था? त्रुटि सीमा कितनी?
- सर्वे, प्रयोग या अवलोकन अध्ययन?
- निष्कर्ष सही समष्टि के बारे में है?
- क्या अंतर संयोग से ज़्यादा है?
घर पर करके देखो
एक थैली में 40 लाल और 60 दूसरे रंग की चीज़ें (बटन, मोती, पर्चियाँ) डालो। हिलाओ। बिना देखे 20 निकालो, लाल का हिस्सा लिखो, वापस डालो। 15 बार करो और बिंदु-आलेख बनाओ। बीच कहाँ है? अब 5-5 के नमूने लेकर दोहराओ। कौन-सा आलेख ज़्यादा फैला है? फिर ऊपर के 3D में स्लाइडर चलाकर मिलाओ।
मुख्य सूत्र और परिभाषाएँ
- नमूना अनुपात: p̂ = (गुण वाले) ÷ n
- अनुपात की मानक त्रुटि: SE = √(p(1−p)/n)
- माध्य की मानक त्रुटि: SE = σ/√n
- p के लिए विश्वास्यता अंतराल: p̂ ± z*·√(p̂(1−p̂)/n)
- μ के लिए विश्वास्यता अंतराल: x̄ ± z*·σ/√n
- z* = 1.645 (90%), 1.96 (95%), 2.576 (99%)
- त्रुटि सीमा E के लिए नमूना आकार: n ≈ (z*/(2E))²
हल किए गए उदाहरण
1. 80 विद्यार्थियों के यादृच्छिक नमूने में 28 साइकिल से स्कूल आते हैं। साइकिल वालों के अनुपात का बिंदु आकलन बताओ।
p̂ = 28 ÷ 80 = 0.35। सबसे अच्छा एक अंदाज़ा 35% है।
2. असली अनुपात p = 0.4 है। n = 100 और n = 400 के लिए p̂ की मानक त्रुटि निकालो।
n = 100: SE = √(0.4 × 0.6 / 100) = √0.0024 ≈ 0.049। n = 400: SE = √(0.24/400) ≈ 0.0245। चार गुना नमूना, आधी SE।
3. 500 वयस्कों के सर्वे में 210 फ़िटनेस ऐप चलाते हैं। असली अनुपात का 95% विश्वास्यता अंतराल बनाओ।
p̂ = 210/500 = 0.42। SE = √(0.42 × 0.58 / 500) ≈ 0.0221। त्रुटि सीमा = 1.96 × 0.0221 ≈ 0.043। अंतराल: (0.377, 0.463)। हमें 95% विश्वास है कि लगभग 37.7% से 46.3% वयस्क ऐसा ऐप चलाते हैं।
4. चावल के पैकेटों में σ = 8 g है। 64 पैकेटों का माध्य x̄ = 998 g है। μ का 95% अंतराल बनाओ। क्या "1000 g" का लेबल मानने लायक है?
SE = 8/√64 = 1 g। त्रुटि सीमा = 1.96 g। अंतराल: (996.04, 999.96) g। 1000 g ठीक बाहर है, तो लगता है माध्य 1000 g से थोड़ा कम है।
5. 95% विश्वास पर ±4% के अंदर अनुपात का आकलन करने के लिए कितना बड़ा नमूना चाहिए?
सुरक्षित मान p = 0.5 लो। n ≈ (1.96 / 0.08)² = 24.5² = 600.25। ऊपर गोल करो: n = 601।
6. दावा: p = 0.5। p = 0.5 से 40-40 के 200 सिमुलेटेड नमूनों में 0.30 या कम सिर्फ़ 3 बार आया। तुम्हारा असली नमूना 0.30 है। क्या दावा आँकड़ों से मेल खाता है?
ऐसा कम परिणाम 3/200 = 1.5% बार आया। दावा सच हो तो यह बहुत दुर्लभ है, इसलिए आँकड़े p = 0.5 से मेल नहीं खाते। असली अनुपात शायद कम है।
आम गलतियाँ
- प्राचल और प्रतिदर्शज में गड़बड़। p और μ समष्टि के हैं; p̂ और x̄ नमूने के।
- यह कहना कि बने हुए 95% अंतराल में p के होने की 95% संभावना है। 95% तरीके के बारे में है, बहुत सारे नमूनों पर।
- यह सोचना कि बड़ी समष्टि को बहुत बड़ा नमूना चाहिए। SE नमूना आकार n पर निर्भर है, समष्टि के आकार पर नहीं (अगर समष्टि बड़ी है)।
- अवलोकन अध्ययन से कारण निकाल लेना। सिर्फ़ साथ बदलना कारण साबित नहीं करता।