📘 CodingMarble Learn

सांख्यिकीय अनुमिति

सांख्यिकीय अनुमिति (statistical inference) का मतलब है: एक छोटे नमूने को देखकर पूरी समष्टि (population) के बारे में बात कहना। समष्टि के बारे में संख्या (जैसे असली अनुपात p या माध्य μ) प्राचल (parameter) कहलाती है। नमूने से निकली संख्या (जैसे p̂ या x̄) प्रतिदर्शज (statistic) है, और यही हमारा बिंदु आकलन है। अलग-अलग नमूने अलग उत्तर देते हैं: यह नमूना परिवर्तनशीलता है। बहुत सारे नमूनों के उत्तर मिलकर नमूना वितरण बनाते हैं, जिसका बीच असली मान पर होता है और फैलाव मानक त्रुटि (SE) कहलाता है: अनुपात के लिए √(p(1−p)/n), माध्य के लिए σ/√n। बड़ा नमूना = कम फैलाव। 95% विश्वास्यता अंतराल = आकलन ± 1.96 × SE; ऐसे 100 में से लगभग 95 अंतराल असली मान को पकड़ते हैं। सिमुलेशन से जाँचते हैं कि कोई दावा आँकड़ों से मेल खाता है या नहीं। अच्छी अनुमिति के लिए यादृच्छिक नमूना ज़रूरी है, और साथ-साथ बदलना कारण साबित नहीं करता।

🎬 कदम-दर-कदम कहानी

  1. थैले में 400 मोती हैं। हमें नहीं पता कि कितना हिस्सा p लाल है। हम 50 मोती निकालते हैं (नमूना) और लाल गिनते हैं। यह हिस्सा p̂ है, हमारा अंदाज़ा।
  2. मोती वापस डालकर फिर 50 निकालो। उत्तर बदल गया! हर नमूने का p̂ थोड़ा अलग आता है। इसे नमूना परिवर्तनशीलता कहते हैं।
  3. अब 150 नमूने लो और हर p̂ को एक बिंदु बनाकर रखो। बिंदु घंटी जैसा ढेर बनाते हैं। इसका बीच असली p के पास है। यही नमूना वितरण है।
  4. हर नमूना बड़ा करो: n = 200। ढेर पतला हो जाता है। बड़े नमूने कम डगमगाते हैं, इसलिए उन पर ज़्यादा भरोसा।
  5. हर नमूने से एक पट्टी बनाओ: p̂ ± 1.96 × SE। यह 95% विश्वास्यता अंतराल है। 20 में से लगभग 19 पट्टियाँ असली p को छूती हैं (हरी)। कुछ चूक जाती हैं (लाल)।
  6. अब तुम्हारी बारी: नमूना आकार और असली p बदलो। "नमूना लो" कई बार दबाओ। गिनो कितनी पट्टियाँ असली p को पकड़ती हैं।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

थैला वही है तो हर नमूना अलग उत्तर क्यों देता है?

हर बार संयोग से अलग मोती आते हैं। चरण 1 में एक ही थैले के दो नमूने अलग p̂ देते हैं।

नमूने संयोग से बनते हैं, तो उन पर भरोसा कैसे?

उनकी गलतियाँ एक पैटर्न में होती हैं। चरण 2 में बहुत सारे p̂ असली p के आसपास ढेर बनाते हैं।

बड़ा नमूना क्यों मदद करता है?

p̂ का ढेर पतला होता है (SE = √(p(1−p)/n) घटती है)। चरण 3 में n = 200 और n = 50 की तुलना है।

क्या 95% अंतराल हमेशा असली मान पकड़ता है?

नहीं। लगभग 20 में से 1 चूकता है। चरण 4 में हरी पट्टियाँ पकड़ती हैं, लाल चूकती हैं।

p और p̂ में असली फ़र्क क्या है?

p पूरे थैले का छिपा हिस्सा है (स्थिर)। p̂ तुम्हारी मुट्ठी का हिस्सा है (बदलता है)। चरण 0 में दोनों दिखते हैं।

कैसे जाँचूँ कि कोई दावा मेरे आँकड़ों से मेल खाता है?

दावे वाले मॉडल से बहुत सारे नमूने सिमुलेट करो और देखो तुम्हारे जैसा परिणाम कितनी बार आता है। चरण 5 के स्लाइडर चलाओ।

समष्टि, नमूना, प्राचल और प्रतिदर्शज

समष्टि (population) वह पूरा समूह है जिसके बारे में हम जानना चाहते हैं: देश के सभी मतदाता, आज बने सभी बल्ब। नमूना या प्रतिदर्श (sample) वह छोटा हिस्सा है जिसे हम सच में देखते हैं।

याद रखो: Population ↔ Parameter, Sample ↔ Statistic (पहले अक्षर एक जैसे)।

नमूना क्यों?

सबको जाँचना (जनगणना, census) बहुत धीमा, महँगा या असंभव होता है (हर माचिस जलाकर जाँचोगे तो कुछ नहीं बचेगा)। अच्छा नमूना सस्ता पड़ता है।

अच्छा नमूना यादृच्छिक होता है

सरल यादृच्छिक नमूने में हर सदस्य के चुने जाने का मौका बराबर होता है। दूसरे तरीके: स्तरित (हर उम्र-समूह में से यादृच्छिक), क्रमबद्ध (हर 10वाँ व्यक्ति), गुच्छ (पूरी कक्षाएँ या गाँव चुनना)। अभिनति (bias) तब आती है जब कुछ लोगों के चुने जाने का मौका ज़्यादा हो, जैसे सिर्फ़ दोस्तों से पूछना, या ऑनलाइन पोल जहाँ सिर्फ़ उत्सुक लोग जवाब दें।

नमूना परिवर्तनशीलता और नमूना वितरण

एक ही समष्टि से लिए गए दो यादृच्छिक नमूने लगभग कभी एक जैसा उत्तर नहीं देते। यह स्वाभाविक डगमगाहट नमूना परिवर्तनशीलता है। यह ग़लती नहीं, संयोग है।

अगर एक ही आकार n के ढेर सारे नमूने लें और हर p̂ को बिंदु बनाएँ, तो नमूना वितरण मिलता है। बड़े नमूनों के लिए यह:

n वर्गमूल के नीचे है, इसलिए नमूना 4 गुना करने पर फैलाव सिर्फ़ आधा होता है।

सिमुलेशन से दावे की जाँच

कंपनी कहती है उसके 40% ग्राहक विद्यार्थी हैं। तुम्हारे 50 के यादृच्छिक नमूने में सिर्फ़ 10 (20%) विद्यार्थी हैं। क्या दावा मानने लायक है? कंप्यूटर (या ऊपर का 3D) से p = 0.4 वाली समष्टि से 50-50 के बहुत सारे नकली नमूने लो। अगर 20% या कम लगभग कभी नहीं आता, तो आँकड़े दावे से मेल नहीं खाते। अगर अक्सर आता है, तो दावा ठीक बैठता है।

आकलन: बिंदु आकलन और विश्वास्यता अंतराल

बिंदु आकलन एक संख्या है: "p̂ = 0.42"। यह सबसे अच्छा एक अंदाज़ा है, पर लगभग कभी बिल्कुल सही नहीं होता।

अंतराल आकलन एक दायरा और भरोसे का स्तर देता है:

± के बाद वाला हिस्सा त्रुटि सीमा (margin of error) है। z* के मान: 90% के लिए 1.645, 95% के लिए 1.96, 99% के लिए 2.576।

"95% विश्वास" का मतलब?

अगर हम बार-बार नमूना लेकर हर बार अंतराल बनाएँ, तो लगभग 95% अंतराल असली मान को पकड़ेंगे। p स्थिर है; बदलता अंतराल है (चरण 4 की हरी और लाल पट्टियाँ देखो)।

अंतराल पतला कैसे करें

चाही गई त्रुटि सीमा E के लिए नमूना आकार (अनुपात, p = 0.5 मानकर): n ≈ (z*/(2E))²। E = 0.03, 95% पर: n ≈ (1.96/0.06)² ≈ 1068।

समूहों की तुलना और निष्कर्षों की परख

अनुमिति से दो समूहों की तुलना भी होती है, जैसे दो स्कूलों में पैदल आने वाले बच्चों का अनुपात।

साथ बदलना कारण नहीं है

गर्मी में आइसक्रीम की बिक्री और डूबने की घटनाएँ दोनों बढ़ती हैं। ये संबद्ध हैं, पर आइसक्रीम डूबने का कारण नहीं; गर्म मौसम दोनों को बढ़ाता है (भ्रामक/छिपा चर, confounding variable)। कारण सिर्फ़ यादृच्छिक प्रयोग से साबित होता है, जहाँ संयोग तय करता है कि किसे उपचार मिलेगा।

किसी दावे को परखने की सूची

  1. क्या नमूना यादृच्छिक था? कौन छूट गया?
  2. n कितना था? त्रुटि सीमा कितनी?
  3. सर्वे, प्रयोग या अवलोकन अध्ययन?
  4. निष्कर्ष सही समष्टि के बारे में है?
  5. क्या अंतर संयोग से ज़्यादा है?

घर पर करके देखो

एक थैली में 40 लाल और 60 दूसरे रंग की चीज़ें (बटन, मोती, पर्चियाँ) डालो। हिलाओ। बिना देखे 20 निकालो, लाल का हिस्सा लिखो, वापस डालो। 15 बार करो और बिंदु-आलेख बनाओ। बीच कहाँ है? अब 5-5 के नमूने लेकर दोहराओ। कौन-सा आलेख ज़्यादा फैला है? फिर ऊपर के 3D में स्लाइडर चलाकर मिलाओ।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. 80 विद्यार्थियों के यादृच्छिक नमूने में 28 साइकिल से स्कूल आते हैं। साइकिल वालों के अनुपात का बिंदु आकलन बताओ।

p̂ = 28 ÷ 80 = 0.35। सबसे अच्छा एक अंदाज़ा 35% है।

2. असली अनुपात p = 0.4 है। n = 100 और n = 400 के लिए p̂ की मानक त्रुटि निकालो।

n = 100: SE = √(0.4 × 0.6 / 100) = √0.0024 ≈ 0.049। n = 400: SE = √(0.24/400) ≈ 0.0245। चार गुना नमूना, आधी SE।

3. 500 वयस्कों के सर्वे में 210 फ़िटनेस ऐप चलाते हैं। असली अनुपात का 95% विश्वास्यता अंतराल बनाओ।

p̂ = 210/500 = 0.42। SE = √(0.42 × 0.58 / 500) ≈ 0.0221। त्रुटि सीमा = 1.96 × 0.0221 ≈ 0.043। अंतराल: (0.377, 0.463)। हमें 95% विश्वास है कि लगभग 37.7% से 46.3% वयस्क ऐसा ऐप चलाते हैं।

4. चावल के पैकेटों में σ = 8 g है। 64 पैकेटों का माध्य x̄ = 998 g है। μ का 95% अंतराल बनाओ। क्या "1000 g" का लेबल मानने लायक है?

SE = 8/√64 = 1 g। त्रुटि सीमा = 1.96 g। अंतराल: (996.04, 999.96) g। 1000 g ठीक बाहर है, तो लगता है माध्य 1000 g से थोड़ा कम है।

5. 95% विश्वास पर ±4% के अंदर अनुपात का आकलन करने के लिए कितना बड़ा नमूना चाहिए?

सुरक्षित मान p = 0.5 लो। n ≈ (1.96 / 0.08)² = 24.5² = 600.25। ऊपर गोल करो: n = 601।

6. दावा: p = 0.5। p = 0.5 से 40-40 के 200 सिमुलेटेड नमूनों में 0.30 या कम सिर्फ़ 3 बार आया। तुम्हारा असली नमूना 0.30 है। क्या दावा आँकड़ों से मेल खाता है?

ऐसा कम परिणाम 3/200 = 1.5% बार आया। दावा सच हो तो यह बहुत दुर्लभ है, इसलिए आँकड़े p = 0.5 से मेल नहीं खाते। असली अनुपात शायद कम है।

आम गलतियाँ

अभ्यास क्विज़

1. पूरी समष्टि के बारे में बताने वाली संख्या कहलाती है:
2. नमूना आकार 4 गुना करने पर मानक त्रुटि:
3. 95% विश्वास के लिए z* लगभग है:
4. किस नमूने में अभिनति की संभावना सबसे ज़्यादा है?
5. p का 95% अंतराल (0.31, 0.39) है। बिंदु आकलन p̂ है:

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

सांख्यिकीय अनुमिति आसान शब्दों में क्या है?

नमूने की जानकारी से पूरी समष्टि के बारे में सावधानी से बात कहना, साथ में यह बताना कि हम कितने पक्के हैं।

वर्णनात्मक और अनुमानात्मक सांख्यिकी में क्या अंतर है?

वर्णनात्मक सांख्यिकी सिर्फ़ मौजूद आँकड़ों का सार देती है (माध्य, आलेख)। अनुमानात्मक सांख्यिकी उन आँकड़ों से बड़ी समष्टि का आकलन या परीक्षण करती है।

95% अंतराल में 1.96 क्यों?

प्रसामान्य बंटन में 95% मान माध्य से 1.96 मानक विचलन के अंदर होते हैं, इसलिए p̂ ± 1.96 SE लगभग 95% बार असली मान पकड़ता है।

यह कहाँ पढ़ाया जाता है

नीदरलैंडHAVO 5 (eindexamenjaar)Statistics (part 2)
नीदरलैंडVWO 5Statistics and probability (part 2)
स्पेन1º BachilleratoStochastic Sense
स्पेन1º BachilleratoStochastic Sense
सीबीएसई (भारत)कक्षा 12अनुमानिक सांख्यिकी
अमेरिकाGrade 11Inferences and conclusions from data
अमेरिकाGrade 11Inferences and conclusions from data
जापान高校(専門学科)1〜3年Advanced Mathematics II

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी गणित पाठ