United Grade 12 AP Statistics
अध्याय: 5
1. Exploring One-Variable Data and Collecting Data
Introducing Statistics: What Can We Learn from Data? · Variables · Tabular Representation and Summary Statistics for One Categorical Variable · Graphical Representations for One Categorical Variable · Graphical Representations for One Quantitative Variable · Descriptions for One Quantitative Variable Distributions · Summary Statistics for One Quantitative Variable · Graphical Representations of Summary Statistics for One Quantitative Variable · Comparisons of the Distributions for One Quantitative Variable · The Investigative Question Revisited and Data Collection · Random Sampling · Potential Problems with Sampling · Experimental Design
- प्रकीर्णन की माप: परिसर, माध्य विचलन, प्रसरण और मानक विचलन – प्रकीर्णन का मतलब है फैलाव: मान बीच (केंद्र) से कितनी दूर हैं। परिसर = सबसे बड़ा − सबसे छोटा। माध्य विचलन = माध्य (या माध्यिका) से औसत दूरी। प्रसरण = माध्य से दूरियों के वर्गों का औसत। मानक विचलन = √प्रसरण। वर्गीकृत आँकड़ों में हर पद को बारंबारता f से गुणा करते हैं।
- प्रतिचयन: प्रतिदर्श से पूरी समष्टि को जानना – समष्टि (population) वह पूरा समूह है जिसके बारे में हम जानना चाहते हैं; प्रतिदर्श (sample) उसका छोटा भाग है जिसे हम सच में जाँचते हैं। अच्छा प्रतिदर्श यादृच्छिक रूप से चुना जाता है ताकि वह पूरी समष्टि जैसा दिखे। सरल यादृच्छिक प्रतिचयन में सबको बराबर मौका; स्तरीकृत में हर समूह से सही हिस्सा; क्रमबद्ध में हर k-वाँ सदस्य। अलग-अलग प्रतिदर्श थोड़े अलग उत्तर देते हैं (प्रतिचयन-विचलन), पर बड़े प्रतिदर्श कम डगमगाते हैं (बड़ी संख्याओं का नियम)। पक्षपाती प्रतिदर्श कितना भी बड़ा हो, ग़लत उत्तर देता है।
- वैज्ञानिक विधि – वैज्ञानिक विधि वह सावधान तरीका है जिससे वैज्ञानिक पता लगाते हैं कि दुनिया कैसे चलती है। कुछ देखो (प्रेक्षण), परखने लायक प्रश्न पूछो, परिकल्पना बनाओ (साफ़, परखने योग्य अनुमान), निष्पक्ष प्रयोग से परखो (एक चर बदलो, एक मापो, बाकी सब एक जैसा), दोहराओ और आँकड़े लिखो, विश्लेषण करो, निष्कर्ष निकालो और साझा करो ताकि दूसरे जाँच सकें। जो नतीजे परिकल्पना से मेल न खाएँ, वे भी काम के हैं: वे नई परिकल्पना की ओर ले जाते हैं।
2. Probability, Random Variables, and Probability Distributions
Tabular and Graphical Representations for the Distributions of Two Categorical Variables · Summary Statistics for Two Categorical Variables · Estimating Probabilities Using Simulation · Introduction to Probability · Mutually Exclusive Events · Conditional Probability · Independent Events and Unions of Events · Introduction to Random Variables and Probability Distributions · Parameters of Random Variables · The Binomial Distribution · The Normal Distribution · Sampling Distributions and the Central Limit Theorem
- दो-तरफ़ा सारणी (Two-Way Table) – दो-तरफ़ा सारणी दो श्रेणीगत चरों की गिनती एक साथ दिखाती है: एक चर पंक्तियों में, दूसरा स्तंभों में। पंक्ति और स्तंभ के योग सीमांत योग हैं। खाने को कुल योग से भाग दो तो संयुक्त सापेक्ष बारंबारता; उसकी पंक्ति (या स्तंभ) के योग से भाग दो तो सशर्त सापेक्ष बारंबारता। अगर समूहों के सशर्त प्रतिशत बहुत अलग हों, तो चरों में संबंध है।
- अनुकरण (सिमुलेशन) से प्रायिकता का अनुमान – अनुकरण (simulation) यादृच्छिक संख्याओं से किसी संयोग वाली प्रक्रिया की नक़ल करता है, ताकि मुश्किल प्रायिकता का अनुमान लग सके। योजना: प्रश्न लिखो, हर परिणाम को उसकी प्रायिकता के हिसाब से अंक दो, एक प्रयास और घटना तय करो, फिर बहुत सारे प्रयास चलाओ। सापेक्ष बारंबारता (घटना की गिनती ÷ प्रयास) अनुमान है, और प्रयास बढ़ने पर यह सही प्रायिकता के पास आती है (बड़ी संख्याओं का नियम)।
- प्रायिकता: घटनाएँ, घटनाओं का बीजगणित और अभिगृहीत – घटना प्रतिदर्श समष्टि S का कोई भी उपसमुच्चय है। घटनाओं A और B से नई घटनाएँ बनती हैं: A नहीं (A′), A और B (A ∩ B), A या B (A ∪ B)। कोई साझा परिणाम न हो तो घटनाएँ परस्पर अपवर्जी, और मिलकर पूरा S बनाएँ तो निःशेष। अभिगृहीत: हर P(E) ≥ 0, P(S) = 1, और परस्पर अपवर्जी A, B के लिए P(A ∪ B) = P(A) + P(B)। इनसे P(A′) = 1 − P(A) और P(A ∪ B) = P(A) + P(B) − P(A ∩ B) मिलते हैं।
- सप्रतिबंध प्रायिकता, गुणन नियम और स्वतंत्र घटनाएँ – सप्रतिबंध प्रायिकता का मतलब है: जब हमें पहले से पता हो कि घटना B हो चुकी है, तब A का मौका। B के बाहर के सारे परिणाम हटाओ और फिर से गिनो: P(A|B) = P(A ∩ B) ÷ P(B)। इसी से गुणन नियम मिलता है: P(A ∩ B) = P(B)·P(A|B)। अगर B जानकर A का मौका न बदले, तो घटनाएँ स्वतंत्र हैं और P(A ∩ B) = P(A)·P(B)।
- यादृच्छिक चर और प्रायिकता बंटन – यादृच्छिक चर (random variable) X किसी संयोग वाले प्रयोग के हर परिणाम को एक संख्या देता है। असतत (discrete) यादृच्छिक चर अलग-अलग मान लेता है; उसका प्रायिकता बंटन हर मान x और उसकी प्रायिकता P(X = x) बताता है, जिनका जोड़ 1 होता है। माध्य (प्रत्याशित मान) E(X) = Σ x·P(x) है। प्रसरण Var(X) = E(X²) − [E(X)]² फैलाव मापता है, और मानक विचलन इसका वर्गमूल है।
- द्विपद बंटन (Binomial Distribution) – एक ही हाँ/ना वाला प्रयोग n बार दोहराओ, हर बार स्वतंत्र रूप से और हर बार सफलता की प्रायिकता p बराबर। तब सफलताओं की संख्या X द्विपद बंटन B(n, p) मानती है: P(X = k) = ⁿCₖ pᵏ qⁿ⁻ᵏ, जहाँ q = 1 − p। माध्य np और प्रसरण npq होता है।
- प्रसामान्य बंटन (Normal Distribution) – प्रसामान्य बंटन एक सतत, सममित, घंटी जैसा बंटन है जो माध्य μ (केंद्र) और मानक विचलन σ (फैलाव) से तय होता है: X ~ N(μ, σ²)। माध्य = माध्यिका = बहुलक। लगभग 68% मान μ से 1σ के भीतर, 95% 2σ के भीतर और 99.7% 3σ के भीतर होते हैं। किसी भी मान को मानक स्कोर z = (x − μ)/σ में बदलते हैं, जो N(0, 1) का पालन करता है; प्रायिकता वक्र के नीचे का क्षेत्रफल है, जिसे तालिका या कैलकुलेटर से Φ(z) के रूप में पढ़ते हैं।
- प्रतिदर्श बंटन (Sampling Distribution) और केंद्रीय सीमा प्रमेय – नमूने से निकाली संख्या (जैसे नमूना माध्य x̄ या नमूना अनुपात p̂) हर नमूने में थोड़ी बदलती है। अगर हम बहुत सारे नमूने लें और हर बार यह संख्या लिखें, तो जो पैटर्न बनता है वह उसका प्रतिदर्श बंटन है। इसका केंद्र असली मान (μ या p) होता है, फैलाव मानक त्रुटि (माध्य के लिए σ/√n, अनुपात के लिए √(p(1−p)/n)) होता है, और केंद्रीय सीमा प्रमेय के अनुसार बड़ा n होने पर इसका आकार लगभग सामान्य (घंटी जैसा) हो जाता है।
3. Inference for Categorical Data: Proportions
Estimators · Sampling Distributions for Sample Proportions · Constructing a Confidence Interval for a Population Proportion · Justifying a Claim Based on a Confidence Interval for a Population Proportion · Setting Up a Test for a Population Proportion · p-Values · Carrying Out a Test for a Population Proportion · Potential Errors When Performing Tests · Sampling Distributions for the Difference Between Sample Proportions · Constructing a Confidence Interval for the Difference Between Two Population Proportions · Justifying a Claim Based on a Confidence Interval for the Difference Between Two Population Proportions · Setting Up a Test for the Difference Between Two Population Proportions · Carrying Out a Test for the Difference Between Two Population Proportions · Setting Up a Chi-Square Test for Homogeneity or Independence · Carrying Out a Chi-Square Test for Homogeneity or Independence
- प्रतिदर्श बंटन (Sampling Distribution) और केंद्रीय सीमा प्रमेय – नमूने से निकाली संख्या (जैसे नमूना माध्य x̄ या नमूना अनुपात p̂) हर नमूने में थोड़ी बदलती है। अगर हम बहुत सारे नमूने लें और हर बार यह संख्या लिखें, तो जो पैटर्न बनता है वह उसका प्रतिदर्श बंटन है। इसका केंद्र असली मान (μ या p) होता है, फैलाव मानक त्रुटि (माध्य के लिए σ/√n, अनुपात के लिए √(p(1−p)/n)) होता है, और केंद्रीय सीमा प्रमेय के अनुसार बड़ा n होने पर इसका आकार लगभग सामान्य (घंटी जैसा) हो जाता है।
- विश्वास्यता अंतराल (Confidence Interval) – विश्वास्यता अंतराल किसी अज्ञात जनसंख्या संख्या (माध्य μ या अनुपात p) के लिए मानने लायक मानों की एक सीमा है, जो एक नमूने से निकाली जाती है। इसका रूप है: अनुमान ± त्रुटि सीमा, जहाँ त्रुटि सीमा = क्रांतिक मान × मानक त्रुटि। 95% स्तर का मतलब है कि यह तरीका लगभग 95% नमूनों में असली मान को पकड़ लेता है। ज़्यादा भरोसा चाहिए तो अंतराल चौड़ा होगा; नमूना बड़ा हो तो पतला। अगर कोई दावा अंतराल के बाहर है, तो आँकड़े उस दावे के ख़िलाफ़ सबूत देते हैं।
- परिकल्पना परीक्षण (Hypothesis Testing) – परिकल्पना परीक्षण नमूने (sample) से पूरी जनसंख्या के बारे में किसी दावे को जाँचता है। शुरुआत शून्य परिकल्पना H₀ (कोई बदलाव नहीं, जैसे p = 0.5) और वैकल्पिक परिकल्पना H₁ (जो हमें शक है, जैसे p > 0.5) से होती है। सार्थकता स्तर चुनो, जैसे 5%। अगर H₀ सच हो तो हमारा नतीजा (या उससे भी चरम) कितना संभव है, यही p-मान है। p-मान स्तर से कम हो या नतीजा क्रांतिक क्षेत्र में हो, तो H₀ अस्वीकार। वरना H₀ अस्वीकार करने का पर्याप्त प्रमाण नहीं। टाइप I त्रुटि: सच्ची H₀ को अस्वीकार करना; टाइप II: झूठी H₀ को अस्वीकार न करना।
- काई-वर्ग परीक्षण: स्वतंत्रता और समरूपता – काई-वर्ग (χ²) परीक्षण देखता है कि सारणी की गिनतियाँ संयोग से अपेक्षित गिनतियों से बहुत दूर तो नहीं हैं। E = पंक्ति योग × स्तंभ योग ÷ कुल योग, χ² = Σ (O − E)² ÷ E, df = (r − 1)(c − 1)। अगर χ² क्रांतिक मान से बड़ा हो (या p < सार्थकता स्तर), तो H0 (कोई संबंध नहीं) अस्वीकार। 2×2 सारणी में येट्स संशोधन (|O − E| − 0.5)² लेता है।
4. Inference for Quantitative Data: Means
Sampling Distributions for Sample Means · Constructing a Confidence Interval for a Population Mean or Population Mean Difference · Justifying a Claim Based on a Confidence Interval for a Population Mean or Population Mean Difference · Setting Up a Test for a Population Mean or Population Mean Difference · Carrying Out a Test for a Population Mean or Population Mean Difference · Sampling Distributions for the Difference Between Two Sample Means · Constructing a Confidence Interval for the Difference Between Two Population Means · Justifying a Claim Based on a Confidence Interval for the Difference Between Two Population Means · Setting Up a Test for the Difference Between Two Population Means · Carrying Out a Test for the Difference Between Two Population Means
- प्रतिदर्श बंटन (Sampling Distribution) और केंद्रीय सीमा प्रमेय – नमूने से निकाली संख्या (जैसे नमूना माध्य x̄ या नमूना अनुपात p̂) हर नमूने में थोड़ी बदलती है। अगर हम बहुत सारे नमूने लें और हर बार यह संख्या लिखें, तो जो पैटर्न बनता है वह उसका प्रतिदर्श बंटन है। इसका केंद्र असली मान (μ या p) होता है, फैलाव मानक त्रुटि (माध्य के लिए σ/√n, अनुपात के लिए √(p(1−p)/n)) होता है, और केंद्रीय सीमा प्रमेय के अनुसार बड़ा n होने पर इसका आकार लगभग सामान्य (घंटी जैसा) हो जाता है।
- विश्वास्यता अंतराल (Confidence Interval) – विश्वास्यता अंतराल किसी अज्ञात जनसंख्या संख्या (माध्य μ या अनुपात p) के लिए मानने लायक मानों की एक सीमा है, जो एक नमूने से निकाली जाती है। इसका रूप है: अनुमान ± त्रुटि सीमा, जहाँ त्रुटि सीमा = क्रांतिक मान × मानक त्रुटि। 95% स्तर का मतलब है कि यह तरीका लगभग 95% नमूनों में असली मान को पकड़ लेता है। ज़्यादा भरोसा चाहिए तो अंतराल चौड़ा होगा; नमूना बड़ा हो तो पतला। अगर कोई दावा अंतराल के बाहर है, तो आँकड़े उस दावे के ख़िलाफ़ सबूत देते हैं।
- परिकल्पना परीक्षण (Hypothesis Testing) – परिकल्पना परीक्षण नमूने (sample) से पूरी जनसंख्या के बारे में किसी दावे को जाँचता है। शुरुआत शून्य परिकल्पना H₀ (कोई बदलाव नहीं, जैसे p = 0.5) और वैकल्पिक परिकल्पना H₁ (जो हमें शक है, जैसे p > 0.5) से होती है। सार्थकता स्तर चुनो, जैसे 5%। अगर H₀ सच हो तो हमारा नतीजा (या उससे भी चरम) कितना संभव है, यही p-मान है। p-मान स्तर से कम हो या नतीजा क्रांतिक क्षेत्र में हो, तो H₀ अस्वीकार। वरना H₀ अस्वीकार करने का पर्याप्त प्रमाण नहीं। टाइप I त्रुटि: सच्ची H₀ को अस्वीकार करना; टाइप II: झूठी H₀ को अस्वीकार न करना।
5. Regression Analysis
Graphical Representations Between Two Quantitative Variables · Correlation · Linear Regression Models · Residuals · Least-Squares Regression
- सहसंबंध: प्रकीर्ण आरेख, कार्ल पियर्सन गुणांक और स्पीयरमैन कोटि सहसंबंध – सहसंबंध बताता है कि दो चर साथ-साथ कैसे बदलते हैं। दोनों साथ बढ़ें तो धनात्मक, एक बढ़े और दूसरा घटे तो ऋणात्मक, और कोई सीधा पैटर्न न हो तो शून्य। प्रकीर्ण आरेख इसे चित्र में दिखाता है। कार्ल पियर्सन का गुणांक r दिशा और ताक़त नापता है और हमेशा −1 से +1 के बीच रहता है। स्पीयरमैन का कोटि सहसंबंध R कोटियों (रैंक) से चलता है और सुंदरता या ईमानदारी जैसे गुणों पर भी काम करता है; समान कोटियों में छोटा सुधार जोड़ते हैं।