South 고등학교 2학년 Data Science
अध्याय: 4
1. Understanding data science
What data science is · Structured and unstructured data · Databases · Data and social change
- डेटा साइंस: सवाल से परखे हुए मॉडल तक – डेटा साइंस का मतलब है डेटा, गणित और कंप्यूटर से सवालों के जवाब ढूँढना और अनुमान लगाना। हर प्रोजेक्ट एक चक्र में चलता है: साफ़ सवाल पूछो, डेटा इकट्ठा करो, उसे साफ़ करो (ग़लतियाँ ठीक करो या हटाओ), चार्ट और औसत से खोजो, मॉडल बनाओ, उसे परखो और नतीजा बताओ। मॉडल डेटा से सीखा गया एक आसान नियम है, जैसे अंक ≈ 35 + 7 × घंटे। अनुमान (रिग्रेशन) मॉडल संख्या देते हैं; वर्गीकरण मॉडल समूह बताते हैं। मॉडल को नए डेटा पर परखते हैं और सटीकता या ग़लती नापते हैं। डेटा साइंस सेहत, खेल, मौसम, दुकानों और खेती में काम आता है। असली प्रोजेक्ट अक्सर पहली बार में फ़ेल होते हैं, इसलिए धैर्य और जाँच ज़रूरी है।
- आँकड़ों का प्रबंधन: इकट्ठा करो, व्यवस्थित करो, दिखाओ – आँकड़े (डेटा) तथ्यों का समूह हैं, जैसे जवाब, गिनती या माप। आँकड़े गुणात्मक (शब्द) या मात्रात्मक (संख्या) होते हैं; संख्याएँ असतत (गिनी हुई) या सतत (नापी हुई) होती हैं। हम सर्वे, अवलोकन, प्रयोग या पहले से मौजूद स्रोतों से आँकड़े इकट्ठा करते हैं, फिर मिलान चिह्नों से बारंबारता सारणी बनाते हैं। सही आलेख चुनते हैं: तुलना के लिए दंड आलेख, पूरे के हिस्सों के लिए पाई चार्ट, समय के साथ बदलाव के लिए रेखा आलेख, दो चीज़ों के रिश्ते के लिए बिंदु आलेख। कंप्यूटर डेटा को संरचित सारणी या असंरचित पाठ, चित्र और आवाज़ के रूप में रखते हैं।
- डेटाबेस संकल्पनाएँ: DBMS, रिलेशन और की – अलग-अलग फ़ाइलों में डेटा रखने से दोहराव, असंगति और कमज़ोर सुरक्षा होती है। डेटाबेस संबंधित डेटा को एक व्यवस्थित जगह रखता है, और DBMS (जैसे MySQL) उसे सँभालने वाला सॉफ़्टवेयर है। रिलेशनल मॉडल में डेटा तालिकाओं (रिलेशन) में रहता है, जिनमें स्तंभ (एट्रिब्यूट) और पंक्तियाँ (टपल) होती हैं; डोमेन किसी स्तंभ के अनुमत मानों का समूह है। कैंडिडेट की हर पंक्ति को अलग पहचानती है; उनमें से एक प्राइमरी की चुनी जाती है और बाकी ऑल्टरनेट की होती हैं।
- डिजिटल समाज: सूचना तकनीक हमारी ज़िंदगी कैसे बदलती है – डिजिटल समाज (सूचना समाज) वह समाज है जहाँ कंप्यूटर और नेटवर्क से जानकारी बनाना, बाँटना और इस्तेमाल करना ज़िंदगी, काम और सरकार का मुख्य हिस्सा है। जानकारी तेज़ चलती है, हर जगह पहुँचती है और लगभग मुफ़्त में कॉपी हो जाती है। सॉफ़्टवेयर ने ख़रीदारी, बैंकिंग, इलाज, पढ़ाई और दोस्ती बदल दी। नई नौकरियाँ आईं (ऐप डेवलपर, डेटा विश्लेषक), कुछ पुरानी घटीं। हर ऑनलाइन काम डेटा छोड़ता है, इसलिए निजता ज़रूरी है। सब लोग जुड़े नहीं हैं (डिजिटल खाई), और ज़्यादा स्क्रीन या गेमिंग सेहत बिगाड़ सकती है। अच्छा डिजिटल नागरिक फ़ायदे लेता है और ख़तरे सँभालता है।
2. Preparing and analysing data
Unbiased data collection · Outliers, missing values, normalisation · Transforming data for analysis · Different analyses of the same data
- प्रतिचयन: प्रतिदर्श से पूरी समष्टि को जानना – समष्टि (population) वह पूरा समूह है जिसके बारे में हम जानना चाहते हैं; प्रतिदर्श (sample) उसका छोटा भाग है जिसे हम सच में जाँचते हैं। अच्छा प्रतिदर्श यादृच्छिक रूप से चुना जाता है ताकि वह पूरी समष्टि जैसा दिखे। सरल यादृच्छिक प्रतिचयन में सबको बराबर मौका; स्तरीकृत में हर समूह से सही हिस्सा; क्रमबद्ध में हर k-वाँ सदस्य। अलग-अलग प्रतिदर्श थोड़े अलग उत्तर देते हैं (प्रतिचयन-विचलन), पर बड़े प्रतिदर्श कम डगमगाते हैं (बड़ी संख्याओं का नियम)। पक्षपाती प्रतिदर्श कितना भी बड़ा हो, ग़लत उत्तर देता है।
- डेटा विश्लेषण – डेटा विश्लेषण यानी कच्चे आँकड़ों को जवाब में बदलना। इसका एक चक्र है: सवाल पूछो, डेटा इकट्ठा करो, साफ़ करो (ग़लती, दोहराव और खाली जवाब हटाओ), व्यवस्थित करो, माध्य, माध्यिका, परास और पैटर्न से विश्लेषण करो, सही चार्ट बनाओ और सावधानी से निष्कर्ष निकालो। बाहरी मान, छोटे नमूने और पक्षपात पर नज़र रखो, और याद रखो कि दो चीज़ों का साथ बढ़ना (सहसंबंध) यह साबित नहीं करता कि एक दूसरे का कारण है। डेटा को सुरक्षित रखना और अनुमति से इस्तेमाल करना भी ज़रूरी है।
3. Modelling and evaluation
Data models · Regression models · Similarity and clustering · Correlation and relationships · Model outputs by method · Comparing and evaluating models
- डेटा साइंस: सवाल से परखे हुए मॉडल तक – डेटा साइंस का मतलब है डेटा, गणित और कंप्यूटर से सवालों के जवाब ढूँढना और अनुमान लगाना। हर प्रोजेक्ट एक चक्र में चलता है: साफ़ सवाल पूछो, डेटा इकट्ठा करो, उसे साफ़ करो (ग़लतियाँ ठीक करो या हटाओ), चार्ट और औसत से खोजो, मॉडल बनाओ, उसे परखो और नतीजा बताओ। मॉडल डेटा से सीखा गया एक आसान नियम है, जैसे अंक ≈ 35 + 7 × घंटे। अनुमान (रिग्रेशन) मॉडल संख्या देते हैं; वर्गीकरण मॉडल समूह बताते हैं। मॉडल को नए डेटा पर परखते हैं और सटीकता या ग़लती नापते हैं। डेटा साइंस सेहत, खेल, मौसम, दुकानों और खेती में काम आता है। असली प्रोजेक्ट अक्सर पहली बार में फ़ेल होते हैं, इसलिए धैर्य और जाँच ज़रूरी है।
- रैखिक समाश्रयण और न्यूनतम वर्ग रेखा – रैखिक समाश्रयण जोड़े वाले आँकड़ों (x, y) के लिए सबसे अच्छी सीधी रेखा ŷ = a + bx ढूँढता है। किसी असली बिंदु और रेखा के बीच का अंतर अवशिष्ट (residual) है: e = y − ŷ। न्यूनतम वर्ग रेखा वह है जिसमें अवशिष्टों के वर्गों का योग सबसे कम हो। ढाल b = Sxy ÷ Sxx और रेखा हमेशा माध्य बिंदु (x̄, ȳ) से गुज़रती है। इससे x से y का अनुमान लगाते हैं, पर सिर्फ़ आँकड़ों की सीमा के अंदर। मज़बूत संबंध का मतलब यह नहीं कि x ही y का कारण है।
- सहसंबंध: प्रकीर्ण आरेख, कार्ल पियर्सन गुणांक और स्पीयरमैन कोटि सहसंबंध – सहसंबंध बताता है कि दो चर साथ-साथ कैसे बदलते हैं। दोनों साथ बढ़ें तो धनात्मक, एक बढ़े और दूसरा घटे तो ऋणात्मक, और कोई सीधा पैटर्न न हो तो शून्य। प्रकीर्ण आरेख इसे चित्र में दिखाता है। कार्ल पियर्सन का गुणांक r दिशा और ताक़त नापता है और हमेशा −1 से +1 के बीच रहता है। स्पीयरमैन का कोटि सहसंबंध R कोटियों (रैंक) से चलता है और सुंदरता या ईमानदारी जैसे गुणों पर भी काम करता है; समान कोटियों में छोटा सुधार जोड़ते हैं।
4. Data science project
Applications by field · Exploratory data analysis · Combining several datasets · Persistence with hard problems · Full project cycle
- डेटा साइंस: सवाल से परखे हुए मॉडल तक – डेटा साइंस का मतलब है डेटा, गणित और कंप्यूटर से सवालों के जवाब ढूँढना और अनुमान लगाना। हर प्रोजेक्ट एक चक्र में चलता है: साफ़ सवाल पूछो, डेटा इकट्ठा करो, उसे साफ़ करो (ग़लतियाँ ठीक करो या हटाओ), चार्ट और औसत से खोजो, मॉडल बनाओ, उसे परखो और नतीजा बताओ। मॉडल डेटा से सीखा गया एक आसान नियम है, जैसे अंक ≈ 35 + 7 × घंटे। अनुमान (रिग्रेशन) मॉडल संख्या देते हैं; वर्गीकरण मॉडल समूह बताते हैं। मॉडल को नए डेटा पर परखते हैं और सटीकता या ग़लती नापते हैं। डेटा साइंस सेहत, खेल, मौसम, दुकानों और खेती में काम आता है। असली प्रोजेक्ट अक्सर पहली बार में फ़ेल होते हैं, इसलिए धैर्य और जाँच ज़रूरी है।
- डेटा विश्लेषण – डेटा विश्लेषण यानी कच्चे आँकड़ों को जवाब में बदलना। इसका एक चक्र है: सवाल पूछो, डेटा इकट्ठा करो, साफ़ करो (ग़लती, दोहराव और खाली जवाब हटाओ), व्यवस्थित करो, माध्य, माध्यिका, परास और पैटर्न से विश्लेषण करो, सही चार्ट बनाओ और सावधानी से निष्कर्ष निकालो। बाहरी मान, छोटे नमूने और पक्षपात पर नज़र रखो, और याद रखो कि दो चीज़ों का साथ बढ़ना (सहसंबंध) यह साबित नहीं करता कि एक दूसरे का कारण है। डेटा को सुरक्षित रखना और अनुमति से इस्तेमाल करना भी ज़रूरी है।