📘 CodingMarble Learn

डेटा साइंस: सवाल से परखे हुए मॉडल तक

डेटा साइंस का मतलब है डेटा, गणित और कंप्यूटर से सवालों के जवाब ढूँढना और अनुमान लगाना। हर प्रोजेक्ट एक चक्र में चलता है: साफ़ सवाल पूछो, डेटा इकट्ठा करो, उसे साफ़ करो (ग़लतियाँ ठीक करो या हटाओ), चार्ट और औसत से खोजो, मॉडल बनाओ, उसे परखो और नतीजा बताओ। मॉडल डेटा से सीखा गया एक आसान नियम है, जैसे अंक ≈ 35 + 7 × घंटे। अनुमान (रिग्रेशन) मॉडल संख्या देते हैं; वर्गीकरण मॉडल समूह बताते हैं। मॉडल को नए डेटा पर परखते हैं और सटीकता या ग़लती नापते हैं। डेटा साइंस सेहत, खेल, मौसम, दुकानों और खेती में काम आता है। असली प्रोजेक्ट अक्सर पहली बार में फ़ेल होते हैं, इसलिए धैर्य और जाँच ज़रूरी है।

🎬 कदम-दर-कदम कहानी

  1. हर डेटा साइंस प्रोजेक्ट एक चक्र में घूमता है। सवाल पूछो। डेटा इकट्ठा करो। साफ़ करो। खोजो। मॉडल बनाओ। रिपोर्ट दो। फिर नया सवाल।
  2. हर नीला बिंदु एक छात्र है: पढ़ाई के घंटे और अंक। लाल बिंदु 140 और माइनस 10 अंक दिखाते हैं। ये असंभव हैं, इसलिए इन्हें साफ़ कर देते हैं।
  3. अब बिंदुओं के बीच से एक रेखा गुज़रती है। यही रेखा मॉडल है। यह बताती है कि 6 घंटे पढ़ने पर लगभग 77 अंक आएँगे।
  4. दूसरा मॉडल संख्या नहीं बताता, छात्रों को समूहों में बाँटता है। हरा मतलब पास, नारंगी मतलब ख़तरा। काली रेखा सीमा है।
  5. हम मॉडल को 20 नए छात्रों पर परखते हैं। 17 डिब्बे हरे (सही) और 3 लाल (ग़लत) हैं। सटीकता 20 में से 17, यानी 85%।
  6. अब तुम्हारी बारी। ढलान का स्लाइडर खिसकाओ। औसत ग़लती पर नज़र रखो। वह रेखा ढूँढो जो बिंदुओं के सबसे पास हो।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

क्या डेटा साइंस सिर्फ़ चार्ट बनाना है?

नहीं। चार्ट एक चरण (खोज) है। डेटा साइंस सवाल से परखे मॉडल और रिपोर्ट तक जाता है। चरण 1 में पूरा घेरा देखो।

हर बिंदु को क्यों न रखें?

असंभव मान ग़लती से आते हैं और मॉडल को ग़लत दिशा में खींचते हैं। चरण 2 में लाल बिंदु हटते देखो।

रेखा 'अनुमान' कैसे लगाती है?

घंटों से ऊपर रेखा तक जाओ, फिर बगल में अंक पढ़ो। चरण 3 का पीला बिंदु: 6 घंटे → लगभग 77 अंक।

रिग्रेशन और वर्गीकरण में क्या फ़र्क़ है?

रिग्रेशन संख्या देता है (चरण 3); वर्गीकरण समूह बताता है (चरण 4, हरा या नारंगी)।

कैसे पता चले कि मॉडल अच्छा है?

नए डेटा पर परखो और गिनो कितने सही हुए। चरण 5 में 20 में से 17।

'सबसे अच्छी रेखा' क्या है?

वह रेखा जिसकी बिंदुओं से औसत दूरी सबसे कम हो। चरण 6 में स्लाइडर से ढूँढो।

डेटा साइंस क्या है?

डेटा वे तथ्य हैं जो हम दर्ज करते हैं: संख्याएँ, शब्द, तस्वीरें, क्लिक। डेटा साइंस सांख्यिकी (डेटा का गणित), कंप्यूटर और विषय की समझ से डेटा को काम के जवाबों में बदलने का हुनर है।

डेटा तब कीमती है जब वह किसी को बेहतर फ़ैसला लेने में मदद करे: क्या स्टॉक करें, फ़सल को कब पानी दें, किस मरीज़ को पहले देखें।

डेटा सँभालने का छोटा इतिहास

पहले लोग मिट्टी की पट्टियों और बही-खातों में डेटा रखते थे। फिर पंच कार्ड (लगभग 1890), कंप्यूटर डेटाबेस (1960–70 के दशक), स्प्रेडशीट (1980 के दशक), इंटरनेट और बिग डेटा (2000 के दशक) आए, और अब मशीन लर्निंग, जिसमें कंप्यूटर बड़े डेटा से पैटर्न सीखते हैं।

डेटा साइंस प्रोजेक्ट का चक्र

  1. सवाल: साफ़ सवाल लिखो। "क्या पढ़ाई का समय अंकों पर असर डालता है?"
  2. इकट्ठा करो: सर्वे, सेंसर, रिकॉर्ड, खुले डेटासेट।
  3. साफ़ करो: असंभव मान हटाओ, टाइपिंग की ग़लतियाँ ठीक करो, छूटे डेटा को सँभालो, दोहराव हटाओ।
  4. खोजो: चार्ट बनाओ, औसत और पैटर्न ढूँढो।
  5. मॉडल: ऐसा नियम बनाओ जो समझाए या अनुमान लगाए।
  6. रिपोर्ट: चार्ट और आसान शब्दों में नतीजे बताओ, और सीमाएँ भी बताओ।

चक्र दोहराता है: जवाब से अक्सर बेहतर सवाल निकलता है।

मॉडल और उनका नतीजा

मॉडल डेटा से सीखा गया आसान नियम है।

मॉडल का नतीजा पढ़ते समय पूछो: हर संख्या का मतलब क्या है, किस इकाई में? ढलान 7 का मतलब है हर एक घंटा और पढ़ने पर लगभग 7 अंक बढ़ते हैं।

मॉडलों की तुलना और जाँच

मॉडल को हमेशा ऐसे नए डेटा पर परखो जिससे उसने सीखा नहीं।

बेहतर मॉडल वह है जिसकी नए डेटा पर सटीकता ज़्यादा या ग़लती कम हो। जो मॉडल पुराने डेटा पर पूरा सही पर नए पर कमज़ोर हो, उसने ओवरफ़िट किया है: उसने रटा, समझा नहीं।

उपयोग, नैतिकता और लगन

उपयोग: सेहत (बीमारी पकड़ना), खेल (खिलाड़ियों की रणनीति), खेती (बारिश और कीट की चेतावनी), यातायात, व्यापार (स्टॉक और दाम), विज्ञान (जलवायु अध्ययन)।

नैतिकता: निजता बचाओ, अनुमति लो, और देखो कि डेटा निष्पक्ष है। पक्षपाती डेटा से सीखा मॉडल पक्षपाती जवाब देता है।

लगन: असली डेटा गड़बड़ होता है। मॉडल अक्सर पहली बार फ़ेल होते हैं। अच्छे डेटा वैज्ञानिक फिर कोशिश करते हैं, एक बार में एक बदलाव परखते हैं और जो सीखा उसे लिखते हैं।

घर पर करके देखो

10 दोस्तों से पूछो कि कल रात कितने घंटे सोए और आज कितना ताज़ा महसूस कर रहे हैं (1–10 अंक)। तालिका में लिखो। असंभव मान (जैसे 30 घंटे) हटाओ। ग्राफ़ पेपर पर बिंदु लगाओ और बीच से एक रेखा खींचो। रेखा से 7 घंटे की नींद के लिए अंक का अनुमान लगाओ। फिर दो और दोस्तों से पूछो और देखो तुम्हारा अनुमान कितना पास था।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. मॉडल अंक ≈ 35 + 7 × घंटे से 4 घंटे पढ़ाई के अंक का अनुमान लगाओ।

35 + 7 × 4 = 35 + 28 = 63 अंक।

2. स्पैम फ़िल्टर ने 200 ईमेल में से 184 सही पहचाने। सटीकता?

184 ÷ 200 × 100% = 92%।

3. मॉडल ने 60, 72 और 80 अंक बताए। असली अंक 64, 70 और 85 थे। औसत ग़लती?

ग़लतियाँ: |64 − 60| = 4, |70 − 72| = 2, |85 − 80| = 5। औसत = (4 + 2 + 5) ÷ 3 = 11 ÷ 3 ≈ 3.7 अंक।

4. मॉडल A: पुराने डेटा पर 90%, नए पर 70%। मॉडल B: 82% और 80%। कौन-सा लें?

मॉडल B। यह नए डेटा पर भी लगभग उतना ही अच्छा है। A ने ओवरफ़िट किया: पुराना डेटा रट लिया।

आम गलतियाँ

अभ्यास क्विज़

1. डेटा साइंस प्रोजेक्ट में सबसे पहले क्या आता है?
2. असंभव मान और दोहराव हटाने को कहते हैं…
3. जो मॉडल 'स्पैम' या 'स्पैम नहीं' बताए, वह है…
4. 20 में से 17 सही की सटीकता…
5. ओवरफ़िटिंग का मतलब है मॉडल ने…

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

डेटा साइंस आसान शब्दों में क्या है?

डेटा, गणित और कंप्यूटर से सवालों के जवाब और अनुमान निकालना, ताकि लोग बेहतर फ़ैसले ले सकें।

डेटा साइंस प्रक्रिया के चरण क्या हैं?

सवाल पूछो, डेटा इकट्ठा करो, साफ़ करो, खोजो, मॉडल बनाकर परखो, फिर नतीजे बताओ।

डेटा साइंस और बिग डेटा में क्या फ़र्क़ है?

बिग डेटा बहुत बड़े, तेज़ और तरह-तरह के डेटा को कहते हैं। डेटा साइंस किसी भी आकार के डेटा से जवाब निकालने का तरीका है।

यह कहाँ पढ़ाया जाता है

दक्षिण कोरिया고등학교 2학년Understanding data science
दक्षिण कोरिया고등학교 2학년Modelling and evaluation
दक्षिण कोरिया고등학교 2학년Data science project
चीन高二Sel.3 Data management and analysis

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी कंप्यूटर विज्ञान पाठ