डेटा साइंस क्या है?
डेटा वे तथ्य हैं जो हम दर्ज करते हैं: संख्याएँ, शब्द, तस्वीरें, क्लिक। डेटा साइंस सांख्यिकी (डेटा का गणित), कंप्यूटर और विषय की समझ से डेटा को काम के जवाबों में बदलने का हुनर है।
डेटा तब कीमती है जब वह किसी को बेहतर फ़ैसला लेने में मदद करे: क्या स्टॉक करें, फ़सल को कब पानी दें, किस मरीज़ को पहले देखें।
डेटा सँभालने का छोटा इतिहास
पहले लोग मिट्टी की पट्टियों और बही-खातों में डेटा रखते थे। फिर पंच कार्ड (लगभग 1890), कंप्यूटर डेटाबेस (1960–70 के दशक), स्प्रेडशीट (1980 के दशक), इंटरनेट और बिग डेटा (2000 के दशक) आए, और अब मशीन लर्निंग, जिसमें कंप्यूटर बड़े डेटा से पैटर्न सीखते हैं।
डेटा साइंस प्रोजेक्ट का चक्र
- सवाल: साफ़ सवाल लिखो। "क्या पढ़ाई का समय अंकों पर असर डालता है?"
- इकट्ठा करो: सर्वे, सेंसर, रिकॉर्ड, खुले डेटासेट।
- साफ़ करो: असंभव मान हटाओ, टाइपिंग की ग़लतियाँ ठीक करो, छूटे डेटा को सँभालो, दोहराव हटाओ।
- खोजो: चार्ट बनाओ, औसत और पैटर्न ढूँढो।
- मॉडल: ऐसा नियम बनाओ जो समझाए या अनुमान लगाए।
- रिपोर्ट: चार्ट और आसान शब्दों में नतीजे बताओ, और सीमाएँ भी बताओ।
चक्र दोहराता है: जवाब से अक्सर बेहतर सवाल निकलता है।
मॉडल और उनका नतीजा
मॉडल डेटा से सीखा गया आसान नियम है।
- अनुमान (रिग्रेशन) संख्या देता है: अंक, दाम, तापमान। उदाहरण: अंक ≈ 35 + 7 × घंटे।
- वर्गीकरण (classification) समूह बताता है: स्पैम या नहीं, पास या ख़तरा, स्वस्थ या बीमार।
- क्लस्टरिंग ऐसे समूह ढूँढता है जिनका पहले नाम नहीं था, जैसे ग्राहकों के प्रकार।
मॉडल का नतीजा पढ़ते समय पूछो: हर संख्या का मतलब क्या है, किस इकाई में? ढलान 7 का मतलब है हर एक घंटा और पढ़ने पर लगभग 7 अंक बढ़ते हैं।
मॉडलों की तुलना और जाँच
मॉडल को हमेशा ऐसे नए डेटा पर परखो जिससे उसने सीखा नहीं।
- सटीकता (accuracy) (वर्गीकरण के लिए) = सही जवाब ÷ कुल × 100%।
- औसत ग़लती (अनुमान के लिए) = हर अनुमान असली मान से कितना दूर है, उसका औसत।
बेहतर मॉडल वह है जिसकी नए डेटा पर सटीकता ज़्यादा या ग़लती कम हो। जो मॉडल पुराने डेटा पर पूरा सही पर नए पर कमज़ोर हो, उसने ओवरफ़िट किया है: उसने रटा, समझा नहीं।
उपयोग, नैतिकता और लगन
उपयोग: सेहत (बीमारी पकड़ना), खेल (खिलाड़ियों की रणनीति), खेती (बारिश और कीट की चेतावनी), यातायात, व्यापार (स्टॉक और दाम), विज्ञान (जलवायु अध्ययन)।
नैतिकता: निजता बचाओ, अनुमति लो, और देखो कि डेटा निष्पक्ष है। पक्षपाती डेटा से सीखा मॉडल पक्षपाती जवाब देता है।
लगन: असली डेटा गड़बड़ होता है। मॉडल अक्सर पहली बार फ़ेल होते हैं। अच्छे डेटा वैज्ञानिक फिर कोशिश करते हैं, एक बार में एक बदलाव परखते हैं और जो सीखा उसे लिखते हैं।
घर पर करके देखो
10 दोस्तों से पूछो कि कल रात कितने घंटे सोए और आज कितना ताज़ा महसूस कर रहे हैं (1–10 अंक)। तालिका में लिखो। असंभव मान (जैसे 30 घंटे) हटाओ। ग्राफ़ पेपर पर बिंदु लगाओ और बीच से एक रेखा खींचो। रेखा से 7 घंटे की नींद के लिए अंक का अनुमान लगाओ। फिर दो और दोस्तों से पूछो और देखो तुम्हारा अनुमान कितना पास था।
मुख्य सूत्र और परिभाषाएँ
- प्रोजेक्ट चक्र: सवाल → इकट्ठा → साफ़ → खोज → मॉडल → रिपोर्ट
- रेखा मॉडल: y = a + b × x (b = ढलान = x में 1 बढ़ने पर y में बदलाव)
- सटीकता = सही ÷ कुल × 100%
- औसत ग़लती = |असली − अनुमान| का योग ÷ कुल संख्या
हल किए गए उदाहरण
1. मॉडल अंक ≈ 35 + 7 × घंटे से 4 घंटे पढ़ाई के अंक का अनुमान लगाओ।
35 + 7 × 4 = 35 + 28 = 63 अंक।
2. स्पैम फ़िल्टर ने 200 ईमेल में से 184 सही पहचाने। सटीकता?
184 ÷ 200 × 100% = 92%।
3. मॉडल ने 60, 72 और 80 अंक बताए। असली अंक 64, 70 और 85 थे। औसत ग़लती?
ग़लतियाँ: |64 − 60| = 4, |70 − 72| = 2, |85 − 80| = 5। औसत = (4 + 2 + 5) ÷ 3 = 11 ÷ 3 ≈ 3.7 अंक।
4. मॉडल A: पुराने डेटा पर 90%, नए पर 70%। मॉडल B: 82% और 80%। कौन-सा लें?
मॉडल B। यह नए डेटा पर भी लगभग उतना ही अच्छा है। A ने ओवरफ़िट किया: पुराना डेटा रट लिया।
आम गलतियाँ
- सफ़ाई छोड़ देना। 100 में से 140 जैसी एक टाइपिंग ग़लती पूरे मॉडल को ग़लत दिशा में खींच सकती है।
- मॉडल को उसी डेटा पर परखना जिससे उसने सीखा। हमेशा नए डेटा पर परखो।
- सोचना कि मॉडल हमेशा सही है। वह कुछ ग़लती के साथ सबसे अच्छा अनुमान देता है।
- अनुमान और वर्गीकरण को मिला देना। एक संख्या देता है, दूसरा समूह।