डेटा विज्ञान पद्धति क्या है?
डेटा विज्ञान डेटा से प्रश्नों के उत्तर और अनुमान निकालता है। पद्धति तय चरणों का क्रम है जिससे कोई ज़रूरी काम न छूटे। आम डेटा विज्ञान पद्धति में 10 चरण चक्र की तरह होते हैं। यही AI कैपस्टोन प्रोजेक्ट की रीढ़ है।
- व्यावसायिक समझ (समस्या)
- विश्लेषण का तरीका
- डेटा की ज़रूरतें
- डेटा संग्रह
- डेटा की समझ
- डेटा की तैयारी
- मॉडलिंग
- मूल्यांकन
- लागू करना (डिप्लॉयमेंट)
- प्रतिक्रिया (फ़ीडबैक)
चरण पीछे भी लौट सकते हैं। जैसे, डेटा समझने पर पता चले कि और डेटा चाहिए, तो संग्रह पर लौटते हैं।
समस्या से तरीके तक
1. व्यावसायिक समझ
समस्या को एक साफ़ प्रश्न में लिखें। उत्तर कौन उपयोग करेगा? सफलता कैसे मापेंगे? 5W1H प्रश्न (कौन, क्या, कहाँ, कब, क्यों, कैसे) मदद करते हैं।
2. विश्लेषण का तरीका
- वर्गीकरण: एक श्रेणी (स्पैम या नहीं)।
- रिग्रेशन: एक संख्या (कल की बिक्री)।
- क्लस्टरिंग: बिना लेबल के प्राकृतिक समूह (ग्राहकों के प्रकार)।
- वर्णनात्मक: क्या हुआ (चार्ट और औसत)।
डेटा की ज़रूरतें, संग्रह, समझ और तैयारी
3. डेटा की ज़रूरतें
कौन-से फ़ीचर (कॉलम), कितनी पंक्तियाँ, किस रूप में और किस समय का डेटा चाहिए, यह लिखें।
4. डेटा संग्रह
रिकॉर्ड, सेंसर, सर्वे, वेबसाइट या खुले डेटासेट से डेटा लें। अनुमति लें और निजी डेटा सुरक्षित रखें।
5. डेटा की समझ
औसत, न्यूनतम, अधिकतम, चार्ट और सहसंबंध से देखें कि डेटा पूरा और समझदार है।
6. डेटा की तैयारी
अक्सर सबसे लंबा चरण। दोहराव हटाएँ, ख़ाली मान संभालें (औसत से भरें या पंक्ति हटाएँ), असंभव मान सुधारें, टेक्स्ट को संख्या में बदलें और नए उपयोगी फ़ीचर बनाएँ (फ़ीचर इंजीनियरिंग)।
मॉडलिंग, वैलिडेशन और मूल्यांकन
7. मॉडलिंग
डिसीज़न ट्री या लीनियर रिग्रेशन जैसा मॉडल सिखाएँ। निष्पक्ष जाँच के लिए कुछ डेटा उससे छिपाना ज़रूरी है।
- ट्रेन-टेस्ट स्प्लिट: अक्सर 80% प्रशिक्षण, 20% परीक्षण।
- k-फ़ोल्ड क्रॉस-वैलिडेशन: डेटा को k बराबर भागों में बाँटें। k − 1 भागों पर सिखाएँ, बचे एक पर जाँचें; यह k बार करें, हर भाग एक बार परीक्षण बने। k अंकों का औसत लें। कम डेटा में यह भरोसेमंद अंक देता है।
8. मूल्यांकन
वर्गीकरण के लिए सटीकता = सही अनुमान ÷ कुल अनुमान (और कन्फ़्यूज़न मैट्रिक्स)। रिग्रेशन के लिए त्रुटि:
MSE (माध्य वर्ग त्रुटि) = (वास्तविक − अनुमानित)² का औसत
RMSE = √MSE, डेटा की ही इकाई में। जितना छोटा, उतना अच्छा।
उदाहरण: वास्तविक 3, 5, 2; अनुमानित 2, 5, 4। त्रुटियाँ 1, 0, −2; वर्ग 1, 0, 4। MSE = 5 ÷ 3 ≈ 1.67; RMSE ≈ 1.29।
डिप्लॉयमेंट, फ़ीडबैक और कैपस्टोन प्रोजेक्ट
9. लागू करना
मॉडल को काम में लगाएँ: ऐप, वेबसाइट या रिपोर्ट में जिसे लोग उपयोग करें।
10. प्रतिक्रिया
असली उपयोग के नतीजे लें। दुनिया बदले (नया मेन्यू, नई क़ीमतें) तो मॉडल कमज़ोर होता है, इसलिए दोबारा सिखाते हैं। फ़ीडबैक से डेटा विज्ञान सीधी रेखा नहीं, चक्र बनता है।
कैपस्टोन प्रोजेक्ट में उपयोग
कैपस्टोन प्रोजेक्ट इन्हीं चरणों पर चलता है: असली समस्या चुनें, तरीका बताएँ, डेटा जुटाएँ और साफ़ करें, मॉडल बनाकर जाँचें, नतीजे दिखाएँ, और सीमाएँ व नैतिकता (पक्षपात, निजता) समझाएँ।
करके देखें: 3D में और घर पर
खुले खेल में हर चरण दबाएँ और ज़ोर से बताएँ कि स्कूल कैंटीन के लिए आप क्या करेंगे। स्लाइडर हिलाएँ: 50% प्रशिक्षण में मॉडल कम डेटा से सीखता है; 90% में परीक्षण बहुत छोटा रह जाता है। 70 से 80% आम क्यों है?
घर पर: छोटा प्रोजेक्ट बनाएँ, "हफ़्ते के किस दिन घर में सबसे ज़्यादा दूध लगता है?" 10 चरण काग़ज़ पर लिखें, दो हफ़्ते डेटा जुटाएँ, फिर अपना अनुमान जाँचें।
मुख्य सूत्र और परिभाषाएँ
- सटीकता = सही अनुमान ÷ कुल अनुमान
- त्रुटि = वास्तविक − अनुमानित
- MSE = (1/n) Σ (वास्तविक − अनुमानित)²
- RMSE = √MSE
- k-फ़ोल्ड क्रॉस-वैलिडेशन: k दौर; हर दौर k − 1 भाग पर प्रशिक्षण, 1 पर परीक्षण; अंतिम अंक = औसत
हल किए गए उदाहरण
1. बैंक जानना चाहता है कि आवेदक ऋण लौटाएगा या नहीं। कौन-सा तरीका ठीक है?
उत्तर एक श्रेणी है (लौटाएगा / नहीं), इसलिए वर्गीकरण।
2. 1,000 पंक्तियों का डेटा 80:20 में बाँटें। प्रशिक्षण और परीक्षण में कितनी पंक्तियाँ?
प्रशिक्षण = 800, परीक्षण = 200।
3. वास्तविक 10, 12, 8; अनुमानित 11, 12, 6। MSE और RMSE ज्ञात करें।
त्रुटियाँ −1, 0, 2। वर्ग 1, 0, 4। MSE = 5 ÷ 3 ≈ 1.67। RMSE ≈ 1.29।
4. 500 पंक्तियों पर 5-फ़ोल्ड क्रॉस-वैलिडेशन में हर दौर में कितनी पंक्तियाँ परखी जाती हैं और कितने दौर होते हैं?
500 ÷ 5 = 100 पंक्तियाँ हर दौर में, कुल 5 दौर।
5. मॉडल 50 में से 45 परीक्षण ईमेल सही पहचानता है। सटीकता?
45 ÷ 50 = 0.9 = 90%।
6. ट्रैफ़िक मॉडल पिछले साल अच्छा था, पर नई मेट्रो लाइन के बाद ग़लत अनुमान दे रहा है। कौन-सा चरण इसे ठीक करता है?
फ़ीडबैक: नया डेटा लें, तैयारी और मॉडलिंग दोहराएँ और मॉडल दोबारा सिखाएँ।
आम गलतियाँ
- मॉडल को उसी डेटा पर परखना जिस पर सिखाया। अंक अच्छे दिखते हैं पर बेकार हैं; अनदेखा परीक्षण डेटा लें।
- साफ़ समस्या के बिना सीधे मॉडल पर कूदना। सटीक प्रश्न ही डेटा और तरीका तय करता है।
- डेटा की सफ़ाई छोड़ देना। दोहराव, ख़ाली और ग़लत मान मॉडल को ग़लत पैटर्न सिखाते हैं।
- सोचना कि डिप्लॉयमेंट पर काम ख़त्म। दुनिया बदलने पर मॉडल को फ़ीडबैक और दोबारा प्रशिक्षण चाहिए।