📘 CodingMarble Learn

डेटा विज्ञान पद्धति: समस्या से काम करते मॉडल तक

डेटा विज्ञान पद्धति डेटा से समस्या हल करने का चरण-दर-चरण चक्र है। इसके 10 चरण: व्यावसायिक समझ (समस्या), विश्लेषण का तरीका, डेटा की ज़रूरतें, डेटा संग्रह, डेटा की समझ, डेटा की तैयारी, मॉडलिंग, मूल्यांकन, लागू करना (डिप्लॉयमेंट) और प्रतिक्रिया (फ़ीडबैक)। डेटा को प्रशिक्षण और परीक्षण भागों में बाँटा जाता है (या k-फ़ोल्ड क्रॉस-वैलिडेशन से जाँचा जाता है) ताकि मॉडल अनदेखे डेटा पर परखा जाए। वर्गीकरण मॉडल सटीकता से और रिग्रेशन मॉडल MSE, RMSE जैसी त्रुटियों से आँके जाते हैं।

🎬 कदम-दर-कदम कहानी

  1. हर डेटा प्रोजेक्ट एक साफ़ समस्या से शुरू होता है। फिर तय करते हैं कि उत्तर किस प्रकार का चाहिए: वर्ग, संख्या या समूह।
  2. फिर तय करते हैं कौन-सा डेटा चाहिए, उसे जुटाते हैं और ध्यान से देखकर समझते हैं।
  3. असली डेटा गड़बड़ होता है। तैयारी में दोहराव हटाते हैं, ख़ाली मान भरते या हटाते हैं और ग़लत प्रविष्टियाँ ठीक करते हैं।
  4. मॉडलिंग में डेटा बाँटते हैं। मॉडल प्रशिक्षण वाले भाग से सीखता है। परीक्षण वाला भाग छिपा रहता है।
  5. परीक्षण डेटा पर मॉडल का मूल्यांकन करते हैं, उसे असली काम में लगाते हैं और फ़ीडबैक से सुधारते हैं। फिर चक्र दोहराता है।
  6. खुलकर खेलें: कोई भी चरण चुनें और देखें वहाँ क्या होता है, और प्रशिक्षण-परीक्षण बँटवारा बदलें।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

सीधे मॉडल से शुरू क्यों नहीं करते?

साफ़ प्रश्न के बिना पता नहीं कि कौन-सा डेटा या मॉडल चाहिए। चक्र समस्या से शुरू होता है।

कैसे जानें कि डेटा पर्याप्त है?

डेटा की समझ: मॉडलिंग से पहले गिनती, चार्ट और कमियाँ देखें।

पंक्तियाँ हटाना डेटा फेंकना नहीं है?

ग़लत या दोहराई पंक्तियाँ ग़लत पैटर्न सिखाती हैं। छोटा साफ़ डेटा बड़े गंदे डेटा से अच्छा है।

परीक्षण डेटा क्यों छिपाते हैं?

अनदेखे प्रश्नों वाली परीक्षा की तरह, यह दिखाता है कि मॉडल ने पैटर्न सीखा या बस रटा।

मॉडल लागू होते ही प्रोजेक्ट ख़त्म?

नहीं। फ़ीडबैक बताता है कब मॉडल कमज़ोर हुआ, और चक्र फिर शुरू होता है।

कितना बँटवारा रखें?

आमतौर पर 70:30 या 80:20। स्लाइडर से फ़र्क़ देखें।

डेटा विज्ञान पद्धति क्या है?

डेटा विज्ञान डेटा से प्रश्नों के उत्तर और अनुमान निकालता है। पद्धति तय चरणों का क्रम है जिससे कोई ज़रूरी काम न छूटे। आम डेटा विज्ञान पद्धति में 10 चरण चक्र की तरह होते हैं। यही AI कैपस्टोन प्रोजेक्ट की रीढ़ है।

  1. व्यावसायिक समझ (समस्या)
  2. विश्लेषण का तरीका
  3. डेटा की ज़रूरतें
  4. डेटा संग्रह
  5. डेटा की समझ
  6. डेटा की तैयारी
  7. मॉडलिंग
  8. मूल्यांकन
  9. लागू करना (डिप्लॉयमेंट)
  10. प्रतिक्रिया (फ़ीडबैक)

चरण पीछे भी लौट सकते हैं। जैसे, डेटा समझने पर पता चले कि और डेटा चाहिए, तो संग्रह पर लौटते हैं।

समस्या से तरीके तक

1. व्यावसायिक समझ

समस्या को एक साफ़ प्रश्न में लिखें। उत्तर कौन उपयोग करेगा? सफलता कैसे मापेंगे? 5W1H प्रश्न (कौन, क्या, कहाँ, कब, क्यों, कैसे) मदद करते हैं।

2. विश्लेषण का तरीका

डेटा की ज़रूरतें, संग्रह, समझ और तैयारी

3. डेटा की ज़रूरतें

कौन-से फ़ीचर (कॉलम), कितनी पंक्तियाँ, किस रूप में और किस समय का डेटा चाहिए, यह लिखें।

4. डेटा संग्रह

रिकॉर्ड, सेंसर, सर्वे, वेबसाइट या खुले डेटासेट से डेटा लें। अनुमति लें और निजी डेटा सुरक्षित रखें।

5. डेटा की समझ

औसत, न्यूनतम, अधिकतम, चार्ट और सहसंबंध से देखें कि डेटा पूरा और समझदार है।

6. डेटा की तैयारी

अक्सर सबसे लंबा चरण। दोहराव हटाएँ, ख़ाली मान संभालें (औसत से भरें या पंक्ति हटाएँ), असंभव मान सुधारें, टेक्स्ट को संख्या में बदलें और नए उपयोगी फ़ीचर बनाएँ (फ़ीचर इंजीनियरिंग)।

मॉडलिंग, वैलिडेशन और मूल्यांकन

7. मॉडलिंग

डिसीज़न ट्री या लीनियर रिग्रेशन जैसा मॉडल सिखाएँ। निष्पक्ष जाँच के लिए कुछ डेटा उससे छिपाना ज़रूरी है।

8. मूल्यांकन

वर्गीकरण के लिए सटीकता = सही अनुमान ÷ कुल अनुमान (और कन्फ़्यूज़न मैट्रिक्स)। रिग्रेशन के लिए त्रुटि:

MSE (माध्य वर्ग त्रुटि) = (वास्तविक − अनुमानित)² का औसत

RMSE = √MSE, डेटा की ही इकाई में। जितना छोटा, उतना अच्छा।

उदाहरण: वास्तविक 3, 5, 2; अनुमानित 2, 5, 4। त्रुटियाँ 1, 0, −2; वर्ग 1, 0, 4। MSE = 5 ÷ 3 ≈ 1.67; RMSE ≈ 1.29।

डिप्लॉयमेंट, फ़ीडबैक और कैपस्टोन प्रोजेक्ट

9. लागू करना

मॉडल को काम में लगाएँ: ऐप, वेबसाइट या रिपोर्ट में जिसे लोग उपयोग करें।

10. प्रतिक्रिया

असली उपयोग के नतीजे लें। दुनिया बदले (नया मेन्यू, नई क़ीमतें) तो मॉडल कमज़ोर होता है, इसलिए दोबारा सिखाते हैं। फ़ीडबैक से डेटा विज्ञान सीधी रेखा नहीं, चक्र बनता है।

कैपस्टोन प्रोजेक्ट में उपयोग

कैपस्टोन प्रोजेक्ट इन्हीं चरणों पर चलता है: असली समस्या चुनें, तरीका बताएँ, डेटा जुटाएँ और साफ़ करें, मॉडल बनाकर जाँचें, नतीजे दिखाएँ, और सीमाएँ व नैतिकता (पक्षपात, निजता) समझाएँ।

करके देखें: 3D में और घर पर

खुले खेल में हर चरण दबाएँ और ज़ोर से बताएँ कि स्कूल कैंटीन के लिए आप क्या करेंगे। स्लाइडर हिलाएँ: 50% प्रशिक्षण में मॉडल कम डेटा से सीखता है; 90% में परीक्षण बहुत छोटा रह जाता है। 70 से 80% आम क्यों है?

घर पर: छोटा प्रोजेक्ट बनाएँ, "हफ़्ते के किस दिन घर में सबसे ज़्यादा दूध लगता है?" 10 चरण काग़ज़ पर लिखें, दो हफ़्ते डेटा जुटाएँ, फिर अपना अनुमान जाँचें।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. बैंक जानना चाहता है कि आवेदक ऋण लौटाएगा या नहीं। कौन-सा तरीका ठीक है?

उत्तर एक श्रेणी है (लौटाएगा / नहीं), इसलिए वर्गीकरण।

2. 1,000 पंक्तियों का डेटा 80:20 में बाँटें। प्रशिक्षण और परीक्षण में कितनी पंक्तियाँ?

प्रशिक्षण = 800, परीक्षण = 200।

3. वास्तविक 10, 12, 8; अनुमानित 11, 12, 6। MSE और RMSE ज्ञात करें।

त्रुटियाँ −1, 0, 2। वर्ग 1, 0, 4। MSE = 5 ÷ 3 ≈ 1.67। RMSE ≈ 1.29।

4. 500 पंक्तियों पर 5-फ़ोल्ड क्रॉस-वैलिडेशन में हर दौर में कितनी पंक्तियाँ परखी जाती हैं और कितने दौर होते हैं?

500 ÷ 5 = 100 पंक्तियाँ हर दौर में, कुल 5 दौर।

5. मॉडल 50 में से 45 परीक्षण ईमेल सही पहचानता है। सटीकता?

45 ÷ 50 = 0.9 = 90%।

6. ट्रैफ़िक मॉडल पिछले साल अच्छा था, पर नई मेट्रो लाइन के बाद ग़लत अनुमान दे रहा है। कौन-सा चरण इसे ठीक करता है?

फ़ीडबैक: नया डेटा लें, तैयारी और मॉडलिंग दोहराएँ और मॉडल दोबारा सिखाएँ।

आम गलतियाँ

अभ्यास क्विज़

1. डेटा विज्ञान पद्धति का पहला चरण है:
2. कल का तापमान संख्या के रूप में बताना है:
3. आमतौर पर सबसे ज़्यादा समय कौन-सा चरण लेता है?
4. RMSE है:
5. परीक्षण डेटा मॉडल से क्यों छिपाते हैं?

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

डेटा विज्ञान पद्धति के चरण कौन-से हैं?

व्यावसायिक समझ, विश्लेषण का तरीका, डेटा की ज़रूरतें, डेटा संग्रह, डेटा की समझ, डेटा की तैयारी, मॉडलिंग, मूल्यांकन, डिप्लॉयमेंट और फ़ीडबैक।

MSE और RMSE में क्या अंतर है?

MSE त्रुटियों के वर्गों का औसत है। RMSE उसका वर्गमूल है, इसलिए डेटा की इकाई में होता है और पढ़ना आसान है।

क्रॉस-वैलिडेशन क्या है?

डेटा को k फ़ोल्ड में बाँटकर हर फ़ोल्ड को एक बार परीक्षण बनाना और अंकों का औसत लेना।

यह कहाँ पढ़ाया जाता है

सीबीएसई (भारत)कक्षा 12डेटा विज्ञान पद्धति

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी कंप्यूटर विज्ञान पाठ