📘 CodingMarble Learn

मॉडल मूल्यांकन: मॉडल कितना अच्छा है?

मॉडल असली दुनिया की सरल नकल है जो अनुमान लगाती है। उसे परखने के लिए उसके अनुमानों को असली उत्तरों से मिलाते हैं। मशीन लर्निंग में डेटा को प्रशिक्षण भाग (सीखने के लिए) और परीक्षण भाग (नए डेटा पर जाँच के लिए) में बाँटते हैं। कन्फ़्यूज़न मैट्रिक्स TP, FP, FN और TN गिनता है। सटीकता = (TP + TN) ÷ कुल। परिशुद्धता = TP ÷ (TP + FP)। रिकॉल = TP ÷ (TP + FN)। F1 = 2PR ÷ (P + R)। विज्ञान के मॉडल (जैसे व्युत्क्रम वर्ग नियम) भी ऐसे ही परखे जाते हैं: क्या अनुमान माप से मिलते हैं, और मॉडल कहाँ काम करना बंद करता है?

🎬 कदम-दर-कदम कहानी

  1. मॉडल अनुमान लगाता है। हम उसे असली उत्तरों से मिलाते हैं।
  2. डेटा बाँटो। ज़्यादातर पर सिखाओ। छिपे भाग पर जाँचो।
  3. कन्फ़्यूज़न मैट्रिक्स नतीजों को चार ख़ानों में बाँटता है: TP, FP, FN, TN।
  4. सटीकता = सही उत्तर ÷ सारे उत्तर। यहाँ 85% है।
  5. परिशुद्धता: कितनी चेतावनियाँ सच थीं? रिकॉल: कितने असली मामले पकड़े?
  6. खुला खेल: सीमा खिसकाओ। देखो परिशुद्धता और रिकॉल एक-दूसरे को खींचते हैं।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

प्रशिक्षण डेटा पर ही क्यों न जाँचें? आसान है।

मॉडल उसे देख चुका है, इसलिए रटकर ही ऊँचे अंक ला सकता है। चरण 2 में सुनहरे टेस्ट डिब्बे अलग रखे हैं।

FP और FN में क्या फ़र्क़ है?

FP झूठी चेतावनी है (हाँ कहा, था नहीं)। FN चूक है (नहीं कहा, था हाँ)। चरण 3 में नारंगी और बैंगनी ढेर देखो।

99% सटीकता हो तो क्या मॉडल हमेशा अच्छा है?

नहीं। अगर 99% मामले "नहीं" हैं, तो हमेशा "नहीं" कहकर 99% आ जाता है पर कुछ नहीं पकड़ा। चरण 4 यह जाल समझाता है।

परिशुद्धता और रिकॉल एक जैसे लगते हैं। याद कैसे रखूँ?

दोनों में ऊपर TP है। परिशुद्धता में ऊपरी पंक्ति (सारे अनुमानित हाँ) से भाग, रिकॉल में बाएँ स्तंभ (सारे असली हाँ) से। चरण 5 बाक़ी ख़ाने धूसर कर देता है।

क्या 100% परिशुद्धता और 100% रिकॉल साथ मिल सकते हैं?

सिर्फ़ पूर्ण मॉडल में। आमतौर पर एक बढ़े तो दूसरा घटता है। चरण 6 में सीमा खिसकाकर देखो।

भौतिकी के मॉडल ML मॉडल जैसे कैसे?

दोनों अनुमान लगाते हैं, और दोनों को असली माप से मिलाकर परखा जाता है, जैसे चरण 1 में।

मॉडल क्या है, और उसे क्यों परखें?

मॉडल किसी असली चीज़ का सरल रूप है। यह समझाने या अनुमान लगाने में मदद करता है।

कोई मॉडल पूर्ण नहीं। मूल्यांकन = जाँचना कि अनुमान सच के कितने क़रीब हैं और मॉडल कहाँ विफल होता है। अच्छा मॉडल सरल हो, सही अनुमान दे, और उसकी सीमाएँ हमें पता हों।

ट्रेन-टेस्ट विभाजन (Train-test split)

डेटा को दो भागों में बाँटते हैं:

क्यों? मॉडल प्रशिक्षण डेटा रट सकता है और फिर भी नए डेटा पर फ़ेल हो सकता है। इसे ओवरफ़िटिंग कहते हैं। बहुत सरल मॉडल जो प्रशिक्षण डेटा पर भी फ़ेल हो, वह अंडरफ़िटिंग है। नए डेटा पर जाँच नए सवालों वाली परीक्षा जैसी है।

कन्फ़्यूज़न मैट्रिक्स

हाँ/नहीं वाले मॉडल (स्पैम या नहीं) का हर परिणाम चार में से एक ख़ाने में जाता है:

आमतौर पर पंक्तियाँ अनुमान और स्तंभ असलियत होते हैं (कुछ किताबें उलटा रखती हैं, इसलिए लेबल ज़रूर पढ़ो)।

सटीकता, परिशुद्धता, रिकॉल और F1

सटीकता (Accuracy) = (TP + TN) ÷ कुल। सारे उत्तरों में सही का हिस्सा।

परिशुद्धता (Precision) = TP ÷ (TP + FP)। मॉडल ने जिन्हें हाँ कहा, उनमें कितने सच में हाँ?

रिकॉल (Recall) = TP ÷ (TP + FN)। जो सच में हाँ थे, उनमें से मॉडल ने कितने ढूँढे?

F1 स्कोर = 2 × P × R ÷ (P + R)। परिशुद्धता और रिकॉल का संतुलन एक संख्या में।

कौन-सा ज़रूरी है?

जब एक वर्ग दुर्लभ हो (99 स्वस्थ, 1 बीमार), सटीकता धोखा देती है। रोग-जाँच में चूक ख़तरनाक है, इसलिए रिकॉल सबसे ज़रूरी। स्पैम फ़िल्टर में असली ईमेल छिपाना परेशान करता है, इसलिए परिशुद्धता ज़रूरी। सीमा (threshold) बदलने से एक बढ़ता है तो दूसरा घटता है।

वैज्ञानिक मॉडलों को परखना

भौतिकी के मॉडल भी ऐसे ही परखे जाते हैं: अनुमान, माप, तुलना।

तकनीक (सोलर पैनल, MRI, फ़ोन) में पहचानो कि कौन-से नियम लगे हैं और सरल मॉडल कहाँ रुकता है।

करके देखो

अपना "बारिश मॉडल" बनाओ: रोज़ शाम बादल देखकर अगले दिन "बारिश" या "बारिश नहीं" का अनुमान लिखो। 10 दिन बाद कन्फ़्यूज़न मैट्रिक्स भरो और सटीकता, परिशुद्धता और रिकॉल निकालो। फिर 3D स्लाइडर से देखो कि सख़्त नियम से अंक कैसे बदलते हैं।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. परीक्षण में 200 फ़ोटो हैं। बिल्ली-पहचान मॉडल 170 सही बताता है। सटीकता?

सटीकता = 170 ÷ 200 = 0.85 = 85%।

2. स्पैम फ़िल्टर: TP = 40, FP = 10, FN = 5, TN = 45। सटीकता, परिशुद्धता, रिकॉल और F1 निकालो।

कुल = 100। सटीकता = (40 + 45) ÷ 100 = 85%। परिशुद्धता = 40 ÷ 50 = 0.80। रिकॉल = 40 ÷ 45 ≈ 0.889। F1 = 2 × 0.80 × 0.889 ÷ (0.80 + 0.889) = 1.422 ÷ 1.689 ≈ 0.84।

3. 1,000 लोगों में 10 को दुर्लभ रोग है। मॉडल हमेशा "स्वस्थ" कहता है। सटीकता और रिकॉल? क्या मॉडल अच्छा है?

TN = 990, FN = 10, TP = 0, FP = 0। सटीकता = 990 ÷ 1000 = 99%। रिकॉल = 0 ÷ 10 = 0%। मॉडल बेकार है: एक भी बीमार नहीं पकड़ता। वर्ग असंतुलित हों तो ऊँची सटीकता बुरे मॉडल को छिपा सकती है।

4. एक लैंप 1 m पर 36 W/m² तीव्रता देता है। व्युत्क्रम वर्ग मॉडल से 3 m पर?

I₂ = 36 × (1/3)² = 36 ÷ 9 = 4 W/m²। माप लगभग 4 आए तो मॉडल ठीक; बड़े परावर्तक के पास शायद नहीं।

आम गलतियाँ

अभ्यास क्विज़

1. अंत में मॉडल जाँचने के लिए कौन-सा डेटा?
2. स्पैम कहा, पर सामान्य ईमेल था। यह है:
3. सटीकता =
4. कैंसर-जाँच में कौन-सा अंक सबसे ज़रूरी?
5. बिंदु प्रकाश स्रोत से दूरी दोगुनी हो तो तीव्रता:

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

कन्फ़्यूज़न मैट्रिक्स क्या है?

2×2 तालिका जो सही धनात्मक, ग़लत धनात्मक, ग़लत ऋणात्मक और सही ऋणात्मक गिनती है, ताकि पता चले मॉडल किस तरह की ग़लतियाँ करता है।

अच्छा F1 स्कोर कितना?

1 के जितना क़रीब, उतना अच्छा। "अच्छा" काम पर निर्भर है; मॉडलों की तुलना एक ही परीक्षण डेटा पर करो।

हर मॉडल की सीमा क्यों होती है?

सरल रहने के लिए मॉडल कुछ बातें छोड़ देता है। जब वे बातें ज़रूरी हो जाएँ (बहुत छोटा, बहुत तेज़, बहुत दूर), अनुमान असलियत से नहीं मिलते।

यह कहाँ पढ़ाया जाता है

नीदरलैंडHAVO 5 (eindexamenjaar)Physics and technology
नीदरलैंडVWO 6 (eindexamenjaar)Laws of nature and models
सीबीएसई (भारत)कक्षा 10भाग ख: मॉडल का मूल्यांकन

पहले यह पढ़ें

इससे जुड़े पाठ

सभी कंप्यूटर विज्ञान पाठ