📘 CodingMarble Learn

मशीन लर्निंग (Machine Learning)

मशीन लर्निंग (ML) में कंप्यूटर को नियम बताया नहीं जाता; वह उदाहरणों से नियम ख़ुद सीखता है. हम डेटा देते हैं: फ़ीचर (इनपुट) और, सुपरवाइज़्ड लर्निंग में, लेबल (उत्तर). मशीन एक मॉडल बनाती है: रिग्रेशन संख्या का अनुमान लगाता है, डिसीज़न ट्री हाँ/नहीं प्रश्नों से वर्ग चुनता है, और k-means बिना लेबल वाले डेटा को समूहों में बाँटता है. ज़्यादातर डेटा पर सिखाते हैं, अनदेखे डेटा पर परखते हैं और सटीकता नापते हैं. सिर्फ़ रटने वाला मॉडल (ओवरफ़िटिंग) नए डेटा पर फेल होता है.

🎬 कदम-दर-कदम कहानी

  1. हर बिंदु एक फल है. उसका आकार और मिठास फ़ीचर हैं. रंग लेबल बताता है: सेब या नींबू.
  2. रिग्रेशन: हरी रेखा ग़लत जगह से शुरू होती है. धीरे-धीरे घूमती है जब तक लाल त्रुटि-डंडे सबसे छोटे न हो जाएँ. अब यह किराये का अनुमान लगा सकती है.
  3. डिसीज़न ट्री: पहला प्रश्न, मिठास 5 से ज़्यादा? फिर, आकार 6 cm से ज़्यादा? समतल का हर हिस्सा एक उत्तर देता है.
  4. K-means: बिंदुओं पर कोई लेबल नहीं. दो केंद्र आते हैं. हर बिंदु पास वाले केंद्र से जुड़ता है, केंद्र बीच में खिसकते हैं, फिर दोहराओ.
  5. परीक्षण: धूसर बिंदु सीखते समय छिपे थे. हरा छल्ला = सही, लाल = ग़लत. 5 में 4 सही = 80% सटीकता.
  6. अब तुम्हारी बारी: k को 1 से 5 तक चुनो और बिंदुओं को समूहों में बँटते देखो.

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

क्या फ़ीचर और लेबल एक ही हैं?

नहीं. फ़ीचर इनपुट हैं (आकार, मिठास). लेबल उत्तर है (सेब या नींबू). 3D में जगह = फ़ीचर, रंग = लेबल.

मशीन को कैसे पता कि कौन-सी रेखा सबसे अच्छी?

वह त्रुटियाँ (लाल डंडे) नापती है और ढलान व अंतःखंड बदलती रहती है ताकि कुल वर्ग त्रुटि घटे.

डिसीज़न ट्री के प्रश्न कौन तय करता है?

ट्रेनिंग एल्गोरिद्म कई प्रश्न आज़माता है और हर बार वह चुनता है जो वर्गों को सबसे अच्छा अलग करे.

बिना उत्तर के समूह कैसे बनते हैं?

दूरी से: पास के बिंदु शायद मिलते-जुलते हैं. केंद्र तब तक खिसकते हैं जब तक समूह बदलना बंद न करें.

ट्रेनिंग डेटा पर ही टेस्ट क्यों नहीं?

मॉडल उसे देख चुका है. सिर्फ़ छिपा डेटा असली प्रदर्शन दिखाता है, जैसे हरे-लाल छल्ले.

k-means में k कैसे चुनें?

कई मान आज़माओ और देखो कब एक और समूह जोड़ने से ज़्यादा फ़ायदा नहीं होता. खुद करो में k = 1 से 5 आज़माओ.

मशीन लर्निंग क्या है?

साधारण प्रोग्रामिंग में इंसान नियम लिखता है: अगर मिठास > 5 तो सेब. मशीन लर्निंग में हम कंप्यूटर को बहुत से उदाहरण देते हैं और वह नियम ख़ुद ढूँढता है.

ML, कृत्रिम बुद्धि (AI) का एक हिस्सा है. इंसान थोड़े उदाहरणों और समझ से सीख लेता है. मशीन को बहुत उदाहरण चाहिए, पर वह बहुत तेज़ है, थकती नहीं और लाखों संख्याएँ देख सकती है.

ML समस्या तय करने के लिए पूछो: क्या अनुमान लगाना है? क्या उत्तर वाले पुराने उदाहरण हैं? मशीन अच्छी है, यह कैसे जाँचेंगे?

डेटा, फ़ीचर और लेबल

डेटा की हर पंक्ति एक उदाहरण है. इनपुट वाले कॉलम फ़ीचर हैं (आकार, मिठास, फ़्लैट का क्षेत्रफल). जो उत्तर चाहिए वह लेबल है.

डेटा तैयार करना: ग़लतियाँ और ख़ाली मान हटाओ, संख्याओं को मिलते-जुलते पैमाने पर लाओ, शब्दों को संख्या में बदलो. ख़राब डेटा = ख़राब मॉडल.

तीन आम मॉडल: रिग्रेशन, डिसीज़न ट्री, k-means

लीनियर रिग्रेशन (संख्या का अनुमान)

डेटा से होकर रेखा y = mx + c बिठाओ. हर असली बिंदु और रेखा के बीच का अंतर त्रुटि है. ट्रेनिंग में m और c बदलते हैं ताकि औसत वर्ग त्रुटि सबसे कम हो.

डिसीज़न ट्री (वर्ग चुनना)

हाँ/नहीं प्रश्नों का पेड़. हर प्रश्न डेटा को बाँटता है. आख़िरी सिरे, पत्ते, उत्तर देते हैं. इसे इंसान आसानी से पढ़ सकते हैं.

K-means क्लस्टरिंग (समूह ढूँढना)

k चुनो. k केंद्र रखो. दोहराओ: हर बिंदु पास वाले केंद्र से जुड़े; हर केंद्र अपने बिंदुओं के औसत पर जाए. जब कुछ न बदले तो रुको.

मॉडल चुनना: संख्या → रिग्रेशन; लेबल वाला वर्ग → क्लासिफ़िकेशन; लेबल नहीं → क्लस्टरिंग.

ट्रेनिंग, टेस्टिंग और मूल्यांकन

डेटा बाँटो: लगभग 80% ट्रेनिंग, 20% टेस्टिंग. टेस्ट डेटा सीखते समय छिपा रहता है, जैसे बिना देखा परीक्षा-पत्र.

पक्षपाती (बायस्ड) डेटा से ML अन्यायपूर्ण भी हो सकता है. देखो किसका डेटा छूटा है, और निजी डेटा सुरक्षित रखो.

करके देखो: एक AI समाधान बनाओ

छोटी समस्या लो: कल बारिश होगी या नहीं. 1) तय करो: बारिश हाँ/नहीं. 2) डेटा: 20 दिन तक बादल, नमी और हवा लिखो, और अगले दिन बारिश हुई या नहीं. 3) मॉडल: हाथ से दो प्रश्नों वाला ट्री बनाओ. 4) आख़िरी 5 दिनों पर परखो और गिनो कितने सही. 3D में k बदलकर देखो समूह कैसे बदलते हैं.

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. एक स्पैम फ़िल्टर 200 ईमेल में 184 सही पहचानता है. सटीकता?

184 ÷ 200 × 100% = 92%.

2. किराया मॉडल y = 0.5x + 3 (y हज़ार रुपये में, x = क्षेत्रफल m² ÷ 10). 60 m² फ़्लैट का किराया?

x = 6. y = 0.5 × 6 + 3 = 6. अनुमानित किराया ≈ ₹6,000.

3. रेखा पर बिंदु 2, 4, 10, 12; k = 2; केंद्र 2 और 4. k-means का एक चक्र करो.

पास वाला केंद्र: 2 → 2; 4, 10, 12 → 4. समूह {2} और {4, 10, 12}. नए केंद्र: 2 और 26/3 ≈ 8.67. अगले चक्र में 4 अब 2 के पास, समूह {2, 4} और {10, 12}, केंद्र 3 और 11. फिर कोई बदलाव नहीं.

4. मॉडल ट्रेनिंग पर 99% पर टेस्ट पर 60% लाता है. क्या हो रहा है?

ओवरफ़िटिंग: उसने ट्रेनिंग उदाहरण रट लिए, सामान्य पैटर्न नहीं सीखा. उपाय: ज़्यादा डेटा, सरल मॉडल, या ट्रेनिंग जल्दी रोकना.

आम गलतियाँ

अभ्यास क्विज़

1. सुपरवाइज़्ड लर्निंग में डेटा के साथ होते हैं:
2. घर की क़ीमत जैसी संख्या का अनुमान कौन-सा मॉडल लगाता है?
3. K-means किसका उदाहरण है?
4. ट्रेनिंग के समय टेस्ट डेटा क्यों छिपाते हैं?
5. ट्रेनिंग डेटा पर पूरा सही पर नए डेटा पर कमज़ोर मॉडल:

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

मशीन लर्निंग क्या है, आसान शब्दों में?

कंप्यूटर को उदाहरणों से सिखाना ताकि वह पैटर्न पकड़कर नए डेटा पर अनुमान लगा सके.

मशीन लर्निंग के मुख्य प्रकार कौन-से हैं?

सुपरवाइज़्ड (लेबल के साथ), अनसुपरवाइज़्ड (बिना लेबल, जैसे क्लस्टरिंग) और रीइनफ़ोर्समेंट (इनाम से सीखना).

AI और ML में क्या अंतर है?

AI मशीनों को समझदार बनाने का बड़ा लक्ष्य है. ML उसका एक तरीका है जिसमें मशीन डेटा से सीखती है.

यह कहाँ पढ़ाया जाता है

नीदरलैंडHAVO 5 (eindexamenjaar)Elective theme: Cognitive computing
नीदरलैंडVWO 6 (eindexamenjaar)Elective theme: Cognitive computing
सीबीएसई (भारत)कक्षा 10भाग ख: एआई मॉडलिंग की उन्नत अवधारणाएँ
सीबीएसई (भारत)कक्षा 11मशीन लर्निंग एल्गोरिद्म
दक्षिण कोरिया중학교 2학년Artificial intelligence
दक्षिण कोरिया고등학교 2학년AI and learning
दक्षिण कोरिया고등학교 2학년AI project
दक्षिण कोरिया고등학교 2학년Text data
दक्षिण कोरिया고등학교 2학년Image data
दक्षिण कोरिया고등학교 2학년Artificial intelligence
दक्षिण कोरिया고등학교 2학년Science and logic
दक्षिण कोरिया고등학교 3학년Classification and prediction
जर्मनीJahrgangsstufe 11Artificial intelligence
चीन九年级(初三)Module: AI and smart society
चीन高三Sel.4 Introduction to AI

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी कंप्यूटर विज्ञान पाठ