कंप्यूटर विज़न
कंप्यूटर विज़न कंप्यूटर को तस्वीरें और वीडियो समझने में मदद करता है। तस्वीर पिक्सेल संख्याओं का जाल है (पूरा ब्योरा कंप्यूटर विज़न पाठ में है)। आम कड़ी यह है:
- पिक्सेल: चमक या रंग की संख्याएँ।
- किनारे और विशेषताएँ: जहाँ संख्याएँ अचानक बदलती हैं, जैसे पेड़ की रूपरेखा।
- आकार और वस्तुएँ: मॉडल पैटर्न मिलाकर तय करता है "पेड़" या "घर"।
- नाम: भरोसे के प्रतिशत के साथ उत्तर, जैसे "पेड़ 97%"।
मुख्य काम: वर्गीकरण (यह क्या है?), पहचान/डिटेक्शन (यह कहाँ है?) और विभाजन (कौन-से पिक्सेल?)। उपयोग: फ़ेस अनलॉक, नंबर-प्लेट पढ़ना, मेडिकल स्कैन, फ़सल जाँच, चालक-रहित गाड़ियाँ। आधुनिक प्रणालियाँ बहुत सारी नामित तस्वीरों से न्यूरल नेटवर्क द्वारा पैटर्न सीखती हैं।
भाषा-संसाधन (NLP)
प्राकृतिक भाषा संसाधन (NLP) कंप्यूटर को मानव भाषा के साथ काम करने देता है। लोग एक ही बात कई तरह कहते हैं, इसलिए यह कठिन है। क़दम ये हैं:
- टोकनीकरण: वाक्य को टुकड़ों (टोकन) में काटना। "मुझे ठंडी चाय पसंद है" के 4 टोकन बनते हैं।
- टैगिंग (शब्द-भेद): हर शब्द को संज्ञा, क्रिया, विशेषण आदि चिह्नित करना।
- पार्सिंग: शब्द आपस में कैसे जुड़े हैं, कौन क्या करता है, यह खोजना।
- अर्थ: वाक्य क्या कहता है, उसका भाव (यहाँ सकारात्मक) या उसका उत्तर खोजना।
उपयोग: अनुवाद, खोज, वॉइस असिस्टेंट, वर्तनी-व्याकरण मदद, स्पैम फ़िल्टर, चैटबॉट। कठिनाइयाँ: एक शब्द के कई अर्थ ("बैंक"), व्यंग्य, और हिंग्लिश जैसी मिली-जुली भाषाएँ। आधुनिक प्रणालियाँ बहुत सारे पाठ से भाषा के पैटर्न सीखती हैं।
तर्क (Reasoning)
तर्क का मतलब है जाने हुए तथ्यों और नियमों से ऐसा नया तथ्य निकालना जो ज़रूर सही निकले। इसे निगमन (डिडक्शन) कहते हैं।
नियम: अगर बारिश हुई तो सड़क गीली। तथ्य: बारिश हुई। निष्कर्ष: सड़क गीली है। यह वैध है, कभी ग़लत नहीं होगा।
अब उल्टा देखिए। नियम: अगर बारिश हुई तो सड़क गीली। तथ्य: सड़क गीली है। क्या कह सकते हैं कि बारिश हुई? नहीं। पानी का टैंकर भी सड़क गीली कर सकता है। इस ग़लती को परिणाम की पुष्टि कहते हैं। तर्क प्रणाली को वैध और जोखिम भरे क़दमों में फ़र्क़ करना आना चाहिए।
दूसरे विचार: योजना (लक्ष्य तक के क़दमों की सूची बनाना), अनिश्चितता में तर्क (प्रायिकता से, जैसे बेज़) और सामान्य-बुद्धि का तर्क, जो कंप्यूटर के लिए अब भी कठिन है। उपयोग: नियम-आधारित सहायक, समय-सारणी बनाने वाले, पहेली हल करने वाले, और यह जाँचना कि डिज़ाइन नियमों के अनुसार है।
गेम खेलने वाला AI
खेल AI की साफ़ परीक्षा हैं क्योंकि नियम तय होते हैं और विजेता पता चलता है। प्रोग्राम एक खेल-पेड़ बनाता है: हर गोला एक स्थिति है, हर तीर एक चाल।
तीलियों का खेल: 1 या 2 तीलियाँ उठाइए; जो आख़िरी तीली उठाए वह जीतता है। नीचे से स्थितियाँ देखिए:
- अपनी बारी पर 0 तीली बची: दूसरे ने आख़िरी उठा ली, यानी आप हार गए।
- कोई स्थिति जीत की है अगर आप उससे दूसरे के लिए हार की स्थिति में जा सकें। कोई स्थिति हार की है अगर हर चाल दूसरे के लिए जीत की स्थिति में ले जाए।
नीचे से ऊपर का यह स्कोर मिनिमैक्स है: आप अपने लिए सबसे अच्छी चाल चुनते हैं, यह मानकर कि दूसरा भी अपने लिए सबसे अच्छी चाल चुनेगा। 1 तीली पर जीत, 2 पर जीत (2 उठाइए), 3 पर हार (1 या 2 छोड़ेंगे तो सामने वाला जीतेगा), 4 पर जीत (3 छोड़िए)। 3 के हर गुणज की स्थिति हार की है, इसलिए जीतने वाला हमेशा 3 का गुणज छोड़ता है।
शतरंज जैसे बड़े खेलों में चालें इतनी हैं कि पूरा पेड़ नहीं बन सकता। इसलिए प्रोग्राम कुछ चालें आगे देखते हैं, बोर्ड का एक स्कोर (ह्यूरिस्टिक) लगाते हैं और बेकार शाखाएँ छोड़ देते हैं (प्रूनिंग)। आधुनिक प्रोग्राम लाखों अभ्यास खेलों से भी सीखते हैं। डीप ब्लू ने 1997 में शतरंज चैंपियन गैरी कास्पारोव को हराया, और अल्फ़ागो ने 2016 में गो चैंपियन ली सेडोल को।
करके देखें
दोस्त के साथ 7 सिक्कों से तीलियों का खेल खेलिए। बारी-बारी 1 या 2 सिक्के उठाइए; आख़िरी सिक्का उठाने वाला जीतता है। क्या आप हमेशा दोस्त के लिए 3 का गुणज छोड़ पा रहे हैं? फिर 3D के चरण 6 में कंप्यूटर से खेलिए। अगला काम: बारिश वाले नियम की तरह अपना एक नियम लिखिए, जैसे "अगर मैं मिठाई खाऊँ तो ख़ुश होता हूँ", और जाँचिए कि कौन-से दो निष्कर्ष वैध हैं और कौन-से जोखिम भरे।
मुख्य सूत्र और परिभाषाएँ
- विज़न कड़ी: पिक्सेल → किनारे → आकार → नाम
- NLP कड़ी: टोकन → टैग → पार्स → अर्थ
- वैध: अगर P तो Q; P सही है → Q सही है
- सुरक्षित नहीं: अगर P तो Q; Q सही है → P ग़लत भी हो सकता है
- मिनिमैक्स: जीत की स्थिति = कोई चाल प्रतिद्वंद्वी की हार की स्थिति में ले जाए
- तीलियों का खेल (1 या 2 उठाओ): 3 का गुणज छोड़ो
हल किए गए उदाहरण
1. "मुझे ठंडी चाय पसंद है" के चार NLP क़दम लिखिए और हर एक से क्या मिलता है बताइए।
टोकन: मुझे | ठंडी | चाय | पसंद है। टैग: सर्वनाम, विशेषण, संज्ञा, क्रिया। पार्स: "मुझे" को "ठंडी चाय" "पसंद है"। अर्थ: बोलने वाले को चाय पसंद है, सकारात्मक भाव।
2. नियम: अगर बैटरी ख़त्म तो टॉर्च बंद। तथ्य: टॉर्च बंद है। क्या पक्का है कि बैटरी ख़त्म है?
नहीं। बल्ब ख़राब हो सकता है या स्विच बंद हो सकता है। यह जोखिम भरा क़दम है। सिर्फ़ "बैटरी ख़त्म, इसलिए टॉर्च बंद" वैध है।
3. तीलियों का खेल (1 या 2, आख़िरी जीतता है)। जिसकी बारी है, उसके लिए 5 तीलियाँ जीत की हैं या हार की?
2 उठाइए, 3 बचेंगी जो 3 का गुणज है। सामने वाला हार की स्थिति में है। इसलिए 5 जीत की है।
4. 9 तीलियाँ हैं और आप पहले चलते हैं। सही खेल में कौन जीतता है?
9, 3 का गुणज है, इसलिए चलने वाले के लिए हार की स्थिति है। दूसरा खिलाड़ी हमेशा 3 का गुणज छोड़कर जीतता है (आप 1 उठाएँ तो वह 2, आप 2 उठाएँ तो वह 1)।
5. एक विज़न प्रणाली "गेंद 91%" बताती है। इन शब्दों से क्या पता चलता है?
नाम (गेंद), भरोसा (91%) और यह कि यह वर्गीकरण है। वह 91% पक्की है, 100% नहीं।
आम गलतियाँ
- यह सोचना कि कंप्यूटर फ़ोटो हमारी तरह देखता है। वह संख्याएँ (पिक्सेल) देखता है।
- यह सोचना कि NLP का मतलब कंप्यूटर सचमुच भावनाएँ समझता है। वह शब्दों और संदर्भ में पैटर्न खोजता है।
- नियम को उल्टा करके सही मान लेना। "बारिश तो गीला" का मतलब "गीला तो बारिश" नहीं है।
- यह सोचना कि गेम AI हर संभव खेल जाँचता है। बड़े खेलों में वह कुछ चालें आगे देखता है और स्कोर लगाता है।