कंप्यूटर विज़न क्या है?
कंप्यूटर विज़न (CV) कृत्रिम बुद्धि (AI) की एक शाखा है। यह कंप्यूटर को फ़ोटो और वीडियो का मतलब समझने में मदद करती है।
हमारी आँख रोशनी पकड़ती है और दिमाग़ समझता है। CV में कैमरा रोशनी पकड़ता है और प्रोग्राम समझने की कोशिश करता है। प्रोग्राम ने बहुत सारे उदाहरण चित्रों से सीखा होता है।
- इनपुट: चित्र या वीडियो (वीडियो = हर सेकंड कई चित्र)।
- प्रक्रिया: पिक्सेल को संख्या में बदलना और पैटर्न ढूँढना।
- आउटपुट: उत्तर, जैसे नाम ("बिल्ली"), डिब्बा या फ़ैसला ("खोलो")।
चित्र पिक्सेल से बनते हैं
पिक्सेल (picture element) डिजिटल चित्र का सबसे छोटा बिंदु है। पिक्सेल पंक्तियों और स्तंभों में होते हैं, जैसे ग्राफ़ पेपर के वर्ग।
रिज़ॉल्यूशन
रिज़ॉल्यूशन = आड़े पिक्सेल × खड़े पिक्सेल। 1920 × 1080 चित्र में 2,073,600 पिक्सेल (लगभग 2 मेगापिक्सेल) होते हैं। ज़्यादा पिक्सेल = ज़्यादा बारीकी।
पिक्सेल मान
- ग्रेस्केल: हर पिक्सेल एक संख्या, 0 (काला) से 255 (सफ़ेद)। कुल 256 स्तर, जो 1 बाइट (8 बिट) में आ जाते हैं।
- रंगीन (RGB): हर पिक्सेल तीन संख्याएँ — लाल, हरा, नीला, हर एक 0–255। (255, 0, 0) लाल, (255, 255, 0) पीला, (0, 0, 0) काला, (255, 255, 255) सफ़ेद।
- यानी रंगीन चित्र तीन जालों का ढेर है, जिन्हें चैनल कहते हैं।
फ़ीचर: कंप्यूटर क्या ढूँढता है
फ़ीचर चित्र का वह हिस्सा है जो चीज़ों को अलग पहचानने में मदद करे:
- किनारे (edges): जहाँ पिक्सेल मान अचानक बदलें (गहरा के बगल में हल्का)।
- कोने (corners): जहाँ दो किनारे मिलें। कोने बहुत अच्छे फ़ीचर हैं, क्योंकि दूसरी फ़ोटो में भी आसानी से मिल जाते हैं।
- रंग और बनावट: पका आम पीला; घास की खुरदरी हरी बनावट।
- आकार: गोले, रेखाएँ, चेहरे।
संख्याओं का एक छोटा जाल, जिसे फ़िल्टर (कर्नेल) कहते हैं, चित्र पर खिसकता है। हर जगह वह पिक्सेल मानों को गुणा करके जोड़ता है। जहाँ फ़ीचर है, वहाँ परिणाम बड़ा आता है। इसे कनवल्यूशन कहते हैं। CNN (कनवल्यूशनल न्यूरल नेटवर्क) हज़ारों लेबल वाले चित्रों से अपने फ़िल्टर ख़ुद सीखता है: शुरू की परतें किनारे, बाद की परतें आँख, पहिए या पत्ते ढूँढती हैं।
CV के काम और उपयोग
मुख्य काम
- चित्र वर्गीकरण: पूरे चित्र के लिए एक नाम ("कुत्ता")।
- वर्गीकरण + स्थान: नाम और एक डिब्बा जो बताए वस्तु कहाँ है।
- ऑब्जेक्ट डिटेक्शन: कई वस्तुओं के डिब्बे और नाम (3 कारें, 2 लोग)।
- इंस्टेंस सेगमेंटेशन: हर वस्तु के ठीक-ठीक पिक्सेल।
उपयोग
- फ़ेस अनलॉक और फ़ोटो टैगिंग
- चालक-रहित कार, लेन पहचान
- चिकित्सा: एक्स-रे और आँख के स्कैन में रोग के संकेत (पुष्टि डॉक्टर करते हैं)
- खेती: ड्रोन फ़ोटो से पत्ती का रोग या फल गिनना
- दुकानें: सेल्फ़-चेकआउट, स्टॉक गिनती, बारकोड/QR पढ़ना
- यातायात: नंबर-प्लेट पढ़ना, गाड़ियाँ गिनना
- Google Lens जैसे ऐप: बोर्ड का अनुवाद, पौधे पहचानना
सीमाएँ और नैतिकता
कम रोशनी, धुंधलापन या अजीब कोण CV को धोखा दे सकते हैं। अगर ट्रेनिंग चित्रों में कुछ समूह के लोग कम हों तो वह उनके लिए ग़लत हो सकता है (पक्षपात)। कैमरों से निजता का सवाल भी उठता है, इसलिए नियम और सहमति ज़रूरी हैं।
घर पर करके देखें
फ़ोन में कोई फ़ोटो खोलें और जितना हो सके ज़ूम करें। छोटे वर्ग दिखेंगे: यही पिक्सेल हैं। अब ब्राइटनेस बढ़ाएँ और देखें, हर वर्ग एक साथ हल्का होता है। 3D के आख़िरी चरण में यही दिखाया गया है।
मुख्य सूत्र और परिभाषाएँ
- पिक्सेल: डिजिटल चित्र का सबसे छोटा बिंदु
- रिज़ॉल्यूशन = चौड़ाई (पिक्सेल) × ऊँचाई (पिक्सेल)
- ग्रेस्केल पिक्सेल: 0 (काला) से 255 (सफ़ेद), 1 बाइट
- RGB पिक्सेल: (R, G, B), हर एक 0–255; 3 चैनल
- फ़ीचर: किनारा, कोना, रंग, बनावट या आकार
- काम: वर्गीकरण (क्या), डिटेक्शन (कहाँ), सेगमेंटेशन (कौन-से पिक्सेल)
हल किए गए उदाहरण
1. एक चित्र 640 × 480 पिक्सेल का है। कुल पिक्सेल कितने?
640 × 480 = 307,200 पिक्सेल (लगभग 0.3 मेगापिक्सेल)।
2. 100 × 100 का ग्रेस्केल चित्र, हर पिक्सेल 1 बाइट। कितनी मेमोरी? RGB हो तो?
ग्रे: 100 × 100 × 1 = 10,000 बाइट। RGB में 3 बाइट: 100 × 100 × 3 = 30,000 बाइट।
3. पिक्सेल मान 200 है, चमक 80 जोड़ी। नया मान?
200 + 80 = 280, पर अधिकतम 255 है, इसलिए पिक्सेल 255 (सफ़ेद) हो जाएगा।
4. पार्किंग कैमरा को बताना है कितनी कारें हैं और हर कार कहाँ है। यह कौन-सा काम है?
ऑब्जेक्ट डिटेक्शन: हर कार का डिब्बा और नाम देता है, इसलिए गिनती भी हो जाती है।
आम गलतियाँ
- यह सोचना कि कंप्यूटर हमारी तरह चित्र देखता है। उसे सिर्फ़ संख्याओं का जाल मिलता है।
- ग्रे पिक्सेल को 0 से 256 बताना। स्तर 256 हैं, पर सीमा 0 से 255 है।
- वर्गीकरण और डिटेक्शन को एक मानना। वर्गीकरण सिर्फ़ नाम देता है, डिटेक्शन जगह भी बताता है।
- यह मानना कि ज़्यादा पिक्सेल से हमेशा बेहतर परिणाम। बहुत बड़े चित्र धीमे होते हैं; CV अक्सर उन्हें छोटा कर लेता है।