📘 CodingMarble Learn

बिग डेटा (Big Data)

बिग डेटा वह डेटा है जो एक साधारण कंप्यूटर और साधारण सॉफ़्टवेयर के लिए बहुत बड़ा, बहुत तेज़ या बहुत मिला-जुला हो। इसे तीन V से समझते हैं: मात्रा (Volume), वेग (Velocity) और विविधता (Variety)। इसे संभालने के लिए काम कई मशीनों में एक साथ बाँटा जाता है (वितरित प्रोसेसिंग, जैसे MapReduce)। बिग डेटा को अक्सर तथ्यों (facts) या ग्राफ (नोड और लिंक) के रूप में रखा जाता है। मौसम, नक्शे, स्वास्थ्य, खरीदारी और AI में इसका उपयोग होता है, पर निजता और निष्पक्षता के सवाल भी उठते हैं।

🎬 कदम-दर-कदम कहानी

  1. यह एक कंप्यूटर है और थोड़ा-सा डेटा: 8 ब्लॉक। इतना डेटा एक मशीन आराम से रख और छाँट सकती है।
  2. मात्रा (Volume): डेटा बढ़ता जाता है, इतना कि ढेर एक मशीन की क्षमता से बहुत बड़ा हो जाता है।
  3. वेग (Velocity): नया डेटा रुकता नहीं। फ़ोन और सेंसर से हर सेकंड धारा की तरह आता है।
  4. विविधता (Variety): डेटा संख्या, फ़ोटो, वीडियो और टेक्स्ट में आता है। यह एक साफ़ तालिका में नहीं समाता।
  5. बाँटो और जोड़ो: काम के टुकड़े करके 4 मशीनों को एक साथ दिए गए (Map)। फिर उनके जवाब जोड़े गए (Reduce)। काम लगभग 4 गुना जल्दी हुआ।
  6. खुद करो: डेटा की मात्रा और मशीनों की संख्या बदलो। देखो समय कैसे बदलता है।

टिप: 3D दृश्य को घुमाने के लिए खींचें। ज़ूम के लिए दो उंगलियाँ इस्तेमाल करें।

🤔 आम शंकाएँ और उनके जवाब

कितना बड़ा डेटा 'बिग डेटा' कहलाता है?

कोई तय संख्या नहीं। जब एक साधारण कंप्यूटर और साधारण टूल उसे काम के समय में न संभाल सकें, तब वह बिग है। दूसरे चरण में ढेर एक मशीन से बड़ा हो जाता है।

एक बहुत बड़ा कंप्यूटर क्यों न खरीद लें?

एक मशीन की सीमा है और वह बहुत महँगी होती जाती है। कई साधारण मशीनें जोड़ना सस्ता है और बिना सीमा बढ़ सकता है, जैसा पाँचवें चरण में दिखता है।

छोटा पर तेज़ डेटा भी समस्या है?

हाँ। अगर डेटा प्रोसेस करने से तेज़ आए तो ढेर लगता जाता है। तीसरा चरण बिना रुके आती धारा दिखाता है।

4 मशीनें ठीक 4 गुना तेज़ क्यों नहीं?

डेटा बाँटने, नेटवर्क पर भेजने और जोड़ने में अतिरिक्त समय लगता है। आखिरी चरण में मशीनों का स्लाइडर बदलकर देखो।

विविधता से मुश्किल क्यों होती है?

फ़ोटो, संख्या और वाक्य एक ही साफ़ स्तंभ में नहीं बैठ सकते। चौथा चरण अलग आकार दिखाता है।

बिग डेटा क्या है?

डेटा यानी वे तथ्य जिन्हें हम दर्ज कर सकते हैं: संख्याएँ, शब्द, चित्र, आवाज़। ज़्यादातर डेटा एक कंप्यूटर में आसानी से आ जाता है।

बिग डेटा अलग है। यह इतना बड़ा, इतना तेज़ या इतना मिला-जुला होता है कि एक साधारण कंप्यूटर और स्प्रेडशीट जैसे साधारण सॉफ़्टवेयर से इसे रखना और समझना मुश्किल होता है।

इसे तीन V से पहचानते हैं:

कुछ किताबें और V जोड़ती हैं: विश्वसनीयता (Veracity) और मूल्य (Value)।

डेटा साइंस यानी डेटा इकट्ठा करना, साफ़ करना, जाँचना और उससे सवालों के जवाब निकालना। बिग डेटा डेटा साइंटिस्ट का मुख्य कच्चा माल है।

एक कंप्यूटर काफ़ी क्यों नहीं: बिग डेटा की प्रोसेसिंग

रिलेशनल डेटाबेस तय ढाँचे वाली तालिकाओं में डेटा रखता है। बिग डेटा अक्सर असंरचित होता है और बदलता रहता है, इसलिए तय तालिकाओं में ठीक से नहीं बैठता।

एक मशीन की मेमोरी और गति भी सीमित है। इसलिए वितरित प्रोसेसिंग (distributed processing) करते हैं: डेटा और काम कई कंप्यूटरों (क्लस्टर) में बँटता है जो एक साथ (parallel) चलते हैं।

MapReduce तीन चाल में

  1. Split (बाँटो): डेटा के टुकड़े, हर मशीन को एक।
  2. Map: हर मशीन अपने टुकड़े पर काम करके छोटे नतीजे बनाती है (जैसे शब्द → गिनती)।
  3. Reduce (जोड़ो): एक ही key वाले नतीजे इकट्ठे करके अंतिम जवाब बनता है।

उदाहरण: अरबों वेब पेजों में हर शब्द कितनी बार आया, यह गिनना हो तो हर मशीन अपने पेज गिनती है; फिर 'क्रिकेट' की सारी गिनतियाँ जोड़ दी जाती हैं।

फ़ंक्शनल प्रोग्रामिंग क्यों काम आती है

जिन फ़ंक्शन का कोई साइड इफ़ेक्ट नहीं होता और जो अपरिवर्तनीय (immutable) डेटा लेते हैं, वे एक ही इनपुट पर हमेशा एक ही आउटपुट देते हैं। इसलिए उन्हें कई मशीनों पर किसी भी क्रम में एक साथ चलाना सुरक्षित है। map, filter, reduce जैसे हायर-ऑर्डर फ़ंक्शन इसी तरीके के हैं।

बिग डेटा का मॉडल: तथ्य और ग्राफ

फैक्ट-आधारित मॉडल (Fact-based model)

किसी रिकॉर्ड को बदलने के बजाय हर जानकारी को समय के साथ एक तथ्य की तरह जोड़ते हैं, जो कभी मिटाया नहीं जाता। जैसे 'आशा पुणे में रहती है (2024-03-01)', बाद में 'आशा दिल्ली में रहती है (2026-07-15)'। कुछ भी ऊपर से नहीं लिखा जाता, इसलिए पूरा इतिहास बचा रहता है।

ग्राफ स्कीमा (Graph schema)

ग्राफ में डेटा नोड (लोग, जगह, सामान) और एज (उनके बीच संबंध, जैसे 'फ़ॉलो करता है', 'खरीदा') के रूप में रहता है। नोड और एज पर गुण (properties) भी हो सकते हैं, जैसे उम्र या तारीख। सोशल नेटवर्क, नक्शे और सुझाव (recommendations) के लिए ग्राफ सबसे अच्छे हैं।

उपयोग, AI और खतरे

खतरे: निजता (privacy) का नुकसान, डेटा लीक, पक्षपाती डेटा से अन्यायपूर्ण फ़ैसले, 'साथ-साथ बढ़ना' (correlation) को 'कारण' मान लेना, और डेटा सेंटर की बिजली खपत। डेटा सुरक्षा कानून कहते हैं कि केवल ज़रूरी डेटा लो और उसे सुरक्षित रखो।

खुद करके देखो: MapReduce टीम बनो

चाहिए: अख़बार का एक पन्ना और 3-4 दोस्त या घर के लोग।

  1. पहले अनुमान लगाओ: 'है' शब्द एक व्यक्ति जल्दी गिनेगा या चार लोग?
  2. एक व्यक्ति पूरे पन्ने पर 'है' गिने। समय नोट करो।
  3. अब पन्ने को 4 पट्टियों में काटो (Split)। हर व्यक्ति अपनी पट्टी पर गिने (Map)।
  4. चारों संख्याएँ जोड़ो (Reduce)। फिर समय नोट करो।
  5. तुलना करो। टीम ठीक 4 गुना तेज़ क्यों नहीं हुई? (काटने, बाँटने और जोड़ने में भी समय लगता है।)

3D के आखिरी चरण में स्लाइडर से यही बात देखो।

मुख्य सूत्र और परिभाषाएँ

हल किए गए उदाहरण

1. एक वीडियो ऐप पर हर मिनट 500 घंटे का नया वीडियो, साथ में कमेंट और लाइक आते हैं। इसमें बिग डेटा के कौन-से V हैं?

मात्रा: वीडियो फ़ाइलें बहुत बड़ी हैं और हर मिनट 500 घंटे बहुत ज़्यादा है। वेग: यह हर मिनट बिना रुके आता है। विविधता: वीडियो, टेक्स्ट कमेंट और लाइक की संख्या, तीन अलग प्रकार। यानी तीनों V।

2. एक कंप्यूटर को किसी डेटा पर 60 घंटे लगते हैं। काम 12 मशीनों में बराबर बाँटा गया। अतिरिक्त समय छोड़ दें तो कितना समय लगेगा?

आदर्श समय = 60 ÷ 12 = 5 घंटे। असल में थोड़ा ज़्यादा लगेगा, क्योंकि डेटा बाँटने, नेटवर्क पर भेजने और नतीजे जोड़ने में भी समय लगता है।

3. MapReduce से तीन टोकरियों के फल गिनो: टोकरी 1 = सेब, आम, सेब; टोकरी 2 = आम, आम; टोकरी 3 = सेब, केला।

Map (हर टोकरी अलग): T1 → (सेब,2), (आम,1); T2 → (आम,2); T3 → (सेब,1), (केला,1)। key से समूह: सेब → [2,1], आम → [1,2], केला → [1]। Reduce (जोड़ो): सेब = 3, आम = 3, केला = 1।

4. शब्दों में एक छोटा ग्राफ बनाओ: रवि मीना को फ़ॉलो करता है, मीना रवि को फ़ॉलो करती है, मीना ने पोस्ट 'बारिश का दिन' लाइक की।

नोड: रवि (व्यक्ति), मीना (व्यक्ति), 'बारिश का दिन' (पोस्ट)। एज: रवि → मीना 'फ़ॉलो'; मीना → रवि 'फ़ॉलो'; मीना → 'बारिश का दिन' 'लाइक'। 'लाइक' एज पर तारीख एक गुण हो सकती है।

आम गलतियाँ

अभ्यास क्विज़

1. इनमें से कौन मूल 3 V में नहीं है?
2. MapReduce में एक ही key वाले नतीजों को जोड़ने वाला चरण है:
3. फ़ोटो, वीडियो और चैट संदेश किसके उदाहरण हैं?
4. वितरित प्रोसेसिंग में फ़ंक्शनल प्रोग्रामिंग क्यों उपयोगी है?
5. ग्राफ स्कीमा में 'फ़ॉलो करता है' जैसा संबंध क्या होता है?

अभ्यास: खुद जवाब दो

अपना जवाब लिखो या चुनो, फिर जाँचें दबाओ। अटको तो संकेत देखो; जवाब देने के बाद पूरा हल दिखेगा।

अक्सर पूछे जाने वाले प्रश्न

बिग डेटा आसान शब्दों में क्या है?

ऐसा डेटा जो एक साधारण कंप्यूटर के लिए बहुत बड़ा, तेज़ या मिला-जुला हो, इसलिए कई कंप्यूटर मिलकर उस पर काम करते हैं।

बिग डेटा के 3 V कौन-से हैं?

मात्रा (Volume), वेग (Velocity) और विविधता (Variety)। कुछ लोग Veracity और Value भी जोड़ते हैं।

MapReduce क्या है?

बिग डेटा प्रोसेस करने का तरीका: डेटा बाँटो, कई मशीनें हिस्सों पर काम करें (Map), फिर नतीजे जोड़ो (Reduce)।

यह कहाँ पढ़ाया जाता है

सीबीएसई (भारत)कक्षा 12बिग डेटा और डेटा विश्लेषण
इंग्लैंडYear 134.11 Big Data
दक्षिण कोरिया고등학교 1학년Science and the future
दक्षिण कोरिया고등학교 2학년AI and big data
दक्षिण कोरिया고등학교 2학년Data
चीन高一Comp.1 Ch.1 Data and big data

पहले यह पढ़ें

आगे पढ़ें

इससे जुड़े पाठ

सभी कंप्यूटर विज्ञान पाठ