जैव सूचना विज्ञान क्या है?
जैव सूचना विज्ञान = जीव विज्ञान + कंप्यूटर विज्ञान + सांख्यिकी। एक मानव जीनोम में लगभग 3.2 अरब DNA अक्षर हैं। इसे हाथ से पढ़ना असंभव है, इसलिए कंप्यूटर चाहिए।
यह डेटा सुरक्षित रखने, तेज़ी से खोजने, अनुक्रम मिलाने, जीन ढूँढने और प्रोटीन का काम अनुमान लगाने में मदद करता है।
लैब डेटा के लिए स्प्रेडशीट
स्प्रेडशीट खानों (cells) की जाली है। हर पंक्ति एक नमूना, हर स्तंभ एक माप (जैसे अवशोषण या कॉलोनी की गिनती)।
- सूत्र खुद गणना करते हैं:
=AVERAGE(B2:B7)माध्य देता है। - चार्ट रुझान दिखाते हैं, जैसे वृद्धि वक्र।
- अच्छी आदतें: एक शीर्षक पंक्ति, शीर्षक में इकाई (mg/L), खाने न मिलाएँ (no merged cells), कच्चा डेटा और नतीजे अलग, तारीख़ वाली कॉपी सहेजें।
अनुक्रम डेटाबेस
DNA अनुक्रम 4 अक्षरों से लिखा जाता है: A, T, G, C। प्रोटीन अनुक्रम में 20 अक्षर होते हैं, हर अमीनो अम्ल का एक।
सार्वजनिक डेटाबेस में करोड़ों अनुक्रम मुफ़्त साझा होते हैं: GenBank (अमेरिका), ENA (यूरोप), DDBJ (जापान) रोज़ आपस में डेटा बाँटते हैं। UniProt में प्रोटीन, PDB में प्रोटीन के 3D आकार।
हर रिकॉर्ड में ID, जीव, विवरण और अनुक्रम होता है। आम फ़ॉर्मेट FASTA है: > से शुरू नाम की पंक्ति, फिर अक्षर।
अनुक्रम संरेखण (alignment)
संरेखण दो अनुक्रमों को सीध में रखकर देखता है कि कहाँ मिलते हैं। कंप्यूटर एक को दूसरे पर खिसकाता है और हर जगह अंक देता है: मिलान पर +, बेमेल या खाली जगह पर −। सबसे ज़्यादा अंक वाली जगह जीतती है।
% समानता = मिलते अक्षर ÷ मिलाए गए अक्षर × 100। ऊँची समानता का अर्थ अक्सर साझा पूर्वज होता है।
BLAST जैसे टूल पूरे डेटाबेस में सेकंडों में मिलते-जुलते अनुक्रम खोजते हैं। उपयोग: अनजान जीवाणु पहचानना, दूसरी प्रजाति में जीन खोजना, वायरस का पता लगाना।
जीनोम, SNP और प्रोटीन
जीनोमिक्स
जीनोम किसी जीव का पूरा DNA है। प्रोग्राम शुरू और रुकने के संकेत खोजकर जीन का अनुमान लगाते और गिनते हैं। मनुष्य में लगभग 20 000 प्रोटीन बनाने वाले जीन हैं।
SNP
SNP (एकल न्यूक्लियोटाइड बहुरूपता, "स्निप") वह जगह है जहाँ लोग एक अक्षर से अलग होते हैं। ज़्यादातर SNP हानिरहित हैं; कुछ बीमारी के ख़तरे या दवा के असर को बदलते हैं।
तुलनात्मक और कार्यात्मक जीनोमिक्स
प्रजातियों के जीनोम मिलाकर पता चलता है क्या साझा है और क्या नया। कार्यात्मक जीनोमिक्स पूछता है कौन सा जीन कब और कहाँ चालू होता है।
प्रोटियोमिक्स
प्रोटियोमिक्स कोशिका के सारे प्रोटीनों का अध्ययन है। सॉफ़्टवेयर अक्षरों से प्रोटीन का आकार अनुमानित करता है, जिससे दवाएँ बनाने में मदद मिलती है।
लैब में डिजिटल चित्र
सूक्ष्मदर्शी पर लगा कैमरा डिजिटल चित्र बनाता है: छोटे वर्गों की जाली, जिन्हें पिक्सेल कहते हैं। हर पिक्सेल चमक या रंग की संख्या रखता है।
सॉफ़्टवेयर कोशिकाएँ गिन सकता है, आकार या क्षेत्रफल माप सकता है। हमेशा स्केल बार (जैसे 10 µm) लगाओ और चित्र को ऐसे मत बदलो कि नतीजा बदल जाए।
नैतिकता और डिजिटल डेटा
- गोपनीयता: किसी का DNA स्वास्थ्य और परिवार के रिश्ते बता सकता है। डेटा बेनाम और सुरक्षित रखना ज़रूरी है।
- सहमति: लोग जानकर हाँ कहें कि डेटा कैसे इस्तेमाल होगा।
- न्याय: डेटा से नौकरी या बीमा न रोका जाए।
- ईमानदारी: कच्चा डेटा साझा करो, स्रोत बताओ, नतीजे कभी नकली या छिपाओ मत।
करके देखो
कागज़ की दो पट्टियों पर DNA लिखो, जैसे ATGCCTA और ATGACTA। एक को दूसरी के नीचे खिसकाओ और हर जगह मिलान गिनो। % समानता निकालो। फिर 3D के आख़िरी चरण में यही करो।
मुख्य सूत्र और परिभाषाएँ
- % समानता = मिलान ÷ मिलाए गए अक्षर × 100
- माध्य = मानों का योग ÷ मानों की संख्या
- DNA अक्षर: A, T, G, C (A-T और G-C जोड़ी)
- SNP = एक ही जगह पर एक अक्षर का अंतर
- वस्तु का क्षेत्रफल = एक पिक्सेल का क्षेत्रफल × पिक्सेल की संख्या
हल किए गए उदाहरण
1. अवशोषण मान 0.42, 0.55, 0.38, 0.61, 0.47 और 0.53 हैं। माध्य निकालो।
योग = 2.96। माध्य = 2.96 ÷ 6 ≈ 0.49।
2. ATGCCTAG और ATGACTAG का संरेखण करो। % समानता?
8 जगह मिलाओ: सिर्फ़ चौथी जगह अलग (C और A)। मिलान = 7। % समानता = 7 ÷ 8 × 100 = 87.5%।
3. एक कोशिका 22 पिक्सेल घेरती है। हर पिक्सेल 0.5 µm × 0.5 µm है। क्षेत्रफल?
एक पिक्सेल = 0.25 µm²। क्षेत्रफल = 22 × 0.25 = 5.5 µm²।
4. दो लोगों के अनुक्रम: GATTACA और GATCACA। कितने SNP, कहाँ?
चौथी जगह: T और C। एक SNP।
आम गलतियाँ
- सोचना कि यह सिर्फ़ कोडिंग है। शुरुआत जैविक सवाल से होती है; कंप्यूटर औज़ार है।
- % समानता में लंबे अनुक्रम की लंबाई से भाग देना, जबकि मिलाए गए अक्षरों से देना है।
- मानना कि हर SNP बीमारी करता है। ज़्यादातर का कोई असर नहीं।
- मिली-जुली इकाइयाँ या merged cells लिखना, जिससे स्प्रेडशीट के सूत्र बिगड़ते हैं।