मॉलिक्युलर बायोलॉजीमधील सिक्वेन्स रूपांतरण
मॉलिक्युलर बायोलॉजीच्या सेंट्रल डोग्मा (Central Dogma) नुसार, जनुकीय माहितीचा प्रवाह DNA कडून RNA कडे आणि शेवटी प्रथिनांकडे (Proteins) होतो. या प्रक्रियेतील पहिला टप्पा म्हणजे ट्रान्सक्रिप्शन (Transcription), ज्यामध्ये DNA टेम्पलेटचा वापर करून मेसेंजर RNA (mRNA) तयार केला जातो. प्रयोगशाळेतील संशोधनात किंवा बायोइन्फॉरमॅटिक्स विश्लेषणामध्ये, संशोधकांना अनेकदा DNA सिक्वेन्सचे RNA मध्ये किंवा RNA सिक्वेन्सचे परत DNA मध्ये रूपांतर करावे लागते.
हे रूपांतरण अचूकपणे करण्यासाठी सिक्वेन्सचा कोणता स्ट्रँड वापरला जात आहे हे समजणे आवश्यक असते. हे टूल कोडिंग (सेन्स) आणि टेम्पलेट (अँटीसेन्स) या दोन्ही स्ट्रँडचा विचार करून अचूक ट्रान्सक्रिप्शन आणि रिव्हर्स ट्रान्सक्रिप्शन प्रक्रिया पूर्ण करते.
कोडिंग विरुद्ध टेम्पलेट स्ट्रँड
DNA हा दुहेरी धाग्यांचा (Double-stranded) रेणू असतो, ज्यामध्ये दोन परस्परपूरक स्ट्रँड असतात. या दोन स्ट्रँडचे कार्य आणि रचना खालीलप्रमाणे असते:
- कोडिंग (सेन्स) स्ट्रँड (कोडिंग (सेन्स) strand): हा DNA चा तो स्ट्रँड आहे ज्याचा सिक्वेन्स थेट तयार होणाऱ्या mRNA सिक्वेन्ससारखाच असतो, फक्त DNA मधील थायमिन (T) च्या जागी RNA मध्ये युरॅसिल (U) असतो.
- टेम्पलेट (अँटीसेन्स) स्ट्रँड (टेम्पलेट (अँटीसेन्स) strand): हा तो स्ट्रँड आहे ज्याचा वापर RNA पॉलिमरेज एन्झाइम ट्रान्सक्रिप्शन दरम्यान प्रत्यक्ष टेम्पलेट म्हणून करतो. या स्ट्रँडवरील प्रत्येक बेसचा पूरक (Complementary) बेस RNA मध्ये जोडला जातो.
रूपांतरणाचे नियम
निवडलेल्या स्ट्रँडनुसार हे टूल खालील नियमांचे पालन करून रूपांतरण करते:
-
कोडिंग (सेन्स) स्ट्रँड रूपांतरण:
DNA → RNAरूपांतरणासाठी, प्रत्येकTच्या जागीUकेला जातो.RNA → DNAरूपांतरणासाठी, प्रत्येकUच्या जागीTकेला जातो.- इतर सर्व बेसेस बदलले जात नाहीत.
-
टेम्पलेट (अँटीसेन्स) स्ट्रँड रूपांतरण:
- यामध्ये प्रत्येक बेस त्याच्या पूरक बेसमध्ये बदलला जातो.
DNA → RNAसाठी:Aचे रूपांतरUमध्ये,TचेAमध्ये,CचेGमध्ये आणिGचेCमध्ये होते.
IUPAC डिजनरेट बेस कोड आणि विशेष अक्षरे
संशोधनात अनेकदा अशा सिक्वेन्सचा सामना करावा लागतो ज्यामध्ये निश्चित बेसऐवजी संदिग्धता (Ambiguity) असते. IUPAC-IUB मानकांनुसार, अशा संदिग्ध बेसेससाठी विशिष्ट डिजनरेट कोड ठरवले गेले आहेत. हे टूल हे कोड ओळखून त्यांचे योग्य पूरक कोडमध्ये रूपांतर करते:
| मूळ IUPAC कोड | अर्थ (बेसेस) | टेम्पलेट स्ट्रँडवरील पूरक कोड |
|---|---|---|
| R | A किंवा G | Y |
| Y | C किंवा T/U | R |
| K | G किंवा T/U | M |
| M | A किंवा C | K |
| S | G किंवा C (Strong) | S (स्वतःचा पूरक) |
| W | A किंवा T/U (Weak) | W (स्वतःचा पूरक) |
| B | C, G किंवा T/U (A नाही) | V |
| V | A, C किंवा G (T/U नाही) | B |
| D | A, G किंवा T/U (C नाही) | H |
| H | A, C किंवा T/U (G नाही) | D |
| N | कोणतेही बेस | N (स्वतःचा पूरक) |
Cornish-Bowden A, "Nomenclature for incompletely specified bases in nucleic acid sequences: recommendations 1984", Nucleic Acids Research 13(9):3021–3030 (1985), DOI 10.1093/nar/13.9.3021.
केस आणि अलाइनमेंट गॅप्स संवर्धन
रूपांतरण करताना अक्षरांचा आकार (Lowercase/Uppercase) जसाच्या तसा ठेवला जातो. लोअरकेस अक्षरे रूपांतरित झाल्यावरही लोअरकेस राहतात. तसेच, सिक्वेन्स अलाइनमेंटसाठी वापरले जाणारे गॅप मार्कर्स (-) देखील कोणत्याही बदलाशिवाय सुरक्षित ठेवले जातात.
GC प्रमाणाची गणना
GC प्रमाण हे PCR प्रक्रियेसाठी प्रायमर्स डिझाइन करताना आणि जीनोमिक विश्लेषणात अत्यंत महत्त्वाचे असते. या टूलमध्ये GC प्रमाणाची गणना खालील सूत्राचा वापर करून केली जाते:
GC प्रमाण = (G + C + S) / (A + C + G + T + U + W + S) × 100%
या गणनेमध्ये खालील नियमांचे पालन केले जाते:
- संदिग्धता कोड
S(G किंवा C) हा GC च्या बेरजेत मोजला जातो. - संदिग्धता कोड
W(A किंवा T/U) हा AT च्या बेरजेत मोजला जातो. - इतर सर्व डिजनरेट कोड (
R,Y,K,M,B,V,D,H,N) हे अंश आणि छेद या दोन्हीमधून वगळले जातात, कारण त्यांचे GC मधील योगदान अनिश्चित असते. - जर सिक्वेन्समध्ये एकही मोजण्यायोग्य बेस नसेल, तर कोणतेही टक्केवारीचे मूल्य दाखवले जात नाही.
- रूपांतरणामुळे GC प्रमाण बदलत नाही, कारण साध्या T↔U बदलांमुळे मूळ बेसेस बदलत नाहीत आणि टेम्पलेट रूपांतरणात बेसेस फक्त आपापल्या वर्गात बदलतात (G↔C, A↔T/U).
FASTA फॉरमॅट आणि इनपुट प्रक्रिया
हे टूल FASTA फॉरमॅटशी सुसंगत आहे. इनपुट प्रक्रियेदरम्यान खालील नियमांनुसार डेटा हाताळला जातो:
- FASTA हेडर:
>किंवा जुन्या पद्धतीनुसार;ने सुरू होणारी नावाची ओळ ओळखली जाते आणि ती निकालाच्या वर तशीच ठेवली जाते. या वेळीनावाची ओळ ठेवली आहे.असा संदेश दिसतो. - अनेक हेडर ओळी: इनपुटमध्ये एकापेक्षा जास्त हेडर ओळी आढळल्यास, सर्व सिक्वेन्स ओळी एकत्र करून एक केल्या जातात आणि
‹n› नावाच्या ओळी सापडल्या — सिक्वेन्सच्या ओळी एकत्र करून एक केल्या आहेत.असा संदेश दाखवला जातो. - वगळलेली अक्षरे: सिक्वेन्समधील स्पेस, लाइन ब्रेक्स, अंक आणि विरामचिन्हे स्वयंचलितपणे काढून टाकली जातात. अशा वेळी
‹n› स्पेस, अंक आणि विरामचिन्हांकडे दुर्लक्ष केले.हा संदेश दाखवून वगळलेल्या अक्षरांची अचूक संख्या दर्शवली जाते. - मर्यादा: इनपुट सिक्वेन्सची लांबी २०,००,००० (2,000,000) अक्षरांपेक्षा कमी असणे आवश्यक आहे. मर्यादा ओलांडल्यास
तो सिक्वेन्स या टूलसाठी खूप मोठा आहे. कृपया तो ‹max› अक्षरांपेक्षा कमी ठेवा.ही त्रुटी दर्शवली जाते. - अवैध अक्षरे: सिक्वेन्समध्ये अनधिकृत अक्षरे असल्यास
असमर्थित अक्षरे: ‹chars›. फक्त DNA/RNA बेस अक्षरांना परवानगी आहे.हा एरर मेसेज येतो, ज्यामध्ये पहिल्या ६ अवैध अक्षरांचा उल्लेख असतो.
गोपनीयता आणि डेटा सुरक्षा
तुमचा सिक्वेन्स तुमच्या ब्राउझरमध्येच रूपांतरित केला जातो. BroBroGo वर काहीही अपलोड केले जात नाही.
वारंवार विचारले जाणारे प्रश्न (FAQ)
FASTA हेडर्स, अंक आणि स्पेसचे काय होते?
> ने सुरू होणारी नावाची ओळ तशीच ठेवली जाते आणि निकालाच्या वर दाखवली जाते. जागा, लाइन ब्रेक्स, अंक आणि विरामचिन्हे यांकडे दुर्लक्ष केले जाते आणि इनपुटच्या खालील नोंद तुम्हाला किती भाग काढून टाकला हे सांगते — काहीही नकळत वगळले जात नाही.
मी N, R किंवा Y सारखे संदिग्धता कोड पेस्ट करू शकतो का?
होय. डिजनरेट IUPAC अक्षरे सुरक्षित ठेवली जातात: साधे रूपांतरण फक्त T आणि U ला स्पर्श करते, आणि टेम्पलेट-स्ट्रँड रूपांतरण प्रत्येक कोडला त्याच्या योग्य पूरक कोडमध्ये मॅप करते (R↔Y, K↔M; S, W आणि N तसेच राहतात). अलाइनमेंट गॅप मार्कर्स (-) ठेवले जातात आणि लोअरकेस अक्षरे त्यांची केस कायम ठेवतात.
कोडिंग आणि टेम्पलेट स्ट्रँडमध्ये काय फरक आहे?
कोडिंग (सेन्स) स्ट्रँड मेसेंजर RNA शी जुळतो, फक्त T ऐवजी U होतो. टेम्पलेट (अँटीसेन्स) स्ट्रँड हा असा असतो जो पेशी प्रत्यक्षात वाचते, त्यामुळे प्रत्येक बेस पूरक केला जातो: A→U, T→A, C→G, G→C. तुमचा सिक्वेन्स ज्या प्रकारे लिहिला गेला आहे त्याच्याशी जुळणारा स्ट्रँड निवडा.
RNA → DNA मला काय देते?
तुमच्या RNA ची DNA प्रत: प्रत्येक U ऐवजी T होतो आणि बाकी सर्व काही तसेच राहते. हा तो cDNA सिक्वेन्स आहे जो रिव्हर्स ट्रान्सक्रिप्टेज तयार करेल, जो पुढील टूल फक्त DNA स्वीकारत असताना उपयुक्त ठरतो.