DNA ir RNA sekų konvertavimo principai
Molekulinėje biologijoje genetinis kodas yra saugomas deoksiribonukleorūgšties (DNA) molekulėse, o baltymų sintezei ir kitoms ląstelinėms funkcijoms vykdyti informacija yra nuskaitoma į ribonukleorūgštį (RNA). Šis procesas, vadinamas transkripcija, vyksta pagal griežtas komplementarumo taisykles. Norint atlikti bioinformatinę analizę, kurti pradmenis (angl. primers) ar modeliuoti eksperimentus, dažnai tenka konvertuoti DNA sekas į RNA arba atlikti atvirkštinį procesą – RNA sekas paversti į komplementarią DNA (cDNA).
Šis procesas priklauso nuo to, kuri DNA grandinė yra naudojama kaip atskaitos taškas:
- Koduojančioji (prasminė) grandinė (angl. coding / sense strand) turi tokią pačią nukleotidų seką kaip ir susidaranti mRNA, išskyrus tai, kad DNA esantis timinas (T) RNA molekulėje yra pakeičiamas uracilu (U).
- Matricinė (priešprasminė) grandinė (angl. template / antisense strand) tarnauja kaip tiesioginis šablonas transkripcijos metu. RNA polimerazė nuskaito šią grandinę ir sintezuoja jai komplementarią RNA molekulę, kurioje adeninas (A) jungiasi su uracilu (U), timinas (T) su adeninu (A), o citozinas (C) su gvaninu (G).
Konvertavimo kryptys ir grandinių parinktys
Atliekant sekų transformaciją, įrankis leidžia pasirinkti dvi esmines parinktis: konvertavimo kryptį (Konvertavimas) ir grandinės tipą (Grandinė).
DNA → RNA konvertavimas
Ši kryptis naudojama transkripcijos procesui imituoti. Rezultatas priklauso nuo pasirinktos grandinės:
- Pasirinkus Koduojančioji (prasminė): kiekviena DNA bazė
Tyra pakeičiama įU. Visos kitos bazės išlieka nepakitusios. - Pasirinkus Matricinė (priešprasminė): atliekamas pilnas komplementarus keitimas, kur
A→U,T→A,C→GirG→C.
RNA → DNA konvertavimas
Ši kryptis imituoja atvirkštinę transkripciją, kurios metu iš RNA šablono yra susintetinama DNA seka. Tai itin naudinga tyrėjams, kuriems reikia sugeneruoti cDNA seką iš RNA šablono, kad galėtų ją naudoti molekulinės biologijos įrankiuose, priimančiuose tik DNA įvestis.
- Pasirinkus Koduojančioji (prasminė): kiekviena RNA bazė
Uyra pakeičiama įT. - Pasirinkus Matricinė (priešprasminė): atliekamas komplementarus keitimas, kur
A→T,U→A,C→GirG→C.
IUPAC neapibrėžtumo kodai ir specialieji simboliai
Dirbant su konsensuso sekomis arba degeneruotais pradmenimis, sekose dažnai pasitaiko ne tik standartinės bazės (A, T, C, G, U), bet ir IUPAC (International Union of Pure and Applied Chemistry) neapibrėžtumo kodai. Šie kodai žymi kelias galimas bazes konkrečioje pozicijoje.
Atliekant matricinės grandinės konvertavimą, šie kodai yra tiksliai komplementuojami pagal Cornish-Bowden (1985) rekomendacijas:
R(purinas: A arba G) keičiamas suY(pirimidinas: C arba T/U).K(keto: G arba T/U) keičiamas suM(amino: A arba C).B(visi išskyrus A) keičiamas suV(visi išskyrus T/U).D(visi išskyrus C) keičiamas suH(visi išskyrus G).- Kodai
S(stiprus: G arba C),W(silpnas: A arba T/U) irN(bet kuri bazė) yra savaime komplementarūs, todėl konvertavimo metu išlieka nepakitę.
Lygiavimo tarpų žymekliai (-) ir mažosios raidės yra visiškai išsaugomi, išlaikant jų originalų registrą ir poziciją.
FASTA formato palaikymas ir simbolių filtravimas
Įrankis yra pritaikytas darbui su FASTA formato failais. Jei įvestyje aptinkama viena pavadinimo eilutė, prasidedanti simboliu > (arba senojo formato komentaro simboliu ;), ji yra išsaugoma ir rodoma virš rezultato, o vartotojui pateikiama pastaba: Pavadinimo eilutė išsaugota..
Jei įvestyje aptinkamos kelios pavadinimo eilutės, įrankis sujungia sekos eilutes į vieną bendrą seką ir pateikia pranešimą: Rasta ‹n› pavadinimo eilučių – sekos eilutės buvo sujungtos į vieną..
Visi tarpai, eilučių lūžiai, skaitmenys ir skyrybos ženklai yra automatiškai pašalinami iš sekos prieš pradedant konvertavimą. Vartotojui parodomas tikslus pašalintų simbolių skaičius su pranešimu: Ignoruota ‹n› tarpų, skaitmenų ir skyrybos ženklų.. Tai leidžia tiesiogiai kopijuoti sekas iš mokslinių publikacijų ar duomenų bazių, nesirūpinant dėl formatavimo šiukšlių.
GC kiekio skaičiavimas
GC kiekis (angl. GC content) yra svarbus rodiklis, nurodantis gvanino ir citozino bazių dalį sekoje, kuri daro tiesioginę įtaką DNA/RNA lydymosi temperatūrai (Tm) ir yra kritiškai svarbi PCR reakcijų bei pradmenų projektavimui.
GC kiekis procentais yra skaičiuojamas pagal šią formulę:
GC kiekis = (G + C + S) / (A + C + G + T + U + W + S) × 100%
Šioje formulėje neapibrėžtumo kodas S (stiprios jungtys: G arba C) yra įtraukiamas į skaitiklį ir vardiklį, o kodas W (silpnos jungtys: A arba T/U) – tik į vardiklį. Kiti degeneruoti kodai (R, Y, K, M, B, V, D, H, N) yra visiškai neįtraukiami į skaičiavimą, nes jų indėlis į GC kiekį yra neapibrėžtas. Jei sekoje nėra bazių, kurias būtų galima įvertinti, procentinė reikšmė nerodoma. GC kiekis išlieka identiškas tiek prieš, tiek po konvertavimo.
Techniniai apribojimai ir klaidų apdorojimas
Kad įrankis veiktų stabiliai, taikomi šie apribojimai ir taisyklės:
- Maksimalus ilgis: Įvesties seka negali viršyti 2 000 000 neapdorotų simbolių. Viršijus šią ribą, rodoma klaida:
Ši seka yra per ilga šiam įrankiui. Apribokite ją iki ‹max› simbolių.. - Neleistini simboliai: Jei sekoje aptinkamos raidės, kurios nepriklauso standartinėms bazėms ar IUPAC kodams, konvertavimas sustabdomas ir parodomas pranešimas:
Nepalaikomos raidės: ‹chars›. Leidžiamos tik DNA/RNA bazių raidės.(parodoma iki 6 pirmųjų skirtingų neleistinų raidžių). Skaitmenys, tarpai ir skyrybos ženklai niekada nesukelia šios klaidos, nes jie yra tiesiog pašalinami.
Duomenų apdorojimas ir privatumas
Visi sekų konvertavimo procesai yra atliekami lokaliai, tiesiogiai jūsų interneto naršyklėje. Jūsų seka konvertuojama jūsų naršyklėje. Nieko neperduodama į BroBroGo.
Dažniausiai užduodami klausimai (FAQ)
Kas nutinka su FASTA antraštėmis, skaičiais ir tarpais?
Pavadinimo eilutė, prasidedanti simboliu >, yra išsaugoma ir rodoma virš rezultato. Tarpai, eilučių lūžiai, skaitmenys ir skyrybos ženklai yra ignoruojami, o po įvesties lauku esanti pastaba nurodo, kiek jų buvo pašalinta – niekas nėra pašalinama tyliai.
Ar galiu įklijuoti neapibrėžtumo kodus, tokius kaip N, R arba Y?
Taip. Degeneruotos IUPAC raidės yra išsaugomos: atliekant paprastą konvertavimą keičiami tik T ir U, o konvertuojant matricinę grandinę kiekvienas kodas susiejamas su jam tinkamu komplementu (R↔Y, K↔M; S, W ir N lieka). Lygiavimo tarpų žymekliai (-) yra išsaugomi, o mažosios raidės išlaiko savo registrą.
Kuo skiriasi koduojančioji ir matricinė grandinės?
Koduojančioji (prasminė) grandinė atitinka informacinę RNA (mRNA), tik T tampa U. Matricinė (priešprasminė) grandinė yra ta, kurią ląstelė iš tikrųjų nuskaito, todėl kiekviena bazė yra komplementuojama: A→U, T→A, C→G, G→C. Pasirinkite grandinę, kuri atitinka tai, kaip buvo užrašyta jūsų seka.
Ką man duoda RNA → DNA konvertavimas?
Jūsų RNA kopija DNA pavidalu: kiekvienas U tampa T, o visa kita lieka nepakitę. Tai yra cDNA seka, kurią sukurtų atvirkštinė transkriptazė, naudinga, kai tolesnis įrankis priima tik DNA.