Tok genetických informácií a molekulárna konverzia
V molekulárnej biológii je prenos genetickej informácie opísaný centrálnou dogmou, ktorá definuje tok informácií od DNA cez RNA až po proteíny. Proces, pri ktorom sa informácia z dvojvláknovej DNA prepisuje do jednovláknovej RNA, sa nazýva transkripcia. V laboratórnych podmienkach a bioinformatike je často potrebné tento proces simulovať digitálne, prípadne ho zvrátiť prostredníctvom reverznej transkripcie, kedy sa z RNA predlohy vytvára komplementárna DNA (cDNA).
Tento online nástroj slúži na presnú konverziu medzi sekvenciami DNA a RNA v oboch smeroch. Podporuje prácu s rôznymi typmi reťazcov, zachováva dôležité formátovacie prvky a umožňuje spracovanie neštandardných nukleotidových zápisov vrátane degenerovaných kódov.
Kódujúci verzus templátový reťazec
Pri prepise genetického kódu je kľúčové rozlišovať medzi dvoma reťazcami dvojzávitnice DNA:
- Kódujúci (zmyslový) reťazec (sense): Tento reťazec nesie rovnakú sekvenciu báz ako výsledná informačná RNA (mRNA), s jediným rozdielom, že namiesto tymínu (T) obsahuje RNA uracil (U).
- Templátový (antizmyslový) reťazec (antisense): Tento reťazec slúži ako skutočná fyzická predloha pre RNA polymerázu počas transkripcie. Výsledná RNA je komplementárna k tomuto reťazcu.
Nástroj vykonáva konverziu na základe zvoleného smeru a typu reťazca podľa nasledujúcich pravidiel:
| Smer konverzie | Reťazec | Pravidlo konverzie |
|---|---|---|
DNA → RNA |
Kódujúci (zmyslový) |
Každý tymín (T) sa zmení na uracil (U). Ostatné bázy zostávajú nezmenené. |
RNA → DNA |
Kódujúci (zmyslový) |
Každý uracil (U) sa zmení na tymín (T). Ostatné bázy zostávajú nezmenené. |
DNA → RNA |
Templátový (antizmyslový) |
Každá báza sa nahradí svojím komplementom: A→U, T→A, C→G, G→C. |
RNA → DNA |
Templátový (antizmyslový) |
Každá báza sa nahradí svojím komplementom: A→T, U→A, C→G, G→C. |
Spracovanie degenerovaných IUPAC kódov a špeciálnych znakov
V genomike sa často stretávame so sekvenciami, ktoré obsahujú nejednoznačné pozície, napríklad pri zápise konsenzuálnych sekvencií alebo degenerovaných primerov. Tieto pozície sa označujú štandardizovanými IUPAC-IUB kódmi pre neúplne špecifikované bázy.
Nástroj plne podporuje a správne konvertuje tieto degenerované symboly podľa medzinárodných odporúčaní (Cornish-Bowden, 1985). Pri konverzii templátového reťazca dochádza k presnému komplementárnemu párovaniu týchto kódov:
R(purín: A/G) sa mení naY(pyrimidín: C/T/U) a naopak (R↔Y).K(keto: G/T) sa mení naM(amino: A/C) a naopak (K↔M).B(všetky okrem A) sa mení naV(všetky okrem T/U) a naopak (B↔V).D(všetky okrem C) sa mení naH(všetky okrem G) a naopak (D↔H).- Kódy
S(silné väzby: G/C),W(slabé väzby: A/T/U) aN(akýkoľvek nukleotid) sú samokomplementárne, preto zostávajú nezmenené.
Malé písmená v sekvencii si počas celej konverzie zachovávajú svoju veľkosť. Zarovnávacie pomlčky (-), ktoré slúžia ako indikátory medzier v sekvenčných zarovnaniach, zostávajú taktiež neporušené.
Výpočet obsahu GC a štatistiky
Nástroj po vložení sekvencie automaticky analyzuje jej zloženie a zobrazuje štatistické údaje vrátane hodnôt pre Vstupné bázy, Výsledné bázy a Obsah GC.
Obsah GC vyjadruje percentuálny podiel guanínu a cytozínu v sekvencii, čo je kľúčový parameter pre stanovenie teploty topenia primerov a stability nukleových kyselín. Výpočet prebieha podľa nasledujúceho vzorca:
Obsah GC = (G + C + S) / (A + C + G + T + U + W + S) × 100%
V tomto výpočte sa zohľadňuje aj degenerovaný kód S (keďže reprezentuje G alebo C) a W (reprezentuje A alebo T/U). Ostatné nejednoznačné IUPAC kódy (R, Y, K, M, B, V, D, H, N) sú z čitateľa aj menovateľa vylúčené, pretože ich presný príspevok k obsahu GC nie je definovaný. Ak sekvencia neobsahuje žiadne počítateľné bázy, percentuálny údaj sa nezobrazí. Hodnota obsahu GC zostáva pri konverzii konštantná, keďže komplementácia iba zamieňa bázy v rámci rovnakých skupín.
Formát FASTA a čistenie vstupu
Nástroj je navrhnutý tak, aby bez problémov spracovával štandardný textový formát FASTA.
Ak vstup obsahuje jeden riadok s názvom začínajúci znakom > (prípadne starším komentárovým znakom ;), tento riadok je detegovaný ako hlavička. Nástroj ho počas konverzie izoluje, neupravuje ho a zobrazí ho na začiatku výsledku spolu s upozornením Riadok s názvom bol zachovaný..
Ak sa na vstupe nachádza viacero riadkov s hlavičkou, nástroj zlúči samotné sekvenčné riadky do jedného celku a zobrazí informáciu Našlo sa ‹n› riadkov s názvom – riadky sekvencie boli spojené do jedného..
Všetky nepovolené znaky, ako sú medzery, zalomenia riadkov, číslice a interpunkčné znamienka, sú zo sekvencie automaticky odstránené. Používateľ je o tomto kroku informovaný správou Ignorovaných ‹n› medzier, číslic a interpunkčných znamienok.. Ak vstup obsahuje nepovolené písmená, ktoré nie sú bázami ani IUPAC kódmi, systém zobrazí chybové hlásenie Nepodporované písmená: ‹chars›. Povolené sú iba bázy DNA/RNA. s výpisom prvých šiestich neplatných znakov. Maximálny limit pre spracovanie je 2 000 000 znakov na vstupe, inak systém vygeneruje chybu Táto sekvencia je pre tento nástroj príliš dlhá. Skráťte ju pod ‹max› znakov..
Ochrana osobných údajov
Spracovanie zadaných sekvencií prebieha s ohľadom na bezpečnosť dát. Vaša sekvencia sa konvertuje priamo vo vašom prehliadači. Na servery BroBroGo sa nič neodosiela.
Často kladené otázky (FAQ)
Čo mi prinesie konverzia RNA → DNA?
DNA kópiu vašej RNA: každé U sa zmení na T a všetko ostatné zostane nezmenené. Ide o sekvenciu cDNA, ktorú by vytvorila reverzná transkriptáza, čo je užitočné, ak nadväzujúci nástroj akceptuje iba DNA.
Aký je rozdiel medzi kódujúcim a templátovým reťazcom?
Kódujúci (zmyslový) reťazec zodpovedá informačnej RNA (mRNA), s výnimkou toho, že T sa mení na U. Templátový (antizmyslový) reťazec je ten, ktorý bunka skutočne číta, takže každá báza sa nahradí svojím komplementom: A→U, T→A, C→G, G→C. Vyberte si reťazec, ktorý zodpovedá tomu, ako bola vaša sekvencia zapísaná.
Môžem vložiť nejednoznačné kódy ako N, R alebo Y?
Áno. Degenerované IUPAC kódy zostávajú zachované: jednoduchá konverzia mení iba T a U a konverzia templátového reťazca priradí každému kódu jeho správny komplement (R↔Y, K↔M; S, W a N zostávajú). Zarovnávacie pomlčky (-) sa zachovajú a malé písmená si zachovajú svoju veľkosť.
Čo sa stane s hlavičkami FASTA, číslami a medzerami?
Riadok s názvom začínajúci znakom > sa zachová a zobrazí sa nad výsledkom. Medzery, zalomenia riadkov, číslice a interpunkcia sa ignorujú a poznámka pod vstupom vás informuje o tom, koľko znakov bolo odstránených – nič sa neodstráni bez upozornenia.