DNA- ja RNA-sekvenssien muuntaminen molekyylibiologiassa
Geneettisen tiedon siirtyminen ja muuntuminen DNA:n ja RNA:n välillä on elämän perusedellytys. Molekyylibiologisessa tutkimuksessa ja bioinformatiikassa tutkijat kohtaavat jatkuvasti tarpeen muuntaa sekvenssejä näiden kahden nukleiinihapon välillä. DNA-RNA-sekvenssimuunnin on kehitetty ratkaisemaan tämä tarve suoraan selaimessa. Työkalu mahdollistaa sekvenssien muuntamisen molempiin suuntiin ottaen huomioon biologiset säännöt, kuten koodaavan ja mallijuosteen erot, IUPAC-suositusten mukaiset epämääräiset emäskoodit sekä FASTA-muotoiset otsikkorivit.
Koodaava ja mallijuoste muunnoksen perustana
Kun DNA-sekvenssiä muunnetaan RNA-sekvenssiksi tai päinvastoin, on ratkaisevaa tietää, kumpaa DNA-kaksoiskierteen juostetta alkuperäinen sekvenssi edustaa. Työkalussa on valittavana kaksi vaihtoehtoa kohdassa Juoste:
- Koodaava (sense): Tämä juoste vastaa emäsjärjestykseltään suoraan syntyvää lähetti-RNA-sekvenssiä (mRNA), sillä erolla että DNA:n tymiini (T) on RNA:ssa korvautunut urasiililla (U). Kun valitaan tämä vaihtoehto suunnassa
DNA → RNA, jokainenTmuuttuuU-emäkseksi ja kaikki muut emäkset säilyvät ennallaan. SuunnassaRNA → DNAjokainenUmuuttuu vastaavastiT-emäkseksi. - Malli (antisense): Mallijuoste toimii transkriptiossa eli RNA-synteesissä templaattina, jota RNA-polymeraasi lukee. Syntyvä RNA-molekyyli on siten mallijuosteen komplementti eli vastinjuoste. Kun muunnos tehdään mallijuosteen mukaan suunnassa
DNA → RNA, jokainen emäs korvataan sen komplementilla:A→U,T→A,C→GjaG→C.
IUPAC-koodit ja erikoismerkit muunnoksessa
Luonnollisissa sekvensseissä esiintyy usein epämääräisyyksiä, joita kuvataan kansainvälisen IUPAC-IUB-nomenklatuurin mukaisilla koodeilla. Nämä koodit edustavat tilanteita, joissa tietyssä sekvenssin kohdassa voi olla useampi kuin yksi mahdollinen emäs. Esimerkiksi koodi R tarkoittaa puriinia (A tai G) ja Y pyrimidiiniä (C tai T/U). Alkuperäinen julkaisu näille koodeille on Cornish-Bowden A, "Nomenclature for incompletely specified bases in nucleic acid sequences: recommendations 1984", Nucleic Acids Research 13(9):3021–3030 (1985), DOI 10.1093/nar/13.9.3021.
Muunnin käsittelee näitä koodeja tarkasti. Kun käytetään koodaavaa juostetta, koodit säilyvät sellaisenaan. Kun muunnos tehdään mallijuosteen (antisense) mukaan, degeneroituneet IUPAC-koodit käännetään niiden oikeiksi komplementtikoodeiksi:
R(puriini) jaY(pyrimidiini) vaihtuvat keskenään:R↔Y.K(keto) jaM(amino) vaihtuvat keskenään:K↔M.B(ei A) jaV(ei T/U) vaihtuvat keskenään:B↔V.D(ei C) jaH(ei G) vaihtuvat keskenään:D↔H.- Itsestään komplementaariset koodit
S(vahva sidos: G tai C),W(heikko sidos: A tai T/U) jaN(mikä tahansa emäs) säilyvät muuttumattomina.
Pienet kirjaimet säilyttävät kokonsa muunnoksen aikana. Myös rinnastusmerkit (-), joita käytetään sekvenssirinnastuksissa kuvaamaan aukkoja, säilytetään tuloksessa sellaisenaan.
FASTA-muodon tuki ja merkkien suodatus
Työkalu on suunniteltu FASTA-yhteensopivaksi. Jos syötetty sekvenssi alkaa FASTA-muotoisella nimirivillä, joka alkaa merkillä > (tai vanhemman käytännön mukaisella kommenttimerkillä ;), tämä rivi tunnistetaan ja säilytetään tuloksen yläpuolella. Tällöin työkalu näyttää ilmoituksen Nimirivi säilytetty..
Jos syötteestä tunnistetaan useita nimirivejä, työkalu yhdistää niiden välissä olevat sekvenssirivit yhdeksi yhtenäiseksi sekvenssiksi ja näyttää ilmoituksen {n} nimiriviä löydetty – sekvenssirivit yhdistettiin yhdeksi..
Kaikki välilyönnit, rivinvaihdot, numerot ja välimerkit tulkitaan pelkästään muotoiluksi. Työkalu poistaa ne automaattisesti sekvenssistä ja ilmoittaa poistettujen merkkien määrän viestillä Ohitettu {n} välilyöntiä, numeroa ja välimerkkiä.. Jos syötteessä on muita kuin sallittuja emäskirjaimia tai IUPAC-koodeja, työkalu antaa virheilmoituksen Tukemattomia kirjaimia: {chars}. Vain DNA/RNA-emäskirjaimet ovat sallittuja. ilmoittaen enintään kuusi ensimmäistä virheellistä kirjainta. Syötteen pituusraja on 2 000 000 merkkiä, jonka ylittämisestä seuraa virheilmoitus Tämä sekvenssi on liian pitkä tälle työkalulle. Pidä se alle {max} merkin pituisena..
GC-pitoisuuden laskentakaava
GC-pitoisuus kuvaa guaniinin ja sytosiinin osuutta sekvenssin kaikista emäksistä. Se on tärkeä parametri muun muassa alukkeiden suunnittelussa ja PCR-menetelmissä, sillä G-C-pari muodostaa kolme vetysidosta ja vaikuttaa siten sekvenssin sulamislämpötilaan.
Työkalu laskee GC-pitoisuuden seuraavan kaavan mukaisesti:
GC-pitoisuus = (G + C + S) / (A + C + G + T + U + W + S) × 100%
Kaavassa otetaan huomioon myös epämääräisyyskoodit S (G tai C) ja W (A tai T/U). Muut degeneroituneet koodit (R, Y, K, M, B, V, D, H, N) jätetään kokonaan laskennan ulkopuolelle sekä osoittajasta että nimittäjästä, koska niiden tarkkaa GC-osuutta ei voida määrittää. Jos sekvenssi ei sisällä yhtään laskettavaa emästä, prosenttiarvoa ei näytetä. GC-pitoisuus pysyy samana muunnoksen suunnasta tai juosteesta riippumatta, sillä T↔U-muunnokset eivät vaikuta laskettaviin emäksiin, ja komplementtijuosteen muodostaminen vain vaihtaa emäkset luokkansa sisällä (G↔C ja A↔T/U).
Tietosuoja ja paikallinen käsittely
Käyttäjän yksityisyys on huomioitu työkalun teknisessä toteutuksessa. Kaikki sekvenssien käsittely ja muuntaminen tapahtuu paikallisesti suoraan käyttäjän omassa selaimessa. Mitään syötettyjä tietoja tai sekvenssejä ei lähetetä BroBroGo-palvelimelle.
Usein kysytyt kysymykset
Mitä eroa on koodaavalla ja mallijuosteella?
Koodaava (sense) juoste vastaa lähetti-RNA-ta, paitsi että T muuttuu U-emäkseksi. Mallijuoste (antisense) on se, jota solu todellisuudessa lukee, joten jokainen emäs korvataan vastin- eli komplementtiemäksellään: A→U, T→A, C→G, G→C. Valitse juoste, joka vastaa sitä, miten sekvenssisi on kirjoitettu.
Mitä RNA → DNA -muunnos antaa minulle?
RNA-sekvenssisi DNA-kopio: jokainen U muuttuu T-emäkseksi ja kaikki muu säilyy ennallaan. Tämä on cDNA-sekvenssi, jonka käänteiskopioijaentsyymi tuottaisi, ja se on hyödyllinen, kun jatkotyökalu hyväksyy vain DNA-sekvenssejä.
Voinko liittää epämääräisiä koodeja, kuten N, R tai Y?
Kyllä. Degeneroituneet IUPAC-koodit säilytetään: tavallinen muunnos koskee vain T- ja U-emäksiä, ja mallijuosteen muunnos vastaa kunkin koodin sen oikeaan vastin- eli komplementtiemäkseen (R↔Y, K↔M; S, W ja N säilyvät). Rinnastusmerkit (-) säilytetään, ja pienet kirjaimet säilyttävät kokonsa.
Mitä tapahtuu FASTA-otsikoille, numeroille ja välilyönneille?
Nimirivi, joka alkaa merkillä >, säilytetään ja näytetään tuloksen yläpuolella. Välilyönnit, rivinvaihdot, numerot ja välimerkit ohitetaan, ja syötteen alla oleva huomautus kertoo, kuinka paljon merkkejä poistettiin – mitään ei jätetä huomiotta hiljaisesti.