A molekuláris biológia központi dogmája és a szekvenciakonverzió
A molekuláris biológia központi dogmája írja le a genetikai információ áramlásának fő irányát a sejtekben: a DNS-ben tárolt információ transzkripció (átírás) útján RNS-sé alakul, majd a transzláció (lefordítás) folyamatában fehérjévé szintetizálódik. A laboratóriumi kutatások és a bioinformatikai elemzések során gyakran szükséges a nukleinsav-szekvenciák számítógépes átírása vagy visszaírása.
A DNS és az RNS közötti legfőbb szerkezeti különbség a pirimidinbázisokban rejlik: a DNS timint (T) tartalmaz, míg az RNS uracilt (U). Amikor a kutatóknak egy gén kódoló régióját kell elemezniük, vagy egy RNS-alapú vírus genomját vizsgálják, a szekvenciák manuális átalakítása időigényes és hibaforrást jelentő feladat. Ez az online eszköz pontosan ezt a folyamatot automatizálja, lehetővé téve a gyors váltást a két nukleinsav-típus között.
Kódoló és templát szálak a konverzióban
A kettős szálú DNS-molekulák két ellentétes lefutású, komplementer szálból állnak. A transzkripció és a szekvencia-értelmezés szempontjából kulcsfontosságú a megfelelő szál kiválasztása:
- Kódoló (értelmes) szál: Ez a DNS-szál azonos bázissorrenddel rendelkezik, mint a keletkező mRNS (hírvivő RNS), azzal az egyetlen különbséggel, hogy a DNS-ben található timin (T) helyett az RNS-ben uracil (U) szerepel.
- Templát (ellenértelmes) szál: Ez az a szál, amelyet az RNS-polimeráz enzim ténylegesen leolvas a transzkripció során. A keletkező RNS-szekvencia a templát szál komplementer másolata lesz.
A konverzió iránya szerint az eszköz az alábbi szabályokat alkalmazza:
Kódoló (értelmes) szál konverziója
- DNA → RNA: Minden
Tbázis helyéreUkerül. Minden egyéb bázis változatlan marad. - RNA → DNA: Minden
Ubázis helyéreTkerül. Minden egyéb bázis változatlan marad.
Templát (ellenértelmes) szál konverziója
Ebben a módban minden egyes bázis a komplementer párjára cserélődik.
- DNA → RNA:
A→U,T→A,C→G,G→C. - RNA → DNA:
A→T,U→A,C→G,G→C.
IUPAC degenerált bázisok és speciális karakterek kezelése
A valós laboratóriumi szekvenciák gyakran tartalmaznak bizonytalan vagy degenerált bázisokat, amelyeket az IUPAC (International Union of Pure and Applied Chemistry) szabványos kódrendszere ír le. Az eszköz teljes mértékben támogatja ezeket a kódokat, így a konverzió során nem vész el az információ.
A templát szál konverziója során a degenerált IUPAC kódok a megfelelő komplementer kódra képződnek le a Cornish-Bowden által leírt nómenklatúra alapján:
R(purin: A vagy G) komplementere aY(pirimidin: C vagy T/U), ígyR↔Y.K(keto: G vagy T/U) komplementere aM(amino: A vagy C), ígyK↔M.B(nem A) komplementere aV(nem T/U), ígyB↔V.D(nem C) komplementere aH(nem G), ígyD↔H.- Az
S(erős kötés: G vagy C), aW(gyenge kötés: A vagy T/U), valamint azN(bármely bázis) kódok önkomplementerek, így változatlanok maradnak.
A kisbetűs karakterek a konverzió után is megőrzik kisbetűs formájukat. Az igazítási hézagok jelölésére használt kötőjelek (-) szintén érintetlenül megmaradnak az eredményben.
A FASTA formátum és a bemeneti adatok tisztítása
A bioinformatikában a FASTA a legelterjedtebb szöveges formátum a nukleinsav-szekvenciák ábrázolására. A formátum jellegzetessége a > jellel kezdődő fejléc (névsor), amely a szekvencia metaadatait tartalmazza. Az eszköz a régi FASTA konvenció szerinti, ; jellel kezdődő megjegyzéssorokat is felismeri.
A beillesztett adatok feldolgozása során az alábbi szabályok érvényesülnek:
- Egyetlen fejléc esetén: A névsort az eszköz változatlanul megőrzi és a kapott eredmény felett jeleníti meg, miközben a
Névsor megtartva.üzenetet jelzi ki. - Több fejléc esetén: Ha a bemenet több névsort is tartalmaz, az eszköz a szekvenciasorokat egyetlen folytonos szekvenciává fűzi össze, és a
‹n› névsor található – a szekvenciasorok egybe lettek fűzve.megjegyzést jeleníti meg. - Nemkívánatos karakterek: A szóközök, soremelések, számjegyek és írásjelek automatikusan eltávolításra kerülnek a szekvenciából. Az eszköz pontosan jelzi a tisztítás tényét a
Figyelmen kívül hagyva ‹n› szóköz, számjegy és írásjel.üzenettel.
Ha a bemenet nem támogatott betűket tartalmaz, a rendszer hibaüzenetet küld: Nem támogatott betűk: ‹chars›. Csak DNA/RNA bázisbetűk megengedettek., amelyben legfeljebb az első 6 hibás karaktert listázza ki. A maximális beviteli méret 2 000 000 nyers karakter; e felett a Ez a szekvencia túl hosszú ehhez az eszközhöz. Kérjük, tartsa ‹max› karakter alatt. hibaüzenet jelenik meg.
GC-tartalom számítása és jelentősége
A GC-tartalom a guanin (G) és citozin (C) bázisok százalékos arányát jelenti a szekvenciában a teljes bázisszámhoz képest. Ez a mutató kritikus fontosságú a PCR (polimeráz láncreakció) primerek tervezése során, mivel a G-C párok három hidrogénkötéssel kapcsolódnak egymáshoz (szemben az A-T/U párok két kötésével), így közvetlenül befolyásolják a DNS olvadási hőmérsékletét.
Az eszköz a GC-tartalmat az alábbi képlet alapján számítja ki:
GC-tartalom = (G + C + S) / (A + C + G + T + U + W + S) × 100%
A képletben az S degenerált kód (G vagy C) beleszámít a GC-értékbe, míg a W kód (A vagy T/U) az AT-értéket növeli. Az egyéb bizonytalan IUPAC kódok (R, Y, K, M, B, V, D, H, N) kimaradnak a számításból, mivel pontos GC-hozzájárulásuk nem határozható meg. A GC-tartalom értéke a konverziók során nem változik, mivel a T↔U csere nem érinti a G, C, A bázisokat, a templát-szál komplementáció pedig csak a csoportokon belüli cseréket (G↔C, A↔T/U) hajtja végre.
Adatkezelés és adatvédelem
A szekvencia konvertálása a böngészőjében történik. Semmi sem töltődik fel a BroBroGo szervereire. Ez biztosítja, hogy a kutatási adatok és a szekvenciák helyben, a felhasználó eszközén maradnak a feldolgozás során.
Gyakran Ismételt Kérdések
Mi a különbség a kódoló és a templát szál között?
A kódoló (értelmes) szál megegyezik a hírvivő RNS-sel (mRNA), kivéve, hogy a T helyébe U lép. A templát (ellenértelmes) szál az, amelyet a sejt ténylegesen leolvas, így itt minden bázis komplementerére cserélődik: A→U, T→A, C→G, G→C. Válassza azt a szálat, amelyik megfelel a beillesztett szekvencia leírásának.
Mit eredményez az RNA → DNA konverzió?
Az RNA-jának egy DNA-másolata: minden U bázisból T lesz, minden más változatlan marad. Ez az a cDNA szekvencia, amelyet egy reverz transzkriptáz állítana elő, ami akkor hasznos, ha egy későbbi eszköz csak DNA-t fogad el.
Beilleszthetek olyan bizonytalan báziskódokat, mint az N, R vagy Y?
Igen. A degenerált IUPAC kódok megmaradnak: az egyszerű konverzió csak a T és U bázisokat érinti, a templát-szál konverzió pedig minden kódot a megfelelő komplementerére képez le (R↔Y, K↔M; az S, W és N változatlan marad). Az igazítási hézagok jelölései (-) megmaradnak, és a kisbetűk is megőrzik a kisbetűs formájukat.
Mi történik a FASTA fejlécekkel, számokkal és szóközökkel?
A > jellel kezdődő névsort megtartjuk és a kapott eredmény felett jelenítjük meg. A szóközöket, soremeléseket, számjegyeket és írásjeleket figyelmen kívül hagyjuk, a beviteli mező alatti megjegyzés pedig jelzi, hogy mennyi karakter lett eltávolítva – semmi sem tűnik el nyomtalanul.