Hur genetisk information översätts och konverteras
Inom molekylärbiologin beskriver det centrala dogmat hur den genetiska informationen flödar i en cell: från DNA via transkription till RNA, och slutligen till proteiner genom translation. DNA fungerar som det stabila arkivet i cellkärnan, medan RNA fungerar som den aktiva budbäraren (mRNA) som transporterar instruktionerna till ribosomerna.
Vid laboratoriearbete och bioinformatisk analys uppstår ofta behovet av att konvertera sekvenser mellan dessa två former. Exempelvis behöver forskare som arbetar med RNA-sekvenser ofta generera en cDNA-sekvens (komplementär DNA) för att kunna använda sekvensen i efterföljande molekylärbiologiska verktyg som endast accepterar DNA-indata. Denna process efterliknar hur enzymet omvänt transkriptas fungerar i naturen.
För att konverteringen ska bli korrekt måste man ta hänsyn till vilken av de två DNA-strängarna sekvensen representerar:
- Kodande (sense): Denna sträng har samma sekvens som det resulterande RNA-et, med den enda skillnaden att tymin (T) i DNA motsvaras av uracil (U) i RNA.
- Mallsträng (antisense): Detta är den fysiska mall som RNA-polymeraset faktiskt läser av under transkriptionen. Varje bas komplementeras till sin motsvarighet: adenin (A) blir uracil (U) i RNA (eller tymin (T) i DNA), tymin (T) blir adenin (A), cytosin (C) blir guanin (G), och guanin (G) blir cytosin (C).
Regler för sekvenskonvertering
Verktyget utför konverteringen baserat på strikta biologiska och notationella regler beroende på vald riktning och strängtyp:
Kodande (sense) strängkonvertering
Vid val av Kodande (sense) sker en direkt utbytning av motsvarande baser:
- Vid konvertering
DNA → RNAersätts varjeTmedU. - Vid konvertering
RNA → DNAersätts varjeUmedT. - Alla andra baser lämnas helt oförändrade.
Mallsträng (antisense) konvertering
Vid val av Mallsträng (antisense) komplementeras varje enskild bas:
- För
DNA → RNAgäller mappningen:A→U,T→A,C→G,G→C. - För
RNA → DNAgäller mappningen:A→T,U→A,C→G,G→C.
Hantering av skiftläge och specialtecken
- Skiftläge: Verktyget bevarar gemener. Om indata innehåller ett litet
tkonverteras det till ett litetu(och vice versa). - Justeringsgap: Tecken för sekvensjustering, såsom bindestreck (
-), bevaras intakta genom hela konverteringen. - Ignorerade tecken: Blanksteg, radbrytningar, siffror och skiljetecken rensas automatiskt bort från sekvensen. Verktyget visar exakt hur många sådana tecken som har tagits bort med meddelandet
Ignorerade ‹n› blanksteg, siffror och skiljetecken..
IUPAC-osäkerhetskoder och komplementering
Vid sekvensering eller design av degenererade primers används ofta standardiserade IUPAC-IUB-koder för att representera positioner där flera olika nukleotider är möjliga. Verktyget har fullt stöd för dessa koder och bevarar dem under konverteringen.
När en mallsträngskonvertering utförs, komplementeras de degenererade koderna enligt etablerade standarder (Cornish-Bowden, 1985):
R(purin: A/G) ochY(pyrimidin: C/T/U) är komplementära och mappas somR↔Y.K(keto: G/T) ochM(amino: A/C) är komplementära och mappas somK↔M.B(ej A) ochV(ej T/U) är komplementära och mappas somB↔V.D(ej C) ochH(ej G) är komplementära och mappas somD↔H.- Koderna
S(stark: G/C),W(svag: A/T/U) ochN(valfri bas) är självkomplementära och förblir därför oförändrade (S↔S,W↔W,N↔N).
FASTA-format och hantering av huvuden
FASTA är ett textbaserat standardformat för att representera nukleotidsekvenser, där varje sekvens inleds med en beskrivande namnrad. Verktyget är utformat för att hantera detta format utan att störa metadata:
- Enskild namnrad: Om indata innehåller en namnrad som inleds med
>(eller;enligt äldre FASTA-konvention), bevaras denna rad och placeras direkt ovanför det konverterade resultatet. Statusmeddelandet visar dåNamnrad behållen.. - Flera namnrader: Om verktyget upptäcker flera namnrader i indata, slås sekvensraderna ihop till en enda sammanhängande sekvens. Detta indikeras med meddelandet
‹n› namnrader hittades — sekvensraderna slogs ihop till en..
GC-halt och sekvensstatistik
GC-halten (andelen guanin och cytosin i en sekvens) är en kritisk parameter vid PCR-analys, primerdesign och genomiska studier eftersom GC-par binds samman med tre vätebindningar, till skillnad från AT-parens två.
Verktyget beräknar och visar sekvensstatistik för Baser indata, Baser resultat och GC-halt. GC-halten beräknas enligt följande formel:
GC-halt = (G + C + S) / (A + C + G + T + U + W + S) × 100%
I denna beräkning inkluderas den degenererade koden S (G eller C) i både täljaren och nämnaren, medan W (A eller T/U) inkluderas i nämnaren. Övriga osäkerhetskoder (R, Y, K, M, B, V, D, H, N) exkluderas helt från beräkningen eftersom deras exakta GC-bidrag är obestämt. Om sekvensen saknar mätbara baser visas inget procentvärde. GC-halten förblir alltid densamma före och efter konvertering, eftersom enkla T↔U-byten eller komplementeringar inte förändrar förhållandet mellan baserna.
Gränser och felmeddelanden
För att säkerställa stabil prestanda i webbläsaren finns det vissa begränsningar för indata:
- Längdbegränsning: Sekvensen får inte överstiga 2 000 000 tecken i råformat. Om denna gräns överskrids visas felmeddelandet:
Sekvensen är för lång för detta verktyg. Håll den under ‹max› tecken.. - Otillåtna tecken: Om sekvensen innehåller bokstäver som inte är giltiga nukleotider eller IUPAC-koder visas felmeddelandet:
Bokstäver som inte stöds: ‹chars›. Endast DNA/RNA-basbokstäver är tillåtna.. Meddelandet listar upp till de sex första felaktiga bokstäverna. Siffror, blanksteg och skiljetecken utlöser aldrig detta fel eftersom de automatiskt filtreras bort.
Integritet och lokal bearbetning
Din sekvens konverteras direkt i din webbläsare. Ingenting laddas upp till BroBroGo. Detta innebär att ingen extern server tar emot eller lagrar dina sekvensdata under konverteringsprocessen.
Vanliga frågor
Vad är skillnaden mellan den kodande strängen och mallsträngen?
Den kodande strängen (sense) matchar budbärar-RNA (mRNA), förutom att T blir U. Mallsträngen (antisense) är den som cellen faktiskt läser, så varje bas komplementeras: A→U, T→A, C→G, G→C. Välj den sträng som matchar hur din sekvens skrevs.
Vad ger RNA → DNA mig?
En DNA-kopia av ditt RNA: varje U blir T och allt annat stannar kvar. Detta är den cDNA-sekvens som ett omvänt transkriptas skulle producera, vilket är användbart när ett efterföljande verktyg endast accepterar DNA.
Kan jag klistra in osäkerhetskoder som N, R eller Y?
Ja. Degenererade IUPAC-bokstäver bevaras: en vanlig konvertering rör endast T och U, och konvertering av mallsträng mappar varje kod till dess korrekta komplement (R↔Y, K↔M; S, W och N stannar kvar). Justeringsgap (-) behålls, och gemener behåller sitt skiftläge.
Vad händer med FASTA-huvuden, siffror och blanksteg?
En namnrad som börjar med > behålls och visas ovanför resultatet. Blanksteg, radbrytningar, siffror och skiljetecken ignoreras, och anteckningen under indata visar hur mycket som togs bort — ingenting tas bort i tystnad.