A szekvencia-transzformációk matematikája és kémiája
A molekuláris biológiában a nukleinsav-szekvenciákat szabvány szerint az 5'→3' irányban írjuk le és olvassuk. Amikor a DNS két komplementer szála egymáshoz kapcsolódik, a két lánc antiparallel, azaz ellentétes lefutású. Ez azt jelenti, hogy az egyik szál 5'→3' irányú szekvenciájának pontos fizikai párja a szemközti szálon csak úgy határozható meg, ha a bázisok párosítása után a kapott sorrendet megfordítjuk.
Matematikai szempontból a reverz komplementer képzése két különálló műveletből áll: a komplementációból (a bázisok kicserélése a párjukra) és a reverzióból (a sorrend megfordítása). E két művelet kommutatív, ami azt jelenti, hogy a sorrendjük felcserélhető: ha előbb képezzük a komplementer szekvenciát, majd azt megfordítjuk, pontosan ugyanazt az eredményt kapjuk, mintha előbb fordítottuk volna meg a szekvenciát, és utána végeztük volna el a bázispárosítást.
A DNA reverz komplementer eszköz három különböző művelet elvégzését teszi lehetővé a beillesztett szekvencián:
- Reverz komplementer (az
Reverz komplementeropció): Elvégzi a bázisok cseréjét és a szekvencia megfordítását is. Ez a leggyakrabban használt transzformáció, mert az így kapott eredmény a szemközti szálat írja le a szabványos 5'→3' irányban. - Komplementer (az
Komplementeropció): Kicseréli a bázisokat a párjukra, de megtartja az eredeti irányt. Az eredmény így 3'→5' irányban lesz olvasható. - Reverz (az
Reverzopció): Egyszerűen megfordítja a karakterek sorrendjét anélkül, hogy megváltoztatná magukat a bázisokat.
DNS és RNS bázispárosítási szabályok
A transzformáció során alkalmazott párosítási szabályok attól függnek, hogy a bemeneti lánc DNS vagy RNS. Az eszköz automatikus detektálást végez: ha a beillesztett szekvencia tartalmaz uracil ("U") bázist, de nem tartalmaz timint ("T"), akkor a rendszer automatikusan RNS-ként kezeli a bevitelt. Ebben az esetben a "RNA észlelve – az A az U-val párosul." üzenet jelenik meg, és az adenin (A) az uracillal (U) fog párosulni. Minden egyéb esetben a szekvenciát DNS-ként kezeli a rendszer, így az adenin (A) a timinnel (T) alkot párt. A citozin (C) és a guanin (G) párosítása mindkét esetben azonos.
A standard bázisokon kívül a biológiai minták gyakran tartalmaznak bizonytalan vagy degenerált bázisokat. Az eszköz teljes mértékben támogatja az IUPAC (International Union of Pure and Applied Chemistry) bizonytalan kódokat, és a következő specifikus párosítási szabályokat alkalmazza a komplementáció során:
- Az R (purin: A vagy G) kicserélődik az Y (pirimidin: C vagy T/U) kóddal.
- A K (keto: G vagy T/U) kicserélődik az M (amino: A vagy C) kóddal.
- A B (nem A) kicserélődik a V (nem T/U) kóddal.
- A D (nem C) kicserélődik a H (nem G) kóddal.
- Az S (erős kötés: G vagy C), a W (gyenge kötés: A vagy T/U) és az N (bármely bázis) változatlanok maradnak.
A transzformáció során a kis- és nagybetűk megőrződnek. Ez a gyakorlatban rendkívül hasznos, mivel a kutatók gyakran kisbetűkkel jelölik a szekvenciák bizonyos specifikus régióit (például az intronokat vagy az alacsony komplexitású szakaszokat), és ezek a jelölések az átalakítás után is a megfelelő pozícióban maradnak.
PCR primer tervezési elvek
A polimeráz-láncreakció (PCR) során két primerre van szükség a célszekvencia amplifikálásához: egy forward (egyenes) primerre és egy reverse (reverz) primerre.
A forward primer a célszekvencia antiszensz (szemközti) szálához kapcsolódik, így annak szekvenciája megegyezik a szensz szál 5' végén található szakaszával. Ezzel szemben a reverz primer a szensz szálhoz kapcsolódik a célszekvencia 3' végén. Mivel a DNS-polimeráz enzim kizárólag 5'→3' irányban képes szintetizálni az új szálat, a reverz primernek a szensz szál 3' végén lévő szakasz komplementerének kell lennie, méghozzá megfordított (reverz) sorrendben.
Ha a reverz primert nem reverz komplementer formában, hanem egyszerűen komplementerként vagy csak megfordítva rendelnénk meg, az nem tudna a megfelelő helyre és irányban kikötődni, így a PCR reakció sikertelen lenne. Az eszköz segítségével a célszekvencia kiválasztott 3' végi szakaszából azonnal előállítható a pontos, megrendelésre kész reverz primer szekvencia.
FASTA formátumok és adatkezelés
A bioinformatikában a legelterjedtebb fájlformátum a FASTA, amely egy leíró sorral (fejléccel) kezdődik, ezt pedig a szekvenciasorok követik. A leíró sor mindig a > karakterrel indul.
Az eszköz intelligensen kezeli a FASTA formátumot:
- Ha a bemenet egyetlen
>karakterrel kezdődő névsort tartalmaz, az eszköz a transzformáció során ezt a fejlécet érintetlenül megőrzi a kapott eredmény tetején, és a "Névsor megőrizve." jelzést jeleníti meg. - Ha a beillesztett szövegben több névsor is található, a rendszer a szekvenciasorokat egyetlen folyamatos szekvenciává fűzi össze, és a "
‹n›névsor található – a szekvenciasorok egybe lettek fűzve." üzenettel tájékoztatja a felhasználót a végrehajtott módosításról.
A nyers szekvenciaadatok gyakran tartalmaznak nemkívánatos karaktereket, például sorszámokat, szóközöket vagy egyéb írásjeleket, amelyek a laboratóriumi jegyzőkönyvekből vagy adatbázisokból való másolás során kerülnek a szövegbe. Az eszköz automatikusan megtisztítja a bemenetet: a szóközöket, számjegyeket és írásjeleket kiszűri a feldolgozás előtt, és a "Figyelmen kívül hagyva ‹n› szóköz, számjegy és írásjel." üzenetben pontosan jelzi, hány ilyen karaktert távolított el. Ha a bemenet nem támogatott betűket tartalmaz, a rendszer a "Nem támogatott karakterek: ‹chars›. Csak DNA/RNA bázisok engedélyezettek." hibaüzenettel leállítja a folyamatot.
Adatvédelem és helyi feldolgozás
A kutatási adatok biztonsága érdekében a szekvenciák feldolgozása teljes egészében a felhasználó eszközén történik. A beillesztett adatok nem kerülnek továbbításra semmilyen külső szerverre, az átalakítás közvetlenül a böngészőben fut le. Ez biztosítja, hogy a bizalmas vagy még publikálatlan szekvenciák nem hagyják el a helyi számítógépet.
Gyakran Ismételt Kérdések
Mi a különbség a komplementer és a reverz komplementer között?
A komplementer (complement) minden bázist kicserél a párjára (az A-t T-re, a C-t G-re), de megtartja az eredeti irányt, így az 3'→5' irányban olvasható. A reverz komplementer (reverse complement) emellett a sorrendet is megfordítja, így a szemközti szálat adja vissza a megszokott 5'→3' irányban – azt a szekvenciát, amely ténylegesen bázispárosodást alkot az Ön szekvenciájával.
Miért a reverz komplementert használja egy reverz PCR primer?
A primereket 5'→3' irányban írjuk. A reverz primer a szemközti szálhoz kapcsolódik a célszekvencia túlsó végén, ezért az azon a végén található szekvenciát kell venni, és annak a reverz komplementerét képezni. Az eredmény visszafelé mutat a célszekvencia felé, és pontosan ez lesz az a szekvencia, amelyet megrendel.
Beilleszthetek olyan bizonytalan kódokat, mint az N, R vagy Y?
Igen. A degenerált IUPAC-kódok a saját párosodási szabályaikat követik: az R kicserélődik az Y-nal, a K az M-mel, a B a V-vel és a D a H-val, míg az S, W és N változatlanok maradnak. A kis- és nagybetűk megmaradnak, így a kisbetűs régiójelölések is túlélnek.
Működik RNA-val is, és mi történik a FASTA fejlécekkel?
Igen. Az olyan szekvenciát, amely tartalmaz U-t és nem tartalmaz T-t, RNA-ként kezeljük, így az A az U-val párosul; egyébként az A a T-vel párosul. A kezdő > névsor megmarad az eredmény tetején, míg a szóközök, számjegyek és írásjelek eltávolításra és megszámlálásra kerülnek a bemenet alatt.