Насоченост во молекуларната биологија и потребата од трансформација
Во молекуларната биологија, нуклеинските киселини имаат своја насоченост дефинирана од хемиската структура на шеќерно-фосфатниот рбет. Синџирите на DNA и RNA се читаат и синтетизираат во насока од 5' кон 3' крајот. Кога два синџири на DNA се поврзуваат во двојна спирала, тие се антипаралелни — тоа значи дека едниот синџир се протега во насока 5'→3', додека неговиот комплементарен партнер се протега во насока 3'→5'.
Бидејќи стандардната конвенција налага сите генетички низи да се пишуваат исклучиво во насока 5'→3', едноставното претворање на базите во нивните парови (комплементирање) не е доволно за да се добие правилно запишан синџир. Комплементарната низа на 5'-ATCG-3' е 3'-TAGC-5'. За да се претстави оваа нова низа според биолошките стандарди, таа мора да се преврти (реверзира) за да се прочита како 5'-CGAT-3'. Овој процес на истовремено комплементирање и превртување на насоката се нарекува реверзен комплемент.
Математика на трансформациите на низи
Постојат три основни операции што можат да се извршат врз една генетичка низа, а кои се достапни преку опциите во полето за избор на операција:
- Реверзен комплемент (
Реверзен комплемент): Ги заменува базите со нивните парови и го превртува редоследот на низата од почеток кон крај. - Комплемент (
Комплемент): Ги заменува базите со нивните соодветни парови, но го задржува оригиналниот редослед на читање. - Реверз (
Реверз): Го превртува редоследот на буквите во низата без да ги менува самите бази.
Од математичка гледна точка, реверзниот комплемент е комутативна операција во однос на неговите две компоненти. Тоа значи дека ако прво направите комплемент на низата, а потоа ја превртите (реверзирате), ќе го добиете апсолутно истиот резултат како кога прво би ја превртеле низата, па потоа би ги замениле базите со нивните парови.
Правила за спарување кај DNA и RNA
Хемиските разлики помеѓу DNA и RNA ја одредуваат и разликата во нивните правила за спарување на базите. Алатката врши автоматска детекција на типот на нуклеинска киселина врз основа на присутните карактери во влезот:
- Детекција на RNA: Доколку низата содржи урацил ("U"), а во неа нема тимин ("T"), алатката ја идентификува како RNA. Во овој случај се применува правилото каде аденин ("A") се спарува со урацил ("U"). Корисникот ја добива нотификацијата „Детектирана е RNA — A се спарува со U.“ (
Детектирана е RNA — A се спарува со U.). - Детекција на DNA: Во сите останати случаи, низата се третира како DNA, при што аденин ("A") се спарува со тимин ("T").
Кај двата типа нуклеински киселини, цитозин ("C") секогаш се спарува со гванин ("G").
IUPAC кодови за двосмисленост и зачувување на големината на буквите
При секвенционирање на DNA често се јавуваат позиции каде точната база не може со сигурност да се одреди, или пак се претставуваат дегенерирани прајмери кои можат да се врзат за повеќе различни бази. За оваа намена се користат стандардните IUPAC кодови за двосмисленост. Алатката целосно ги поддржува овие кодови и ги применува следните специфични правила за нивно спарување:
| Оригинален IUPAC код | Значење | Комплементарен партнер |
|---|---|---|
| R (пурин) | A или G | Y (пиримидин) |
| Y (пиримидин) | C или T/U | R (пурин) |
| K (кето) | G или T/U | M (амино) |
| M (амино) | A или C | K (кето) |
| B | не-A (C, G или T/U) | V (не-T/не-U) |
| V | не-T/не-U (A, C или G) | B |
| D | не-C (A, G или T/U) | H (не-G) |
| H (не-G) | A, C или T/U | D |
| S | силна врска (C или G) | S (останува непроменето) |
| W | слаба врска (A или T/U) | W (останува непроменето) |
| N | која било база | N (останува непроменето) |
Дополнително, алатката ја зачувува големината на буквите од влезната низа. Ова е исклучително корисно во биоинформатиката кога малите букви (на пример, "atgc") се користат за означување на специфични региони, како што се интрони, повторувачки секвенци или места на кои се врзуваат прајмери. По трансформацијата, овие региони остануваат со мали букви на нивните нови позиции.
Ракување со FASTA формати и чистење на карактери
Во практичната работа, генетичките низи ретко се совршено чисти. Тие често содржат заглавија, броеви на позиции или празни места од копирањето. Алатката е дизајнирана автоматски да се справува со овие елементи:
- FASTA заглавија: Доколку низата започнува со знакот
>, оваа линија се препознава како име на низата. Единечна линија со име се зачувува непроменета на самиот врв на резултатот, а се прикажува пораката „Линијата со име е задржана.“ (Линијата со име е задржана.). Доколку се детектираат повеќе линии со име, низите се спојуваат во една заедничка линија, при што се прикажува известувањето „Пронајдени се‹n›линии со име — линиите на низата се споени во една.“ (Пронајдени се ‹n› линии со име — линиите на низата се споени во една.). - Игнорирани карактери: Сите празни места, цифри и интерпункциски знаци автоматски се отстрануваат од низата пред да започне обработката. Корисникот добива прецизна информација за бројот на исчистени карактери преку пораката „Игнорирани се
‹n›празни места, цифри и интерпункциски знаци.“ (Игнорирани се ‹n› празни места, цифри и интерпункциски знаци.).
Доколку внесете недозволени карактери кои не се дел од стандардните бази или IUPAC кодовите, алатката ќе прикаже грешка: „Неподдржани букви: ‹chars›. Дозволени се само букви за DNA/RNA бази.“ (invalid). Исто така, доколку низата ја надмине максималната дозволена должина, ќе се појави предупредувањето: „Таа низа е премногу долга за оваа алатка. Ограничете ја на под ‹max› знаци.“ (Таа низа е премногу долга за оваа алатка. Ограничете ја на под ‹max› знаци.).
Примена при дизајнирање на PCR прајмери
Една од најчестите практични примени на реверзниот комплемент е дизајнирањето на прајмери за полимеразна верижна реакција (PCR). За да се амплифицира одреден двоверижен регион на DNA, потребни се два прајмери:
- Директен прајмер (Forward primer): Се врзува за антисенс синџирот (3'→5') и има иста низа како сенс синџирот (5'→3') на почетокот на целниот регион.
- Реверзен прајмер (Reverse primer): Мора да се врзе за сенс синџирот (5'→3') на спротивниот крај на целниот регион. Бидејќи синтезата на DNA секогаш се одвива во насока 5'→3', овој прајмер мора да се движи во спротивна насока од оригиналниот сенс синџир. Затоа, неговата низа мора да биде реверзен комплемент на крајот од целниот регион.
Без правилно пресметување на реверзниот комплемент, нарачаниот прајмер нема да може да се врзе за целната DNA верига и PCR реакцијата нема да успее.
Локална обработка и приватност на податоците
Вашата низа останува на Вашиот уред. Таа се трансформира во Вашиот прелистувач и никогаш не се прикачува на надворешни сервери. Ова овозможува брза обработка и сигурност дека вашите истражувачки податоци не се споделуваат надвор од вашиот локален систем.
Често поставувани прашања (FAQ)
Која е разликата помеѓу комплемент и реверзен комплемент?
Комплементот ја заменува секоја база со нејзиниот партнер за спарување (A со T, C со G), но го задржува оригиналниот редослед, па затоа се чита во насока 3'→5'. Реверзниот комплемент дополнително го превртува редоследот, давајќи ви ја спротивната низа во познатата насока 5'→3' — низата што всушност се спарува со вашата.
Може ли да вметнам кодови за двосмисленост како N, R или Y?
Да. Двосмислените IUPAC букви ги следат сопствените правила за спарување: R се заменува со Y, K со M, B со V и D со H, додека S, W и N остануваат непроменети. Големината на буквите е зачувана, па ознаките за региони со мали букви опстојуваат.
Зошто реверзниот PCR прајмер користи реверзен комплемент?
Прајмерите се пишуваат во насока 5'→3'. Реверзниот прајмер се врзува за спротивната низа на далечниот крај на целта, па затоа ја земате низата на тој крај и правите нејзин реверзен комплимент. Резултатот покажува назад кон целта и е токму низата што ја нарачувате.
Дали работи со RNA и што се случува со FASTA заглавијата?
Да. Низата што содржи U, а нема T се третира како RNA, па затоа A се спарува со U; во спротивно A се спарува со T. Водечката линија со име > се задржува на врвот на резултатот, додека празните места, цифрите и интерпункциските знаци се чистат и се бројат под влезот.