Проток генетичких информација и улога конверзије секвенци
У молекуларној биологији, пренос генетичких информација прати централну догму која описује двостепени процес: транскрипцију DNA у RNA и транслацију RNA у протеине. Током транскрипције, информације записане у дволанчаној DNA молекули преносе се на једноланчану RNA. Овај процес је кључан за експресију гена, а у лабораторијским и биоинформатичким истраживањима често се јавља потреба за симулацијом ових природних процеса кроз конверзију нуклеотидних секвенци.
Конверзија између DNA и RNA секвенци омогућава истраживачима да прелазе из једног молекуларног формата у други у зависности од експерименталних потреба. На пример, приликом дизајнирања прајмера, анализе експресије гена или рада са базама података, често је неопходно превести секвенцу добијену секвенцирањем у њен функционални RNA транскрипт или обрнуто.
Кодирајући насупрот матричном ланцу
Приликом конверзије DNA у RNA (или обрнуто), од пресудног је значаја дефинисати који ланац DNA секвенца представља:
- Кодирајући (смислени) ланац: Овај ланац DNA има исту секвенцу и смер као и настала информациона RNA (mRNA), са једином разликом што RNA садржи урацил (U) уместо тимина (T). Конверзија у овом смеру је директна замена база.
- Матрични (антисмислени) ланац: Овај ланац служи као калуп који RNA полимераза заправо чита током транскрипције у ћелији. Настала RNA је комплементарна овом ланцу. Због тога се при конверзији матричног ланца свака база преводи у свој комплементарни пар.
Алат омогућава избор између ова два ланца како би се осигурало да добијени резултат тачно одражава биолошку стварност вашег узорка.
Правила конверзије и комплементарности база
Конверзија се врши на основу строго дефинисаних биохемијских правила у зависности од изабраног смера и ланца:
Конверзија кодирајућег ланца
- DNA → RNA: Сваки тимин (
T) прелази у урацил (U). Све остале базе остају непромењене. - RNA → DNA: Сваки урацил (
U) прелази у тимин (T). Све остале базе остају непромењене.
Конверзија матричног ланца
У овом моду, свака база се мења својим комплементарним паром:
- За DNA → RNA:
Aпрелази уU,Tпрелази уA,Cпрелази уG, аGпрелази уC. - За RNA → DNA:
Aпрелази уT,Uпрелази уA,Cпрелази уG, аGпрелази уC.
Мала слова у уносу у потпуности задржавају своју величину након конверзије. Такође, маркери празнина у поравнању (-) се чувају на својим местима у секвенци.
Руковање IUPAC двосмисленим кодовима
Током секвенцирања или при раду са консензус секвенцама, често се користе дегенерисани нуклеотидни кодови дефинисани од стране IUPAC-IUB. Ови кодови представљају позиције на којима је могуће присуство више од једне врсте базе. Алат у потпуности подржава ове кодове према стандардним препорукама (Cornish-Bowden A, "Nomenclature for incompletely specified bases in nucleic acid sequences: recommendations 1984", Nucleic Acids Research 13(9):3021–3030 (1985), DOI 10.1093/nar/13.9.3021).
Приликом конверзије матричног ланца, дегенерисани IUPAC кодови се прецизно пресликавају у своје комплементе:
R(пурин: A или G) се мења саY(пиримидин: C или T/U) и обрнуто (R↔Y).K(кето: G или T/U) се мења саM(амино: A или C) и обрнуто (K↔M).B(сви осим A) се мења саV(сви осим T/U) и обрнуто (B↔V).D(сви осим C) се мења саH(сви осим G) и обрнуто (D↔H).- Кодови
S(јаке везе: G или C),W(слабе везе: A или T/U) иN(било која база) су самокомплементарни и остају непромењени.
FASTA формат и пречишћавање уноса
Алат је прилагођен за рад са FASTA форматом, који представља стандард за запис нуклеотидних секвенци у биоинформатици.
- Једноструко заглавље: Ако унос почиње линијом назива која креће са симболом
>(или старијом конвенцијом са;), та линија се препознаје као заглавље, чува се и приказује изнад резултата уз поруку "Линија са називом је задржана.". - Вишеструка заглавља: Ако систем детектује више линија са називом, све линије секвенци ће бити спојене у једну непрекидну секвенцу, а корисник ће видети обавештење "Пронађено је линија са називом:
‹n›— линије секвенце су спојене у једну.".
Сви размаци, преломи редова, цифре и знаци интерпункције се аутоматски уклањају из секвенце пре обраде. Након уноса, приказује се информација о броју очишћених карактера: "Игнорисано је следеће: ‹n› размака, цифара и знакова интерпункције.".
Уколико унос садржи недозвољена слова која нису део стандардних или IUPAC нуклеотидних ознака, систем ће приказати грешку: "Неподржана слова: ‹chars›. Дозвољена су само слова DNA/RNA база.", наводећи до првих 6 спорних карактера. Максимална дужина сировог уноса је ограничена на 2.000.000 карактера, а прекорачење активира поруку: "Та секвенца је предугачка за овај алат. Ограничите је на мање од ‹max› карактера.".
Прорачун GC садржаја
GC садржај представља удео азотних база гванина (G) и цитозина (C) у молекулу нуклеинске киселине. Овај параметар је изузетно важан у молекуларној биологији јер утиче на температуру топљења DNA дволанчаног молекула, што је кључно за дизајнирање PCR прајмера и хибридизационих проба.
Формула по којој овај алат рачуна GC удео је:
GC садржај = (G + C + S) / (A + C + G + T + U + W + S) × 100%
У овој формули, двосмислени код S (G или C) се рачуна као GC пар, док се код W (A или T/U) рачуна као AT пар. Сви остали дегенерисани кодови (R, Y, K, M, B, V, D, H, N) се искључују из прорачуна (како из бројиоца, тако и из имениоца) јер је њихов тачан допринос GC односу неизвестан. Вредност GC садржаја остаје идентична пре и после конверзије, јер промена T↔U не утиче на количину база, а комплементација матричног ланца само мења места базама унутар истих рачунских класа.
Локална приватност података
Ваша секвенца се конвертује у вашем прегледачу. Ништа се не шаље на BroBroGo.
Често постављана питања (FAQ)
Шта се дешава са FASTA заглављима, бројевима и размацима?
Линија са називом која почиње симболом > се задржава и приказује изнад резултата. Размаци, преломи редова, цифре и знаци интерпункције се игноришу, а напомена испод уноса вам говори колико је тога уклоњено — ништа се не одбацује прећутно.
Могу ли да налепим двосмислене кодове као што су N, R или Y?
Да. Дегенерисана IUPAC слова су сачувана: обична конверзија утиче само на T и U, а конверзија матричног ланца пресликава сваки код у његов одговарајући комплемент (R↔Y, K↔M; S, W и N остају). Маркери празнина у поравнању (-) се задржавају, а мала слова задржавају своју величину.
Која је разлика између кодирајућег и матричног ланца?
Кодирајући (смислени) ланац одговара информационој RNA, осим што T постаје U. Матрични (антисмислени) ланац је онај који ћелија заправо чита, па се свака база комплементира: A→U, T→A, C→G, G→C. Изаберите ланац који одговара начину на који је ваша секвенца написана.
Шта добијам конверзијом RNA → DNA?
DNA копија ваше RNA: свако U постаје T, а све остало остаје исто. Ово је cDNA секвенца коју би произвела реверзна транскриптаза, што је корисно када алат у наставку процеса прихвата само DNA.