DNA RNA 서열 변환기의 작동 원리
DNA RNA 서열 변환기는 DNA 서열을 RNA로 변환하거나, 반대로 RNA 서열을 DNA로 역변환하는 도구입니다. 이 도구는 분자생물학 연구에서 자주 다루는 코딩 (센스) 가닥과 템플릿 (안티센스) 가닥의 특성을 모두 반영하여 변환을 수행합니다.
변환 과정에서 소문자는 소문자 상태를 그대로 유지하며, 정렬 갭 마커(-)와 IUPAC 축약 염기 기호도 안전하게 보존됩니다. 반면 서열 내에 존재하는 공백, 줄 바꿈, 숫자, 문장 부호는 자동으로 무시되고 제거되므로 정제되지 않은 서열 데이터도 편리하게 처리할 수 있습니다. 또한, 생물정보학에서 널리 쓰이는 FASTA 형식의 헤더 라인을 인식하고 보존하는 기능을 갖추고 있습니다.
입력 및 변환 옵션 설정
도구를 사용할 때 입력하는 데이터와 선택 가능한 옵션은 다음과 같습니다.
- 서열: 입력창에 직접 붙여넣는 DNA 또는 RNA 서열입니다. 일반 텍스트 형식뿐만 아니라,
>로 시작하는 이름 줄(또는 기존 FASTA 주석 규칙에 따른;로 시작하는 줄)을 포함하는 FASTA 형식도 지원합니다. 입력 가능한 원시 데이터의 최대 제한량은 2,000,000자 미만입니다. - 변환: 변환하고자 하는 방향을 선택합니다.
DNA → RNARNA → DNA
- 가닥: 서열이 유래한 가닥의 종류를 선택합니다.
코딩 (센스)템플릿 (안티센스)
변환 규칙과 예외 처리
선택한 가닥의 종류에 따라 다음과 같은 구체적인 변환 규칙이 적용됩니다.
코딩 (센스) 가닥 변환
코딩 가닥은 전사되는 RNA 서열과 염기 서열이 동일하므로(T와 U의 차이 제외), 단순 치환만 일어납니다.
DNA → RNA변환 시, 모든T가U로 바뀝니다.RNA → DNA변환 시, 모든U가T로 바뀝니다.- 그 외의 모든 염기는 변하지 않고 그대로 유지됩니다.
템플릿 (안티센스) 가닥 변환
템플릿 가닥은 실제 전사 과정에서 RNA를 합성할 때 주형으로 사용되는 가닥이므로, 각 염기가 상보적인 염기로 변환됩니다.
DNA → RNA변환 시:A는U로,T는A로,C는G로,G는C로 상보적 매핑이 이루어집니다.- IUPAC 축약 염기 기호 역시 상보적 규칙에 따라 매핑됩니다. 구체적으로
R↔Y,K↔M,B↔V,D↔H로 서로 변환되며, 자체 상보적인 기호인S,W,N은 변하지 않고 그대로 유지됩니다.
특수 문자 및 오류 처리
- 공백 및 기호 제거: 서열 내의 공백, 줄 바꿈, 숫자, 문장 부호는 변환 시 자동으로 제거되며, 도구는
공백, 숫자, 문장 부호 ‹n›개를 무시했습니다.라는 메시지를 통해 제외된 문자 수를 알려줍니다. - FASTA 헤더 처리: 단일 이름 줄(
>또는;로 시작)이 감지되면 결과 서열 위에 해당 줄을 그대로 유지하고이름 줄이 유지되었습니다.라는 노트를 표시합니다. 만약 여러 개의 이름 줄이 발견되면 서열 줄들을 하나로 합친 후‹n›개의 이름 줄이 발견되어 서열 줄들을 하나로 합쳤습니다.라는 메시지를 출력합니다. - 오류 메시지: 입력 서열이 2,000,000자를 초과하면
서열이 너무 깁니다. ‹max›자 이하로 입력해 주세요.라는 오류가 발생합니다. 허용되지 않는 문자가 포함되어 있을 경우지원하지 않는 문자: ‹chars›. DNA/RNA 염기 문자만 사용할 수 있습니다.라는 메시지가 나타나며, 발견된 잘못된 문자 중 최대 6개까지 표시됩니다. 단, 공백, 숫자, 문장 부호 등은 오류를 일으키지 않고 자동으로 필터링됩니다.
GC 함량 계산 공식
도구는 입력 및 결과 서열의 통계 데이터로 입력 염기 수, 결과 염기 수, 그리고 GC 함량을 제공합니다. GC 함량은 다음 공식을 기준으로 계산됩니다.
GC 함량 = (G + C + S) / (A + C + G + T + U + W + S) × 100%
이 공식에서 축약 염기 기호 중 강한 결합(G 또는 C)을 뜻하는 S는 GC 값에 포함되며, 약한 결합(A 또는 T/U)을 뜻하는 W는 AT 값에 포함됩니다. 그 외의 축약 기호(R, Y, K, M, B, V, D, H, N)는 GC 기여도가 불확실하므로 분모와 분자 모두에서 제외됩니다. 서열 내에 계산 가능한 염기가 존재하지 않는 경우에는 GC 함량 백분율이 표시되지 않습니다. 이 값은 단순 T↔U 변환이나 상보적 염기 쌍 변환(G↔C, A↔T/U) 시 비율이 보존되므로 변환 전후로 동일하게 유지됩니다.
개인정보 보호 및 데이터 처리
이 도구를 사용할 때 입력하는 모든 서열 데이터는 외부 서버로 전송되지 않습니다. 서열 변환 작업은 브라우저 내에서 처리됩니다. BroBroGo 서버로 어떠한 데이터도 전송되지 않으므로 안심하고 도구를 사용할 수 있습니다.
자주 묻는 질문 (FAQ)
Q: FASTA 헤더, 숫자, 공백은 어떻게 처리되나요?
A: >로 시작하는 이름 줄은 그대로 유지되어 결과 위에 표시됩니다. 공백, 줄 바꿈, 숫자, 문장 부호는 무시되며, 입력창 아래의 알림을 통해 제거된 양을 정확히 알려드립니다. 어떠한 데이터도 알림 없이 임의로 누락되지 않습니다.
Q: N, R, Y 같은 축약 염기 코드를 붙여넣어도 되나요?
A: 네, 보존됩니다. IUPAC 축약 염기 기호는 그대로 유지됩니다. 일반 변환은 T와 U만 변환하며, 템플릿 가닥 변환은 각 코드를 올바른 상보적 염기로 매핑합니다(R↔Y, K↔M, S, W, N은 유지). 정렬 갭 마커(-)도 유지되며, 소문자는 대소문자 상태를 그대로 유지합니다.
Q: 코딩 가닥과 템플릿 가닥의 차이점은 무엇인가요?
A: 코딩(센스) 가닥은 T가 U로 바뀌는 것을 제외하고 메신저 RNA와 일치합니다. 템플릿(안티센스) 가닥은 세포가 실제로 읽는 가닥이므로 각 염기가 상보적으로 변환됩니다(A→U, T→A, C→G, G→C). 붙여넣은 서열이 작성된 방식에 맞는 가닥을 선택하세요.
Q: RNA → DNA 변환을 하면 무엇을 얻을 수 있나요?
A: RNA의 DNA 복사본을 생성합니다. 모든 U가 T로 바뀌고 나머지는 그대로 유지됩니다. 이는 역전사 효소가 생성하는 cDNA 서열과 동일하며, 후속 도구가 DNA만 지원할 때 유용합니다.