Convertisseur de séquence DNA RNA

Convertissez le DNA en RNA ou inversement — brin codant ou matrice, codes d'ambiguïté préservés.

Sens de conversion
Brin
Séquence
Séquence convertie
Prêt. Collez une séquence de DNA ou RNA.

Votre séquence est convertie dans votre navigateur. Rien n’est envoyé à BroBroGo.

FAQ

Quelle est la différence entre le brin codant et le brin matrice ?

Le brin codant (sens) correspond à l'mRNA, sauf que T devient U. Le brin matrice (antisens) est celui que la cellule lit réellement, chaque base est donc complémentée : A→U, T→A, C→G, G→C. Choisissez le brin qui correspond à la manière dont votre séquence a été écrite.

Que donne la conversion RNA → DNA ?

Une copie DNA de votre RNA : chaque U devient T et tout le reste reste inchangé. Il s'agit de la séquence de cDNA qu'une transcriptase inverse produirait, utile lorsqu'un outil en aval n'accepte que le DNA.

Puis-je coller des codes d’ambiguïté comme N, R ou Y ?

Oui. Les lettres dégénérées IUPAC sont préservées : une conversion simple ne touche qu’aux T et U, et la conversion du brin matrice associe chaque code à son complément correct (R↔Y, K↔M ; S, W et N restent inchangés). Les marqueurs de trou d’alignement (-) sont conservés, et les lettres minuscules gardent leur casse.

Qu’advient-il des en-têtes FASTA, des chiffres et des espaces ?

Une ligne de nom commençant par > est conservée et affichée au-dessus du résultat. Les espaces, sauts de ligne, chiffres et signes de ponctuation sont ignorés, et la note sous le champ de saisie vous indique la quantité retirée — rien n’est supprimé en silence.

Le flux d'information génétique et la transcription

Le dogme central de la biologie moléculaire décrit le flux bidirectionnel et unidirectionnel de l'information génétique au sein d'une cellule. L'information stockée dans l'acide désoxyribonucléique (DNA) est transcrite en acide ribonucléique (RNA), qui est ensuite traduit en protéines. Lors de la transcription, l'enzyme RNA polymérase synthétise un brin de RNA à partir d'une matrice de DNA.

Dans le cadre de la recherche en laboratoire et de la bioinformatique, il est fréquemment nécessaire de simuler ce processus ou de réaliser l'opération inverse. Les chercheurs qui étudient l'expression des gènes doivent souvent générer une séquence de DNA complémentaire (cDNA) à partir d'un modèle de RNA afin de l'utiliser dans des outils d'analyse moléculaire qui n'acceptent que le DNA comme paramètre d'entrée. La conversion précise entre ces deux polynucléotides nécessite de prendre en compte la nature du brin d'acide nucléique manipulé.

Brin codant et brin matrice: deux approches de conversion

Une séquence de DNA double brin est composée de deux molécules antiparallèles aux rôles distincts lors de la transcription:

  • Le brin codant (sens): Sa séquence de bases correspond directement à celle du RNA transcrit (à l'exception du remplacement de la thymine par l'uracile). Il est orienté dans le sens de lecture 5' vers 3'.
  • Le brin matrice (antisens): C'est le brin physique que la RNA polymérase lit pour assembler le RNA par complémentarité des bases.

Le choix du brin dans l'outil détermine les règles de conversion appliquées:

Sens de conversion Brin sélectionné Règle appliquée
DNA → RNA Codant (sens) Chaque T devient U. Les autres bases restent inchangées.
RNA → DNA Codant (sens) Chaque U devient T. Les autres bases restent inchangées.
DNA → RNA Matrice (antisens) Chaque base est complémentée: AU, TA, CG, GC.
RNA → DNA Matrice (antisens) Chaque base est complémentée: AT, UA, CG, GC.

Les lettres minuscules conservent leur casse d'origine après le traitement. Les marqueurs de trou d'alignement, représentés par le caractère -, sont également préservés à leur position initiale.

Gestion des codes d'ambiguïté IUPAC

Dans les séquences consensus ou lors de la conception d'amorces dégénérées, les bases ne sont pas toujours définies de manière unique. L'IUPAC (Union internationale de chimie pure et appliquée) a établi une nomenclature standardisée pour représenter les positions de bases incomplètement spécifiées.

Lors d'une conversion sur le brin Codant (sens), ces codes d'ambiguïté restent inchangés. En revanche, lors d'une conversion sur le brin Matrice (antisens), l'outil applique les règles de complémentarité biochimique définies par Cornish-Bowden (1985) aux codes dégénérés:

  • R (purine: A ou G) s'associe avec Y (pyrimidine: C ou T/U) et inversement: RY.
  • K (céto: G ou T/U) s'associe avec M (amino: A ou C) et inversement: KM.
  • B (autre que A) s'associe avec V (autre que T/U) et inversement: BV.
  • D (autre que C) s'associe avec H (autre que G) et inversement: DH.
  • Les codes auto-complémentaires S (fort: G ou C), W (faible: A ou T/U) et N (n'importe quelle base) restent identiques: SS, WW, NN.

Prise en charge du format FASTA et nettoyage des données

Le format FASTA est une convention textuelle essentielle en bioinformatique. Il débute par une ligne de description commençant par le caractère > (ou ; selon l'ancienne convention de commentaire).

L'outil traite ces structures de la manière suivante:

  • En-tête unique: Si une seule ligne de nom commençant par > ou ; est détectée, elle est conservée et affichée au-dessus du résultat, accompagnée de la notification Ligne de nom conservée..
  • En-têtes multiples: Si plusieurs lignes de nom sont détectées, l'outil fusionne les lignes de séquence en une seule chaîne continue et affiche la notification ‹n› lignes de nom trouvées — les lignes de séquence ont été fusionnées en une seule..

Pour éviter les erreurs d'analyse dues aux copier-coller depuis des bases de données ou des documents PDF, les espaces, les sauts de ligne, les chiffres et les signes de ponctuation sont automatiquement nettoyés et retirés de la séquence. L'outil affiche alors le message ‹n› espaces, chiffres et signes de ponctuation ignorés..

Si la séquence d'entrée contient des caractères alphabétiques non autorisés, l'outil interrompt le traitement et affiche le message d'erreur: Lettres non prises en charge: ‹chars›. Seules les lettres de bases de DNA/RNA sont autorisées. (jusqu'à 6 caractères non valides sont listés). La longueur maximale autorisée pour la saisie brute est de 2 000 000 de caractères, au-delà de laquelle le message Cette séquence est trop longue pour cet outil. Veuillez ne pas dépasser ‹max› caractères. s'affiche.

Calcul de la teneur en GC

La teneur en GC représente la proportion de bases guanine (G) et cytosine (C) dans une séquence d'acide nucléique. Cette valeur est un paramètre critique pour estimer la température de fusion (Tm) des amorces lors de la conception de PCR ou pour analyser les propriétés structurales des génomes.

L'outil calcule cette valeur selon la formule suivante:

Teneur en GC = (G + C + S) / (A + C + G + T + U + W + S) × 100%

Dans cette équation, le code d'ambiguïté S (G ou C) est inclus à la fois au numérateur et au dénominateur car il garantit la présence d'une base forte. Le code W (A ou T/U) est inclus uniquement au dénominateur. Les autres codes dégénérés (R, Y, K, M, B, V, D, H, N) sont exclus du calcul car leur contribution exacte en GC est incertaine. Si la séquence ne contient aucune base comptable, aucun pourcentage n'est affiché. La teneur en GC reste strictement identique avant et après la conversion, car les substitutions simples T↔U et les opérations de complémentation sur le brin matrice ne modifient pas la proportion globale de ces classes de bases.

Confidentialité des données

La sécurité de vos données de recherche est préservée lors de l'utilisation de cet outil. Votre séquence est convertie dans votre navigateur. Rien n’est envoyé à BroBroGo. Les calculs s'effectuent localement sur votre terminal, sans aucun transfert de vos séquences vers un serveur externe.

FAQ

Quelle est la différence entre le brin codant et le brin matrice?

Le brin codant (sens) correspond à l'mRNA, sauf que T devient U. Le brin matrice (antisens) est celui que la cellule lit réellement, chaque base est donc complémentée: A→U, T→A, C→G, G→C. Choisissez le brin qui correspond à la manière dont votre séquence a été écrite.

Que donne la conversion RNA → DNA?

Une copie DNA de votre RNA: chaque U devient T et tout le reste reste inchangé. Il s'agit de la séquence de cDNA qu'une transcriptase inverse produirait, utile lorsqu'un outil en aval n'accepte que le DNA.

Puis-je coller des codes d'ambiguïté comme N, R ou Y?

Oui. Les lettres dégénérées IUPAC sont préservées: une conversion simple ne touche qu’aux T et U, et la conversion du brin matrice associe chaque code à son complément correct (R↔Y, K↔M; S, W et N restent inchangés). Les marqueurs de trou d’alignement (-) sont conservés, et les lettres minuscules gardent leur casse.

Qu’advient-il des en-têtes FASTA, des chiffres et des espaces?

Une ligne de nom commençant par > est conservée et affichée au-dessus du résultat. Les espaces, sauts de ligne, chiffres et signes de ponctuation sont ignorés, et la note sous le champ de saisie vous indique la quantité retirée — rien n’est supprimé en silence.