Traducteur ADN vers protéine - Convertisseur de codons et d'acides aminés
Traduisez une séquence d'ADN ou d'ARN en acides aminés selon le code génétique standard. Choisissez un cadre de lecture et visualisez chaque codon traduit.
Traducteur ADN vers protéine
Entrez une séquence d'ADN ou d'ARN. Utilisez les bases A, C, G et T. U est lu comme T. Les espaces, sauts de ligne et chiffres sont ignorés. La traduction utilise le code génétique standard (table NCBI 1).
Commencer la traduction au premier ATG de ce cadre de lecture, comme un ribosome qui commence la lecture d'un cadre ouvert de lecture, plutôt qu'au tout début du cadre.
Documentation
Convertisseur d’ADN en protéine
Un convertisseur d’ADN en protéine transforme une séquence d’ADN ou d’ARN en la séquence protéique qu’elle code. Il lit la séquence par groupes de trois lettres, appelés codons, et convertit chaque codon en un acide aminé à l’aide du code génétique standard.
Qu’est-ce que la traduction de l’ADN ?
Une cellule stocke les instructions génétiques dans l’ADN. Pour fabriquer une protéine, elle commence par copier un gène dans l’ARN messager (ARNm). Cette étape est appelée transcription. Les ribosomes lisent ensuite l’ARNm et relient les acides aminés dans l’ordre indiqué par l’ARNm. Cette étape est appelée traduction. La chaîne d’acides aminés ainsi formée se replie pour devenir une protéine fonctionnelle.
L’ARN ne diffère de l’ADN que par un point pertinent : l’ARN utilise la base uracile (U), tandis que l’ADN utilise la thymine (T). Ainsi, une séquence d’ADN peut être traduite avec la même table des codons qu’une séquence d’ARN, à condition de lire d’abord chaque U comme un T.
Comment traduire l’ADN en protéine
Le convertisseur transforme une séquence d’entrée en séquence protéique en quatre étapes.
- Nettoyer la séquence. Les lettres sont converties en majuscules et chaque U est remplacé par un T. Les espaces, les sauts de ligne, les chiffres et la ponctuation utilisée dans les séquences FASTA collées (
>,-et*) sont supprimés. Si la séquence est vide après le nettoyage, le convertisseur signale que l’entrée est vide. - Vérifier les bases. Chaque caractère restant doit être A, C, G ou T. Tout autre caractère interrompt le processus et produit un message d’erreur listant les caractères non valides.
- Découper en codons. À partir du cadre de lecture choisi, la séquence est découpée en groupes de trois bases qui ne se chevauchent pas.
- Traduire chaque codon. Chaque codon est associé à un acide aminé à l’aide de la table du code génétique ci-dessous. La traduction s’arrête au premier codon-stop (TAA, TAG ou TGA). Le codon-stop lui-même n’est pas ajouté à la séquence protéique.
S’il reste moins de trois bases après le dernier codon complet, ces bases ne peuvent pas être traduites et le convertisseur les signale comme des bases restantes. Les bases situées après un codon-stop ne sont pas comptées parmi les bases restantes, car la traduction est déjà terminée.
Cadres de lecture
Un cadre de lecture est le point de départ utilisé pour découper une séquence en codons. Comme chaque codon comporte trois bases, une séquence peut être découpée en commençant par sa première, sa deuxième ou sa troisième base. Ces cadres sont appelés cadre de lecture 1, 2 et 3. Chaque cadre produit généralement une séquence protéique différente. Dans un gène réel, un seul cadre de lecture produit la protéine correcte. Les deux autres rencontrent souvent rapidement un codon-stop et produisent une courte séquence dépourvue de sens.
Commencer au premier ATG
La plupart des gènes commencent par le codon ATG. Celui-ci code la méthionine et marque le point de départ de la protéine. Le convertisseur propose une option appelée « Rechercher le premier codon initiateur (ATG) ». Lorsque cette option est activée, le convertisseur avance dans le cadre choisi jusqu’à atteindre un codon exactement égal à ATG, puis commence la traduction à cet endroit. Les bases précédant cet ATG sont ignorées. Lorsque l’option est désactivée, la traduction commence à la première base du cadre.
La recherche n’accepte qu’un ATG situé à la limite d’un codon du cadre choisi. Prenons CATGGCCTAA. Le cadre 1 le découpe en CAT GGC CTA, de sorte que les lettres ATG ne s’alignent jamais sur un codon et que le convertisseur signale qu’aucun codon initiateur n’a été trouvé dans ce cadre. Le cadre 2 commence à la deuxième base et donne ATG GCC TAA ; la traduction commence donc immédiatement et produit MA.
Le code génétique
Le code génétique standard associe chacun des 64 codons possibles à l’un des 20 acides aminés ou à un signal stop. C’est le code utilisé par la plupart des gènes chez la plupart des organismes, y compris les humains.
| Acide aminé | Codons |
|---|---|
| Alanine (A) | GCT, GCC, GCA, GCG |
| Arginine (R) | CGT, CGC, CGA, CGG, AGA, AGG |
| Asparagine (N) | AAT, AAC |
| Acide aspartique (D) | GAT, GAC |
| Cystéine (C) | TGT, TGC |
| Acide glutamique (E) | GAA, GAG |
| Glutamine (Q) | CAA, CAG |
| Glycine (G) | GGT, GGC, GGA, GGG |
| Histidine (H) | CAT, CAC |
| Isoleucine (I) | ATT, ATC, ATA |
| Leucine (L) | TTA, TTG, CTT, CTC, CTA, CTG |
| Lysine (K) | AAA, AAG |
| Méthionine (M) | ATG |
| Phénylalanine (F) | TTT, TTC |
| Proline (P) | CCT, CCC, CCA, CCG |
| Sérine (S) | TCT, TCC, TCA, TCG, AGT, AGC |
| Thréonine (T) | ACT, ACC, ACA, ACG |
| Tryptophane (W) | TGG |
| Tyrosine (Y) | TAT, TAC |
| Valine (V) | GTT, GTC, GTA, GTG |
| Stop | TAA, TAG, TGA |
ATG code la méthionine. C’est également le codon que la plupart des gènes utilisent pour marquer le début de la séquence codante.
Exemple : traduire une séquence d’ADN
Prenons la séquence ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG dans le cadre de lecture 1.
Découpage en codons : ATG GCC ATT GTA ATG GGC CGC TGA AAG GGT GCC CGA TAG
Traduction de chaque codon : ATG → M, GCC → A, ATT → I, GTA → V, ATG → M, GGC → G, CGC → R, TGA → stop.
Le huitième codon, TGA, est un codon-stop ; la traduction s’arrête donc à cet endroit. La séquence protéique est MAIVMGR, longue de sept acides aminés. Les bases situées après le codon-stop ne sont pas traduites.
Exemple : une séquence codante sans codon-stop
Prenons la séquence ATGAAGTACGCCTACATCGCCAAGCAGCGCCAG dans le cadre de lecture 1. Elle comporte 33 bases, soit exactement 11 codons.
Découpage en codons : ATG AAG TAC GCC TAC ATC GCC AAG CAG CGC CAG
Traduction de chaque codon : M, K, Y, A, Y, I, A, K, Q, R, Q.
Aucun codon-stop n’apparaît ; les 11 codons sont donc tous traduits. La séquence protéique est MKYAYIAKQRQ, sans base restante.
Exemple : comment le cadre de lecture modifie le résultat
La courte séquence ATGCATGCA montre pourquoi le cadre de lecture est important.
- Cadre 1 (commencer à la base 1) : ATG CAT GCA → M, H, A. Protéine : MHA.
- Cadre 2 (commencer à la base 2) : TGC ATG CA → C, M, avec 2 bases restantes qui ne peuvent pas former un codon.
- Cadre 3 (commencer à la base 3) : GCA TGC A → A, C, avec 1 base restante.
Les trois points de départ donnent trois séquences protéiques différentes à partir des mêmes neuf bases.
Utilisations de la traduction de l’ADN en protéine
Les chercheurs traduisent les séquences d’ADN pour prédire quelle protéine produit un gène, vérifier qu’une séquence clonée est toujours dans le bon cadre de lecture après des modifications et déterminer comment une mutation modifie la séquence d’acides aminés d’une protéine. Les chaînes d’analyse bioinformatique traduisent automatiquement les séquences génomiques afin de faciliter l’annotation des gènes et la recherche dans les bases de données protéiques.
Bref historique
Francis Crick a décrit le flux de l’information génétique, de l’ADN à l’ARN puis à la protéine, en 1958, en l’appelant le dogme central de la biologie moléculaire. En 1961, Marshall Nirenberg et Heinrich Matthaei ont montré que le codon UUU code l’acide aminé phénylalanine, premier codon dont le code a été déchiffré. En 1966, des chercheurs, dont Nirenberg et Har Gobind Khorana, avaient déterminé les 64 associations codon-acide aminé, établissant le code génétique utilisé aujourd’hui par ce convertisseur.
Foire aux questions
Quelle est la différence entre la traduction et la transcription de l’ADN ?
La transcription copie une séquence d’ADN en ARNm. La traduction lit cet ARNm et construit une protéine à partir de celui-ci. Cet outil ignore l’étape de l’ARN et traduit directement une séquence d’ADN en appliquant les mêmes règles relatives aux codons.
Pourquoi le convertisseur propose-t-il trois cadres de lecture ?
Un codon comporte trois bases ; une séquence peut donc être découpée en codons en commençant par sa première, sa deuxième ou sa troisième base. Un seul de ces trois cadres correspond généralement à la véritable séquence codante d’un gène ; les vérifier tous peut donc aider à le trouver.
Que se passe-t-il si la longueur de ma séquence n’est pas un multiple de trois ?
Les bases supplémentaires à la fin ne peuvent pas former un codon complet. Le convertisseur indique le nombre de bases restantes et traduit tous les codons complets qui les précèdent.
Puis-je coller une séquence d’ARN au lieu d’une séquence d’ADN ?
Oui. Chaque U de l’entrée est automatiquement lu comme un T avant la traduction ; une séquence d’ARN donne donc le même résultat que son équivalent en ADN.
Que fait un codon-stop ?
Un codon-stop (TAA, TAG ou TGA) marque la fin de la séquence codante. Le convertisseur s’arrête à cet endroit et n’ajoute ni le codon-stop lui-même ni ce qui le suit à la séquence protéique.
Que fait l’option du codon initiateur ?
Elle indique au convertisseur d’avancer jusqu’au premier ATG du cadre de lecture choisi et de commencer à cet endroit, comme le fait un ribosome lorsqu’il commence à lire au niveau d’un codon initiateur. Lorsque l’option est désactivée, la traduction commence à la première base du cadre. Si le cadre ne contient aucun ATG en phase, le convertisseur le signale au lieu de faire une supposition.
Tous les organismes utilisent-ils le même code génétique ?
Presque tous les gènes nucléaires utilisent le code standard présenté ci-dessus. Quelques exceptions existent, comme l’ADN mitochondrial humain, dans lequel le codon TGA code le tryptophane au lieu d’agir comme un signal stop.