Traductor de ADN a proteína - Conversor de codones y aminoácidos
Traduce una secuencia de ADN o ARN a una secuencia de aminoácidos con el código genético estándar. Elige un marco de lectura y consulta cada codón traducido.
Traductor de ADN a proteína
Introduce una secuencia de ADN o ARN. Usa las bases A, C, G y T. La U se lee como T. Los espacios, saltos de línea y números se ignoran. La traducción usa el Código Genético Estándar (tabla 1 de NCBI).
Comienza la traducción en el primer ATG de este marco de lectura, tal como un ribosoma empieza a leer un marco abierto de lectura, en lugar de empezar justo al inicio del marco.
Documentación
Traductor de ADN a proteína
Un traductor de ADN a proteína convierte una secuencia de ADN o ARN en la secuencia proteica que codifica. Lee la secuencia en grupos de tres letras, llamados codones, y convierte cada codón en un aminoácido mediante el código genético estándar.
Qué es la traducción del ADN
Una célula almacena las instrucciones genéticas en el ADN. Para construir una proteína, primero copia un gen en ARN mensajero (ARNm). Este paso se denomina transcripción. Luego, los ribosomas leen el ARNm y unen los aminoácidos en el orden que especifica el ARNm. Este paso se denomina traducción. La cadena terminada de aminoácidos se pliega hasta formar una proteína funcional.
El ARN difiere del ADN en un único aspecto relevante: el ARN utiliza la base uracilo (U), mientras que el ADN utiliza timina (T). Por ello, una secuencia de ADN puede traducirse con la misma tabla de codones que una secuencia de ARN, siempre que cada U se lea primero como una T.
Cómo traducir ADN a proteína
El traductor convierte una secuencia de entrada en una secuencia proteica en cuatro pasos.
- Limpiar la secuencia. Las letras se convierten a mayúsculas y cada U se cambia por T. Se eliminan los espacios, los saltos de línea, los dígitos y la puntuación utilizada en las secuencias FASTA pegadas (
>,-y*). Si no queda nada después de la limpieza, el traductor informa de que la entrada está vacía. - Comprobar las bases. Cada carácter restante debe ser A, C, G o T. Cualquier otro carácter detiene el proceso y genera un mensaje de error que enumera los caracteres no válidos.
- Dividir en codones. A partir del marco de lectura elegido, la secuencia se divide en grupos no solapados de tres bases.
- Traducir cada codón. Cada codón se relaciona con un aminoácido mediante la tabla del código genético que aparece a continuación. La traducción se detiene en el primer codón de terminación (TAA, TAG o TGA). El codón de terminación no se añade a la secuencia proteica.
Si quedan menos de tres bases después del último codón completo, esas bases no pueden traducirse y el traductor las informa como bases sobrantes. Las bases situadas después de un codón de terminación no se cuentan como sobrantes, porque la traducción ya ha terminado.
Marcos de lectura
Un marco de lectura es el punto de inicio utilizado para dividir una secuencia en codones. Como cada codón tiene tres bases, una secuencia puede dividirse empezando por su primera, segunda o tercera base. Estos se denominan marcos de lectura 1, 2 y 3. Cada marco suele producir una secuencia proteica diferente. En un gen real, solo un marco de lectura produce la proteína correcta. Los otros dos suelen encontrar rápidamente un codón de terminación y producir una secuencia corta sin significado.
Comenzar en el primer ATG
La mayoría de los genes comienza con el codón ATG. Este codifica la metionina y marca el punto donde empieza la proteína. El traductor tiene una opción llamada «Buscar hasta el primer codón de inicio (ATG)». Cuando está activada, el traductor avanza por el marco elegido hasta encontrar un codón exactamente igual a ATG y comienza a traducir allí. Las bases anteriores a ese ATG se ignoran. Cuando está desactivada, la traducción comienza en la primera base del marco.
La búsqueda solo acepta un ATG que coincida con un límite de codón del marco elegido. Tomemos CATGGCCTAA. El marco 1 lo divide en CAT GGC CTA, por lo que las letras ATG nunca se alinean con un codón y el traductor informa de que no se encontró ningún codón de inicio en este marco. El marco 2 comienza en la segunda base y produce ATG GCC TAA, por lo que la traducción comienza de inmediato y produce MA.
El código genético
El código genético estándar asigna cada uno de los 64 codones posibles a uno de 20 aminoácidos o a una señal de terminación. Este es el código utilizado por la mayoría de los genes en la mayoría de los organismos, incluidos los seres humanos.
| Aminoácido | Codones |
|---|---|
| Alanina (A) | GCT, GCC, GCA, GCG |
| Arginina (R) | CGT, CGC, CGA, CGG, AGA, AGG |
| Asparagina (N) | AAT, AAC |
| Ácido aspártico (D) | GAT, GAC |
| Cisteína (C) | TGT, TGC |
| Ácido glutámico (E) | GAA, GAG |
| Glutamina (Q) | CAA, CAG |
| Glicina (G) | GGT, GGC, GGA, GGG |
| Histidina (H) | CAT, CAC |
| Isoleucina (I) | ATT, ATC, ATA |
| Leucina (L) | TTA, TTG, CTT, CTC, CTA, CTG |
| Lisina (K) | AAA, AAG |
| Metionina (M) | ATG |
| Fenilalanina (F) | TTT, TTC |
| Prolina (P) | CCT, CCC, CCA, CCG |
| Serina (S) | TCT, TCC, TCA, TCG, AGT, AGC |
| Treonina (T) | ACT, ACC, ACA, ACG |
| Triptófano (W) | TGG |
| Tirosina (Y) | TAT, TAC |
| Valina (V) | GTT, GTC, GTA, GTG: valina (V) |
| Terminación | TAA, TAG, TGA |
ATG codifica la metionina. También es el codón que utiliza la mayoría de los genes para marcar el inicio de la secuencia codificante.
Ejemplo: traducción de una secuencia de ADN
Tomemos la secuencia ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG en el marco de lectura 1.
División en codones: ATG GCC ATT GTA ATG GGC CGC TGA AAG GGT GCC CGA TAG
Traducción de cada codón: ATG → M, GCC → A, ATT → I, GTA → V, ATG → M, GGC → G, CGC → R, TGA → terminación.
El octavo codón, TGA, es un codón de terminación, por lo que la traducción termina allí. La secuencia proteica es MAIVMGR y tiene siete aminoácidos. Las bases posteriores al codón de terminación no se traducen.
Ejemplo: una secuencia codificante sin codón de terminación
Tomemos la secuencia ATGAAGTACGCCTACATCGCCAAGCAGCGCCAG en el marco de lectura 1. Tiene 33 bases, que corresponden exactamente a 11 codones.
División en codones: ATG AAG TAC GCC TAC ATC GCC AAG CAG CGC CAG
Traducción de cada codón: M, K, Y, A, Y, I, A, K, Q, R, Q.
No aparece ningún codón de terminación, por lo que se traducen los 11 codones. La secuencia proteica es MKYAYIAKQRQ, sin bases sobrantes.
Ejemplo: cómo cambia el resultado con el marco de lectura
La secuencia corta ATGCATGCA muestra por qué es importante el marco de lectura.
- Marco 1 (comienza en la base 1): ATG CAT GCA → M, H, A. Proteína: MHA.
- Marco 2 (comienza en la base 2): TGC ATG CA → C, M, con 2 bases sobrantes que no pueden formar un codón.
- Marco 3 (comienza en la base 3): GCA TGC A → A, C, con 1 base sobrante.
Tres puntos de inicio diferentes producen tres secuencias proteicas diferentes a partir de las mismas nueve bases.
Usos de la traducción del ADN a proteínas
Los investigadores traducen secuencias de ADN para predecir qué proteína produce un gen, comprobar que una secuencia clonada sigue en el marco de lectura correcto después de realizar modificaciones y observar cómo una mutación cambia la secuencia de aminoácidos de una proteína. Las canalizaciones bioinformáticas traducen automáticamente las secuencias del genoma para ayudar a anotar genes y buscar en bases de datos de proteínas.
Breve historia
Francis Crick describió el flujo de información genética del ADN al ARN y a la proteína en 1958, y lo denominó dogma central de la biología molecular. En 1961, Marshall Nirenberg y Heinrich Matthaei demostraron que el codón UUU codifica el aminoácido fenilalanina, el primer codón descifrado. Para 1966, investigadores como Nirenberg y Har Gobind Khorana habían determinado las asignaciones de los 64 codones, estableciendo el código genético que utiliza hoy este traductor.
Preguntas frecuentes
¿Cuál es la diferencia entre la traducción y la transcripción del ADN?
La transcripción copia una secuencia de ADN en ARNm. La traducción lee ese ARNm y construye una proteína a partir de él. Esta herramienta omite el paso del ARN y traduce directamente una secuencia de ADN, aplicando las mismas reglas de los codones.
¿Por qué el traductor ofrece tres marcos de lectura?
Un codón tiene tres bases, por lo que una secuencia puede dividirse en codones comenzando por su primera, segunda o tercera base. Normalmente, solo uno de estos tres marcos coincide con la secuencia codificante real de un gen, por lo que comprobar los tres puede ayudar a encontrarla.
¿Qué ocurre si la longitud de mi secuencia no es múltiplo de tres?
Las bases adicionales del final no pueden formar un codón completo. El traductor informa del número de bases sobrantes y traduce todos los codones completos que aparecen antes de ellas.
¿Puedo pegar una secuencia de ARN en lugar de ADN?
Sí. Cada U de la entrada se lee automáticamente como T antes de la traducción, por lo que una secuencia de ARN produce el mismo resultado que su equivalente de ADN.
¿Qué hace un codón de terminación?
Un codón de terminación (TAA, TAG o TGA) marca el final de la secuencia codificante. El traductor se detiene allí y no añade a la secuencia proteica el propio codón de terminación ni nada que aparezca después.
¿Qué hace la opción del codón de inicio?
Indica al traductor que avance hasta el primer ATG del marco de lectura elegido y comience allí, como un ribosoma empieza a leer en un codón de inicio. Con la opción desactivada, la traducción comienza en la primera base del marco. Si el marco no contiene ningún ATG en fase, el traductor lo indica en lugar de hacer una suposición.
¿Utilizan todos los organismos el mismo código genético?
Casi todos los genes nucleares utilizan el código estándar mostrado arriba. Existen algunas excepciones, como el ADN mitocondrial humano, donde el codón TGA codifica el triptófano en lugar de actuar como señal de terminación.