DNA-zu-Protein-Übersetzer - Codon- und Aminosäure-Umrechner
Übersetzen Sie eine DNA- oder RNA-Sequenz mit dem Standard-Gencode in eine Aminosäuresequenz. Wählen Sie einen Leserahmen und sehen Sie jedes übersetzte Codon.
DNA-zu-Protein-Übersetzer
Geben Sie eine DNA- oder RNA-Sequenz ein. Verwenden Sie die Basen A, C, G und T. U wird als T gelesen. Leerzeichen, Zeilenumbrüche und Zahlen werden ignoriert. Die Übersetzung verwendet den Standard-Gencode (NCBI-Tabelle 1).
Beginnt die Übersetzung beim ersten ATG in diesem Leserahmen, so wie ein Ribosom das Lesen eines offenen Leserahmens beginnt, statt ganz am Anfang des Rahmens.
Dokumentation
DNA-zu-Protein-Übersetzer
Ein DNA-zu-Protein-Übersetzer wandelt eine DNA- oder RNA-Sequenz in die von ihr codierte Proteinsequenz um. Er liest die Sequenz in Dreiergruppen von Buchstaben, den sogenannten Codons, und ordnet jedem Codon mithilfe des Standard-Genetischen Codes eine Aminosäure zu.
Was DNA-Übersetzung ist
Eine Zelle speichert genetische Anweisungen in der DNA. Um ein Protein herzustellen, kopiert die Zelle zunächst ein Gen in die messenger-RNA (mRNA). Dieser Schritt wird Transkription genannt. Ribosomen lesen anschließend die mRNA und verknüpfen Aminosäuren in der von der mRNA vorgegebenen Reihenfolge. Dieser Schritt wird Translation genannt. Die fertige Aminosäurekette faltet sich zu einem funktionsfähigen Protein.
RNA unterscheidet sich nur in einer relevanten Hinsicht von DNA: RNA verwendet die Base Uracil (U), während DNA Thymin (T) verwendet. Deshalb kann eine DNA-Sequenz mit derselben Codontabelle wie eine RNA-Sequenz übersetzt werden, sofern jedes U zunächst als T gelesen wird.
So wird DNA in Protein übersetzt
Der Übersetzer wandelt eine Eingabesequenz in vier Schritten in eine Proteinsequenz um.
- Sequenz bereinigen. Die Buchstaben werden in Großbuchstaben umgewandelt und jedes U wird durch T ersetzt. Leerzeichen, Zeilenumbrüche, Ziffern und die in eingefügten FASTA-Sequenzen verwendeten Satzzeichen (
>,-und*) werden entfernt. Wenn nach der Bereinigung nichts übrig bleibt, meldet der Übersetzer die Eingabe als leer. - Basen überprüfen. Jedes verbleibende Zeichen muss A, C, G oder T sein. Jedes andere Zeichen bricht den Vorgang ab und erzeugt eine Fehlermeldung, in der die ungültigen Zeichen aufgeführt werden.
- In Codons aufteilen. Beginnend mit dem ausgewählten Leserahmen wird die Sequenz in nicht überlappende Gruppen aus jeweils drei Basen aufgeteilt.
- Jedes Codon übersetzen. Jedes Codon wird mithilfe der nachstehenden Tabelle des genetischen Codes einer Aminosäure zugeordnet. Die Übersetzung endet beim ersten Stoppcodon (TAA, TAG oder TGA). Das Stoppcodon selbst wird nicht in die Proteinsequenz aufgenommen.
Wenn nach dem letzten vollständigen Codon weniger als drei Basen übrig bleiben, können diese Basen nicht übersetzt werden, und der Übersetzer meldet sie als verbleibende Basen. Basen, die nach einem Stoppcodon stehen, werden nicht als verbleibend gezählt, da die Übersetzung bereits beendet ist.
Leserahmen
Ein Leserahmen ist der Startpunkt, ab dem eine Sequenz in Codons aufgeteilt wird. Da jedes Codon drei Basen lang ist, kann eine Sequenz beginnend mit ihrer ersten, zweiten oder dritten Base aufgeteilt werden. Diese werden als Leserahmen 1, 2 und 3 bezeichnet. Jeder Leserahmen erzeugt normalerweise eine andere Proteinsequenz. In einem echten Gen erzeugt nur ein Leserahmen das korrekte Protein. Die beiden anderen Leserahmen stoßen häufig schnell auf ein Stoppcodon und erzeugen eine kurze, bedeutungslose Sequenz.
Beginn beim ersten ATG
Die meisten Gene beginnen mit dem Codon ATG. Es codiert für Methionin und markiert den Beginn des Proteins. Der Übersetzer bietet eine Option namens „Bis zum ersten Startcodon (ATG) suchen“. Ist diese Option aktiviert, bewegt sich der Übersetzer im ausgewählten Leserahmen vorwärts, bis er ein Codon erreicht, das genau ATG entspricht, und beginnt dort mit der Übersetzung. Basen vor diesem ATG werden ignoriert. Ist die Option deaktiviert, beginnt die Übersetzung mit der ersten Base des Leserahmens.
Bei der Suche wird nur ein ATG akzeptiert, das an einer Codongrenze des ausgewählten Leserahmens liegt. Nehmen wir CATGGCCTAA. Leserahmen 1 teilt die Sequenz in CAT GGC CTA auf, sodass die Buchstaben ATG nicht mit einem Codon übereinstimmen. Der Übersetzer meldet daher, dass in diesem Leserahmen kein Startcodon gefunden wurde. Leserahmen 2 beginnt mit der zweiten Base und ergibt ATG GCC TAA. Daher beginnt die Übersetzung sofort und erzeugt MA.
Der genetische Code
Der Standard-Genetische Code ordnet jedes der 64 möglichen Codons einer von 20 Aminosäuren oder einem Stoppsignal zu. Dieser Code wird von den meisten Genen der meisten Organismen, einschließlich des Menschen, verwendet.
| Aminosäure | Codons |
|---|---|
| Alanin (A) | GCT, GCC, GCA, GCG |
| Arginin (R) | CGT, CGC, CGA, CGG, AGA, AGG |
| Asparagin (N) | AAT, AAC |
| Asparaginsäure (D) | GAT, GAC |
| Cystein (C) | TGT, TGC |
| Glutaminsäure (E) | GAA, GAG |
| Glutamin (Q) | CAA, CAG |
| Glycin (G) | GGT, GGC, GGA, GGG |
| Histidin (H) | CAT, CAC |
| Isoleucin (I) | ATT, ATC, ATA |
| Leucin (L) | TTA, TTG, CTT, CTC, CTA, CTG |
| Lysin (K) | AAA, AAG |
| Methionin (M) | ATG |
| Phenylalanin (F) | TTT, TTC |
| Prolin (P) | CCT, CCC, CCA, CCG |
| Serin (S) | TCT, TCC, TCA, TCG, AGT, AGC |
| Threonin (T) | ACT, ACC, ACA, ACG |
| Tryptophan (W) | TGG |
| Tyrosin (Y) | TAT, TAC |
| Valin (V) | GTT, GTC, GTA, GTG |
| Stopp | TAA, TAG, TGA |
ATG codiert für Methionin. Es ist außerdem das Codon, mit dem die meisten Gene den Beginn der codierenden Sequenz markieren.
Beispiel: Übersetzung einer DNA-Sequenz
Nehmen wir die Sequenz ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG im Leserahmen 1.
Aufteilung in Codons: ATG GCC ATT GTA ATG GGC CGC TGA AAG GGT GCC CGA TAG
Übersetzung der einzelnen Codons: ATG → M, GCC → A, ATT → I, GTA → V, ATG → M, GGC → G, CGC → R, TGA → Stopp.
Das achte Codon, TGA, ist ein Stoppcodon, daher endet die Übersetzung an dieser Stelle. Die Proteinsequenz lautet MAIVMGR und ist sieben Aminosäuren lang. Die Basen nach dem Stoppcodon werden nicht übersetzt.
Beispiel: Eine codierende Sequenz ohne Stoppcodon
Nehmen wir die Sequenz ATGAAGTACGCCTACATCGCCAAGCAGCGCCAG im Leserahmen 1. Sie ist 33 Basen lang, was genau 11 Codons entspricht.
Aufteilung in Codons: ATG AAG TAC GCC TAC ATC GCC AAG CAG CGC CAG
Übersetzung der einzelnen Codons: M, K, Y, A, Y, I, A, K, Q, R, Q.
Es erscheint kein Stoppcodon, daher werden alle 11 Codons übersetzt. Die Proteinsequenz lautet MKYAYIAKQRQ; verbleibende Basen gibt es nicht.
Beispiel: Wie der Leserahmen das Ergebnis verändert
Die kurze Sequenz ATGCATGCA zeigt, warum der Leserahmen eine Rolle spielt.
- Leserahmen 1 (Beginn bei Base 1): ATG CAT GCA → M, H, A. Protein: MHA.
- Leserahmen 2 (Beginn bei Base 2): TGC ATG CA → C, M, mit 2 verbleibenden Basen, die kein Codon bilden können.
- Leserahmen 3 (Beginn bei Base 3): GCA TGC A → A, C, mit 1 verbleibender Base.
Drei verschiedene Startpunkte ergeben aus denselben neun Basen drei verschiedene Proteinsequenzen.
Verwendung der DNA-zu-Protein-Übersetzung
Forschende übersetzen DNA-Sequenzen, um vorherzusagen, welches Protein ein Gen erzeugt, um zu überprüfen, ob eine klonierte Sequenz nach Veränderungen noch im richtigen Leserahmen liegt, und um zu untersuchen, wie eine Mutation die Aminosäuresequenz eines Proteins verändert. Bioinformatik-Pipelines übersetzen Genomsequenzen automatisch, um Gene zu annotieren und Proteindatenbanken zu durchsuchen.
Eine kurze Geschichte
Francis Crick beschrieb 1958 den Fluss genetischer Informationen von DNA über RNA zu Protein und nannte ihn das zentrale Dogma der Molekularbiologie. 1961 zeigten Marshall Nirenberg und Heinrich Matthaei, dass das Codon UUU für die Aminosäure Phenylalanin codiert – das erste entschlüsselte Codon. Bis 1966 hatten Forschende, darunter Nirenberg und Har Gobind Khorana, alle 64 Codonzuordnungen ermittelt und damit den genetischen Code bestimmt, den dieser Übersetzer heute verwendet.
Häufig gestellte Fragen
Was ist der Unterschied zwischen DNA-Übersetzung und Transkription?
Bei der Transkription wird eine DNA-Sequenz in mRNA kopiert. Bei der Translation wird diese mRNA gelesen und daraus ein Protein aufgebaut. Dieses Werkzeug überspringt den RNA-Schritt und übersetzt eine DNA-Sequenz direkt, wobei dieselben Codonregeln angewendet werden.
Warum bietet der Übersetzer drei Leserahmen an?
Ein Codon ist drei Basen lang, daher kann eine Sequenz beginnend mit ihrer ersten, zweiten oder dritten Base in Codons aufgeteilt werden. Normalerweise entspricht nur einer dieser drei Leserahmen der tatsächlichen codierenden Sequenz eines Gens. Daher kann die Prüfung aller drei Leserahmen helfen, den richtigen zu finden.
Was geschieht, wenn die Länge meiner Sequenz kein Vielfaches von drei ist?
Die zusätzlichen Basen am Ende können kein vollständiges Codon bilden. Der Übersetzer meldet die Anzahl der verbleibenden Basen und übersetzt jedes vollständige Codon, das davor steht.
Kann ich statt einer DNA-Sequenz eine RNA-Sequenz einfügen?
Ja. Jedes U in der Eingabe wird vor der Übersetzung automatisch als T gelesen. Daher liefert eine RNA-Sequenz dasselbe Ergebnis wie die entsprechende DNA-Sequenz.
Was bewirkt ein Stoppcodon?
Ein Stoppcodon (TAA, TAG oder TGA) markiert das Ende der codierenden Sequenz. Der Übersetzer beendet die Übersetzung an dieser Stelle und fügt weder das Stoppcodon selbst noch etwas danach in die Proteinsequenz ein.
Was bewirkt die Startcodon-Option?
Sie weist den Übersetzer an, im ausgewählten Leserahmen bis zum ersten ATG vorzugehen und dort zu beginnen, so wie ein Ribosom an einem Startcodon mit dem Lesen beginnt. Ist die Option deaktiviert, beginnt die Übersetzung stattdessen mit der ersten Base des Leserahmens. Enthält der Leserahmen kein ATG im richtigen Leseraster, meldet der Übersetzer dies, statt zu raten.
Verwenden alle Organismen denselben genetischen Code?
Fast alle Gene im Zellkern verwenden den oben gezeigten Standardcode. Es gibt einige Ausnahmen, etwa die menschliche mitochondriale DNA, in der das Codon TGA für Tryptophan codiert, statt als Stoppsignal zu fungieren.