DNA转蛋白质翻译器 - 密码子与氨基酸转换工具
使用标准遗传密码,将DNA或RNA序列翻译成氨基酸序列。选择阅读框,查看每个密码子的翻译结果。
DNA转蛋白质翻译器
请输入DNA或RNA序列。使用碱基A、C、G和T。U将被视为T。空格、换行和数字将被忽略。翻译使用标准遗传密码(NCBI第1号密码子表)。
从该阅读框中第一个ATG处开始翻译,就像核糖体开始读取开放阅读框那样,而不是从该阅读框的最开头开始。
文档
DNA 到蛋白质翻译器
DNA 到蛋白质翻译器可将 DNA 或 RNA 序列转换为其编码的蛋白质序列。它以三个字母为一组读取序列,这些组称为密码子,并使用标准遗传密码将每个密码子转换为一种氨基酸。
什么是 DNA 翻译
细胞将遗传指令储存在 DNA 中。要构建蛋白质,细胞首先将基因复制为信使 RNA(mRNA)。这一步称为转录。随后,核糖体读取 mRNA,并按照 mRNA 指定的顺序将氨基酸连接起来。这一步称为翻译。形成的氨基酸链折叠成具有功能的蛋白质。
RNA 与 DNA 的相关差异只有一个:DNA 使用胸腺嘧啶(T)时,RNA 使用碱基尿嘧啶(U)。因此,只要先将每个 U 按 T 读取,就可以使用与 RNA 序列相同的密码子表翻译 DNA 序列。
如何将 DNA 翻译为蛋白质
翻译器分四步将输入序列转换为蛋白质序列。
- 清理序列。 字母会转换为大写,并将每个 U 改为 T。空格、换行、数字以及粘贴的 FASTA 序列中使用的标点符号(
>、-和*)都会被移除。如果清理后没有剩余内容,翻译器会报告输入为空。 - 检查碱基。 每个剩余字符都必须是 A、C、G 或 T。任何其他字符都会终止处理,并生成列出无效字符的错误消息。
- 拆分为密码子。 从所选阅读框开始,将序列切分为互不重叠的三碱基组。
- 翻译每个密码子。 使用下方的遗传密码表,将每个密码子与一种氨基酸对应起来。遇到第一个终止密码子(TAA、TAG 或 TGA)时停止翻译。终止密码子本身不会添加到蛋白质序列中。
如果最后一个完整密码子之后剩余的碱基少于三个,这些碱基无法翻译,翻译器会将其报告为剩余碱基。终止密码子之后的碱基不计为剩余碱基,因为翻译已经结束。
阅读框
阅读框是将序列切分为密码子时使用的起始位置。由于每个密码子长度为三个碱基,序列可以从第一个、第二个或第三个碱基开始切分。这些分别称为阅读框 1、2 和 3。每个阅读框通常会产生不同的蛋白质序列。在真实基因中,只有一个阅读框会产生正确的蛋白质。其他两个阅读框通常很快遇到终止密码子,只产生一段短而无意义的序列。
从第一个 ATG 开始
大多数基因以密码子 ATG 开始。它编码甲硫氨酸,并标志着蛋白质的起始位置。翻译器提供一个名为“扫描至第一个起始密码子(ATG)”的选项。启用该选项后,翻译器会沿所选阅读框向前扫描,直到遇到恰好为 ATG 的密码子,然后从此处开始翻译。ATG 之前的碱基会被忽略。关闭该选项时,翻译从阅读框的第一个碱基开始。
扫描只接受落在所选阅读框密码子边界上的 ATG。以 CATGGCCTAA 为例。阅读框 1 将其切分为 CAT GGC CTA,因此字母 ATG 无法对齐为一个密码子,翻译器会报告该阅读框中未找到起始密码子。阅读框 2 从第二个碱基开始,得到 ATG GCC TAA,因此翻译立即开始,并产生 MA。
遗传密码
标准遗传密码将 64 个可能的密码子分别指定为 20 种氨基酸之一,或指定为终止信号。包括人类在内的大多数生物的大多数基因都使用这一遗传密码。
| 氨基酸 | 密码子 |
|---|---|
| 丙氨酸(A) | GCT、GCC、GCA、GCG |
| 精氨酸(R) | CGT、CGC、CGA、CGG、AGA、AGG |
| 天冬酰胺(N) | AAT、AAC |
| 天冬氨酸(D) | GAT、GAC |
| 半胱氨酸(C) | TGT、TGC |
| 谷氨酸(E) | GAA、GAG |
| 谷氨酰胺(Q) | CAA、CAG |
| 甘氨酸(G) | GGT、GGC、GGA、GGG |
| 组氨酸(H) | CAT、CAC |
| 异亮氨酸(I) | ATT、ATC、ATA |
| 亮氨酸(L) | TTA、TTG、CTT、CTC、CTA、CTG |
| 赖氨酸(K) | AAA、AAG |
| 甲硫氨酸(M) | ATG |
| 苯丙氨酸(F) | TTT、TTC |
| 脯氨酸(P) | CCT、CCC、CCA、CCG |
| 丝氨酸(S) | TCT、TCC、TCA、TCG、AGT、AGC |
| 苏氨酸(T) | ACT、ACC、ACA、ACG |
| 色氨酸(W) | TGG |
| 酪氨酸(Y) | TAT、TAC |
| 缬氨酸(V) | GTT、GTC、GTA、GTG |
| 终止 | TAA、TAG、TGA |
ATG 编码甲硫氨酸。它也是大多数基因用于标记编码序列起点的密码子。
示例:翻译 DNA 序列
取阅读框 1 中的序列 ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG。
拆分为密码子:ATG GCC ATT GTA ATG GGC CGC TGA AAG GGT GCC CGA TAG
翻译每个密码子:ATG → M,GCC → A,ATT → I,GTA → V,ATG → M,GGC → G,CGC → R,TGA → 终止。
第八个密码子 TGA 是终止密码子,因此翻译到此结束。蛋白质序列为 MAIVMGR,长度为七个氨基酸。终止密码子之后的碱基不会被翻译。
示例:没有终止密码子的编码序列
取阅读框 1 中的序列 ATGAAGTACGCCTACATCGCCAAGCAGCGCCAG。它的长度为 33 个碱基,恰好包含 11 个密码子。
拆分为密码子:ATG AAG TAC GCC TAC ATC GCC AAG CAG CGC CAG
翻译每个密码子:M、K、Y、A、Y、I、A、K、Q、R、Q。
没有出现终止密码子,因此 11 个密码子全部被翻译。蛋白质序列为 MKYAYIAKQRQ,没有剩余碱基。
示例:阅读框如何改变结果
短序列 ATGCATGCA 展示了阅读框为何重要。
- 阅读框 1(从第 1 个碱基开始):ATG CAT GCA → M、H、A。蛋白质:MHA。
- 阅读框 2(从第 2 个碱基开始):TGC ATG CA → C、M,剩余 2 个无法组成密码子的碱基。
- 阅读框 3(从第 3 个碱基开始):GCA TGC A → A、C,剩余 1 个碱基。
三个不同的起始位置会根据同样的九个碱基产生三种不同的蛋白质序列。
DNA 到蛋白质翻译的用途
研究人员翻译 DNA 序列,以预测基因产生的蛋白质,检查克隆序列在编辑后是否仍处于正确的阅读框中,并了解突变如何改变蛋白质的氨基酸序列。生物信息学流程会自动翻译基因组序列,以帮助注释基因和搜索蛋白质数据库。
简短历史
Francis Crick 在 1958 年描述了遗传信息从 DNA 到 RNA 再到蛋白质的流动,并将其称为分子生物学的中心法则。在 1961 年,Marshall Nirenberg 和 Heinrich Matthaei 证明密码子 UUU 编码氨基酸苯丙氨酸,这是第一个被破解的密码子。到 1966 年,包括 Nirenberg 和 Har Gobind Khorana 在内的研究人员已经确定了全部 64 个密码子对应关系,从而得到了这款翻译器如今使用的遗传密码。
常见问题
DNA翻译与DNA转录之间有什么区别?
转录将 DNA 序列复制为 mRNA。翻译读取该 mRNA,并据此构建蛋白质。此工具跳过 RNA 步骤,直接翻译 DNA 序列,但使用相同的密码子规则。
翻译器为什么提供三个阅读框?
一个密码子由三个碱基组成,因此序列可以从第一个、第二个或第三个碱基开始拆分为密码子。这三个阅读框中通常只有一个与基因的真实编码序列相匹配,因此检查全部三个阅读框有助于找到正确的阅读框。
如果序列长度不是三的倍数,会发生什么?
末尾多出的碱基无法组成完整密码子。翻译器会报告剩余碱基的数量,并翻译它们之前的每个完整密码子。
可以粘贴 RNA 序列而不是 DNA 序列吗?
可以。输入中的每个 U 都会在翻译前自动按 T 读取,因此 RNA 序列与其对应的 DNA 序列会产生相同的结果。
终止密码子有什么作用?
终止密码子(TAA、TAG 或 TGA)标志着编码序列的末尾。翻译器会在此处停止,不会将终止密码子本身或其后的任何内容添加到蛋白质序列中。
起始密码子选项有什么作用?
它会指示翻译器跳到所选阅读框中的第一个 ATG,并从那里开始翻译,就像核糖体从起始密码子开始读取一样。关闭该选项时,翻译从阅读框的第一个碱基开始。如果阅读框中没有处于同一阅读框内的 ATG,翻译器会明确报告这一点,而不是进行猜测。
所有生物都使用相同的遗传密码吗?
几乎所有核基因都使用上文所示的标准遗传密码。但也存在少数例外,例如人类线粒体 DNA,其中密码子 TGA 编码色氨酸,而不是充当终止信号。