超越自然序列

一种新的机器学习框架旨在提高计算蛋白质设计的成功率,同时摆脱再现自然界中发现的序列的结果。

来源:MIT新闻 - 人工智能

蛋白质的功能由其结构决定,而结构(蛋白质折叠方式)由其氨基酸序列(蛋白质的组成部分)决定。

设计新型蛋白质的许多方法,包括可以与细胞中致病分子结合的示例,都涉及两步过程:首先是结构,然后机器学习框架生成可能采用该结构的序列库。

在自然界中,许多不同的氨基酸序列可以折叠成相同的结构。同时,根据蛋白质的灵活性或功能触发因素,一种氨基酸序列可能采用不同的结构。因此,当研究人员利用人工智能设计新蛋白质时,面临的挑战是引导人工智能“看到”有许多潜在有用的答案——许多序列可以采用相同的折叠

“多年来,该领域一直通过询问模型是否能够重现进化所选择的蛋白质序列来衡量成功——我们的研究表明,这并不是蛋白质设计的最佳衡量标准,”生物系主任、Jay A. Stein (1968) 生物学教授、生物工程教授以及最近在 PNAS 上发表的一篇论文的资深作者 Amy E. Keating 说道。

PottsMPNN 是生物系开发的一种新的机器学习框架,它融合了控制蛋白质结构和稳定性的物理原理,改进了序列生成以及预测突变如何影响蛋白质稳定性的能力。换句话说,该模型更好地理解了序列能量景观,即每个氨基酸的身份与蛋白质稳定性之间的关系。

将此框架添加到蛋白质设计流程中将使研究人员能够设计结构上可行的蛋白质,其序列与任何天然蛋白质的序列都不相似。

超越噪音

人工智能时代的蛋白质设计