深入Evo:学会编写生命代码的基因组语言模型
本次实验背后的核心基因组基础模型Evo有着不同寻常的起源:它是一种语言模型,但训练数据是DNA而非英语。Arc研究所与斯坦福大学的Hazy Research团队于2024年3月推出了Evo 1,这是首个在大规模DNA数据上训练的基因组基础模型,具备跨DNA、RNA和蛋白质的预测与设计能力[1]。Evo 1的预训练数据包含约270万个原核生物和噬菌体基因组;到2025年2月,其继任者Evo 2已扩展至涵盖生命树上约12.8万个生物体的约9.3万亿个核苷酸[2],成为迄今为止构建的最大规模AI生物学模型[3]。Hie的团队随后将这一训练好的模型聚焦于一个具有历史意义的目标:phiX174——一种约5400个碱基对、包含11个基因的噬菌体,它是首个被完全测序的基因组,数十年后又成为首个从头化学合成的基因组[4]。
研究团队并未修改现有噬菌体,而是让Evo从零开始生成整个基因组。在合成并测试的302个AI设计的基因组序列中,有16个成功‘复活’:‘计算机设计的噬菌体开始复制,最终裂解细菌并将其杀死’[5]。这些存活下来的噬菌体并非微小变异:功能性AI设计的噬菌体相对于最近的天然噬菌体序列,各自携带了67至392个新突变[6];在直接对比测试中,部分AI生成的噬菌体在杀死细菌方面表现优于天然phiX174[7]。约5%的成功率听起来可能不高,但对于一个被要求首次尝试就写出可自我复制生物完整蓝图的模型而言,这一成功率已相当惊人。



