ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI 第一次写出完整的活病毒基因组:Evo 的 70 万候选里只有 16 个活了下来,基因组语言模型把进化变成可编程的

AI 第一次写出完整的活病毒基因组:Evo 的 70 万候选里只有 16 个活了下来,基因组语言模型把进化变成可编程的 合成仪里的一管液体2026 年 8 月 6 日《科学》杂志刊出一篇来自斯坦福大学与 Arc 研究所的论文。标题措辞相当克制但内容让整个合成生物学圈子的研究者把摘要反复读了三遍。论文宣布的成果是人工智能设计并合成了 16 个自然界从未存在过的病毒。而且这些病毒是活的不是纸面上的序列设计。所谓活的在论文里有明确的实验定义。这些噬菌体被转入培养皿后开始自我复制能吸附宿主、注入基因组、组装出下一代病毒颗粒。从吸附到裂解释放它们完成了完整的感染周期行为与天然病毒没有本质区别。这是实验室里可以直接观察、重复验证的事实不是模型输出的自说自话。先把最容易引发的恐慌按下不表。这些噬菌体只感染细菌不感染人、动物或植物属于生物防治意义上的病毒不是恐怖片里的病原体。整个实验流程通过了斯坦福大学的生物安全审查使用的都是成熟的合成与培养规程。把病毒两个字直接等同于危险是这篇论文最容易造成的误读也是最需要纠正的直觉。但技术意义上的震动是真实的。这是人类第一次让 AI 写出一个完整生命体的全部遗传信息并且这个生命体真的运转起来了。从序列到实体从数字设计到湿实验验证整条链路第一次完整闭环。业界普遍把这称为基因组设计领域的里程碑这个措辞并不夸张。论文里最扎眼的数字是一个漏斗。AI 生成了大约70 万个候选基因组其中只有 285 条被送进实验室合成最终 16 个组装成了能稳定传代的病毒。70 万到 285 是计算层面的筛选285 到 16 是湿实验层面的淘汰。每一层筛掉的都是模型或自然界认为不该存在的组合。这组数字同时安抚了两种焦虑。担心 AI 造出超级病原体的看到万分之几的命中率可以松一口气因为设计不等于落地。担心 AI 只会生成纸面设计的看到 16 个活体必须重新评估因为模型已经跨过了从序列到生命的那道门槛。两种立场都能从这组数字里找到支撑这正是它值得细读的原因。把这件事真正看懂需要依次回答三个问题。AI 到底是怎么写基因组的为什么成功率这么低依然震住了整个领域以及这条路最终会把合成生物学带到哪里。三个问题分别对应模型原理、产业意义和风险边界缺一个都看不全。这篇拆解会从实验的起点讲起逐步拆开模型原理、筛选漏斗、五个反直觉事实和生物安全争议。中间会插入真实可运行的代码让你在自己的机器上体验基因组语言模型。最后用一段关于分寸感的讨论收尾不煽动恐慌也不鼓吹万能。70 万到 16 的筛选漏斗实验的起点是一个被研究了几十年的小病毒ΦX174。它的基因组只有5386 个碱基对编码11 个基因是分子生物学教科书里的老熟人。这个尺寸在病毒里算很小的完整测序于 1977 年是历史上第一个被测序的 DNA 基因组。选它作为设计基准是因为小意味着每个基因都能被逐个验证。团队先用与 ΦX174 亲缘相近的大约 1.5 万个噬菌体基因组对模型做了监督微调。微调的目的是让模型熟悉这类病毒的写作风格包括基因顺序、启动子位置和衣壳蛋白的组装逻辑。然后研究者要求模型从零生成全新的基因组序列不给它现成模板。这一步的输出就是 70 万个候选基因组的来源。70 万个候选不是随机噪声而是模型认为有可能成立的各种组合方式。它们覆盖了不同的基因排布、不同的序列变体、不同的调控元件组合。这些序列在自然界里找不到任何对应的模板完全是模型的自由创作。也正因为如此它们才配得上自然界不存在这个说法。第一道筛选在计算机里完成。衣壳蛋白折叠不稳定的组合先被淘汰终止密码子位置离谱的组合随后出局复制起点缺失的序列也没有资格进入下一轮。凡是结构层面就说不通的组合全部在这一关被过滤掉。这道关卡的依据是生物物理规则与基因组语法模型自己也会给出置信度评分。285 条序列通过了计算筛选进入实验室阶段。DNA 合成仪把它们一段一段拼出来每条序列都先组装成完整的噬菌体基因组再转入大肠杆菌内部。接下来的观察只有一个问题它能不能完成从吸附到裂解释放子代的完整生活史。答案在数小时到一天之内就能揭晓。285 条里最终有 16 条成功。成功意味着病毒颗粒组装完毕、能裂解宿主、能产出下一代构成一个闭环的感染周期。论文把这定义为功能性噬菌体并且强调这 16 个都能稳定传代不是一次性事件。它们现在被保存在实验室里可以随时重新培养。把漏斗摊开看每一步的淘汰逻辑完全不同。从 70 万到 285靠的是模型先验和结构规则的组合筛选。从 285 到 16靠的是湿实验里实打实的存活验证。数量级的骤减背后是三种筛选机制在接力运转每一层都不可替代。阶段数量筛选机制AI 生成候选约 700000模型先验与采样序列级过滤285结构可行性与语法检查实验室合成285合成与组装成功率功能性噬菌体16完整感染周期验证成功率大约是万分之二点三但读法要反过来。放在传统合成生物学的语境里这个命中率已经高得让同行侧目因为过去的设计更多依赖专家直觉和随机突变。而它仅仅是第一代基因组模型交出的成绩单模型还在快速迭代。这才是最让这个领域紧张的地方。基因组语言模型把 DNA 当句子学Evo 不是为这个实验临时编写的程序而是 Arc 研究所持续投入的基因组基础模型家族。这次实验同时用到了 Evo 1 和 Evo 2 两代模型。Evo 1 发布于 2024 年论文发表在《科学》Evo 2 发布于 2025 年论文发表在《自然》。两代模型都有正式论文背书目标一致把基因组当作语言来建模。Evo 2 的训练数据规模是9 万亿个 DNA 碱基覆盖生命之树的各个域。从细菌、古菌到真核生物从病毒到复杂的多细胞生物训练语料横跨数百万个物种的基因组序列。可以把它理解成基因组的维基百科只不过每一行条目都是一段真实的 DNA。进化本身成了这份语料的作者。它的工作方式与 ChatGPT 高度同构。DNA 序列先被切成长度可变的 token模型学习下一个碱基的概率分布从而学会基因组的语法。在语言模型里下一个词的概率来自语料里的统计规律在 Evo 里下一个碱基的概率来自数百万物种的进化约束。同一个技术框架换了一个世界级的语料。这意味着模型内部沉淀的不是规则表而是什么样的基因组能活下来的隐式知识。它没见过 ΦX174 的完美答案但见过成千上万个与它相似的病毒基因组。它知道基因之间怎么排布才合理知道编码区该长什么样知道终止信号放在哪里。这些知识以参数的形式存在而不是以人工规则的形式存在。架构上两代模型有明确的分工演进。Evo 1 用的是自研的 StripedHyena 架构混合了卷积与注意力机制专门为长序列设计。Evo 2 换成了改进版的 StripedHyena2长程依赖的建模能力更强训练效率也更高。基因组序列恰恰是最考验长程建模的数据类型之一因为功能元件之间的距离动辄几千个碱基。模型必须记住很远的上文才能预测下一个碱基这与长文档理解是同一个技术难题。一段基因的调控元件可能位于上游几千碱基处编码区内部的每个密码子又必须保持正确的读框。注意力机制在这里的代价极高所以 Evo 系列选择了混合架构来平衡质量与成本这也是它区别于普通大模型的工程细节。论文里的对比数据印证了架构升级的价值。在相同的监督微调流程下Evo 2 生成的设计在湿实验里的成功率全面优于 Evo 1。16 个功能性噬菌体全部来自微调后的设计流程说明不是模型天生会设计而是微调把通用知识引导到了特定任务上。这个结论对做应用的开发者同样有参考意义。顺带说一句Evo 2 的权重是开源的任何人都可以在 HuggingFace 上下载。论文里强调开放权重是 Arc 研究所的一贯立场他们认为基因组基础模型应该像大语言模型一样接受社区检验。这个选择让本文后面的代码演示成为可能也让生物安全的讨论变得更加复杂。五个反直觉的事实这篇论文最值得读的地方不在结论而在五个与直觉相悖的细节。它们分别关于模型的性质、成功率的意义、性能的分布、结构的意外和应用的潜力。逐个拆开才能理解这个领域真正的变化在哪里。第一个反直觉的事实AI 写的不是代码是语法。人们习惯把基因组想象成一段程序基因是函数启动子是调用语句但 Evo 学会的不是这种确定性规则。它学的是统计语法是哪些写法在进化里出现过、哪些写法从没见过。所以它生成的序列经常包含自然界没有的变异组合看起来不标准却依然能工作。这也解释了为什么它的输出不能按代码审查的方式去读。代码审查是找逻辑错误基因组审查是判断生物可能性两者的判据完全不同。模型生成的是符合语法的句子而不是实现某个功能的程序这个认知差是理解整篇论文的钥匙。第二个反直觉的事实万分之二的命中率是缺陷也是安全阀。从工程角度看70 万选 16 的效率低得可怜说明模型对什么是可行基因组的建模还不够精确。但从风险角度看这个低效率恰好构成了天然的安全屏障因为每一个候选都必须经过湿实验验证才能变成活体。独立专家在接受媒体采访时也指出了这一点。与一些可以端到端自动执行的 AI 工具不同基因组设计的结果必须逐个在实验室里合成和测试命中率低意味着大规模滥用的成本极高。效率与安全的矛盾在这里意外地变成了同一枚硬币的两面。第三个反直觉的事实有的 AI 病毒跑得比天然病毒还快。16 个功能性噬菌体里一部分的裂解速度超过了它们的天然模板 ΦX174。进化花了漫长岁月打磨出的性能模型在几次采样里就复现甚至超越了这说明序列空间里还有大量未被自然探索的可行区域。这个发现对噬菌体疗法意义重大因为裂解速度直接决定治疗效率。同时也提醒我们所谓自然选择最优的直觉并不完整自然只探索了它碰巧走过的路径而模型可以系统性地遍历更多组合。合成生物学正在打开一个自然从未触及的设计空间。第四个反直觉的事实冷冻电镜照出了一个进化上不该出现的蛋白。研究者在其中一个 AI 噬菌体的衣壳里发现了一个在进化谱系上相距甚远的 DNA 包装蛋白。这个蛋白原本属于另一类病毒却出现在 ΦX174 风格的衣壳里而且功能正常。这几乎不可能靠随机突变自然发生因为跨越如此远的进化距离需要无数中间步骤。但模型无视了谱系的边界直接把不同病毒的零件拼在了一起结果依然能运转。这证明基因组语言模型能进行模块化设计像程序员复用库函数一样复用进化的零件。第五个反直觉的事实16 个噬菌体混成的鸡尾酒杀穿了耐药菌。研究者把 16 个 AI 噬菌体混合成鸡尾酒去攻击两种已经对天然噬菌体产生耐药性的大肠杆菌菌株结果两种耐药菌都被清除了。耐药菌面对混合攻击时来不及同时对 16 种不同的入侵策略产生抗性。这个实验结果直接指向抗生素耐药危机也是整篇论文最接近应用的部分。天然噬菌体的宿主范围窄、筛选周期长AI 设计则可以在几天内产出大量候选再用鸡尾酒策略压制耐药性。从实验室到临床还有很长的路但方向已经清晰可见。让 Evo 2 在你机器上写 DNA说了这么多原理不如让模型真正跑一次。Evo 2 的权重在 HuggingFace 上公开最小版本 evo2-7b 只有 70 亿参数一张消费级显卡就能推理。下面的代码用 Transformers 直接加载模型用 ΦX174 基因组开头的一段真实序列作为上下文让模型续写下去。运行之前需要安装依赖pip install transformers torch 即可模型首次加载会自动下载权重。如果你的显卡显存有限可以把 torch_dtype 换成 float32 并用 CPU 推理速度慢一些但结果一致。from transformers import AutoModelForCausalLM, AutoTokenizer model_name arcinstitute/evo2-7b model AutoModelForCausalLM.from_pretrained( model_name, trust_remote_codeTrue, torch_dtypebfloat16, ) tokenizer AutoTokenizer.from_pretrained(model_name) # ΦX174 基因组开头的一段真实序列作为模型的续写上下文 seed GAGTTTTATCGCTTCCATGACGCAGAAGTTAACACTTTCGGATATTTCTGATGAGTCGAAAAATTATCTTGATAAAGCAGGAATTACTACTGCTTGTTTACGAATTAAATCGAAGTGGACTGCTGGCGGAAAATGAGAAAATTCGACCTATCCTTGCGCAGCTCGAGAAGCTCTTACTTTGCGACCTTTCGCCATCAACTAACGATTCTGTCAAAAACTGACGCGTTGGATGAGGAGAAGTGGCTTAATATGCTTGGCACGTTCGTCAAGGACTGGTTTAGATATGAGTCACATTTTGTTCATGGTAGAGATTCTCTTGTTGACATTTTAAAAGAGCGTGGATTACTATCTGAGTCCGATGCTGTTCAACCACTAATAGGTAAGAAATCATGAGTCAAGT inputs tokenizer(seed, return_tensorspt) out model.generate(**inputs, max_new_tokens200) print(tokenizer.decode(out[0]))代码的逻辑只有四步加载模型、加载分词器、准备上下文、生成续写。tokenizer 会把 DNA 字符串切成模型认识的 tokenmodel.generate 则在给定上下文后逐碱基预测后续序列。输出的是一段全新的 DNA大概率是自然界没有的变体。这段代码不是论文实验的缩水版本而是官方支持的真实用法。Arc 研究所在模型仓库里提供了同样的调用方式trust_remote_code 参数是为了加载它们自定义的模型结构。把这段代码跑通你就在本地拥有了一个可以写基因组的语言模型。一个值得玩味的细节是模型并不知道自己在写病毒。它只是根据上下文预测下一个碱基的概率分布所谓设计病毒是人类赋予这个行为的解释。这和 ChatGPT 不知道自己在写文章是同一个道理统计规律与语义解释之间隔着观察者的立场。当然跑通续写和做出论文里的成果之间还有巨大的距离。论文的完整流程包含监督微调、大规模采样、结构过滤和湿实验验证续写只是其中最小的一环。但正是这个最小的闭环让基因组语言模型从概念变成了可以亲手触摸的工具。对开发者来说这个例子的启发在于领域模型的落地方式。Evo 没有发明新的深度学习范式它把语言建模的方法论迁移到了 DNA 上靠的是语料、架构与评估体系的重新设计。同样的思路正在被复制到蛋白质、化学分子和材料序列上这是 AI for Science 最活跃的方向之一。噬菌体疗法耐药菌时代的备选武器整篇论文最接近应用的部分是那个鸡尾酒实验。抗生素耐药菌每年造成数十万人死亡世卫组织早已把耐药性列为全球公共卫生的重大威胁。传统抗生素的研发管线在枯竭而细菌的抗药速度却越来越快。人类急需抗生素之外的第二种武器。噬菌体疗法其实有上百年的历史比抗生素还早。二十世纪初科学家就发现噬菌体可以治疗细菌感染但抗生素的横空出世让这条路线沉寂了几十年。近年来耐药危机卷土重来噬菌体疗法重新进入临床视野只是它一直有个致命短板天然噬菌体的宿主范围太窄。一个天然噬菌体往往只感染特定菌株换一种细菌就失效临床上需要针对每个病人的感染菌株去筛选和定制。这个过程要几周甚至更久而耐药菌感染往往等不了那么久。天然噬菌体库的规模也有限不是每种耐药菌都有现成的对应噬菌体可用。AI 设计恰好补上了这块短板。论文里的实验证明模型可以在几天内生成海量候选而且可以精确控制宿主特异性。16 个功能性噬菌体只抑制目标菌株的生长对无关菌株没有任何影响这种指哪打哪的精确性正是噬菌体疗法的理想形态。鸡尾酒策略解决的是耐药性的问题。单一种噬菌体用久了细菌会演化出对应的抗性机制但 16 种不同入侵策略的混合攻击让细菌来不及同时演化出全套抗性。实验里两种已经耐药的菌株被混合鸡尾酒清除验证了这个策略的有效性。从实验室到病床还有很长的路。噬菌体疗法的监管路径、给药方式、体内稳定性每一项都是独立的工程问题。但论文的价值在于证明了上游设计环节可以自动化剩下的问题从设计不出来变成了如何交付。这是质的改变。合成生物学公司已经开始关注这条路径。AI 设计加自动合成加鸡尾酒配比可能构成一套全新的抗菌治疗流水线。成本方面DNA 合成价格在过去二十年里下降了几个数量级让大规模候选验证在经济上变得可行。技术与成本两条曲线正在交汇。当然也要清醒噬菌体疗法不会取代抗生素它更适合作为耐药菌感染的备选方案。但它代表了一个更宏观的趋势生物设计正在从依赖自然筛选的漫长过程变成可以迭代优化的工程流程。这比单个产品本身重要得多。双刃剑能力与分寸论文作者在讨论部分主动写下了警告这是最值得注意的地方。他们指出同样的方法未来可能被用于设计感染人类、动物或植物的病原体而现有的对策可能无法遏制这类病原体。这句话写在 Science 的正式论文里分量比任何媒体的惊呼都重。更具体的担忧指向技术的通用性。噬菌体基因组只有 11 个基因已经是目前最复杂的设计对象之一但病毒家族里还有更大、更复杂的成员。如果模型的能力继续提升设计更大基因组只是时间问题而每个新设计都可能是双刃剑。能力曲线的上升速度可能超过安全机制的更新速度。独立专家给出的评估相对冷静。西班牙庞培法布拉大学的加西亚·奥哈尔沃教授在接受采访时指出这项研究的安全风险低于许多其他 AI 工具因为基因组设计必须经过逐个的湿实验验证而极低的命中率天然限制了滥用规模。设计结果无法跳过实验室直接变成威胁这是物理世界的天然门槛。两道防线也值得说明。第一道是学术机构的生物安全审查这类实验在立项、合成、操作三个环节都要过审。第二道是 DNA 合成供应商的订单筛查合成公司会对序列进行比对异常序列会被拦截。论文的整个流程都在两套机制下完成这也是结果能发表的制度前提。但防线并非无懈可击。开源权重意味着任何人都能下载模型合成仪器的门槛也在逐年下降筛查体系主要依赖行业自律。技术扩散的速度与监管覆盖的速度之间存在时间差这是所有前沿 AI 领域共同面临的困境基因组设计只是最新的一个案例。讨论到这里值得把视角拉回 AI for Science 的大图景。Evo 的突破在于把进化变成了可优化的工程对象过去设计一个生物体靠自然筛选和专家经验现在靠模型采样和迭代验证。这种范式的迁移正在蛋白质设计、材料发现、药物研发里同步发生基因组只是最早见效的领域之一。范式迁移的受益者不只是实验室。对开发者来说Evo 的代码路径展示了领域基础模型的完整套路通用预训练、任务微调、开源评估。对创业者来说噬菌体疗法、合成生物学工具链都是明确的产业化方向。对普通读者来说这则新闻的意义在于提醒生物世界的设计权正在从进化手里部分转移到人类手里。回到开头那个漏斗。70 万个候选、285 条合成、16 个活体这个数字既展示了 AI 的能力上限也划定了它的现实边界。能力在扩张门槛在降低但每一次从序列到生命的跨越仍然需要实验室里实打实的验证。恐慌没有理由轻慢更没有理由值得做的是持续观察这条曲线的走向。
返回列表