ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI for Science 的三种范式:数据驱动、物理知情与自主智能体实战

AI for Science 的三种范式:数据驱动、物理知情与自主智能体实战 这两年我常被做科研的朋友问一个问题“第四范式到底成不成立以后是不是不需要做实验、不需要推导公式光靠数据就能搞科研”问的人多了我发现大家真正困惑的其实不是“到底有几范式”而是AI到底以什么方式介入科研工作流。我自己折腾AI for Science也有几年了从分子性质预测、材料筛选到反应条件优化都碰过慢慢形成了一个很个人的判断与其说AI给科学新增了一个“第四范式”不如说它正在把经验、理论、计算这三个老范式分别升级了一遍。拆开来看正好对应到我在实际项目里反复用到的三条技术路线。这篇文章就把我理解中“AI时代的三种科学范式”完整讲一遍包括它们各自的核心思想、适用场景、实操细节以及我踩过的坑。1. 从“第四范式”之争谈我理解的三范式1.1 经典三范式经验、理论、计算其实一直在进化科学研究的方法论演进有一个很经典的分期。最早是经验科学靠肉眼观察和手工实验记录现象博物学时代的动植物分类、天文台的星表观测都是这个路子。牛顿写下《自然哲学的数学原理》之后理论科学成型人们开始用微分方程和公理体系去推导世界不再满足于“看到什么记什么”而是想“为什么是这样、下一步会怎样”。到了20世纪中叶计算机出现数值模拟成为第三种基础方法用有限元算桥梁受力、用分子动力学模拟蛋白质折叠这些以前只能在黑板上推的东西终于可以批量算了。这三条腿支撑起了近代科学的绝大部分成果。而且大家默认一件事范式不是互相取代而是互相叠加。一个现代课题组想做出结果几乎总是同时用实验观测、理论方程、数值模拟三种手段。所以每次有人问“AI会不会取代某个范式”我都觉得问题问偏了AI更像是在同时改造这三者。1.2 第四范式这个提法有一个盲点2007年前后图灵奖得主Jim Gray提出了影响深远的“第四范式”数据密集型科学。大意是当数据量大到机器能够自己从里面学会规律时传统“假设—实验—验证”的科研流程可能会被颠覆研究者只要拥有海量数据和新一代算法就能直接得到模型。这个提法在概念上很有冲击力但落到实际项目里我总觉得它有一个大盲点它把“数据驱动”当成了一个和前三者并列的大箩筐什么东西都往里装。可同样是深度学习有的项目只把样本数据丢进网络有的项目把物理方程也焊进了网络有的项目干脆让AI在实验室里自己开跑。这三个方向的工作流、技术栈、风险点完全不同混在一起根本没法指导选型。所以我现在更愿意按工作流来划分把它叫“AI时代的三种科学范式”学规律、融规律、跑规律。1.3 我推荐的AI时代三范式框架第一种叫“学规律”拿大规模数据和深度模型让网络自己学习特征和映射关系典型的例子是AlphaFold预测蛋白质结构、材料的机器学习势函数、大模型分子性质预测。第二种叫“融规律”把已知的物理定律、守恒律、几何对称性作为约束或架构硬编码进网络典型代表是PINN物理信息神经网络和等变图神经网络。第三种叫“跑规律”让智能体自动完成提出假设、设计实验、执行测量、分析结果、修正假设的封闭循环近年来自动化科学平台和AI Scientist系统都走这条路。后面我会按这三个方向逐一拆解每个方向都附上我实际项目里的操作细节和教训。这是全文的主线也是你在自己课题里做技术选型时可以直接用的框架。2. 范式一数据驱动把“找规律”变成“学规律”2.1 什么是数据驱动的研究从特征工程到表示学习先聊“学规律”这条路。传统科研里拿到一批数据后先要做特征工程分子量、脂水分配系数logP、氢键供体数目、拓扑极性表面积……然后套线性回归或随机森林。老手都清楚特征选得好不好直接决定模型上限所以过去做QSAR定量构效关系的人一半时间都花在绞尽脑汁找描述符上。但在数据量足够大的条件下深度学习可以绕过手工特征直接从原子坐标、分子图或序列里端到端学表示。这就是所谓的表示学习。网络自己知道该关注分子的哪一部分、应该用什么组合方式编码结构信息。最典型的例子还是结构生物学。AlphaFold2之前预测一个蛋白质三维结构的主流做法是同源建模加分子动力学精修过程长、依赖同源模板遇到孤儿蛋白基本抓瞎。AlphaFold2的思路完全不同把多序列比对信息和残基对的共进化信号当成输入用注意力机制端到端输出三维坐标。严格说它并没有引入什么新的生物力学规律纯粹是“用数据学规律”。结果大家也看到了结构预测精度直接跨过了实验门槛。2.2 真正决定项目成败的是数据管线不是模型结构但我必须强调数据驱动范式里决定项目生死的往往不是模型结构是数据管线。我做过分子/材料性质预测第一版模型调了一周毫无起色后来把问题定位到训练集上才发现一堆数据基本是乱的。我归纳出来三个高频问题。第一重复样本没去重同一个分子被不同来源数据收录了好多遍模型把重复当增量。第二同一个分子的SMILES写法不同网络把同一个分子当两个样本。比如“CCC”和“C(C)C”明明都是丙烷计算图里却是两个完全不同的输入和弦。第三数据量纲混乱沸点用摄氏度溶解度用log摩尔浓度混合在一起损失函数根本不知道在学什么。后来我做了三件事用RDKit把SMILES规范化同一分子去重统一所有目标变量的单位并做标准化按分子骨架聚类后分层切分。同样的模型R²从0.6涨到0.8以上。所以如果你要做数据驱动的科研项目我的建议是模型可以先糙着用数据管线必须精细打磨。2.3 我在性质预测项目里踩过的两个数据坑这里展开说两个坑都是我真实踩过的。第一个坑叫验证集泄漏。曾经我用一个公开数据库直接在原库里随机划分训练集和验证集结果验证指标漂亮得离谱。后来一排查发现同一个分子在不同子数据集里重复出现而且训练集里存在验证集分子的同分异构体——严格讲不算完全相同但结构高度相似模型相当于“见过”了正确答案的远房亲戚。真实的解决办法是先把全量数据按分子骨架聚类再把每一类整体划分到训练集或验证集里保证验证集和训练集的分子不相似。这个操作叫scaffold split骨架切分现在已经是化学信息学界的共识了。第二个坑是SMILES不规范。如果你用图神经网络需要先把SMILES解析成分子图这里必须用工具库做canonical化否则同一分子会被解析成不同的图。如果你用Transformer直接处理SMILES字符串问题更明显同一分子多种写法都会被模型当成不同样本最终学出一堆噪声。RDKit里一个Chem.MolFromSmiles加Chem.MolToSmiles就能解决大部分问题处理蛋白质序列时要注意统一氨基酸残基的字母规范。这些细节听起来不起眼但在数据驱动范式里它们比模型结构更影响最终产出。我有一个经验法则模型代码通常只占项目工作量的三分之一剩下三分之二都花在数据收集、清洗、切分和验证上。3. 范式二物理知情把科学定律焊进神经网络3.1 为什么纯数据模型会在外推时翻车“学规律”这条路在样本足够多时很强但有一个致命弱点它本质上是在数据分布内做插值。你让它预测分布之外的分子结构它往往给出物理上荒谬的结果。我见过一个课题组训练溶剂性质预测模型训练集里全是常见碳氢溶剂拿去预测含氟溶剂时会输出一个根本不存在的沸点。这不是模型不够好而是它从来没学过氟元素引入后热力学性质会发生怎样的系统性变化。于是就有了“融规律”这条路把已知的科学定律作为归纳偏置塞进网络。物理定律在这里不是背景知识而是约束条件或网络架构的一部分。这样做的直接好处是在数据稀疏的区域和分布外的场景下模型仍然被已知规律拽着走不会放飞自我。3.2 PINN实操损失函数配比与输入归一化我最熟的物理知情工具是PINN。做法很直白让神经网络输出候选解损失函数里除了数据项再加上控制方程残差项。以热传导方程为例除了让预测温度场和观测值接近还要约束网络对空间坐标的导数满足热传导方程本身。这样一来哪怕实验数据稀疏网络也会被方程往物理正确的方向上拉。实际操作中有三个细节非常关键。第一输入必须归一化。把空间坐标和时间都归一到[-1,1]区间否则方程残差项受坐标尺度影响会变得很大网络为了拟合数值量级反而学不到形状。第二多目标损失要加权平衡。data_loss、PDE_loss、边界条件loss三者的尺度可能差好几个数量级我遇到过PDE_loss初始值高达10²、data_loss只有10⁻²数据信号直接被淹没了。后来我先分别统计各loss的初始值按量级归一化后再加权收敛速度快了一倍不止。第三PDE残差采样点必须覆盖整个求解域不能只在数据点附近采样否则网络会在没有数据的地方疯狂跑偏产出一个局部满足方程但全局完全错误的解。PINN有个著名的槽点训练慢、对权重敏感。现在有很多改进方案比如自适应采样、用NTK理论指导损失权重但对绝大多数实际工程问题先做好归一化和loss平衡就能解决大部分痛点。3.3 等变图神经网络与对称性科学的第一性原理物理知情还可以硬到架构层面最典型的例子是等变图神经网络。物理世界有个最基本的对称性把整个分子平移、旋转之后能量、力、偶极矩这些性质的数值虽然会跟着坐标变化但物理含义完全一致。普通GNN把分子当普通图处理在输入旋转后内部表示会变输出的力场自然不稳定。等变网络用球谐函数、向量特征等方法保证网络内部对旋转是协变的预测出的力场天然就满足空间对称性。我现在做机器学习势函数基本默认用MACE或者SO(3)等变表示而不是普通GCN。原因很简单它能外推到训练数据之外的构象。普通GCN在小分子平衡构象附近预测还行一旦放到大尺度分子动力学模拟里键拉伸、键角扭曲之后能量预测立刻崩掉。等变模型把旋转对称性内建进去后同一个力场能泛化到更宽的势能面做MD模拟比从头算方法快几个数量级这是纯数据驱动很难做到的。这里也形成了我一个选型判断如果预测目标涉及能量、力、场这类有明确对称性约束的物理量优先考虑物理知情架构如果只是做分类比如分子是否有毒性、化合物是否活性纯数据驱动通常就够用了。4. 范式三自主智能体让AI自己跑完科研闭环4.1 闭环框架假设生成、实验设计、结果反馈第三个范式“跑规律”是这几年最让人兴奋也最容易被误解的方向。它的核心不是某个单点AI模型而是把完整的科研循环——提出假设、设计实验、执行实验、读取结果、修正假设——尽可能自动化。用大白话说以前是我们人坐在实验台前翻文献、拍脑袋、试条件。现在可以让大语言模型先读一千篇文献把信息整理成候选假设让贝叶斯优化模块决定下一组实验参数让自动化工作站去执行实验仪器返回数据后算法自动更新代理模型再推荐下一轮。人剩下的事是定义研究目标、设置安全边界、审核最终结论。这套东西已经有相对成熟的案例。比如有团队用大模型搭配自动化移液平台做化学反应条件优化几百次实验就收敛到了人工摸索几个月才能达到的最优条件也有团队让LLM读文献后独立设计催化剂配方再通过自动化平台验证。核心思想都是一样的闭环。4.2 最务实的接入路径先数据、再优化、后自动化这里我得泼一点冷水。绝大多数实验室不可能一步到位买一条全自动实验线也不应该这么做。我建议的路径是三步走。第一步先把历史数据变成机器可读的电子记录。大部分实验室的旧数据躺在Excel和纸质笔记本里关键线索都是口口相传。先把这些数据清洗成结构化表格这是后面一切智能化的基础。没有数据积累贝叶斯优化也好、LLM也罢都不知道该怎么开始。第二步用贝叶斯优化做实验设计。不一定要接机器人可以人工执行算法推荐的参数点把结果录入后再更新模型。参数空间稍微大一点时贝叶斯优化比网格搜索效率高得多。举个例子4个连续参数、每个参数取几十个网格点网格搜索需要成千上万次实验而贝叶斯优化往往几百次就能收敛。我通常用EIExpected Improvement作为采集函数因为它很好平衡了探索和开发工程上最稳。初始阶段随机采样10到20个点做预实验再进入贝叶斯优化循环。记住每个实验都要设置重复组否则系统误差会被代理模型当成真实信号。第三步等推荐流程稳定后再把执行环节自动化。自动化设备最好选择开放协议、能输出标准数据的型号。这一步的关键不是“机器人有多炫”而是数据能否自动回流。如果仪器的数据格式乱七八糟闭环还是会断。4.3 智能体幻觉和人在回路我踩过的坑这里必须讲一个我真实遇到的大坑。大语言模型有严重的幻觉问题。让它推荐配方它可能一本正经地给出一个根本不存在的文献编号或者一个浓度上完全没法配的溶剂组合。我实测时甚至碰到过LLM推荐两种混合后会有危险的试剂组合。这种错误在纯文本问答场景里只是聊天翻车放到真实实验里就是安全事件。所以我在用第三种范式时有一条铁律智能体生成的任何配方、条件、文献引用都要经过一层验证。文献引用要检索核对原文配方要经过化学规则检查和人类审核实验执行必须留痕。所谓“人在回路”不是一句口号是安全底线。另外要提醒的是智能体的成本不低。别只看省下的实验时间和人力得把token费用、人工审核时间、自动化设备的维护成本都算进去。我见过不止一个项目省下来的实验时间又被审核重新吃掉了。跑闭环之前先拿一个小问题验证ROI是不是正的。5. 三种范式怎么选一张决策清单加两个真实项目5.1 选型决策清单四个问题每次开始一个AI科学项目我会先问自己四个问题。第一数据量有多大如果有10⁴个以上的高质量标注样本可以放心走数据驱动路线先把基线跑出来再叠加物理约束。如果数据只有几十到几百个纯数据驱动基本是死路建议直接上物理知情范式用强约束弥补数据不足。第二机理到底清楚不清楚如果领域已经有成熟方程和守恒律一定要用物理知情如果机理完全不清楚比如疾病相关的表型变化那就只能数据驱动。第三需要外推还是只要内插真实科研里几乎没有纯插值问题。只要涉及外推我的态度很鲜明选含物理约束的方法。第四实验成本贵不贵如果做一次实验又贵又慢优先引入自主智能体范式用贝叶斯优化和主动学习减少实验次数而不是靠蛮力盲扫。5.2 案例一材料性质筛选数据驱动物理知情我曾经做过一个有机分子库的性质筛选项目给定约5万条数据预测某个力学性质用于初筛。这个任务一开始我用纯图神经网络做验证集指标马马虎虎但拿到实际外推场景就露馅了——从A类骨架预测B类骨架时排序能力几乎随机。后来改成“数据驱动物理知情”的组合路线先用图神经网络在大规模分子图上做预训练表示再把机械性能相关的物理约束作为微调惩罚项加进去。最终MAE比纯GNN提升了大概15%最关键的是外推到新的骨架类别时排序能力保留住了。这个项目还逼着我认真做了scaffold split和去重因为原始数据里同一分子在不同子数据集中重复出现的问题非常严重处理前后模型差异肉眼可见。5.3 案例二反应条件优化自主智能体闭环另一个项目是反应条件优化。变量包括催化剂、配体、碱、温度、溶剂有的是离散选择有的是连续变量。我们搭了闭环初始随机采样20组条件做预实验然后用高斯过程代理模型配合EI采集函数选择下一轮实验点人工执行后回传产率循环70多轮。效果很直观同样的目标产率组里以前的玩法要摸200多组条件才摸得到这次70多轮就到相似水平了。这个项目的另一个收获是倒逼我们把实验记录标准化了所有条件、产率、纯度都变成结构化数据后面再做别的反应优化时直接复用边际成本低很多。5.4 三范式对照表范式核心AI技术数据需求算力需求可解释性最佳场景数据驱动深度神经网络、表示学习高10⁴样本高较弱大数据、机理不清、内插为主物理知情PINN、等变图神经网络中10³样本级中较强有方程/对称性、必须外推自主智能体LLM、贝叶斯优化、自动化设备中可数据累积低到中流程可见实验昂贵、高维参数优化这三者并不互斥。我现在的成熟项目基本都是叠着用数据驱动提供基线物理约束修正外推智能体闭环压缩实验成本。最后说点实在的。我见过不少人一开口就要“上一个AI科学家系统”其实回到实际跑过的项目里投资回报率最高的往往是先把数据管线做扎实再选一个合适的物理约束加上去结果就能超过大多数精心打磨的纯数据模型。范式是拿来选型的不是拿来贴标签的。我的个人建议是以数据为主线以物理为护栏以智能体为加速器哪个环节ROI高就先用哪个。别让“AI浓度”决定技术路线让数据量和问题本身决定。
返回列表