企业谈 AI 研发,最容易被吸引的是一个画面:模型生成候选方案,机器人自动执行实验,结果返回系统,下一轮方案随即开始。过去以周或月计算的循环,似乎可以变成连续运行的机器。
但真实研发并不是一道只要算得更快就能解出的题。一次实验为什么这样设计、使用了哪批样本、设备当时处于什么状态、哪些条件被临时调整、结果为何没有达到预期——这些上下文如果没有留下来,AI 得到的只是一堆结果,而不是可以继续推理的经验。
2026 年 8 月 19 日,AWS 与 Sanofi 联合披露了一套企业级“实验室在环”(Lab-in-the-Loop)架构。其核心并非让一个 Agent 包办科研,而是把科学知识、历史实验、计算模型、实验室设备和实际观测接入连续闭环;系统中的科学推理 Agent 需要理解此前的实验周期、分子演化、设计理由以及已观察到的失败模式,再提出下一步行动。
同月,《Nature Reviews Drug Discovery》发表的一篇综述给出了必要的冷静判断:AI 药物发现的临床相关影响证据仍然有限,研究重点应从模型基准成绩转向能否改善真实决策。
两份材料放在一起,释放出的信号比“AI 自动做实验”更重要:AI 进入研发现场后,企业的竞争壁垒不只是模型或自动化设备,而是能否把每一次尝试——尤其是不成功的尝试——变成下一轮可用、可解释、可审计的实验记忆。
研发组织最常丢失的,恰恰是“为什么没有成功”
很多企业已经保存了实验报告、检测结果和项目结论,却没有真正保存实验记忆。
成功项目通常会被整理、汇报并进入下一阶段;失败或不理想的尝试则更容易散落在个人笔记、设备日志、邮件和会议讨论中。几年后,另一支团队可能再次尝试相近路线,却不知道当年的失败来自原理不成立、操作偏差、样本问题,还是设备条件不具备。
这两类记录有本质区别:
对人而言,经验丰富的科学家可以凭上下文补全缺失信息;对 AI 而言,缺少上下文的阴性结果可能被误判为路线无效,也可能被完全忽略。系统随后不是在学习,而是在以更高速度重复组织过去没有记住的事情。
- 结果记录回答“发生了什么”;
- 实验记忆还要回答“为什么这样做、当时知道什么、偏离了什么、这个结果在哪些条件下才成立”。
“闭环”不是把五套系统画成一个圆
Sanofi 披露的架构把能力分成多个相互连接的层次:企业知识与科学文献提供依据,数据与计算层承载实验和模型,实验室层连接仪器与自动化,推理层跨周期理解设计理由与失败模式,共享服务则统一数据访问、编排、治理和 AI 能力。
这个设计提示企业,真正的闭环至少需要完成四次连接:
如果只有“模型生成—设备执行—结果回传”,系统只是自动化流水线。只有当下一轮决策能够引用上一轮的理由、条件和不确定性时,它才开始成为学习系统。
- 问题与方案连接:每个候选实验对应哪个科学问题、假设和决策;
- 方案与执行连接:计划条件与设备实际执行条件是否一致,发生了哪些偏差;
- 执行与证据连接:原始观测、处理过程和最终结论能否相互追溯;
- 证据与下一步连接:新方案具体继承了哪些发现,又放弃了哪些路线。
把一次实验保存为可计算的“证据单元”
企业不必一开始就追求全自动实验室。更现实的起点,是先定义一个能够跨系统流转的实验最小单元。它至少应包含以下信息:
最容易被删掉的是“无效数据”和“临时偏差”。但它们常常最能解释系统为何失败。一次异常可能来自设备状态,而不是研究假设;一次阴性结果可能只在特定批次或温度范围成立。没有这些信息,AI 很难区分科学事实、测量误差和流程事故。
因此,数据治理不能只保证文件被存储,还要保证结果与样本、方法、仪器、人员、版本和决策保持关系。NIST 的自主实验室工作也强调可复现方法、数据标准和可共享数据集;其自主方法研究则要求算法结合实验过程、设备和材料体系的先验知识,并对不确定性进行量化。
- 组成:需要保留的内容
- 决策背景:要回答的问题、业务价值、已知证据与当时的备选方案
- 实验设计:假设、变量、对照、停止条件、预期观察和设计责任人
- 实际执行:样本与批次、设备与校准状态、参数、时间、环境及人工干预
- 原始证据:未经筛选的观测、数据质量标记、处理代码和版本
- 结论边界:支持与不支持什么、置信程度、异常解释及不可外推的范围
- 后续关系:哪个决策使用了该结果、下一轮实验如何继承或修正它
Agent 可以提出下一步,但不能悄悄改变实验
当 AI 从分析结果走向生成可执行实验方案,错误的后果会从“答案不好”变成真实材料、设备时间、安全风险和错误决策。
2026 年 6 月发表于《Scientific Reports》的 AutoLabs 研究,测试了将自然语言转成液体处理设备可执行方案的多 Agent 系统。在五类基准实验中,更强的推理与自校正显著减少了复杂任务的定量误差,最佳配置在高难度多孔板合成任务上接近专家参考程序。但研究同时发现,系统仍会增加多余步骤、算错稀释液体积、遗漏加热或搅拌等关键步骤,并出现单位不一致;部分遗漏还与提示中没有提供完整设备规格有关。
这意味着企业不能只检查最终文件“能否运行”,还应建立三道控制:
高风险实验仍需由具备相应责任的专家批准。AI 适合扩大候选空间、整理证据和提出下一步;是否值得消耗真实资源、是否满足科学与安全要求,不能由一次语言模型输出直接决定。
- 生成前约束:设备能力、安全范围、材料兼容性和禁止动作必须来自受控数据,而不是让模型猜测;
- 执行前编译:对体积守恒、单位、顺序、资源冲突和关键步骤完整性做确定性校验;
- 执行后对账:比较计划与实际轨迹,将人工修改、设备报警和条件偏差写回实验记忆。
研发提效要衡量“少走了多少重复弯路”
如果只统计 AI 生成了多少分子、实验跑了多少批次,团队很容易把更高吞吐误认为更高研发质量。更有意义的指标应覆盖学习效率与决策质量:
这里最重要的变化,是把“实验做完”与“组织学会”区分开。一项实验即使没有得到预期结果,只要它排除了一个方向、暴露了测量问题或缩小了下一轮搜索空间,就可能创造真实价值。相反,成功结果如果无法说明条件、来源与适用边界,也很难安全复用。
- 从实验结束到证据可供下一轮调用的时间;
- 具备完整来源、条件和版本信息的实验比例;
- 新方案能够明确引用历史依据的比例;
- 因上下文缺失而重复进行的实验数量;
- 阴性或异常结果促成路线停止、修正或资源转移的比例;
- AI 建议在专家复核后被接受、修改和否决的原因分布;
- 从关键问题提出到获得足以支持决策的证据所需周期。
从一条高价值研发链路开始
对正在评估研发 AI 的企业,可以先选择一个实验频率较高、数据边界清楚、结果可在较短周期验证的场景,而不是立即连接所有实验室。
第一阶段先还原最近 20 至 50 次实验:哪些上下文能从系统获得,哪些只能询问人员,哪些已经无法恢复。第二阶段统一样本、设备、方法、观测和结论的标识,把人工调整和阴性结果纳入记录。第三阶段再让 AI 基于这些证据提出候选方案,但只进入沙箱或人工审批队列。最后,通过计划—执行对账与下一轮引用关系,验证系统是否真的减少了重复工作并改善决策。
如果这条窄链路仍无法解释“为什么做、实际怎么做、结果改变了什么”,增加更多模型和机器人只会放大信息缺口。
结语
AWS 与 Sanofi 的联合文章使用了“从数年到数周”的表述,但正文明确说明,这是一条将计算工作流和数据集成能力更快建立起来的潜在路径,实际周期取决于组织要求与假设,并非宣称药物发现或临床研发全流程已经普遍缩短到数周。
这项实践真正值得企业借鉴的,不是一个夸张的速度承诺,而是一种研发操作系统思路:让知识、历史实验、模型、设备、实际观测和决策理由持续相连。
模型会更新,自动化设备也会逐渐普及。更难复制的资产,是一家企业多年积累、保留完整条件、能够解释成功与失败的实验记忆。
当 AI 开始决定下一次实验做什么,组织首先要确保:上一次实验真正留下了可供学习的东西。