2026 年 9 月 6 日,OpenAI 公布了一组内部研发数据:它把当前系统称为可在人工指导下完成边界明确、原本需要熟练研究人员数日工作的“自动化研究实习生”。截至 8 月中旬,其研究组织使用的 Agent 工作量,按标准八小时工作日折算,已达到每个人类工作日对应 3.1 个 Agent 工作日;实验数量也随 Agent 使用增长而上升。
这组数据最容易被理解成“研发可以更快了”。但对制药、材料、制造、能源和高科技企业,更重要的管理问题是:当提出假设、写代码和运行实验的速度突然提高,组织验证结论、解释异常和决定是否继续投入的能力,能否同步扩张?
如果不能,企业得到的未必是更短的创新周期,而可能是越来越多尚未充分验证、却已进入汇报、决策甚至产品流程的候选结论。我们可以把这类积压称为“验证债务”。
研发吞吐量增加,不等于有效发现同比增加
OpenAI 的披露很谨慎:代码量和实验数容易测量,却很难直接解释为研究进展;可用算力同期也显著增长,因此不能把实验增长全部归因于 Agent。它还指出,随着部分任务被自动化,最难自动化的环节会占用研究人员更大比例,并成为新的瓶颈。
这个判断可以迁移到企业研发。AI 可能显著降低以下工作的成本:
但研发价值还取决于另一组不容易自动扩张的工作:确认测量是否可信,识别数据泄漏和实验缺陷,判断统计显著是否具有业务意义,解释反常结果,检查安全与合规边界,以及决定哪些结论值得进入更昂贵的实物实验或产品验证。
因此,研发管理不能继续只看实验数量、代码提交量或候选生成速度。AI 把上游供给放大后,真正稀缺的资源会转移到高质量验证和专业判断。
- 检索论文、专利和历史实验;
- 生成候选机理、配方、结构或参数组合;
- 编写分析代码、仿真脚本和实验方案草稿;
- 批量执行计算实验并整理结果;
- 根据初步结果提出下一轮候选。
什么是“验证债务”
验证债务不是尚未完成的实验总数,而是已经被组织使用、传播或据以投入资源,却没有匹配相应证据强度的结论积压。
它通常以几种方式形成:
债务之所以危险,是因为它会产生复利。一个证据不足的材料性能判断,可能继续影响配方选择、采购、工艺设计和客户承诺;越晚发现问题,推翻它的成本越高。
- AI 生成了大量候选,团队只验证表现最好的少数结果,却没有记录筛选过程;
- 同一套数据既用于发现规律又用于证明规律,结果看似优秀,独立验证能力很弱;
- 仿真、离线数据或小规模试验中的改善,被直接写成对真实生产环境的承诺;
- 负结果、失败运行和人工干预没有完整保留,后续团队只能看到“成功故事”;
- 一个结论已被下游设计、预算或产品路线采用,但原始数据、代码、模型版本与实验条件无法重建。
给每个 AI 研发候选建立“证据状态”
企业不必阻止 AI 大量探索,但不应让所有输出以相同身份流动。一个实用做法,是为每个候选结论设置清晰的证据状态:
状态不应由模型根据文字流畅度自行判断,而应由预先定义的证据要求和责任人批准。每次升级至少保留:研究问题、原始来源、数据与代码版本、实验条件、失败记录、人工干预、评价指标、适用边界、未解释异常和批准人。
这不是为了增加文书,而是让下游人员一眼看出“这是值得测试的想法”还是“这是可以据以决策的证据”。
- 状态:含义:允许进入的下一步
- 假设:AI 或研究人员提出,尚无直接验证:文献核对、可行性评审
- 初步信号:在探索数据或单次实验中出现:重复实验、预注册验证方案
- 内部复现:在固定条件下可重复获得:独立数据或不同条件验证
- 边界验证:已知道在哪些条件成立或失效:有限场景试用、风险评审
- 应用证据:在接近真实使用条件下达到预设标准:产品、工艺或投资决策
把稀缺验证能力分配给最值得证明的假设
当生成候选几乎免费时,平均分配验证资源会迅速失效。企业需要在进入昂贵实验前进行一道组合式筛选,但筛选标准不应只看模型预测的成功率。
可以同时考察四个问题:
据此,把验证能力优先投向高价值、关键未知可被当前实验消除的候选;对价值有限、无法证伪或验证成本远高于潜在收益的候选,应尽早停止。AI 提高的不是“所有想法都值得做”的概率,而是组织更快获得可供淘汰的选项。
- 如果结论成立,能改变哪个产品、工艺或客户结果?
- 当前最大的未知来自机理、数据、工程放大还是市场需求?
- 下一项实验能否实质性减少这个未知,而非仅增加更多相似数据?
- 如果结论错误,组织最晚应在投入到哪个阶段前发现?
验收 AI 研发系统,要测整条发现链
OpenAI 披露,在有可判断真实结果的任务中,Agent 成功率随时间提高,但复杂任务仍需要显著人工引导;过去六个月里,成功完成的 4—8 小时任务中,超过一半至少发生过一次人工干预。这说明“最终任务成功”不能掩盖过程中投入的人类判断。
企业评估研发 Agent 时,至少应同时记录:
NIST 的 AI 风险管理框架强调,测试、评估、验证与确认应采用客观、可重复或可扩展的方法,记录指标、方法、不确定性和适用条件,并可引入未参与一线开发的内部专家或独立评估者。OECD 对 AI 与科学生产率的分析也提醒,自动化会增加可运行的假设和实验数量,同时创造数据整理、设备监督和结果检查等新工作;信息过载甚至可能降低生产率。
这些原则意味着,企业不应只采购一个会运行实验的 Agent,还要同步建设实验登记、来源追踪、独立复现、异常处置和结论发布机制。
- 从问题提出到形成可检验假设的时间;
- 候选进入下一证据状态的比例和周期;
- 独立复现率,以及跨数据、设备或环境后的保持率;
- 每个有效结论消耗的算力、实验资源与专家复核时间;
- 人工干预的位置、原因和不可替代的判断类型;
- 被推翻结论已经影响的下游项目数量;
- 无法重建的实验和未关闭异常的规模。
更快的研发系统,必须同样善于暂停和否定
AI 加速研发最有价值的地方,不只是更快找到成功答案,也包括更便宜地排除错误方向。但这要求组织奖励可证伪的实验、完整的负结果和及时停止,而不是只奖励实验吞吐量与正向结论。
OpenAI 的数据来自单一前沿 AI 研究组织,Agent 工作日是按运行时间折算,并不等于相同数量的人类专业劳动;实验增长与 Agent 使用相关,也不构成因果证明。这些数字不能直接外推为普通企业的研发效率或投资回报。
它真正值得企业借鉴的,是瓶颈迁移的信号:当 AI 能够并发承担更多设计、构建和运行工作,人的主要价值会更集中在确定方向、审查证据、理解边界以及决定扩大、暂停或终止。
所以,企业在引入研发 Agent 前,应该先问一个比“能多做多少实验”更重要的问题:我们是否能准确知道每项结论被验证到了哪一步,哪些业务决定已经依赖它,以及在证据不足时由谁按下暂停键?
能回答这个问题,AI 才是在缩短创新周期;回答不了,速度只是在更快累积验证债务。