2026 年 9 月 21 日,IBM 商业价值研究院发布了一项覆盖 1,500 名人力资源负责人和 8,800 名全职员工的全球调查。80% 的受访 CHRO 认为,AI 正在给员工带来验证建议、纠正错误、补充上下文和处理例外等“隐形工作”;42% 的员工表示,AI 增加了自己的工作量,或者新增工作没有得到认可。[1]
这组结果提醒企业:AI 生成一份结果所节省的时间,不等于组织真正释放出的时间。如果员工还要在系统之外核对事实、承担错误责任、向下游解释依据,原本可见的制作工作只是变成了不易统计的判断工作。
因此,企业评估 AI 提效时,不能只问“生成快了多少”,还要追问:节省的工时去了哪里,新增加的判断劳动由谁承担,它是否被纳入流程、产能和绩效设计?
AI 没有消除工作,只是改变了工作的形状
传统效率测算通常比较采用 AI 前后的任务时长。例如,一份报告从两小时缩短到二十分钟,看起来释放了大量产能。但如果员工之后需要核对引用、修正数字、补充业务背景、确认权限,再向审批人解释哪些内容可以相信,真实节省可能远小于表面差额。
更容易被忽略的是,这些工作常常散落在聊天、临时表格和个人经验中。系统记录了 AI 调用次数和输出速度,却没有记录员工为什么改、改了什么、承担了多大后果。久而久之,管理层看到的是工具采用率提高,一线感受到的却是“机器先做一遍,我再负责兜底”。
IBM 调查还显示,43% 的员工认为 AI 出错后责任会落到自己身上;41% 的 CHRO 认为员工可能并不放心去质疑或推翻 AI 输出。[1] 这不是简单的培训不足,而是权责设计不完整:组织要求人对结果负责,却未必给人足够的时间、证据、权限和安全感去作出判断。
把“人工复核”拆成可管理的真实工作
许多 AI 项目的方案里都会写“保留人工复核”,但这四个字不能说明复核成本,也不能证明监督有效。企业至少应把它拆成四类工作:
不同工作的专业门槛和风险并不相同。核对格式可以由规则完成,确认关键经营事实可能需要业务专家,改变客户权益则必须由有授权的人决定。若把它们全部归为笼统的“人工确认”,企业就无法估算真实容量,也容易把高后果判断压给流程末端的普通员工。
更可行的方式,是给关键 AI 流程建立一张“判断工作单”,记录 AI 已完成的部分、仍需验证的主张、可用证据、例外类型、判断责任人、预计复核时间、可否推翻以及最终去向。它不一定要成为新的表单,而应尽可能由业务系统自动生成和留痕。目的不是增加文档,而是让过去不可见的劳动进入排班、成本、质量和责任管理。
- 事实验证:核对数据、来源、计算和时效;
- 情境补充:加入模型无法获知的客户约定、现场变化和组织意图;
- 例外裁决:判断标准流程之外的情况是否可接受,以及由谁批准;
- 后果承担:决定结果是否可以进入报价、生产、招聘、付款或客户承诺等下一环节。
提效指标要从“生成时间”走到“有效释放时间”
企业可以把一次 AI 任务的时间重新分成五段:准备输入、生成结果、验证修正、等待授权、事后返工。真正可用于其他工作的时间,应是采用 AI 前的完整交付时间,减去采用后的五段总成本,而不是只减去生成阶段。
在此基础上,比“使用人数”和“节省小时”更有解释力的指标包括:
这最后一项尤其重要。IBM 调查中,只有 42% 的 CHRO 表示 AI 带来的生产率收益主要被重新投入创新或再培训。[1] 如果企业没有预先决定释放出的时间如何使用,效率收益很可能被更多任务、更多检查和更高响应预期自然吞没,员工不会因此获得更好的工作体验,企业也难以形成可持续能力。
- 首次输出被直接接受的比例;
- 每个有效结果需要的人工判断时间;
- 因缺少证据而退回的比例;
- 例外升级后等待决策的时间;
- 人工推翻 AI 建议的比例及原因;
- 错误进入下游后产生的返工与影响;
- 释放时间最终用于客户服务、创新、培训还是被新的工作量吸收。
培训判断力,不能只靠一门“AI 素养课”
IBM 调查显示,71% 的 CHRO 把监督、验证和推翻 AI 输出视为最重要的员工能力,但只有 29% 的员工把判断力排在重要位置;60% 的员工担心技能退化,其中最常被提及的是批判性思维。[1]
这一差距不能只靠讲解模型原理解决。判断力必须在真实工作中被练习和评价。企业可以保留一部分不使用 AI 的基准任务,让员工维持独立完成能力;对高影响场景定期使用已知缺陷样本进行校准;在复盘中讨论为什么接受或推翻某项建议,而不是只检查最终答案;还应把发现错误、提出反证和及时升级视为工作贡献,而不是把它们看成拖慢自动化。
OECD 2026 年的《AI 时代的技能》也指出,批判性思维、创造力和协作等互补能力会支持高绩效工作,并帮助员工有效与 AI 互动、适应任务变化;AI 素养需要覆盖理解和批判性评估,而不只面向少数技术专家。[2] NIST 的 AI 风险管理实践则建议,组织在制度和流程层面鼓励批判性思维与安全优先,并明确人机配置中的责任和监督。[3]
换句话说,企业需要设计的不是一次培训,而是一种让员工有能力、有依据、也有正向激励去质疑 AI 的工作制度。
从一条“看起来很省时”的流程重新核算
企业可以先选择一条已经使用 AI、管理层认为明显提效,但一线反馈一般的流程,例如销售方案、合同审阅、经营分析或采购询价。连续记录两周完整任务链,而不只记录模型生成时间:员工补了哪些信息,核对了哪些主张,等待了谁的批准,哪些输出被重做,问题最终由谁承担。
随后将发现的问题分开处理:重复验证交给确定性规则或可信数据接口;高频情境补充进入标准输入;少数高风险例外留给授权人员;缺少证据的结果不进入下游。再比较改造前后的完整交付时间、有效结果、人工判断负担和错误后果,才能知道 AI 是否真正释放了组织能力。
IBM 数据来自 2026 年 4 月至 6 月的跨国问卷调查,反映的是受访者认知和组织自报情况,不是随机对照实验。报告中“明确区分人主导、AI 辅助或 AI 执行的工作流”与风险降低、质量改善之间的关系,也不能直接证明因果;不同企业更不能把调查比例当作自己的收益承诺。[1] 但它揭示的管理问题十分具体:当 AI 把制作成本压低,验证、解释、例外和责任不会自动消失。
真正成熟的企业 AI,不是让人无条件接住机器留下的工作,而是让新增判断劳动可见、可计量、可分配,并最终通过流程和产品改进逐步减少。只有这样,“节省时间”才会从一项演示指标,变成组织可以兑现的经营结果。