ChatGPT 已经接近发布四年。模型会写代码、做分析、读文档、生成图片,我自己也越来越多地把 AI 放进日常工作。可当视线从个人电脑移到工厂、医院、供应链和整张国民经济报表时,那种“生产力革命已经发生”的震感并不明显。我的判断不是 AI 没用,而是我们经常把模型能力、个人效率、企业产出和社会生产率误当成同一个指标。
一、先纠正问题:不是“纹丝不动”,而是尚未出现断层式跃升
ChatGPT 于 2022 年 11 月 30 日发布。截至 2026 年 7 月,它还不到整整四年。用这么短的时间要求一项通用技术在全球统计中制造清晰断层,本身就把技术发布和经济扩散压缩成了同一天发生。
“生产率完全没动”也不准确。美国劳工统计局的可比数据表明,非农商业部门劳动生产率在 2024 年增长 3.0%,2025 年增长 2.2%;2025 年全要素生产率增长 0.8%。但 2026 年第一季度劳动生产率折年增速只有 0.3%。这些数字既不能证明 AI 已经带来革命,也不能支持“毫无变化”。更准确的说法是:波动存在,AI 的独立宏观贡献还没有形成一个足够大、足够稳定、能从其他因素中清楚分离的拐点。
我更愿意同时看两个长期区间事实:2019 年第四季度到 2026 年第一季度,美国非农商业劳动生产率年均增长约 2.1%,与 1947 年以来长期平均相当;同一时期制造业劳动生产率年均增速只有约 0.5%。数字经济里亮眼的工具进步,并没有自动穿透到每个物理行业。
二、我们把四种不同的“效率”混在了一起
| 层级 | 它在回答什么 | 为什么不会自动向下传导 |
|---|---|---|
| 模型能力 | 模型能否完成某个基准或一次任务? | 基准没有遗留系统、责任边界和真实失败成本 |
| 个人任务效率 | 我写一封邮件、一个函数、一份摘要快了多少? | 省下来的时间可能被检查、返工或更多任务重新占用 |
| 企业流程产出 | 整个团队是否用更少投入交付更多合格结果? | 需要数据、权限、系统集成、培训、审计和流程重构 |
| 宏观生产率 | 整个经济每单位劳动与资本产生了多少增加值? | 取决于采用覆盖率、产业权重、竞争扩散和新增需求 |
当我用 AI 在十分钟内写出原来需要半小时的初稿,真实的个人收益已经发生。但如果下一位同事仍要把内容复制进旧系统,法务再逐字检查,客户也没有因此多买一件产品,那么宏观产出不会按“节省二十分钟”同比例增加。
三、微观证据并不悲观,但它们有明确边界
目前最有说服力的研究,不是问员工“你感觉快了多少”,而是在真实或受控任务里比较结果。对 5,179 名客服人员的研究发现,生成式 AI 助手让每小时解决的问题数平均提高约 14%,新手和低技能员工的提升更大。这说明 AI 很擅长把优秀员工的隐性做法快速传递给新人。
编程领域也出现强信号。GitHub 对 95 名专业开发者的受控实验中,使用 Copilot 的一组完成指定 JavaScript HTTP 服务器任务平均快 55%。但我不会把这个数字直接写成“软件团队生产率提高 55%”:一项边界清晰的编码任务,没有覆盖需求澄清、架构决策、联调、代码审查、上线、运维和事故责任。
这些研究真正告诉我的,是AI 对结构化、数字化、可快速验证的局部任务已经有价值;它们没有证明整条业务链已经同步提速。任务占总流程的比例、质量门槛和后续瓶颈,决定了局部收益最后能剩下多少。
四、真正稀缺的不是模型,而是互补资产
把一个聊天窗口发给员工很便宜,把企业改造成能够稳定使用 AI 的组织却很贵。我看到的真实成本包括:清理数据、统一知识口径、开放受控接口、重新分配权限、定义人工复核、建立评测集、训练员工、处理隐私与责任,还要重写 KPI,避免大家只追求“生成得更多”。
这正是“生产率 J 曲线”的含义。Brynjolfsson、Rock 与 Syverson 的研究指出,通用技术早期往往要求企业先投入流程、软件、数据、商业模式和人力资本等难以被完整计量的无形资产。在建设期,成本先进入报表,能力却还没有变成稳定产出;等互补资产成熟,收益才集中释放。
电力不是把蒸汽机换成电动机就结束了。工厂真正的跃升来自重新布置生产线、让每台设备使用独立电机,并围绕新的动力结构改变组织方式。AI 也一样:如果流程仍以“人把信息从系统 A 搬到系统 B”为核心,模型只是更快地生成下一段待搬运文本。
五、采用率比热度低,深度采用又比登录率低
大众对 AI 的关注很高,但“用过”与“进入生产”差得很远。美国人口普查局在 2025 年 12 月至 2026 年 5 月的企业调查中,把问题扩展到“任何业务职能”后,报告使用 AI 的企业比例仍大致在 17% 到 20% 之间;至少 250 名员工的企业约 37%,四人及以下小企业低于 20%。
这组数据和一些面向大型企业管理者、声称组织采用率超过八成的调查并不矛盾:样本、问题口径和“采用”的定义不同。一个跨国公司只要市场部门定期使用生成式 AI,就可以回答“已采用”;但这不代表采购、生产、客服、研发、财务和供应链都已围绕 AI 重构。
我会把采用分成四级:偶尔提问、固定任务辅助、嵌入团队流程、重构核心经营。真正有机会改变宏观生产率的是后两级,而它们也是最慢、最需要治理和系统工程的部分。
六、可靠性的尾部风险,会吞掉平均速度
在低风险任务里,十次有九次正确已经很好用;在付款、诊断、合同、生产控制和安全系统里,剩下的一次可能比前九次节省的时间更昂贵。企业因此要增加检索、权限、规则、人工复核、日志、回滚和事故响应。模型平均更快,不代表系统端到端更快。
这也是为什么 Agent 看起来比聊天机器人更接近生产力,同时落地更难。它一旦能够调用真实工具,就不只是“答案可能不准”,而是可能发错消息、覆盖数据、重复付款或把错误写进下游系统。自主性越高,评测、隔离和恢复能力越重要。
七、节省时间不必然增加 GDP
生产率统计关心的是产出与投入。如果 AI 帮我更快写完同样数量的内部材料,企业没有少用工、没有多服务客户、没有提高质量,也没有创造新产品,这部分福利很真实,却未必立刻进入被计价的产出。
还有一种情况是收益被重新竞争掉:所有公司都更快生成广告、报告和代码,市场上内容更多,但用户注意力、订单和预算没有同步增加。单个企业必须使用 AI 才不落后,整个行业的增加值却可能变化不大。AI 先改变竞争门槛,再改变总产出,这两个阶段不能混为一谈。
八、我判断生产率拐点时看什么
我不再用模型发布会、参数规模或一段惊艳演示判断“革命是否到来”,而更看以下六个信号:
- 核心流程渗透:AI 是否进入订单、研发、生产、交付和售后,而不只是写作与搜索。
- 端到端指标:交付周期、一次通过率、单位成本、客户留存是否持续改善。
- 可靠性成本:每一次自动执行需要多少人工复核,错误能否被发现和恢复。
- 中小企业扩散:能力是否从头部科技公司扩散到缺少数据团队的普通企业。
- 新增需求:AI 是否创造过去无法提供、如今有人付费的新产品和服务。
- 组织再设计:企业是否取消旧环节、改变分工,而不是在旧流程上再叠一个聊天窗口。
九、结论:革命可能是真的,但它不会自动发生
我既不接受“AI 已经让所有人效率十倍”的夸张,也不认同“宏观报表没跳升,所以 AI 是泡沫”的反推。前者跳过了转化链,后者忽略了扩散时滞和互补投资。
ChatGPT 接近四年,足够证明模型能力进步很快,却远不足以让全球企业完成数据治理、系统集成、责任重构和人力再培训。今天最真实的状态是:微观收益已经出现,企业收益分布不均,宏观信号仍然混杂。
生产率不会因为模型“会了”就自动起飞。它要等企业把会用 AI 的个人,连接成会用 AI 的流程;再把会用 AI 的流程,重组为能创造更多价值的组织。真正的拐点,不是人人都打开了 AI,而是大量组织终于愿意删掉旧流程,并为新的工作方式重新设计自己。