生成式 AI 进入职场——来自 5,172 名客服人员的大规模实证
Generative AI at Work
生成式 AI 在实验室中表现惊艳,但在真实工作场所的效果如何?本文利用一家财富 500 强企业 5,172 名客服人员分阶段部署基于 GPT-3 的对话助手的准实验,提供了首批大规模真实工作场所的证据。
核心发现有四。第一,AI 辅助将工人生产率(每小时解决的问题数)平均提高 15%,效果具有高度异质性。第二,AI 最显著地惠及低技能和新手员工——他们的问题解决量增长 30%,工作两个月且有 AI 辅助的员工的绩效相当于无 AI 辅助下工作六个月以上的员工。而最资深和高技能的员工几乎未受益,甚至服务质量小幅下降。这意味着生成式 AI 压缩了生产率分布,与以往技能偏向型技术变革(扩大不平等)的模式形成鲜明对比。第三,机制分析表明 AI 促进了工人的持久学习:在 AI 系统因技术故障中断期间,此前密切遵循 AI 建议的员工仍保持相对基线的生产率提升。AI 还改善了国际员工的英语流利度,并促使低技能员工在沟通模式上向高技能员工趋同。第四,AI 改善了工作体验——客户对客服人员更有礼貌、更少要求与经理对话,员工流失率下降主要由新员工留任驱动。
该研究揭示了生成式 AI 作为「技能均衡器」的可能性,同时也警示了长期隐忧:高技能员工若过度依赖 AI 建议(即使这些建议降低了他们的服务质量),未来 AI 模型的训练数据中将缺少高质量的原创贡献,形成「数据质量退化循环」。
创新点 1:发现生成式 AI 是「技能均衡器」而非「技能偏向型」技术——首次大规模证据
既有文献的缺口:此前信息技术和机器人技术的大量研究表明技术进步倾向于技能偏向型(skill-biased),即高技能工人获益更多、加剧工资不平等(Bresnahan et al., 2002; Acemoglu and Restrepo, 2020)。关于生成式 AI 的早期研究主要在实验室环境中进行(Peng et al., 2023; Noy and Zhang, 2023; Dell'Acqua et al., 2023),缺乏真实工作场所的大规模、长期证据。
本文的创新:利用 5,172 名客服人员在实际工作环境中长达数月的分阶段部署数据,首次提供大规模真实职场证据表明生成式 AI 可以成为「技能均衡器」——低技能和新手员工获得最大收益(生产率提升 ~30%),而高技能和资深员工几乎未受益甚至小幅受损。这一发现逆转了数十年来关于技术变革与不平等的主导叙事。
论文中的具体证据:AI 辅助下低经验员工的问题解决量增加 30%;有 AI 辅助的 2 个月经验员工绩效等同于无 AI 辅助 6 个月以上经验员工。高技能员工的服务质量反而小幅下降。
创新点 2:AI 系统中断期间的「持久学习」效应——AI 不仅是工具,还是教师
既有文献的缺口:此前对 AI 辅助的研究聚焦于 AI 存在时的即时效果,无法区分「AI 作为拐杖」还是「AI 作为教师」。如果工人仅依赖 AI 实时建议而未内化知识,当 AI 不可用时他们将回到原有水平。
本文的创新:利用 AI 系统技术故障(outages)作为自然实验,发现此前密切遵循 AI 建议的工人在 AI 不可用时仍保持相对基线的生产率提升,证明 AI 产生了持久的「人类学习」而非仅仅是临时辅助。
论文中的具体证据:在软件中断期间,高 AI 暴露工人的生产率持续高于干预前基线;遵循 AI 建议越密切的工人,中断期间的生产率提升越大。
创新点 3:「数据退化循环」假说——AI 可能削弱自身未来的训练数据质量
既有文献的缺口:AI 经济学文献几乎全部聚焦于 AI 对当前工人的影响,未考虑 AI 工具可能改变人类行为进而影响未来 AI 模型训练数据的动态反馈。
本文的创新:首次提出并提供了「数据退化循环」的初步证据——高技能员工增加了对 AI 建议的遵从度,即使这些建议降低了他们的服务质量。如果最高质量的原创贡献(来自高技能员工的自发行为)被 AI 建议替代,训练下一代 AI 模型的数据将缺少「人类最佳实践」的信号,长期可能降低 AI 系统性能。
论文中的具体证据:高技能员工增加 AI 遵从度但服务质量下降;低技能员工的沟通模式向高技能趋同(convergence),但方向是「向下对齐」而非「向上提升」。
选题方向 1: AI as a Skill Leveler vs. Skill-Biased — A Meta Framework for Technology and Inequality
核心思路: 建立统一框架解释何时 AI 是「技能均衡器」(如本文)vs.「技能偏向型」(如机器人文献)。关键调节变量可能包括:任务的编码化程度、隐性知识的占比、AI 建议与人类判断的替代弹性。利用多家企业跨行业的 AI 部署数据进行实证检验。
适合投稿的期刊: American Economic Review, Journal of Political Economy
选题方向 2: Long-Run Dynamics of AI-Augmented Work: Learning, Deskilling, and Data Quality
核心思路: 本文的「数据退化循环」假说值得系统研究。长期追踪 AI 辅助下的工人行为变化、AI 模型迭代性能、和组织知识积累。关键问题:工人的「去技能化」是否真实发生?AI 训练数据的质量是否随时间退化?
适合投稿的期刊: Quarterly Journal of Economics, Econometrica
选题方向 3: The Customer-Side Effects of AI Adoption — Market Structure and Consumer Welfare
核心思路: 本文发现 AI 改善了客户对客服人员的态度。一个重要但未研究的问题是:AI 辅助如何影响客户端的服务质量和消费者剩余?如果 AI 使低技能工人的服务「看起来」和高技能工人一样好,消费者的选择和支付意愿会如何变化?
适合投稿的期刊: Review of Economic Studies, American Economic Review
方案 1: 生成式 AI 能否缩小中国服务业的生产率差距?——基于客服行业的准实验研究
核心思路: 复制本文研究设计到中国服务业场景。中国客服行业规模全球最大(超 500 万从业人员),且从业者以低学历、低收入群体为主。与中国头部客服平台(如京东、阿里巴巴的客服体系)合作,检验生成式 AI 助手(如基于文心一言或通义千问)对客服人员生产率和技能差距的影响。
政策价值分析: (1) 中国服务业占 GDP 超 52% 且持续上升,但服务业生产率长期低于制造业。如 AI 能显著提升低收入服务业工人的生产率,将直接有助于「共同富裕」战略。(2) 中国 AI 产业政策(《新一代人工智能发展规划》)当前聚焦于技术突破,缺乏对 AI 如何改变劳动力市场不平等的实证研究。(3) 如果 AI 在中国背景下同样表现为「技能均衡器」,将为通过 AI 缩小收入差距提供政策依据。
适合投稿的中文期刊: 《经济研究》《管理世界》《中国工业经济》
方案 2: AI 辅助下的人类学习与去技能化——中国知识工作者的追踪研究
核心思路: 聚焦本文核心发现——AI 既可促进持久学习(中断期间表现维持),也可能导致去技能化(高技能员工服务质量下降)。选择中国典型的 AI 辅助知识工作场景(如 AI 辅助编程/GitHub Copilot、AI 辅助医疗影像诊断、AI 辅助法律文书撰写),追踪工人 6–12 个月,测量(1)AI 离线时的能力保留,(2)独立解决新问题的能力变化。
政策价值分析: ChatGPT 类工具在中国的普及速度极快(百度「文心一言」上线首月用户破亿),但几乎没有任何关于其对人类技能发展长期影响的系统研究。如果 AI 导致大规模的去技能化,将产生严重的人力资本贬值风险。
适合投稿的中文期刊: 《经济研究》《经济学动态》《中国工业经济》
方案 3: AI 系统中断事件作为识别策略——以中国互联网平台为例
核心思路: 该文利用 AI 系统 outage 作为识别「学习 vs. 依赖」效应的自然实验,这是一项巧妙的方法创新。收集中国主要互联网平台(淘宝、微信、美团等)的 AI 系统宕机事件数据,结合高频用户/工人行为数据,研究 AI 中断期间人类表现的恢复轨迹。
政策价值分析: 该方法可用于评估各类 AI 工具的「人类增强」而非「人类替代」效应,为中国 AI 监管政策(如 AI 辅助决策是否需要「人类在环」)提供经验证据。
适合投稿的中文期刊: 《管理世界》《数量经济技术经济研究》