
图片来源:gpt-image-2
原文信息:Maryam Farboodi, Andrew J. Koh, and Anchi Xia, “Data-Driven Automation,” NBER Working Paper 35320 (2026),
01
引言
现代人工智能依赖大规模训练数据,但制约实际生产任务的往往不是通用文本和图像,而是异质的任务特定数据。客服系统需要历史对话,医疗辅助系统需要诊疗过程,工业机器人需要操作轨迹,此类数据通常不是专门生产出来的,而是随经济活动内生积累,构成生产过程的副产品。劳动者在完成任务的同时,也在生成未来训练自动化系统所需的数据。Farboodi、Koh和Xia研究这一反馈如何决定自动化,发现技术上能够自动化并不等于企业会在均衡中采用自动化;经济可能长期趋于全面自动化,也可能停留在部分自动化状态;即使全面自动化最终发生,剩余劳动任务仍可能形成明显的幂律长尾,产出持续增长也可能与长期工资停滞同时出现。
02
数据积累与自动化反馈
2.1 基本设定
模型将最终产品表示为一组连续任务的组合,每项任务均可由劳动或资本完成。企业比较两种要素完成同一任务的单位成本,并选择成本较低的生产方式。任务之间互补性较强时,一项任务产出不足会成为最终生产的瓶颈,其他任务增加产出难以弥补这一缺口;替代性较强时,企业可以通过扩大高生产率任务的产出,减少对其他任务的依赖。跨任务替代弹性因而不仅决定某一时点的资本配置,也会改变此后的数据生成方向。
数据的作用集中体现在资本生产率上。本文将这一核心关系概括为Ψ^K_i,t=f_i·A_i(D_t)^η,其中,Ψ^K_i,t表示资本在时点t完成任务i的生产率, f_i表示任务i将有效数据转化为资本生产率的基础效率,D_t表示各项任务在时点t的原始数据存量, A_i(D_t)表示任务i能够利用的有效数据,η表示有效数据提高资本生产率的程度。模型设定0<η<1,因此数据越多,资本生产率越高,但新增一单位有效数据带来的生产率增益逐渐减小。若不存在跨任务溢出,有效数据只包括本任务数据;若存在数据溢出,其他任务的数据也可以通过迁移学习或任务重叠提高本任务的资本生产率。论文同时假设数据不折旧,已经积累的数据可以持续影响未来生产。
2.2 数据反馈
以客服任务为例,在数据稀缺阶段,劳动完成该任务的单位成本可能低于自动化系统;随着业务规模扩大,对话、分类和处置结果不断积累,资本在客服任务上的生产率随之提高。这里的资本包括部署自动化系统所需的机器、算力等。当资本完成任务的单位成本不再高于劳动时,更多客服任务转由自动化系统完成,而新增任务产出又继续生成训练数据,生产、数据生成与自动化由此形成动态反馈。
沿自动化转型路径,数据具有两重作用,既能继续提高已经自动化任务的资本生产率,也能使尚由劳动完成的任务达到自动化的成本条件,从而扩展自动化边界。下图展示了这一过程,劳动生产率在模型中保持不变,资本生产率随有效数据增加而提高。当资本生产率尚低时,劳动的单位成本更低,随着数据积累,资本生产率超过相应的成本临界值,任务才会在均衡中转由资本完成。不同任务的 f_i 不同,因此即使拥有相同数量的数据,也可能在不同时间达到这一临界值。

基准模型固定资本总量,某项任务获得更多资本,意味着其他任务可用的资本减少。资本租金表示当期使用一单位资本需要支付的价格,由全部任务对稀缺资本的需求共同决定。某项任务的数据增加会提高其资本生产率,改变资本在各任务之间的配置,资本配置又改变各项任务的产出和新增数据。完整的反馈链条为:数据影响资本生产率,资本生产率影响资本配置,资本配置决定任务产出,任务产出再形成新的任务特定数据。初始数据优势究竟会逐渐缩小还是被持续放大,取决于任务之间的替代关系和数据边际收益递减程度。
03
自动化的长期边界、速度与工资
文章首先考察不存在跨任务数据溢出、各项任务只能利用自身数据的情形。以σ表示跨任务替代弹性,数值越大,任务之间越容易相互替代。当σ≤1时,任务间互补关系占主导,数据稀缺任务会成为最终生产的瓶颈。继续扩大数据丰富任务的产出难以替代瓶颈任务,因此均衡中的资本配置相对偏向数据稀缺任务,这些任务由此扩大生产并积累更多数据,任务之间的数据差距逐渐收敛。当σ>1时,任务间替代关系占主导,扩大高生产率任务的产出可以替代其他任务,资本配置转而偏向数据丰富任务。领先任务获得更多资本,扩大产出并加快数据积累,初始优势由此得到强化。
长期结果取决于任务替代性与数据边际收益递减之间的比较。前文的η表示有效数据对资本生产率的作用强度,η越大数据边际收益递减得越慢,全面自动化与部分自动化的动态分界分别为σ≤1/η和σ>1/η。
3.1 全面自动化与部分自动化
当σ≤1/η时,数据优势虽然会通过资本配置和后续生产进一步强化自身,但这一反馈的强度仍不足以抵消数据边际收益递减。即使1<σ≤1/η时资本在当期偏向数据丰富任务,领先任务也无法永久拉开相对生产率差距,数据稀缺任务最终仍会积累足够数据,经济长期趋于全面自动化,此时数据沿平衡路径增长。平衡并不表示所有任务的数据完全相等,而是不同任务数据存量和资本生产率的相对差距收敛到有限的正值。
当σ>1/η时,任务替代性足以使数据优势突破边际收益递减的约束。资本与新增数据不断向少数高生产率任务集中,数据丰富任务与数据稀缺任务之间的数据存量之比可以趋于无限,经济可能长期停留在部分自动化状态。领先任务的资本需求还会推高资本租金相对于工资的水平,使部分原本已经自动化的边际任务重新失去成本优势,因此自动化范围甚至可能收缩。这一结论需要不同任务的 f_i 必须存在足以维持正反馈的系统性差异,若所有任务的初始数据和 f_i 完全相同,对称性会使各项任务按相同比例生产,较高的替代弹性本身不足以造成数据分化和部分自动化。
3.2 自动化速度
全面自动化的长期极限并不意味着转型能够迅速完成。在固定资本且σ<1/η的条件下,文章证明劳动任务份额按幂律下降。该结果意味着,自动化早期可以较快扩张,但越接近全面自动化,新增数据带来的生产率增益越小,剩余劳动任务消失得越慢。大部分任务可能在较短时期内完成自动化,最后一小部分任务却会持续很久。形成长尾并不要求资本在技术上无法完成这些任务,只要在既定资本租金、工资和任务生产率下,劳动的单位成本仍然较低,企业就会继续使用劳动。下图同时展示了长期缓慢收敛与早期较快扩张,两种现象并不矛盾。

3.3 工资
工资由生产率效应与替代效应共同决定。数据提高已自动化任务的资本生产率并扩大最终产出,进而提高仍在生产中使用的劳动的边际产出,形成生产率效应。同时,自动化范围扩大使劳动集中到越来越少的任务,相当于提高了每项剩余劳动任务面对的有效劳动供给,从而压低工资,形成替代效应。
当σ≤1/η且经济长期趋于全面自动化时,生产率效应在初期可以推动工资上升,但替代效应会随劳动任务范围持续收缩而增强,两种力量最终恰好抵消,工资收敛到有限水平,资本收入份额趋近于1。
当σ>1/η且经济保持部分自动化时,劳动承担的任务份额不会收敛到零,替代效应不再持续增强,而资本生产率和总产出仍可继续提高,生产率效应因而占据主导,工资在模型中趋于无限。较强的任务互补性会扩大数据稀缺任务的当期生产,短期内有利于劳动需求,却也会加快这些劳动任务的数据积累,使劳动者在生产过程中不断改善资本完成同类任务的能力。
04
数据溢出、配置效率与增长奇点
4.1 数据溢出与自动化路径
基准分析假设每项任务只能利用自身数据,而现实中数据可能跨任务发挥作用。任务 i 的数据先提高任务 j 的资本生产率,任务 j 扩大生产后生成更多数据,再提高任务 k 的资本生产率,自动化由此沿任务网络逐步扩散。
文章用统一强连通性刻画足够广泛的数据传播。该条件要求几乎任意两项任务之间,都能在统一有限的传递步数内,以不低于某个正值的强度形成数据溢出路径。在初始数据存量有限且 0<η<1 的条件下,无论σ取何值,即使各任务的 f_i 存在显著差异,统一强连通性仍足以保证长期全面自动化。原因在于,数据丰富任务的产出不仅强化自身,还会经过任务网络提高数据稀缺任务的有效数据和资本生产率。局部溢出由此承担了原本由任务互补性发挥的均衡作用,防止有效数据的相对差距永久扩大,并使长期数据路径和任务产出构成趋于平衡。这里的平衡仍然表示相对差距保持有限,而不是所有任务完全相同。值得注意的是,普通意义上的局部关联并不足以推出这一结论,若任务网络分裂为互不连通的部分,或跨组溢出强度接近于零,部分任务仍可能长期缺少外部数据。
即使数据溢出最终带来全面自动化,短期路径仍可能高度不均衡。在核心与边缘结构中,核心任务拥有较多初始数据和较强的内部溢出,核心向边缘传递数据的通道却较弱。提高核心内部溢出强度,一方面可以增加未来可能向外传播的数据,另一方面会更快提高核心任务的资本生产率,使稀缺资本向核心集中并推高均衡资本租金。边缘任务不仅获得外部数据较慢,还必须达到更高的资本生产率才能与核心任务竞争资本,因此更强的核心内部溢出反而可能推迟边缘自动化。下图左侧对应较弱的核心内部溢出,边缘较早开始自动化;右侧对应较强的核心内部溢出,核心生产率和资本需求上升更快,边缘自动化明显推迟。由此可见,数据向边缘扩散与资本向核心集中可以同时发生,短期内后一种力量可能更强。

4.2 配置效率
数据积累还会使市场均衡偏离社会规划者选择的路径。企业生产时获得当期收益,同时生成能够提高未来生产率的数据,单个企业不会完整考虑当前生产对本任务和其他任务未来产出的影响。文章在一个不使用劳动、资本总量固定、只包含数据丰富组和数据稀缺组的简化经济中分析这一外部性,两组任务具有相同的 f_i,区别只在于初始数据存量。社会规划者以贴现总产出最大化为目标,因而不仅比较当期产出,还会计算今天改变资本配置所生成的数据对未来产出的贡献。
当σ<1/η时,数据稀缺任务对最终生产构成相对重要的约束。市场虽然已经可能向这类任务配置资本,但没有充分计入加快其数据积累所带来的未来收益,规划者因而会进一步向数据稀缺组倾斜。对 1≤σ<1/η,这一方向在整个规划期内保持不变;对σ<1,规划者最初同样向数据稀缺组配置更多资本,但由于规划者更快缩小了两组的数据差距,原先的数据稀缺组可能较早失去瓶颈地位,后续与市场路径相比的配置方向因而可能反转。
当σ>1/η时,扩大数据丰富任务的产出能够更有效地替代其他任务,规划者会比市场更积极地利用数据自我强化,把更多资本配置给数据丰富组,以提高贴现总产出。只有在临界条件σ=1/η下,市场均衡与规划者路径重合。因此,数据外部性的存在并不一般性地意味着应当补贴数据稀缺任务,政策方向取决于任务替代性和数据边际回报递减程度。
4.3 资本积累与增长奇点
基准模型固定资本存量,文章最后允许家庭储蓄并形成新的资本,使一部分产出转化为机器人、数据中心和算力等投资。资本折旧表示既有设备和算力资本会随时间损耗或淘汰,折旧越快,维持资本存量所需的投资越多。引入资本积累后,反馈机制增加了一个重要环节。更高的产出既生成更多任务数据,也提供更多可用于储蓄和投资的资源。更多数据提高资本生产率,更多资本扩大任务产出,扩大的产出又同时加快数据和资本积累。
数据积累与资本积累单独存在时,都不足以产生论文所说的有限时间增长奇点。资本总量固定时,数据对资本生产率的边际贡献递减,全面自动化表现为幂律长尾。资本可以积累但资本生产率固定时,经济可以持续增长,增长率却保持有限。两者结合后,数据提高每单位资本的生产率,新增资本又扩大数据生成规模,产出增长因而不再只是按既定比例自我复制,而是形成超线性的正反馈。
数据驱动的增长奇点依赖几项关键假设。数据不折旧,数据存量能够持续提高资本生产率,资本可以不断由储蓄转化而来,模型也没有设置能源、芯片、供应链、组织能力和制度方面的上限。因此,这一命题揭示了数据积累与资本积累相互强化时可能产生的增长力量,而不是对现实经济增长速度或实现时间作出直接预测。
05
结论与启示
(1)内生数据反馈:任务生产形成任务特定数据,数据提高资本生产率,生产率差异又改变资本配置和后续的数据生产。自动化因而是由生产与数据积累共同决定的动态过程。
(2)自动化的长期边界:任务互补性较强时,资本相对偏向数据稀缺的瓶颈任务,数据差距趋于收敛,经济最终走向全面自动化。任务替代性足够强时,资本和新增数据持续向数据丰富任务集中,经济可能长期停留在部分自动化状态。
(3)自动化速度:全面自动化并不意味着转型能够迅速完成。固定资本和数据回报递减会使劳动任务份额按幂律下降,形成持续较久的长尾。
(4)工资:工资由生产率效应与替代效应共同决定。全面自动化路径上,替代效应最终抵消生产率效应,工资收敛到有限水平;部分自动化路径上,劳动承担的任务份额不会趋于零,工资可能随资本生产率和总产出提高而趋于无限。
(5)数据溢出:若任务网络充分连通,跨任务数据溢出能够提高数据稀缺任务的资本生产率,长期全面自动化仍可实现。短期内,资本向核心任务集中却可能延缓边缘任务的自动化。
(6)配置效率:数据生产具有正外部性,市场均衡通常偏离社会规划者选择的路径。社会规划者的资本配置方向取决于任务替代性与数据回报递减程度,并不总是偏向数据稀缺任务。
(7)增长奇点:引入资本积累后,数据提高资本生产率,新增资本扩大数据生产,两种积累相互强化,并可能在模型中产生有限时间增长奇点。这一结果依赖数据不折旧、资本能够持续积累以及不存在能源、供应链和制度等方面的上限,并非对现实增长速度和实现时间的直接预测。
理解人工智能的经济影响,不能只考察技术能否完成某项任务,还要分析任务数据如何生成和传播、企业是否有采用自动化的经济激励以及稀缺资本如何在一般均衡中重新配置。
推文作者:宗景辉
Abstract
We build a dynamic model of data-driven automation in which data (i) is heterogeneous and taskspecific; (ii) accumulates endogenously as a byproduct of economic activity; and (iii) exhibits spillovers such that data generated by one task can augment the productivity of another. Along the transition path of automation, data plays a dual role in simultaneously augmenting the productivity of already-automated tasks and expanding the automation frontier. We derive tight conditions for the economy to be partially versus fully automated in the long-run. In the latter case, automation exhibits rich short-run dynamics that depend on the pattern of data spillovers but is always slow in the long-run: the share of tasks produced by labor decays asymptotically as a power law in time. We show that the economy is generically inefficient and analyze how a planner optimally tilts the direction of data accumulation. With endogenous capital accumulation, data-driven automation generates explosive growth but stagnant long-run wages.
声明:推文仅代表文章原作者观点,以及推文作者的评论观点,并不代表香樟经济学术圈公众号平台的观点。
0
推荐


京公网安备 11010502034662号 