原文信息:Hassan, T. A., Hollander, S., Kalyani, A., van Lent, L., Schwedeler, M., & Tahoun, A. 2025. "Text as Data in Economic Analysis." Journal of Economic Perspectives, 39(3): 193-220.
01
引言
随着信息技术、自然语言处理和大语言模型的发展,经济学家开始更系统地“阅读”文本。年报、专利说明书、招聘广告——这些过去主要依靠人工翻阅的材料,如今正被大规模转化为可追踪、可分析的数据,用来回答传统数据难以触及的问题。Hassan等人于2025年发表在Journal of Economic Perspectives上的《Text as Data in Economic Analysis》一文,系统梳理了这一研究前沿。文章以企业财报电话会议为例,展示了如何从企业“说了什么”中提取暴露度、风险和情绪等信息。
02
财报电话会议
财报电话会议是上市公司每季度召开的公开会议。CEO或CFO先回顾业绩,然后分析师提问,全程约一小时,会后几小时内就会出文字稿。对企业来说,这是解释业绩、回应市场的主要渠道。对研究者来说,电话会有三个优点:一是及时。会计数字通常滞后数月,会议记录当天就能拿到。二是信息丰富。企业利润为什么变了、销售为什么跌了,原因往往只在管理层和分析师的对话里。三是相对可信。证券法对误导性陈述有惩罚,分析师可以当场追问,市场事后也会验证。这种制度约束让会议内容比一般采访或问卷更靠谱。
03
三个核心指标
文章介绍了三种核心指标:暴露度、风险和情绪。
暴露度(Exposure)衡量企业对某一话题的关注程度。财报电话会时间有限,高管在一个话题上投入的篇幅,往往反映了它的重要性。因此,某话题相关句子占会议总句子数的比重,就可以作为企业对该话题的暴露度。例如,统计讨论俄罗斯及俄乌冲突的句子占比,能够衡量企业受这一事件影响的程度。
风险(Risk)衡量企业感知到的不确定性。作者从《牛津英语词典》中提取risk、risky、uncertain和uncertainty的同义词,构建风险词典。会议中同时提及风险词和特定话题的句子占比,就是该话题的风险指标。下图Panel A展示了2003—2023年美国上市公司的整体风险水平:2008年全球金融危机期间升至2.2%,2020年新冠疫情期间进一步升至2.8%。Panel B则刻画了英国脱欧风险的变化:2016年公投后迅速上升,2019年“无协议脱欧”担忧加剧时再次走高,并在英国正式脱欧后明显回落。

情绪(Sentiment)用来衡量企业对某一话题的态度。具体做法是:先识别积极词汇,如good、strong、great,以及消极词汇,如loss、decline、difficult;再统计同时提及该话题、且带有积极或消极词汇的句子。某一话题的情绪得分为:
(积极句子数-消极句子数)÷总句子数。
下图Panel A比较了四类重大事件的情绪得分。企业对AI的整体态度偏正面,而对英国脱欧、新冠疫情和俄罗斯入侵乌克兰的态度均偏负面。Panel B进一步展示了企业之间的差异。Alphabet、NVIDIA和Microsoft对AI明显更乐观;Warner Music Group、News Corp和Universal Music Group则更为消极,这可能与版权保护和内容替代风险有关。

04
关键词怎么选
前面三个指标能否算准,关键在于能否准确识别出与某一话题相关的句子。作者总结了三种常见方法。
第一,关键词法。这是最直接的识别方式,尤其适合边界清晰、表述集中的事件或政策议题。例如,仅凭“Brexit”一词,通常就能识别大部分英国脱欧相关讨论。具体做法是:先人工标注一批句子,找出在相关句中高频、在无关句中低频的关键词,再用样本外数据检验误报率,并据此不断调整词表。
第二,训练库法。当话题边界较模糊时,单靠关键词往往难以覆盖。这时可以引入参考文本作为训练库。比如,为区分“政治风险”和“非政治风险”,研究者可分别选取政治学教材和会计学教材,再利用TF-IDF方法,识别在前者中常见、在后者中少见的二元词组。由此得到的词表往往包含数千个词条,能够捕捉更间接、更隐蔽的相关表达。
第三,机器学习法。这类方法主要用模型辅助扩展词表:研究者先提供若干种子词,再由机器学习模型或LLM推荐相关表达,之后通过人工抽检决定是否保留。但如果把分类判断完全交给LLM,也会带来新的问题。一是不同模型的判断可能不一致,影响可复现性;二是模型可能出现“后见之明”偏差。比如,在分析福岛核事故发生前的文本时,模型可能自动把“福岛”与核灾难联系起来,从而偏离当时的真实语境。
05
指标能做什么
应用一:将总体风险分解为具体来源。文本分析不仅能衡量企业面临的总体风险,还能进一步回答:这些风险究竟来自哪里?
下图展示了2015—2023年七类风险的相对贡献。2018年第三季度,贸易政策不确定性占全部风险讨论的0.98%,与英国脱欧风险大致相当;2020年第二季度,新冠疫情成为最主要的风险来源,占比达到9.88%;随着疫情冲击逐渐消退,企业关注的重点又转向通胀和供应链问题。这种风险分解方法,将不同风险放在同一尺度上比较,既能判断某一时期哪类风险最重要,也能追踪各类风险如何随时间此消彼长。

应用二:区分“坏消息”和“不确定性”。 同一项冲击可能同时通过两条渠道影响企业投资:一是改变企业对未来收益的判断,二是增加前景的不确定性。以AI为例,模仿歌手声音的技术既可能挤压音乐公司的收入,也可能带来版权诉讼和监管变化。
为区分这两种机制,作者将企业投资率同时对总体风险、AI风险和AI情绪进行回归。结果如下表所示:AI风险越高,企业投资越少;但如果企业对AI持积极态度,投资反而增加。也就是说,文本数据能够把“前景变差”和“前景更不确定”这两种通常混在一起的效应拆开。

应用三:追踪冲击的跨国传导。作者比较了各国企业在危机前后对英国或美国相关风险的讨论,借此判断冲击是否沿既有经济联系传播。
下图显示,脱欧公投后,各国企业对英国风险的讨论普遍增加,而且危机前越关注英国的国家,公投后的增幅越大(斜率为1.51,R²=0.86)。这说明,脱欧冲击主要沿着原有的贸易和经济联系传导。
2008年金融危机则不同。各国企业对美国风险的讨论都大幅上升,但增幅与危机前的对美暴露关系较弱(斜率为0.92,R²=0.55)。这表明,金融危机并非主要沿既有双边联系扩散,而是通过更复杂的金融网络演变为全球性的系统风险。

06
不只财报
除了财报电话会议,专利和招聘信息也是重要的文本数据来源。
在专利文本方面,研究者不再只看专利数量和引用次数,而是直接分析专利写了什么。Kelly 等人(2021)比较一项专利与前后专利的文本相似度:如果它与此前专利差异较大,却被后续专利广泛借鉴,就将其识别为突破性专利。Kalyani(2023)则统计专利引入的新技术术语,发现新词越多的创造性专利,与企业生产率增长和超额股票收益的关系越强。
招聘文本则可以用来追踪技术扩散。Kalyani等人(2025)先从1976—2014年的美国专利中提取新出现的技术短语,再借助Wikipedia将其对应到1286项具体技术,最后在招聘信息中搜索这些词汇。结果发现,一项技术最早出现在哪里,相关岗位往往也会在当地持续增长,而且这种优势主要体现在高技能就业上,并可延续数十年。
07
结语
汉代扬雄说:“故言,心声也;书,心画也。”人们说什么、怎么说,本身就是数据,其中藏着态度、预期、风险与选择。如今,技术已不再是文本分析的主要瓶颈。真正的挑战,是让更多散落、封闭、尚未结构化的文本进入研究视野。当越来越多文本被整理、开放和使用,经济学能够测量的边界,也将随之向外延伸。
推文作者:聂一鸣,南京大学商学院博士研究生,研究领域为数字经济。推文内容可能存在疏漏与不足,欢迎邮箱批评指正与进一步交流!
Abstract
This article discusses how to apply computational linguistics techniques to analyze largely unstructured corporate-generated text for economic analysis. As a core example, we illustrate how textual analysis of earnings conference call transcripts can provide insights into how markets and individual firms respond to economic shocks, such as a nuclear disaster or a geopolitical event: insights that often elude traditional non-text data sources. This approach enables extracting actionable intelligence, supporting both policy-making and strategic corporate decision-making. We also explore applications using other sources of corporate-generated text, including patent documents and job postings. By incorporating computational linguistics techniques into the analysis of economic shocks, new opportunities arise for real-time economic data, offering a more nuanced understanding of market and firm responses in times of economic volatility.
声明:推文仅代表文章原作者观点,以及推文作者的评论观点,并不代表香樟经济学术圈公众号平台的观点
0
推荐


京公网安备 11010502034662号 