← 返回 PaperDaily 大模型与智能体

欧洲vs德州,AI选股竟也“水土不服”?米兰理工新框架破解ESG评分分歧

让AI经理同时考三本“ESG评分教材”,再用高斯过程学习投资经理的内心戏,顺带逛了一圈欧洲、德州等不同“水土”下AI选股的口味差异。谁更爱赚钱,谁更爱地球?量化调参党与ESG信徒都能从中看到自己。

欧洲vs德州,AI选股竟也“水土不服”?米兰理工新框架破解ESG评分分歧
原论文信息如下:
论文标题:
Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio Optimization
发表日期:
2026年09月

发表单位:
意大利米兰理工大学(Politecnico di Milano) 与 英国伦敦国王学院(King's College London)

原文链接:
https://arxiv.org/pdf/2609.02677v1.pdf

引言

过去十年量化投资的关键词是“夏普比率”,而最近几年则是“ESG”。
投资者常遇到的问题是:同一公司在不同ESG评分机构中的评价差异巨大。学术研究指出,不同ESG评级机构之间的相关性很低,甚至接近零。ESG评级本身是高度“人格分裂”的。
问题是:当AI算法被要求把“环境、社会、公司治理”写进投资目标时,到底应该听谁的?
米兰理工大学和伦敦国王学院的论文提出了一个解决方案:三家都听。具体做法是将不同评级机构的评分视为相互冲突的多个优化目标,并用多目标强化学习框架来应对。算法层面搞定后,再用高斯过程偏好学习对接人类投资经理。
论文还引入“大模型角色扮演”来模拟不同地区的投资经理。结果显示:欧洲AI经理偏爱ESG,德州AI经理只信夏普比率,亚洲和美国的AI经理各有小心思。AI基金经理也有“水土不服”现象。

ESG投资中的“评分分歧”难题

过去几年,用强化学习做投资组合优化的论文不少,通常将ESG评分作为额外奖励信号。但问题在于,大多数方法只采用一家ESG评级机构的数据。
这就尴尬了。假设算法听着A机构的“环保指挥棒”买入了某只新能源股,结果B机构正好因为这家公司的治理丑闻给它打了低分,那这只股票到底算“负责任资产”还是“风险资产”?
Berg等人在2022年发表于《Review of Finance》的论文中指出:不同ESG评级机构由于方法论差异,给出的评分之间相关性很低,有时甚至接近零。如果只用一家评级机构的分数,其实是在用一个无法代表行业共识的“偏科指标”去引导模型。
本文的思路不同:把三家评级机构的ESG评分视作三个独立的优化目标,加上夏普比率,一共四个目标同时放入强化学习的多目标奖励信号中。这样,不管哪家机构怎么说,策略都能在多个维度之间寻找平衡。

从单目标到多目标:MORL框架设计

先来看看这套框架是怎么设计的。
论文将组合优化建模为一个带约束的马尔可夫决策过程,状态空间包含股票过去60天的收益率、20天和60天的滚动波动率、道琼斯波动率指数、三家ESG机构的逐资产评分和动量等。动作空间则是连续的目标组合权重。
重点在奖励函数。它由两大块构成:一块是经差分夏普比率处理的风险调整收益;另一块则是组合在三个ESG维度上的加权表现(与等权基准作差)。具体来说,本文用了一个线性加权的方式把四个目标合成单一奖励:
Figure 1
图1: 特征提取器架构图。红色模块处理偏好权重配置,蓝色模块则将这些条件信息注入市场特征提炼过程中。
上面的0.3/0.4权重设置只是例子,真正如何取舍?论文引入一个偏好向量,四个分量分别代表对夏普比率和三家机构的重视程度。为了让一个神经网络学会“不管什么偏好都能应对”,论文在训练时从Dirichlet分布中采样不同的偏好向量,甚至故意加入一些极端情况,比如全押夏普、全押某一家机构等。最终得到的策略是一个同时覆盖整个偏好空间的全能型选手。
这里有个比较新颖的细节:传统多目标强化学习的策略通常将偏好向量当作额外输入,但具体怎么把偏好信息“融”进网络,很多论文语焉不详。本文则明显借鉴了FiLM(特征级线性调节)的思路,把偏好向量在特征提取器的两个不同深度嵌入,让底层的市场特征表示跟着偏好动态调整。听起来复杂,其实思路很简单:你想更看重ESG时,网络会侧重学习与ESG相关的市场信号;你想多赚点钱时,网络就突出与夏普相关的特征。
下图展示了训练后的策略在不同权重参数下的表现和调仓行为:
Figure 2
图2: 权重参数对组合表现和资产配置的影响。图中可见该模型在不同权重设置下能激发出显著的调仓及评分变化。

让AI读懂投资经理的“潜台词”

策略训好了,但落地的难题紧随其后:一位真实的投资经理,到底更看重夏普比率还是ESG评分?这个问题连许多投资经理自己都很难说清楚,因为现实中大家很少会用“我给收益50%权重、给环境40%权重、给社会10%权重”这种方式来思考。
本文的解法很聪明:采用“成对比较+高斯过程偏好学习”机制来逆向推断真实偏好。简单来说,系统不断给投资经理展示两个候选组合,每个组合都标明自己的夏普比率和A1/A2/A3三家ESG机构的评分,然后请投资经理挑一个更合心意的。通过多轮问答,高斯过程便能逐步收敛出这位经理“内心戏”里的权重向量。
它代表了一种更人性化的对齐方式。比起甩给对方一张冷冰冰的问卷让填权重,让用户在直观的选项中做“二选一”,认知负担小得多。而高斯过程本身就是一种贝叶斯非参数方法,既能表达复杂非线性的效用函数,又能为不确定性建模,特别适合这类基于小样本人类反馈的推理任务。

让大模型“扮演”各国投资经理

问题来了:到哪里去找那么多不同风格的投资经理来测试这个框架呢?找真人做用户实验当然靠谱,但成本高、周期长,而且很难在论文阶段规模化开展。
本文的做法比较“赶时髦”却也很合理——直接让大语言模型扮演不同地区的投资经理。提示词中明确要求系统扮演来自欧洲、美国、德州和亚洲的投资经理,并遵循当地主流价值观念和监管要求来做投资判断。
大模型要做的只是在两个候选组合中挑一个更好的,并简单解释理由。测试发现,即使只是改变了提示词中的地区描述,大模型的“选股偏好”也会随之变化。有意思的是,不同地区AI经理给出的理由也同样“入戏”——比如“欧洲强调长期系统性稳定和监管压力,因此选ESG高的”;“德州以客户资本增长为重,夏普比率优先,不必为了小众的环境指标牺牲回报”。这一幕堪称“AI版投资经理南北战争”。

数据准备及实验设计

关于数据,论文如实交代了一个限制:真实的多家ESG评级历史数据基本都是商业数据库锁定的,开源拿不到。因此本文在实验中对3家ESG评级机构的数据做了一次受控的合成——具体做法是模拟三家方法论侧重点各不相同的机构:A1偏重公司治理、A2偏重社会责任、A3偏重环保指标。
股票池方面,选取了10只道琼斯工业平均指数(Dow Jones Industrial Average,DJIA)范围里筛出的十只多行业美股:CAT、MMM、MSFT、CRM、AAPL、AMZN、NVDA、CVX、BA和JNJ。这些标的覆盖工业、科技、能源、医药等不同板块,能让三家ESG机构给出足够有区分度的画像,同时又不至于把状态和动作空间的维度撑得太高,便于训练和归因。股票的日频行情数据来自Yahoo Finance。 为了防止信息在不同阶段之间“穿越”,论文对数据做了严格的时间切分:2009年到2014年年中用来训练强化学习策略;2014年年中到2015年用于偏好询问阶段;2015年年中到2016年年中则作为最终样本外测试。训练、交互、验证三个环节彼此不重叠,样本外表现的说服力就来自于这样的隔离。 三家合成评级机构则是对现实中“评级分歧”的一种受控模拟——A1给公司治理(Governance)更高的权重,A2把权重压在社会(Social)维度上,A3则明显偏向环境(Environmental)与碳相关指标。由于真实的多源ESG历史数据基本被商业数据库锁定,这么做虽然牺牲了一部分真实性,却能干净地分离出“方法论差异”这一个变量。强化学习算法采用PPO,关键超参数见表1。 表1 超参数设置
表1:训练与环境的超参数设置。可以看出模型的单条轨迹长度为252天,即一个标准交易年;每天允许调仓一次,这更接近真实机构“盯盘再平衡”的节奏。

实验结果:欧洲与德州的鲜明对比

要验证这套“偏好学习机制”靠不靠谱,第一步先得看它能不能还原一些“设定好答案的傻瓜策略”。论文设计了四类基准oracle:只追求夏普比率最大化的Sharpe-max、分别让三家机构评分最大化的A1-max、A2-max、A3-max,外加一个完全随机选择作对照。每个基准都通过大量成对比较向偏好学习模块“透露”自己的口味,然后看系统最终推断出的权重向量长什么样。 图3 基准偏好学习结果
图3:基于不同基准策略的偏好引出结果。图中*_max表示始终选择对应指标最高组合的策略;箱线图横跨5次偏好引出过程和5个训练策略,圆点代表均值。
从图3能读出几个重要信息。第一,Sharpe-max基准确实拿到了较高的夏普权重,但注意它还额外给了Agency 2不小的权重。这不是bug,而是因为样本里某些股票(比如苹果)在传统财务指标和Agency 2评分上同时都很突出,导致两个目标天然正相关。第二,A2-max和A3-max的权重向量高度趋同,说明两个评级维度在给定股票池上的信息重叠度较高,很难被完全分开。第三,随机策略的权重分布则毫无意外地又散又均匀。 这个现象在论文里被称作可辨识性(identifiability)问题:当多个目标在数据层面高度相关时,不同的权重向量可能诱导出几乎相同的持仓和结果。因此在后续评估中,论文没有死磕“权重还原得准不准”,而是重点看“最终选出的组合是否能产生用户偏好的结果”。这个角度其实更贴近真实投资决策——投资人要的本来就不是一组好看的权重数字,而是符合自己心意的组合。 再来看重头戏:换成不同地区的AI投资经理后,偏好学习还能不能“读懂”它们? 论文让两类大模型分别扮演欧洲、美国、得克萨斯州和亚洲的投资经理,并在提示词里塞入“当地经济现实、文化价值观、监管要求”这些背景约束。候选组合会同时展示夏普比率和三家ESG机构打分,模型需要先给两句理由,再输出[CHOICE: A]或[CHOICE: B]表达偏好;如果实在觉得两者差不多,还可以输出[CHOICE: T]表示“打平”。这个设计既保留了二选一的简洁性,又给了模型一个不强行选择的出口。 考虑到不同大模型对角色扮演的响应模式不同,论文同时测了Gemma4:26B的16K上下文版本、Gemma4:26B的131K长上下文版本,以及Qwen3.6:35B。三个模型变体上都能看到清晰且一致的规律——把“出生地”一换,AI基金经理的投资品味立刻变脸。 图4 不同大模型角色下的偏好向量
图4:不同PM-LLM下反推出的偏好向量Λ。从上到下依次是Gemma4:26B(16K上下文)、Gemma4:26B(131K上下文)和Qwen3.6:35B(252K上下文)。
最典型的就是欧洲人设和得州人设之间的“对峙”。欧洲PM-LLM在四个目标中明显把一部分夏普权重让渡给三家ESG机构,愿意为了“可持续”承担一定的收益折损;而得州PM-LLM则把主要权重压回夏普比率和Agency 2上,表现得更像一个纯粹的收益追逐者。更逗的是,模型给出的理由也相当“入戏”:欧洲版本会强调系统性稳定、监管压力与长期责任;得州版本则直白地表示客户要的是资本增值,没必要为了小众环境指标牺牲回报。看到这里,相信不少读者已经笑出声:两家AI经理根本没有共享同一套“投资世界观”。v2-74ba8bc1c6c52a48ea1c3c5c67685ca3_hd 为了把这种权衡量化,论文还算了所谓的“碳税”——也就是为了把组合在三家ESG机构上的得分拉高,投资人需要额外牺牲多少夏普比率。表格数据取自2015年到2016年年中的样本外区间,可以看作对不同“地区偏好”的一次价格扫描。 表2 碳税结果
表2:碳税量化结果。表格展示不同地区PM-LLM得到的组合,在样本外区间相比等权基准在夏普比率上的损失,以及三家ESG机构评分的提升幅度。
从结果看,欧洲PM-LLM为了提升三家机构评分愿意付出最多的夏普代价,组合的ESG加分也最猛,但收益端的波动和下行也更大;得州PM-LLM把夏普比率放在首位,结果换来的是三家机构评分提升幅度最小的组合——A1只涨了7.66%,A2涨了23.20%,A3涨了30.62%,夏普损失约-0.106,但方差确实低,只有±0.078,收益表现更“稳”。 最耐人寻味的是亚洲人设。它在偏好向量里给夏普的权重并不高,但在样本外却交出了最小的夏普跌幅(-0.045),同时三家机构评分依然提升了13.12%、28.75%和46.60%。论文没有把这种表现吹成亚洲AI经理“更聪明”,而是冷静地指出:这个权重配置刚好落到了可行域里一个比较有利的位置,属于特定环境下的产物,不应该被推广成亚洲投资风格的普遍结论。这种克制在AI金融论文里还挺难得的。 论文还额外测试了提示词细节对结果的影响,结果如图5所示。无论是改变上下文窗口长度,还是去掉地理信息提示,偏好向量的分布都会发生明显迁移。换句话说,大模型角色扮演出来的“投资经理”并不是一个稳定的人格,而是高度依赖提示语境的。这一点既是论文的优势——说明偏好引出机制确实能捕捉到细微的偏好差异;也是潜在隐患——如果角色设定本身不稳定,那AI经理的“真实偏好”到底有多少来自地域文化,又有多少来自提示词噪声,还需要进一步拆解。 图5 不同提示变体下的偏好向量
图5:不同大模型与不同提示变体下反推出的偏好向量Λ。所有实验均使用Qwen3.6:35B,用于检验提示内容对偏好推断稳定性的影响。
综合来看,整条技术链路是自洽的:多目标强化学习负责把“夏普+三家ESG机构”的权衡空间铺开;偏好学习负责找到空间里属于某个投资经理的位置;LLM人设则把“不同地区的人到底想要什么”这一抽象问题,变成了可重复、可对照的合成实验。虽然每一步都不是从零造轮子,但把它们咬合成一套面向可持续投资的完整对齐方案,本身就是一个有价值的增量。

局限与未来展望

当然,这套框架离“直接上实盘”还有相当距离,论文自己也交代得比较坦诚。 第一道坎是数据。三家ESG机构的评分来自合成数据生成过程,只模拟了“同一家公司不同机构打分不同”的一种来源——即E、S、G三大支柱的权重分歧。现实中不同评级机构的方法论差异要复杂得多:有的机构看重争议事件,有的机构强调披露质量,有的机构把行业调整做到让人看不懂的程度。用一份受控的合成数据验证了机制的可行性,但真实场景中评级噪声会更大、分歧更不规则,框架是否仍然稳定是个开放问题。 第二道坎是指标可辨识性。前面已经提到,当两个评级维度在实际股票池上高度相关时,多个不同的偏好向量会映射到几乎相同的持仓结果,导致权重恢复并不唯一。论文通过改用“最终组合效果”评估绕开了这个问题,但从投资管理角度讲,如果不知道投资者确切的偏好权重,后续做风险归因和合规解释时会比较棘手。 第三道坎是验证手段。用LLM persona代替真人做偏好实验非常有创意,也确实能低成本覆盖不同人群。但大模型角色扮演本质上是在“复述”训练语料里地域文化的刻板印象,而不是真实基金经理经过利益权衡后表达出的偏好。真实世界里,一个欧洲养老金投资委员会主席面对客户流失压力和监管处罚风险时,选择很可能和LLM生成的不一样。因此,这套框架下一步最需要的不是更多仿真,而是真正的真人用户研究。 不过换个角度看,这个工作真正的想象空间并不局限于ESG投资。它展示了一条通用的“机器决策与人类价值观对齐”路径:RL策略在多维目标空间里寻找帕累托前沿;偏好学习模块用最轻量的人机交互确定用户落在前沿的哪个位置;LLM则作为低成本、可复制的“用户替身”来大规模压测整套系统。把这套三角关系迁移到消费级投顾、养老定投甚至更广义的个性化推荐中,都是成立的。 未来的研究方向也很清楚:引入更多真实评级源、扩大股票池和测试区间、把交易成本与持仓约束纳入奖励、让偏好随时间缓慢演化,以及用真人投资经理做一轮小规模但高质量的验证。ESG投资要真正落地,缺的从来不是“道德口号”,而是这种能把分歧、权衡和人的偏好都量化清楚的基础设施。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?面对不同ESG评级机构打分严重“打架”的难题,米兰理工等机构提出一套多目标强化学习框架,同时优化夏普比率与三家ESG评分,再借助高斯过程偏好学习,让AI“听懂”投资经理的真实偏好。试验显示欧洲、德州等地的AI投资人格外“有个性”。
这篇工作最值得看的点是什么?论文方法成功展示了不同区域背景的PM-LLM persona会产生显著不同的偏好权重向量,欧洲persona更注重ESG一致性,而德州persona更注重风险调整后收益。
这篇工作的边界或风险在哪里?优点:(1)创新性地将ESG评级分歧问题建模为MORL问题;(2)通过偏好elicitation框架降低了人工设定权重的不直观性;(3)利用LLM persona进行系统评估具有新颖性。缺点:(1)使用合成ESG数据而非真实数据;(2)线性标量化方法在非凸Pareto前沿上可能失效;(3)未考虑交易摩擦。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

把“多源ESG评分分歧”引入多目标强化学习,并串联高斯过程偏好学习与LLM角色扮演,构成了一个新颖且自洽的验证闭环;但每个模块本身都是已有技术,属于系统级创新而非原理级突破。

实验合理度:★★★☆☆

时间切分防止了数据泄漏,基准oracle、多项消融和多家LLM对照也考虑得比较周到;但核心实验依赖合成ESG评分,缺少真实评级数据和真人投资经理的端到端验证,说服力止步于“受控环境”。

学术研究价值:★★★★☆

这篇论文最值得借鉴的是“评级分歧”视角——它提醒后续研究者,ESG投资不能只看单一机构评分。偏好学习与LLM人设结合的做法也有很强的方法论延伸空间。

稳定性:★★☆☆☆

在合成环境中表现稳定,但多个评级维度相关性较高时,权重向量的可辨识性明显变差;LLM角色本身的偏好也会随提示词变化,实盘环境中的可靠性尚无证据。

适应性以及泛化能力:★★★☆☆

框架设计并不绑定特定资产或评级机构,迁移到其他多目标投资场景是可行的;但当前只在10只美股和合成数据上验证,扩大到全市场或真实多源ESG数据时仍需重新检验。

硬件需求及成本:★★★★☆

训练阶段只用10只股票、PPO参数也偏轻量,单张消费级GPU基本能跑;偏好学习阶段更轻,BoTorch在CPU上就能完成。整体对算力非常友好。

复现难度:★★★☆☆

PPO、BoTorch等组件都有成熟开源库,合成评分机制也写得足够细致;但论文未在正文中给出代码仓库链接,合成数据生成的完整流程和数据预处理细节仍需自行摸索。

产品化成熟度:★☆☆☆☆

框架仍处于研究验证阶段。要产品化,至少还需要解决真实多源ESG数据采购、更大股票池的工程适配、监管对AI投顾的解释性要求以及真人用户测试这四道门槛。

可能的问题:合成ESG评分与真实评级差异较大,结论外推需谨慎。LLM persona对提示词高度敏感,并不能真实代表各地投资经理。此外仅10只股票、约7年历史的样本偏小,跨周期稳健性有待检验。可辨识性问题虽被绕过,却也限制了框架在风控归因中的落地价值。


主要参考文献

[1] Dispoto G, Restelli M, Ventre C. Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio Optimization. arXiv:2609.02677, 2026.
[2] Berg F, Kölbel J F, Rigobon R. Aggregate Confusion: The Divergence of ESG Ratings. Review of Finance, 2022.
[3] Moody J, Saffell M. Learning to Trade via Direct Reinforcement. IEEE Transactions on Neural Networks, 2001.
[4] Schulman J, Wolski F, Dhariwal P, et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
[5] Balandat M, Karrer B, Jiang D R, et al. BoTorch: A Framework for Efficient Monte-Carlo Bayesian Optimization. NeurIPS, 2020.

end
想在AI+金融领域找到同频伙伴?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 量化投资+上海+某基金+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。AI金融群内正在热议多目标强化学习与ESG投资的前沿落地,就差你啦!
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。