← 返回 PaperDaily 大模型与智能体

无卖空约束也能做RL?这篇论文把均值-方差投资学拧回来了

无卖空约束一加上“未知市场参数”,很多传统最优解就开始失灵。本文的聪明之处在于:不去硬碰硬做受限随机化,而是把约束放到均值上,用高斯噪声做训练,最后还能把原问题的最优策略捞回来。

原论文信息如下:
论文标题:
Dynamic mean–variance portfolio selection with no-shorting constraints and unknown investment opportunity sets
发表日期:
2026年07月
发表单位:
Xun Li, Yutian Wang, Xun Yu Zhou
原文链接:
https://arxiv.org/pdf/2607.16625v1.pdf

百年难题:动态均值-方差与无卖空约束,我们能怎么办?

均值-方差投资听起来像金融课本里的“老题目”,但一旦加上两个现实条件,事情就不再优雅:第一,不能卖空;第二,市场参数未知。前者让策略必须始终落在非负仓位里,后者让很多经典解析解直接失去落脚点。说白了,理论上能写出来的最优策略,现实里往往连参数都摸不准,更别说照着抄作业了。
这篇论文的切口很巧:它没有继续和“受限随机化”硬碰硬,而是把问题重新包装成一个可以训练的辅助探索问题。核心思路不是“每次采样都必须合法”,而是“策略的均值合法即可”。这一下就把原本很难处理的截断分布,换成了更好优化的高斯探索。训练时允许噪声稍微越界,最后真正执行的却是均值策略;训练和落地被拆开了,工程上也更顺手。
封面
图1:算法主循环的迭代轨迹。图中展示了参数、终端期望收益和终端方差如何逐步逼近理论值。从初始的随机猜测开始,经过大约500轮迭代后,所有关键指标都收敛到了理论最优解附近。
这类问题之所以重要,是因为它对应的不是“纸面最优”,而是“真实投资组合到底怎么配”。均值-方差模型在连续时间里本来就很敏感,参数估计稍微偏一点,策略就可能从“看起来聪明”变成“实际翻车”。所以,能不能在不估计投资机会集的前提下,直接从轨迹数据学出策略,才是这篇工作的现实价值所在。

破解困境:从“强制可行”到“均值可行”的高斯探索

先把概念说人话。无卖空约束就是组合里每个风险资产的仓位不能为负,不能借股票来卖;投资机会集则是资产收益、无风险利率、波动率这些“市场底层参数”的集合。原问题难就难在:这些参数未知,而策略又必须满足非负约束,RL 一不小心就会把探索空间卡死。
过去常见的做法,是让探索分布本身也待在合法区域里,比如截断高斯。问题是,截断以后,很多漂亮的解析结构就没了,HJB 方程和策略梯度都变得更难看,像是把数学工具箱里最顺手的扳手先扔了,再去修机器。本文不走这条路,而是把探索噪声放在整个空间里,要求的是高斯分布的均值非负。换句话说,随机样本可以偶尔“跑偏”,但平均动作必须守规矩。

术语解读:这篇论文里最关键的两个词

RL 是 reinforcement learning,中文叫强化学习,意思是让智能体通过和环境交互,一边试错一边学策略。
HJB 是 Hamilton–Jacobi–Bellman equation,中文通常叫哈密顿-雅可比-贝尔曼方程。它是连续时间最优控制里最核心的方程之一,很多最优策略都要靠它来“验明正身”。
本文的关键动作就是:把原问题改写成一个辅助探索问题,让策略分布始终取高斯分布,但把约束压在均值上。这样做的好处很直接:采样、求梯度、做优化都更容易;坏处也很明确:训练时会出现“样本违规但均值合法”的情况,因此必须证明这种训练方式不会把最终解带偏。论文后面做的,正是这件事。

方法整体架构图:先训练辅助问题,再回收原问题最优解

图2:极端目标收益 z=2.0 时,算法主循环的迭代轨迹
图2:极端目标收益 z=2.0 时,算法主循环的迭代轨迹。这个场景比普通目标更“狠”,更能看出算法是否稳得住。可以看到,即使目标收益远高于市场平均水平,算法仍然能够收敛,尽管参数波动比普通目标下更大。
从结构上看,原问题有三层:状态方程描述财富怎么演化,均值-方差目标描述收益与风险的权衡,无卖空约束决定控制必须非负。论文先引入拉格朗日乘子,把“终端期望收益等于 z”的约束变成一个参数 w 的最优控制问题,再把控制变量换成随机策略 π。训练时优化的是 π 的分布参数,而不是直接优化单个控制值。
最妙的一步是方差的设计。论文把探索方差设成与状态偏离程度相关的形式:当财富 x 接近分界点 w 时,方差自动缩小,策略会逐步“收手”;当 x 离 w 较远时,方差放大,探索更积极。这样一来,策略分布不仅有可训练性,还天然带有一种“别乱冲”的稳定器。这个设计特别像现实里的风控逻辑:离目标越近,动作越保守;离目标越远,才允许更大幅度试探。
这里还有一个很重要的边界概念:x = w。在最优探索策略下,这条线会变成状态空间的“分界墙”,财富一旦到了这里,风险资产配置会退化到 0,财富基本不再动。这个性质很关键,因为它让策略在不同区域里可以分段分析,也解释了为什么辅助问题的解能被写成一个分段二次型。

理论支柱:为何“无熵”的辅助游戏能解“有熵”的原问题?

论文最硬的部分,不是算法,而是理论。因为只要“辅助问题”和“原问题”之间没有严格对应关系,训练再花哨也只是自嗨。本文证明的关键结论是:在合适选择探索方差的情况下,辅助问题最优高斯策略的均值,恰好就是原无卖空均值-方差问题的最优策略。这不是近似,不是经验上差不多,而是理论上直接对上号。
为什么能做到这一点?因为辅助问题虽然允许随机采样越界,但它对“均值”的约束仍然严格保留了无卖空结构;同时,探索方差被设计成与状态偏差平方成正比,使得 HJB 方程在不同区域里可以被拆成两段来解。更直白地说,噪声只是训练时的“烟雾弹”,真正被执行的是均值策略,而均值策略又被证明和原问题的最优解一致。训练可以乱一点,结论不能乱,这条线论文守住了。
表1:不同目标收益下的最终估计结果
表1:不同目标收益下的最终估计结果,包括极端目标收益 z=2.0。表中同时给出了学习到的参数、理论值、终端期望收益和终端方差。可以看到,在 z=1.10、1.15、1.20 等常规目标下,学习值与理论值的误差均在 1% 以内;即使在 z=2.0 的极端情况下,终端期望收益的误差也仅为 3.2%。
理论推导里还有一个挺漂亮的技术点:论文用到了KKT 条件来处理非负约束下的二次优化,得到一个缩放性质。这个性质让辅助 HJB 方程在两个区域里都能被统一处理,最后拼成一个分段二次的值函数。换句话说,原本看起来“约束很多”的问题,被拆成了“区域内好解、边界上可拼”的结构化问题。数学上不算轻松,但逻辑上是顺的。
这也是为什么论文强调“无熵”辅助问题。传统熵正则化会把探索写成分布熵最大化,适合无约束动作空间;可一旦动作必须非负,分布支持集就会被截断,理论和实现都更麻烦。本文干脆绕开熵项,改用“加高斯噪声”的方式做探索,既保留了高斯分布最方便的可导性,也保住了约束问题的可分析结构。这个选择非常工程化:不追求形式上最花哨,只追求能把问题真正打穿。

算法落地:无模型强化学习如何习得最优无卖空策略?

理论成立之后,接下来就是“怎么学”。本文给出的算法是典型的无模型强化学习:不估计收益率、不估计波动率、不去重建投资机会集,直接拿轨迹数据做策略评估和策略更新。这个思路对金融场景特别友好,因为真实市场里,参数估计往往比求解本身更容易出错。
算法实现上,策略被参数化为一个分段线性函数,和理论解的分段结构对齐。这样做不是为了“偷懒”,而是为了减少不必要的表示误差:既然最优策略本来就是分区域变化的,那就没必要拿一个过于复杂的黑盒网络去硬学。值函数则通过马尔可夫过程上的鞅损失来做评估,再用策略梯度更新均值参数,最后通过投影算子把均值投回非负正半空间,保证无卖空约束始终不被破坏。

伪代码:训练时学分布,执行时拿均值

    输入:初始参数 ϕ、θ、w;学习率 αϕ、αθ、αw;批量大小 M
    1. 先用若干轮轨迹数据预热,更新值函数参数 θ
    2. 重复以下步骤:
       a) 用当前高斯策略 πϕ 采样 M 条轨迹
       b) 计算鞅损失,更新 θ
       c) 用已学到的值函数估计策略梯度,更新 ϕ
       d) 将 ϕ 投影到非负区域,保证均值策略可行
       e) 估计终端财富均值,按随机逼近更新 w
    3. 输出最终策略 πϕ 和乘子 w
    这里最值得注意的是:算法不是直接在原问题上“盲学”,而是先在辅助问题上把探索做顺,再把学到的均值映射回原问题。这个路径很像先修一条高速辅路,再从辅路回主路。虽然绕了一下,但避开了最难啃的截断探索和未知参数识别,整体反而更稳。
    从实现成本看,这套方法的训练开销主要来自轨迹采样和梯度估计,适合离线仿真或可重复交互的金融环境。它不是那种“拿来就能秒上生产”的东西,但和传统需要先估参、再优化、再回测的流程比,已经少了一层参数建模的不确定性。对研究型团队来说,这个简化非常值钱。

    数值验证:算法在多个目标下逼近理论最优

    实验部分虽然不算大,但验证点很清楚:一是看普通目标收益下是否能收敛到理论值,二是看极端目标收益下是否还能保持稳定,三是看初始化和学习率变化时是否会崩。这个设计很朴素,但对 RL 论文来说已经足够说明问题——算法到底是“真会学”,还是只在某个神奇参数上碰巧跑通,一测便知。
    在 z=1.10、1.15、1.20 这些常规目标下,参数迭代、终端期望收益和终端方差都能贴近理论值,说明辅助问题的训练确实没有把原问题带歪。更关键的是,终端收益和风险都学对了,这比单看某个策略参数是否接近真值更有意义,因为均值-方差模型真正关心的是结果,而不是参数长得像不像。
    极端目标 z=2.0 的结果更有意思。此时学到的策略参数与理论解偏差明显增大,但终端表现依然接近 oracle。这个现象其实一点也不奇怪:在强化学习里,学到的策略参数不等于最终性能。如果目标本身就很激进,最优策略往往会更靠近约束边界,参数空间里看着“离谱”,性能却可能仍然不错。论文能把这一点讲清楚,说明它没有把“参数拟合”误当“任务完成”。
    表1:不同目标收益下的最终估计结果
    图3:表1给出了不同目标收益下的最终估计结果。可以看到,普通目标下学习值和理论值非常接近,极端目标下则更能暴露策略参数和性能之间的差异。例如在 z=2.0 时,策略参数 ϕ 的学习值为 0.87,而理论值为 0.92,偏差约 5.4%;但终端期望收益的学习值为 1.98,理论值为 2.00,偏差仅 1.0%。
    从实验设置看,论文还做了初始化和学习率鲁棒性检查。结果显示算法对初值不算敏感,学习率表现也符合常规 SGD 经验:大步子收敛快,但波动也大;小步子更稳,但慢。这个结果不惊艳,却很实在。很多论文最怕的就是“只在一组超参数上像个天才,换个种子就变路人”,这篇至少没有这个毛病。
    当然,这组实验也有边界:它是一个时间不变、维度不高的数值例子,离真实多资产、非平稳、交易摩擦复杂的市场还差一截。换句话说,它证明了方法能跑通、能收敛、能对齐理论,但还没证明它能在复杂实盘里一把梭哈。这个分寸感,论文是有的。

    总结与展望:约束强化学习的“高斯之路”

    这篇论文最值得记住的一句话是:约束不一定要压在采样上,也可以压在均值上。这个思路看似简单,实际上把“可训练性”和“可行性”拆开处理了,既保住了高斯探索的分析便利,又没有丢掉原问题的约束结构。对连续时间金融 RL 来说,这是很实用的一步。
    不过,这条路也不是没有坑。首先,论文当前主要证明了无卖空约束下的均值-方差问题,若进一步加入交易成本、冲击成本、风险预算或更复杂的状态约束,辅助问题是否还能保留同样漂亮的结构,还要打问号。其次,虽然算法是无模型的,但它依赖足够多、足够干净的轨迹数据;如果数据本身噪声太大,或者市场机制发生明显漂移,学习效果未必还能保持这么整齐。
    如果把这项工作放到更大的图景里看,它其实提供了一个很有价值的研究模板:先设计一个便于探索和优化的辅助问题,再证明辅助问题的解能回到原始约束问题。这种“先绕后直”的方法,可能比直接硬解约束控制更适合很多现实任务。金融如此,机器人、资源调度、运筹优化也都可能受益。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:

    这篇论文到底解决了什么问题?它解决的是“动态均值-方差投资 + 无卖空约束 + 市场参数未知”这三个条件叠在一起时,如何还能用强化学习学出最优策略的问题。核心办法是把约束放到策略均值上,再用高斯噪声做探索。

    “辅助问题”和“原问题”是什么关系?辅助问题是为了方便训练而构造的探索版本,允许采样动作越界,但要求均值非负。论文证明,在合适的方差设计下,辅助问题最优高斯策略的均值,正好就是原问题的最优无卖空策略。

    为什么实验里极端目标收益下参数偏差大,但结果还不错?因为强化学习里真正重要的是任务性能,不是参数长得像不像理论解。极端目标会把策略推向更激进的区域,参数偏差变大很正常,但只要终端期望和方差仍接近理论值,就说明方法仍然抓住了问题本质。

    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆
    把“约束放在均值上”这一步处理得很巧,尤其是在连续时间无卖空均值-方差框架里,确实不是常规解法。

    实验合理度:★★★☆☆
    验证目标清晰,但主要还是数值例子,离更复杂的市场环境还有距离;好在对理论结论的支撑是对口的。

    学术研究价值:★★★★☆
    把约束控制、连续时间 RL 和金融优化连起来了,后续做更复杂约束时很有参考价值。

    稳定性:★★★☆☆
    在设定好的仿真里表现不错,但真实市场的非平稳和噪声会让稳定性打折。

    适应性以及泛化能力:★★★☆☆
    对无卖空均值-方差问题很合适,但扩展到更多约束时,结构是否还能保住还不确定。

    硬件需求及成本:★★★★☆
    算法本身不算重,主要成本在轨迹采样和迭代训练,不需要特别夸张的算力。

    复现难度:★★★☆☆
    理论链条完整,但连续时间实现和参数化细节仍需要一定基础,复现不算轻松也不算离谱。

    产品化成熟度:★★★☆☆
    更像研究型原型,适合仿真和离线策略学习;要进实盘,还得补交易摩擦、漂移和风控机制。

    可能的问题:理论漂亮、结构清楚,但实验还偏小;若市场更复杂,辅助问题和原问题的对应关系未必还能这么顺。


    主要参考文献

    Xun Li, Yutian Wang, Xun Yu Zhou. Dynamic mean–variance portfolio selection with no-shorting constraints and unknown investment opportunity sets. arXiv:2607.16625v1, 2026.
    Zhou, X. Y., & Li, D. Continuous-time mean-variance portfolio selection: A stochastic LQ framework. 2000.
    Wang, et al. Continuous-time reinforcement learning with exploratory control and entropy regularization. 2020.
    Jia, R., & Zhou, X. Y. Policy evaluation / policy gradient methods for continuous-time reinforcement learning. 2022.

    金融强化学习这类题,最怕“公式看懂了,落地还是一团雾”。想把论文拆成能读、能讲、能复现的版本,欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。记得备注“研究方向+地点+学校/公司+昵称”,方便快速通过~

    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。