← 返回 PaperDaily
大模型与智能体
量化新范式:给残差上"户口",净收益13.52%→19.10%
把特征拼一起,就像把所有水果丢进一台榨汁机——最后没人知道哪一口是苹果、哪一口是橙子,更不知道是哪个"果"在犯错。西湖大学这篇新工作干脆给残差上"户口":先分清谁的错,再动手修。实测同一批特征、同一批树上限,扣费收益从13.52%干到19.10%、夏普1.42→2.09。这份"残差代数",值得所有做表格学习、量化选股的人细品。
龙哥读论文
发布于 2026-08-14 08:31:05
阅读 4
查看原文
原论文信息如下:
好的,龙哥来带大家看看西湖大学这篇有点意思的量化新作。
残差也有身份:从特征拼接到残差代数
一个老生常谈但始终没被正经回答的问题是:特征拼接到底丢掉了什么?在量化选股这类典型表格任务里,梯度提升树仍然是不折不扣的“扛把子”。但无论是GBDT还是各类深度表格模型,最常见的做法还是把一堆因子做成一个扁平的特征向量,全部丢给同一个学习器。特征拼接保住了数值,却破坏了溯源——模型犯了错,到底哪个表示该为这个错误负责,没人知道。西湖大学这篇论文干了一件挺“较真”的事:能不能在误差产生的时候,就搞清楚每个表示的身份,让残差的归属权在组合过程中始终保持可见?
论文给出的第一个部件叫Fold。思路倒不花哨:把两个连续因子在每个交易日内做排序,各自切成10个分位档,一横一竖拼成一个10×10的交互网格。每只股票每天落入其中一个格子,这个格子就是一个“交互状态”。于是,一个因子对就变成了一张100个条目的表:每个格子的值,是历史上落在同一格子的股票未来5日收益的条件均值。等于是把双排序(double sort)当成一种独热编码来读——每个格子的指示向量是100维,某一维为1,其余为0。
这个网格确实是个“有身份”的东西:它自带坐标系(哪两个因子、各自第几档),也自带残差(真实收益减去格内均值)。论文里构造了三个不同经济机制的因子对,构成三个异构因子场:动量×短期反转(F₁)、价值×动量(F₂)、突破×成交量确认(F₃)。它们的信号两两相关平均只有0.54。正是因为相关性不算高,“保持身份再组合”才真正成为架构层面的核心问题,而不是简单的特征混合。下面这张图把Fold的整个逻辑讲得很清楚:从连续因子空间出发,日内排序切成10档,选中唯一的交互状态,最后读出该格子的条件均值。
场内条件均值的定义如下式所示,这里的r_{i,t}是未来5日收益,整个估计只用部署时点可观测的历史数据(年度刷新、252天半衰期加权)。
先给个直观的对比:把三张场直接等权平均,得到的是13.52%的扣费净收益;在平均场上再叠一个共享修正器,收益能到18.01%。但这两条路都没有真正触碰论文提出的问题——残差仍然是一锅粥,谁的错误归谁都说不清。真正拉开差距的,是把残差当成有类型的对象来组合。这就引出了论文的核心框架:残差代数。
三步算子组合:松弛-聚合-闭合的数学之美
FPRC-PQ(Field-Preserving Residual Closure,保场残差闭合)是残差代数的实例化产物。它把学习过程拆成三个顺序固定的算子:松弛(Relaxation)、聚合(Aggregation)、闭合(Closure)。这里的“算子”不是比喻,而是有明确类型签名和组合规则的数学对象。
第一步:松弛。 每个场的残差,只能由该场自己的坐标系统来修正。具体来说,就是在原始的(a_m, b_m)网格坐标、共享顶点坐标P_⊥以及净化后的Q轴坐标上,拟合该场自己的残差r − F_m。这个算子的类型签名里,输入输出都保留了场下标m——动量场的错误由动量场的坐标来修,价值场的错误由价值场的坐标来修。修正完之后,每个场依然是“它自己”。
第二步:聚合。 经过松弛的三个场,在等权平均处汇合。这一步的朴素程度可能让不少人犯嘀咕:就这么简单?是的。关键在于,这一步是整个流水线上唯一允许抹除身份的地方。场与场之间没有任何学习出来的权重或门控——身份在松弛阶段保留得干干净净,又在这一步一次性、可控地被抹除。用论文的话说,这是“受控身份擦除边界”。
第三步:闭合。 共享学习器不再读取任何局部信息,只从父坐标X_par(各场的原始因子坐标集合)出发,拟合r − B_PQ,即聚合之后剩下的“新鲜残差”。闭合算子的信息域被刻意压缩:它看得到父因子,但读不到任何场的局部状态。这样,三个残差群体在闭合阶段不会被重新混淆。
三步组合最漂亮的地方在于残差的望远镜式分解。把B_PQ代入最终的预测式,可以看到整个预测可以被写成三段归各阶段所有的加性项:表示层、局部闭合层、共享闭合层,再加上一个终残差。这个分解可以用下面的公式清晰表达:
换句话说,容量被分配到误差真正存在的地方,而不是堆在同一个学习器里。论文用一句话点题:这是带类型中间目标的阶段性提升(stagewise boosting)。聚合操作还有一个控制变量(control variate)的视角:F_bar是稳定的低维锚点,残差拟合是回归调整项;锚点负责可预测的均值水平,残差拟合去除锚点周围的波动,整体实现残差二阶矩的弱化。整个残差路由的结构如图2所示。
Table 1给出了完整的架构阶梯对比。从最朴素的“三场平均”到完整的FPRC-PQ,每一步的提升都对应一个可解释的设计决策。注意看最上面两行:直接GBDT和残差GBDT,虽然使用了相同的完整特征集,但它俩都不如类型化组合的结构。收益差距不是来自某一棵树的魔法,而是来自残差归属权的结构化分配。
冻结协议下的严格验证:5项审计与4组对照
这套东西是不是只是又一个“先射箭再画靶”?论文在证据纪律上确实下了功夫。所有架构选择、因子选择、超参数全部在2022年12月31日前的数据上冻结;评估窗口是2023年1月到2026年7月,共844个交易日、366万7千行严格的共同账簿。模型每年做一次点对点重拟合,扣费模型采用双边10/15个基点费用,21天分批持仓。这样的设计,把“数据窥探”这个量化研究最常见的坑基本堵死了。
为了防止单纯靠树的数量堆出收益,论文设置了配对容量控制:一个直接GBDT收到三个局部学习器加一个共享闭合器的全部树容量,仍然跑不赢类型化组合。为了防止“加信息总能变强”的朴素想法,论文又测试了八条元信息捷径——误差相关元数据、风格元数据、行业元数据等,全部失败,其中数条在统计上显著为负。下方图4直观地展示了这八条失败捷径的对比区间。
更硬核的是5项预注册审计。每一项都事先冻结问题与决策规则,然后才看数据。Table 2列出了完整的算子决策链。以审计A4为例:它比较Q轴放局部还是放共享,结果显示Q放局部更好,叠加共享Q反而降了0.31个百分点。A3审计检查跨层边界的操作,结论是重新打开跨层边界的做法从未进入最优单元格。这5项审计的结果一致指向同一个架构:松弛阶段要类型化且局部,聚合必须是固定均值,闭合只能吃父坐标。
Table 9则展示了4组匹配结构对照:普通直接学习器、统一残差学习器、身份自由的二阶段学习器、仅配对学习的对照,全部落后于FPRC-PQ。注意表格里Δ是“对照减去FPRC-PQ”,所以负值代表对照不如FPRC-PQ——几乎全是负的,胜场数也说明FPRC-PQ在每一年都保持领先。这组对照直接反驳了“更多特征或更多树就能解释提升”的质疑。
从最终的收益数字看,基础残差代数把扣费净收益从13.52%干到19.10%,夏普比率从1.42提升到2.09。提升的直接来源不是特征变多了,也不是树变多了,而是残差的所有权和组合方式变得显式化了。图3的收益曲线很直观:策略曲线从前半段就开始分化,后半段差距持续拉大。这种持续稳定的分化,比单点的收益数字更有说服力。
反射性沉思:一个优雅但未经验证的理论延伸
论文的第三部分理论延伸叫“反射性沉思”(reflective rumination),这个名字起得颇有禅意。设想一个全局重建器T把锚点F映射成F₂ = T(F),那么位移向量q = F − F₂记录了重建器把原锚点挪动了多少。最朴素的反射更新是R₂ = F + q = 2F − F₂——以F为中心,给F₂照镜子。如果把第一阶段的“已消化残差”R₁ = ρ̂和这个反射更新加在一起,再加上尾项F₂ − F,在理想单位反射下恰好还原为真实收益r。这就是所谓的“归属链闭合”。
如果F₂ = F(什么都没动),那么任何系数a、b满足a − b = 1的算子aF − bF₂都会退化为F。保留这个锚点守恒约束,就得到一个一参数仿射族:R₂的λ版本 = F + λq。此时λ还没有确定。论文用一句话解决:让留给下游学习器的新残差e_λ与反射向量q零对齐,即〈e_λ, q〉= 0。解这个方程,唯一确定λ* = 〈e₀, q〉/〈q, q〉,恰好是投影算子的系数。整个过程不需要任何网格搜索,一步解析解出,所以叫“正交规范固定”。
强调一个容易忽略的细节:论文在实验部分明确声明,所有报告的收益评估的都是基础骨干B_PQ,也就是λ = 0的成员。反射性沉思只作为理论拓展提出,没有为它增加任何实验结果。如果未来要做实证,λ*的估计(以及T的拟合)必须严格限制在使用部署时点可观测的数据上进行,否则就构成前视偏差。这是一个诚实且纪律严明的选择:宁可把一个优雅的理论放在“未验证”的位置,也不把它混进验证过的实验数字里。
可迁移的科研范式:类型化残差所有权与有序组合
最后一步是方法论层面的提炼。论文的四个算子原则——类型化局部修正、受控身份擦除、新鲜残差闭合、分阶段信息压缩——每一个单独拿出来都不算全新的知识,但组合起来却构成一套可迁移的范式。
对表格学习的研究者来说,最直接的启发是:不要急着把特征拼接成一个大向量。先想清楚每个表示产生的误差属于谁,让修正发生在残差产生的地方,把需要共享的部分放到真正的边界之后。对于多模态、图像融合这类天然带有异构表示的场景,“类型化残差所有权”同样是值得认真考察的方向——谁的表示引发了这个误差,就应该由谁来修正。
这套方法也展示了证据纪律的力量。冻结协议、预注册审计、配对容量控制、block-bootstrap配对推断——这些词在量化论文里并不新鲜,但在一篇以残差代数为核心的方法论论文里被严格落地,并不多见。用论文自己的话说:改变残差所有者、算子顺序、信息边界或容量位置,都会产生一个可以直接检验的不同的模型——这就是“代数化”的价值。
龙迷三问
这篇论文到底在解决什么问题? 西湖大学新研究将"残差"代数化:让每个表示自带坐标系与未解残差,再经松弛-聚合-闭合三步算子有序组合。在3.67M条A股数据上,扣费收益从13.52%升至19.10%,夏普1.42增至2.09,全程冻结协议验证。
这篇工作最值得看的点是什么? FPRC-PQ在严格账簿上实现19.10%净收益和2.09夏普比率,全面优于所有对比方法;所有结构性对照均落后,且收益提升不能由更多特征或更多树解释
这篇工作的边界或风险在哪里? 优点:残差代数框架概念清晰,类型化残差所有权和有序组合具有理论深度;实验设计严谨,冻结协议和预注册审计增强了可信度;消融实验全面,多个对照隔离了容量、身份、交互类等混淆因素。缺点:仅在一个市场(中国A股)和一类资产上验证;字段仅二维;正交性声明限于耦合重拟合而非一般效率定理;反射性沉思部分仅为理论扩展,未纳入实证结果。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆ 残差代数作为一个概念框架是这篇论文最大的贡献,把“残差的归属权”从隐含信息变成显式代数结构。反射性沉思的角度也很新颖。扣一星是因为三个算子本身都是已知组件的组合创新,属于“重新组织语言”级别的贡献。
实验合理度:★★★★★ 冻结协议、预注册审计、点对点容量匹配、block-bootstrap推断,量化论文的实验纪律拉满。每个结论都有对应的对照实验,八条失败捷径被公开列出,没有只捡好的说。这种证据密度在同类论文中相当少见。
学术研究价值:★★★★☆ 残差所有权这一概念在表格学习之外的潜力很大,多模态、图像融合都可以借鉴。论文给出了完整的数学框架,后续研究者可以直接在此基础上做扩展。扣一星因为目前只在量化选股单一场景验证。
稳定性:★★★★☆ 3.67M行数据、42个月窗口、逐年点对点重拟合,结果比较稳定。但只有A股单一市场的证据,对美股等市场稳定尚不可知。论文没有展示不同市场、不同因子选择下的敏感性分析。
适应性以及泛化能力:★★★☆☆ 方法针对表格学习、截面排序任务设计。Fold的双排序网格适合金融截面数据,换到非时序表格、图像、文本等场景需要重新设计。三个因子场的选择也依赖金融语义,换成其他任务未必能直接套用。
硬件需求及成本:★★★★☆ XGBoost主模型,冻结超参数,三个局部分支加一个共享学习器,整体训练成本远低于深度模型。推理成本每天一次,工程上完全可控。反射性沉思部分无需额外计算,是解析解。
复现难度:★★★★★ 论文声明所有冻结信号可逐位复现(最大差异为0),并提供了协议常量表、字段定义表、轴选择表。XGBoost本身是成熟开源库,照做一遍的路径非常清晰。扣一星因为代码尚未明确开源。
产品化成熟度:★★★★☆ 一个每年重拟合、每天跑一次的流水线在量化团队中属于标准工程,19.10%的净收益扣费后仍显著,基本可以直接部署。但需要复制其冻结协议才能获得可比效果。反射性沉思部分暂不适用于部署,因为尚未验证。
可能的问题: A股单市场验证限制了外部效度;反射性沉思作为理论延伸没有实验支撑,论文自身对λ=0的处理是诚实的,但读者要警惕实验结果与理论部分的边界。整体而言,是近期少见的、在证据纪律上做得极其扎实的量化方法论文。
主要参考文献
[1] Friedman J H. Greedy function approximation: a gradient boosting machine. The Annals of Statistics, 2001.
[2] Chen T, Guestrin C. XGBoost: A scalable tree boosting system. KDD, 2016.
[3] Grinsztajn L, Oyallon E, Varoquaux G. Why do tree-based models still outperform deep learning on typical tabular data? NeurIPS, 2022.
[4] Gu S, Kelly B, Xiu D. Empirical asset pricing via machine learning. Review of Financial Studies, 2020.
[5] Chernozhukov V, et al. Double/debiased machine learning for treatment and structural parameters. The Econometrics Journal, 2018.
[6] Owen A B. Monte Carlo theory, methods and examples. 2013.
[7] Politis D N, Romano J P. The stationary bootstrap. JASA, 1994.
[8] 原文链接: https://arxiv.org/pdf/2608.07349v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
看完了,别光记着13.52%变19.10%。残差要认领归属,方法要守住边界,研究要过得了冻结协议的审计。大到策略框架,小到一张表格的字段,都值得这样较真。欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 量化选股+上海+西湖大学+龙哥) ,根据格式备注,可更快被通过且邀请进群。群里已备好金融AI、大模型、自动驾驶等5个方向的讨论坑位,等你来填~