← 返回 PaperDaily 大模型与智能体

可解释混合信贷评分:低学历用户被“黑箱”决策多出32个百分点

一套“逻辑回归+梯度提升残差校正”的混合信用评分框架,在东非金融包容数据上精度追平黑箱模型,Brier直降46%,却依旧透明可审计。但公平性审计揭开了另一面:农村、低学历、乌干达用户被路由到“黑箱”ML区域的概率,分别比参照组高出18、32、22个百分点。模型没有制造不平等,却悄悄放大了它。

可解释混合信贷评分:低学历用户被“黑箱”决策多出32个百分点

paperdaily_reaction_gif


原论文信息如下:
论文标题:
Interpretable Hybrid Credit Scoring for Thin-File and Underbanked Populations: A Fairness-Aware Residual Learning Framework with Evidence from East African Financial Inclusion Data
发表日期:
2026年8月
发表单位:
African Institute for Mathematical Sciences (AIMS), Kigali, Rwanda;Sefako Makgatho University;AIRINA Labs
原文链接:
https://arxiv.org/pdf/2608.26837v1.pdf

如果你在肯尼亚做线上信贷,2022年3月之后的日子大概率没那么好过了。肯尼亚央行一纸《数字信贷提供商条例》,把所有自动信贷决策圈进了监管视野:放贷可以,但你得能说清楚每一笔决定依据什么。M-Shwari从2012年上线干到年放款数十亿美元的规模,靠的就是手机钱包里的行为数据;可如今,审核的探照灯直接照到了模型脸上。

问题来了:怎么说明依据?

在撒哈拉以南非洲的大部分市场,传统风控的“标准动作”几乎全部失灵。征信局覆盖率低得可怜:根据世界银行Findex 2021的数据,坦桑尼亚、卢旺达、乌干达的成年人银行账户持有率不足一半,肯尼亚也不到三分之二。没有央行征信记录、没有工资单、没有银行流水,有的只是手机话费记录和移动钱包的转账痕迹。这批“薄档案人群”,恰恰是数字信贷最想触达的客群。

于是行业陷入一个老掉牙的二元困境:要解释性,就用逻辑回归评分卡——监管爱它,因为每个系数都对应一个可审计的风险因子;但精度确实不够看。要精度,就上XGBoost、LightGBM这类梯度提升模型——效果是真香,可几百棵树的集成,连开发者自己都说不清某笔拒绝到底赖哪个特征,更别提给监管写解释了。

过去十年,学术界的主流叙事一直把这两个目标当对立面:想要可解释,就得忍受精度损失;想要精度,就得接受黑箱。混合模型(Hybrid Model)的初衷就是打破这个二选一:保留透明的线性基线,再用非线性模型去拟合它的残差,两头的好处都占一点。但一个更深的问题始终没人正面回答:当混合模型对某个借款人给出解释时,如果30%的决策信号来自黑箱残差部分,对另一个人却只占5%——这个差异,监管凭什么审?这种差异的分布,又是否跟借款人的身份(性别、地域、教育程度)系统性相关?

这篇文章要聊的论文,来自非洲数学科学研究所(AIMS)基加利分校等机构的研究团队。研究者们干了一件相当较真的事:把混合评分框架直接搬到东非四国(肯尼亚、卢旺达、坦桑尼亚、乌干达)的金融包容数据上跑了一遍,然后做了一次“区域粒度”的公平性审计——不是说总体公平指标过得去就算完,而是把每个预测按“可解释性比例ρ(x)”切进三个区域:完全可解释(ρ≥0.9)、部分可解释(0.7≤ρ<0.9)、ML主导(ρ<0.7)。逐个区域检查,到底哪些人群被模型悄悄推向了最不透明、最难出具拒贷解释的那个区域。

结果相当扎心。

模型整体表现确实能打:在东非数据上AUC达到0.869,比纯逻辑回归高1.5个点(统计显著),跟独立XGBoost基本打平;Brier分数从0.158一路砍到0.085,相对降幅46%。但公平性审计一摊开:农村受访者被路由到“ML主导”黑箱区域的概率是66.4%,城市居民只有48.2%,相差18个百分点;小学及以下教育程度的人群68.3%被推进黑箱区域,中学及以上只有35.9%,差距高达32个百分点;乌干达受访者70.2%,肯尼亚48.4%,差22个百分点。性别维度呢?男性和女性的路由概率几乎一模一样,差了0.1个百分点。

换句话说:这套混合模型,确实在精度和可解释性之间找到了一个漂亮平衡,但平衡的代价是——恰恰是那些社会经济地位更弱势的群体,被不成比例地“外包”给了最难解释的黑箱分支。模型没有主动制造不平等,却在误差结构里安静地放大了结构性不平等。

这个发现的价值在于:如果只看聚合层面的公平指标(比如整体disparate impact、整体equalized odds),这套框架看起来完全没有问题,甚至相当优秀。可一旦下钻到“可解释性区域”这个粒度,审计就逮住了那些聚合指标漏掉的子群体路由违规。对非洲各国的央行数字信贷监管者来说,这几乎是现成的审计工具箱。

在信贷风控这个行当里,监管者、建模师、借款人三方的诉求从来就没对齐过。监管要透明,建模师要精度,借款人要公平。传统逻辑回归评分卡是合规的“亲儿子”,每个系数都能对应具体风险因子,这在过去半个世纪撑起了受监管信贷行业的合规地基。但到了东非,这套地基出现了裂缝:大部分成年人没有银行账户、没有工资单、没有征信记录,传统评分卡在数据匮乏面前精度很差。而XGBoost这类梯度提升模型虽然能从手机话费记录、移动支付轨迹里挖出有效信号,却让监管者犯难——几百棵树的集成,拒贷解释从何写起?

混合模型(Hybrid Model)的思路是:用透明的逻辑回归打底,再用梯度提升去拟合残差,理论上两头好处都占一点。但一个更深的问题一直没人正面回答——当混合模型对某个借款人给出解释时,如果30%的决策信号来自黑箱残差,对另一个人却只占5%,这个差异,监管凭什么审?这种差异的分布,又是否跟借款人的身份系统性相关?
为了量化这个问题,论文提出了一个关键指标——可解释性比例ρ(x)。它的直观含义是:在最终的混合预测中,有多大比例来自透明可解释的逻辑回归分支。ρ(x)=1意味着完全线性决策,ρ(x)=0则意味着完全由黑箱残差决定。据此,每个预测被切进三个区域:完全可解释区域(ρ≥0.9)、部分可解释区域(0.7≤ρ<0.9)、ML主导区域(ρ<0.7)。区域归属直接决定监管场景中的解释义务强度——如果借款人落进ML主导区域,传统的“因为A、B、C三项风险因子,所以拒绝”的解释方式就不成立了。

残差学习框架:如何让黑盒模型“开口说话”

可解释性比例公式
可解释性比例ρ(x)定义:逻辑回归预测绝对值在混合预测总信号绝对值中的占比,取值在[0,1],残差校正为零时等于1。
三区域划分公式
三区域划分规则:ρ(x)≥0.9为完全可解释区域,0.7≤ρ(x)<0.9为部分可解释区域,ρ(x)<0.7为ML主导区域。0.9和0.7是经验性阈值,论文做了敏感性评估。
图2:Zindi测试集上可解释性比例ρ(x)的分布
Zindi测试集上可解释性比例ρ(x)的分布。虚线标出ρ=0.9和ρ=0.7两个区域阈值。分布呈双峰形态:主峰位于ML主导阈值之下,次峰接近ρ=1,部分可解释区域是两者之间的过渡带。
可以看到,ρ(x)的分布呈明显的双峰形态:一部分预测集中在ML主导区域,另一部分集中在完全可解释区域。那三个区域里的人数分布和高风险浓度如何?下表给出了答案。
表3:可解释性区域分布
测试集观测在三个可解释性区域中的分布、区域内违约率及区域AUC。台湾结果复现自Kanziga(2026)表5.5,Zindi结果由本论文产生。完全可解释区域集中了最高违约率借款人(台湾69.5%、Zindi 53.8%)。
注意一个微妙的机制:ρ(x)在概率尺度上定义,因此当逻辑回归基线对某个借款人给出接近0或1的极端预测时,残差校正的影响会被“稀释”,这个人自然落入完全可解释区域。也就是说,最能被解释的恰恰是“逻辑回归已经有把握”的那批人;而逻辑回归越没底、越需要机器学习补刀的人,反而越容易掉进黑箱区域。这个结构性偏差,正是公平性问题滋生的土壤。
接下来看看这套框架具体怎么搭建。整个过程分五步走。
第一步,训练逻辑回归基线。这里没有用原始特征直接建模,而是先做了证据权重(Weight of Evidence,WoE)编码
逻辑回归公式
逻辑回归基线:p_LR(x)=σ(βᵀx+β₀),其中σ是Sigmoid函数,β是特征权重向量,β₀是偏置项。
WoE编码公式
WoE编码:WoE_k=ln((g_k/G)/(b_k/B)),其中g_k和b_k分别是第k个分箱内好客户与坏客户的计数,G和B是对应总数。WoE编码把分类变量的非线性效应线性化,并保留评分卡每项可审计的分解结构。
第二步,计算响应残差。
残差公式
响应残差:r_i=y_i−p_LR(x_i)。严格来说,广义线性模型更标准的做法是用Pearson残差或Deviance残差,但这里选原始响应残差的原因很务实:它直接给二级学习器一个回归目标,并且与深度残差网络的残差学习范式一脉相承(He等,2016)。
第三步,用梯度提升树拟合残差。
梯度提升公式
梯度提升残差学习器:r̂(x)=f_GBM(x)=Σνh_m(x),其中h_m是第m轮拟合的回归树,ν是学习率。论文用XGBoost作为实现(Chen和Guestrin,2016),LightGBM(Ke等,2017)作为敏感性检验。
第四步,把两者按自适应权重组合成混合预测,并定义可解释性比例。
混合预测公式
混合预测:p_Hybrid(x)=clip(p_LR(x)+α*(x)r̂(x),0,1),其中α*(x)是随输入变化的权重。
这里的核心在于α*(x)不是固定常数,而是一个不确定性自适应的加权机制。论文设计了一个巧妙的策略:当逻辑回归对某个样本的预测信心不足(概率接近0.5)时,加大残差校正的权重;当逻辑回归已经很有把握时,压住残差校正的作用。
不确定性代理公式
不确定性代理变量:u_LR(x)=4·p_LR(x)·(1−p_LR(x)),取值范围[0,1]。当p_LR=0.5时u=1表示最不确定,p_LR接近0或1时u接近0表示很确定。
自适应权重公式
自适应权重:α*(x)=α_min+(α_max−α_min)·u_LR(x)^γ,γ控制不确定性到权重映射的曲率。三个超参数用5折分层交叉验证在AUC上网格搜索确定。
第五步,概率校准。尽管混合预测已被clip到[0,1],但其输出并非天然校准的概率。论文用普拉特缩放(Platt Scaling)做后处理。
Platt校准公式
Platt校准:p_cal(x)=1/(1+exp(a·p_Hybrid(x)+b)),参数a、b在留出验证折上估计。校准效果通过可靠性图和期望校准误差(ECE)评估。
表1:最终模型配置
最终模型配置。继承自Kanziga(2026)表4.2。
表2:测试集预测性能
表2:测试集预测性能。台湾结果复现自Kanziga(2026)表5.1,Zindi结果由本论文产生。在Zindi东非数据上,混合模型AUC达0.869,Brier从0.158砍到0.085,降幅46%;在台湾基准上Brier降约23%。
图1:Zindi测试集诊断
图1:Zindi FSD测试集诊断。左图:三个模型的ROC曲线,校准后的混合模型几乎全程与独立XGBoost曲线重合,并显著优于逻辑回归基线;右图:可靠性图与期望校准误差(ECE)。Platt校准使混合模型接近对角线,独立逻辑回归在均衡类别加权下严重失准(ECE=0.234)。
表9:成对AUC比较
表9:成对AUC比较。分层配对引导法95%置信区间(B=2000)和DeLong单侧p值(H₁:混合模型AUC>对比模型AUC)。台湾结果复现自Kanziga(2026)表5.7。逻辑回归与混合模型差距在统计上显著,混合模型与XGBoost差距不显著。
在台湾信用违约基准上,混合模型保持了独立XGBoost的区分度(ΔAUC=+0.001,95% CI [−0.004, +0.006]),但同时Brier降低约23%,且把最高违约率的借款人集中在完全可解释区域内。精度追上了黑箱子,解释性却没丢——这就是残差学习框架“开口说话”的方式。

公平性审计的显微镜:揭示被聚合指标掩盖的路由歧视

精度问题解决了,接下来是公平性。传统公平性审计只看聚合指标:整体差异影响比(Disparate Impact,DI)和整体均衡几率差异(Equalized Odds Difference,EOD)。但这种审计有一个盲区——它只看最终决策是否均衡,不关心模型内部结构是否对某些群体“双标”。
论文审计的正是这个“双标”:不同受保护子群体被路由到ML主导区域(ρ<0.7)的概率。路由率(Region-Routing Rate)的定义是Pr[ρ(x)<0.7|A=g],即某个群体中预测落入不透明区域的比例。
表4:路由率表
表4:Zindi测试集上受保护子群体的区域路由率Pr[ρ(x)<0.7|A=g],附95%自助法置信区间(B=500)。农村66.4%对城市48.2%,差18个百分点;小学及以下68.3%对中学及以上35.9%,差32个百分点;乌干达70.2%对肯尼亚48.4%,差22个百分点;性别仅差0.1个百分点。
图3:受保护子群体路由率图
图3:Zindi测试集上各受保护子群体被路由到ML主导可解释性区域(ρ<0.7)的比例。参考组(男性、城市、中学及以上、肯尼亚)用灰色显示,比较组用红色。性别维度基本无路由差异;地区、教育、国家维度分别有18、32、至多22个百分点的差距。
农村受访者的路由率66.4%,城市居民48.2%;小学及以下教育程度68.3%,中学及以上35.9%;乌干达受访者70.2%,肯尼亚48.4%。而男性和女性的路由率几乎一模一样,只差0.1个百分点。这意味着什么?农村、低学历、乌干达用户,恰恰是最需要贷款支持的人群,却被系统性地推向了“最难看懂”的决策通道。拒绝他们的时候,模型甚至说不清具体因为什么。
表5:差异影响比
表5:Zindi测试集上差异影响比DI(g)=Pr[ŷ=1|A=g]/Pr[ŷ=1|A=g_ref],决策阈值0.5,总体及按可解释性区域分层。“四分之五准则”参考区间:DI∈[0.8,1.25]。ML驱动列中的“‥”表示参考组在该区域中无预测正类(分母消失)。
表6:均衡几率差异
表6:Zindi测试集上均衡几率差异max_g{|TPR(g)−TPR(g_ref)|, |FPR(g)−FPR(g_ref)|},总体及各区域,定义遵循Hardt等(2016)。ML驱动列中“—”表示参考组在该区域无预测正类,TPR/FPR分母失效,EOD未定义(不为零)。显式报告是为了避免误导性的“完美均衡”暗示。
这里论文特别提醒了一个统计陷阱:由于ρ(x)是模型输出的函数,区域条件化相当于对后处理变量分层,所以区域内部的DI和EOD是描述性统计,不能直接解释为“区域内部的公平性”。真正干净的审计指标是第一项路由率,因为在路由率检验中ρ(x)是待审计的结果变量,而非分层条件。

从东非到西非:一个可迁移的监管审计工具包

如果说东非四国的实证是“考试”,那这套框架的“出厂设置”是否通用?论文在方法论上留了两手准备。
第一手是硬/软特征空间划分。将Zindi特征集拆成硬人口统计块(年龄、性别、婚姻、教育、家庭规模、地区类型、国家)和软行为块(手机使用、工作类型、与户主关系)。逻辑回归基线只用硬特征,残差学习器同时看到两者。这样ρ(x)≈1意味着决策仅凭硬人口统计就能解释,ρ(x)<0.7则意味着软行为代理显著改写了结果。这为监管者提供了一套“哪些决策是行为数据驱动”的检测机制。
第二手是联合优化的探索。论文把两阶段训练(先定逻辑回归参数,再拟合残差)推广为交替最小化的固定点迭代:固定树,用L-BFGS更新逻辑回归参数;固定逻辑回归,重拟合残差。
联合损失函数公式
联合损失函数:L(β,f_GBM)=Σℓ(y_i, clip(p_LR(x_i;β)+α*(x_i)f_GBM(x_i),0,1))+λ_LR‖β‖₂²+Ω(f_GBM),其中ℓ是二值交叉熵,Ω是XGBoost复杂度惩罚。论文实现的是交替固定点迭代而非精确联合最小化,真正的端到端功能梯度下降留作未来工作。
表8:交替最小化收敛
表8:交替最小化收敛轨迹及与两阶段训练的最终对比。交替最小化在Zindi测试集上追平两阶段训练,收敛干净利落。
那对于掉进ML主导区域的用户,模型还能给出解释吗?论文用TreeSHAP对残差学习器做归因分析。
图4:TreeSHAP蜂群图
图4:Zindi ML主导区域(ρ<0.7,n=2796条测试观测)残差学习器f_GBM的TreeSHAP蜂群图,展示前12个特征。每个点是该区域的一条测试观测;水平位置是SHAP对r̂(x)的贡献(正值将混合预测推高至逻辑回归预测之上);颜色编码特征值高低。
表10:SHAP均值表
表10:Zindi ML主导区域(ρ<0.7,n=2796条测试观测)残差学习器的平均|SHAP|,前10个特征。Top-5排序的500次观测级自助法重采样标准差一并报告,用于评估解释稳定性和可靠性。
组合起来,这套框架对非洲监管者的价值是即插即用的:先跑一个混合评分卡,输出ρ(x)分布;再按受保护属性做逐区域路由率审计;一旦发现某个子群体被不成比例地推入ML主导区域,就把TreeSHAP归因表拿出来作为附加披露。整个过程不依赖任何专有平台,不需要修改现有信审系统的数据接口。从东非到西非,只要数据里有受保护属性、监管需要逐笔解释,这套工具包就能平移。

薄文件借款人的命运:线性基线为何“自信”地拒绝他们

最后聊一个特殊群体——薄文件借款人(Thin-File Borrower)。所谓薄文件,指没有足够信贷历史(征信记录、银行流水、担保物)的人群。传统信用评分体系建立在“有足够的过去可以预测未来”这个假设上,而薄文件人群直接打破了这个假设。在非洲,这类人群占比极大——没有征信记录,但有手机,有移动钱包流水。
论文在Zindi特征集上定义了一个操作性薄文件子群体:教育水平、手机接入、正式工作状态三项复合指标的最低四分位。然后在这个子群体上重新评估框架。
表7:薄文件子群体表现
表7:Zindi测试集薄文件子群体(教育、手机接入和正式工作指标复合指数最低四分位)上的表现。混合模型在薄文件子群体上AUC为0.873,略高于全样本的0.869,Brier降幅也更明显,说明残差学习器在薄文件人群上贡献了更多有效信号。
有意思的是,混合模型在薄文件子群体上的AUC反而比全样本略高,残差学习器的信号增益在薄文件人群上更大——这正好呼应了“替代数据对薄文件人群最有价值”的直觉。但同时,恰恰是这群人,他们的ρ(x)最容易掉到ML主导区域。换句话说:模型最依赖黑箱信号的那批人,正是最没有被数据基础设施覆盖的那批人。
这在监管上构成一个耐人寻味的悖论:算法可以给薄文件借款人“信用”,但这笔信用建立在连借款人本人也看不见的推理链上;而监管者要求模型披露依据,恰好对最需要信贷的群体最难提供依据。逻辑回归基线在最需要它解释的地方,反而“自信”地沉默着。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?非洲科研团队提出可解释混合信用评分框架,在东非金融包容数据上AUC达0.869、Brier直降46%,精度追平黑箱模型。但公平性审计发现:农村、低学历、乌干达用户被路由到“黑箱”ML区域的概率分别高出18、32、22个百分点,性别
这篇工作最值得看的点是什么?在台湾数据集上,混合模型AUC=0.776,与XGBoost持平(∆AUC=+0.001),比LR提升5.7个AUC点,Brier分数降低23%;在Zindi数据集上,混合模型AUC=0.869,比LR提升1.5个AUC点(p<0.001),Brier分数从0.158降至0.085(降低46%),完全可解释区域集中了最高正类率借款人(53.8%)。
这篇工作的边界或风险在哪里?优点:(1) 提出预测级别的可解释性比率ρ(x),实现了混合模型的可审计性分解;(2) 在可解释性区域粒度上进行公平性审计,揭示了聚合公平性指标无法发现的子组路由差异;(3) 在东非金融普惠数据上验证了框架的跨数据集稳定性。缺点:(1) Zindi标签为银行账户拥有而非贷款违约,目标重构存在语义差异;(2) ρ(x)定义在概率尺度上,与高p_LR尾部机械耦合;(3) 单一非洲数据集限制了地理泛化性;(4) 联合优化方案计算成本高但收益有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出一种残差学习混合信用评分框架,将逻辑回归评分卡与梯度提升残差校正相结合,通过预测级别的可解释性比率ρ(x)分解线性分支与ML分支的贡献,并在可解释性区域粒度上进行公平性审计。

实验合理度:★★★★☆

AUC、Gini系数、Brier分数、F1分数、Expected Calibration Error (ECE)、可解释性比率ρ(x)分布、不同解释性区域内的违约率、不同保护属性子组的区域路由率、差异影响比(Disparate Impact。

学术研究价值:★★★★☆

提出一种残差学习混合信用评分框架,将逻辑回归评分卡与梯度提升残差校正相结合,通过预测级别的可解释性比率ρ(x)分解线性分支与ML分支的贡献,并在可解释性区域粒度上进行公平性审计;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

交替最小化联合优化方案的计算成本约为两阶段训练的4倍(因内部XGBoost重拟合占主导),端到端运行时间在近期笔记本电脑CPU上不超过5分钟。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) Zindi标签为银行账户拥有而非贷款违约,目标重构存在语义差异;


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球