论文标题:
Interpretable Hybrid Credit Scoring for Thin-File and Underbanked Populations: A Fairness-Aware Residual Learning Framework with Evidence from East African Financial Inclusion Data
发表日期: 2026年8月
发表单位: African Institute for Mathematical Sciences (AIMS), Kigali, Rwanda;Sefako Makgatho University;AIRINA Labs
可解释性比例ρ(x)定义:逻辑回归预测绝对值在混合预测总信号绝对值中的占比,取值在[0,1],残差校正为零时等于1。三区域划分规则:ρ(x)≥0.9为完全可解释区域,0.7≤ρ(x)<0.9为部分可解释区域,ρ(x)<0.7为ML主导区域。0.9和0.7是经验性阈值,论文做了敏感性评估。Zindi测试集上可解释性比例ρ(x)的分布。虚线标出ρ=0.9和ρ=0.7两个区域阈值。分布呈双峰形态:主峰位于ML主导阈值之下,次峰接近ρ=1,部分可解释区域是两者之间的过渡带。可以看到,ρ(x)的分布呈明显的双峰形态:一部分预测集中在ML主导区域,另一部分集中在完全可解释区域。那三个区域里的人数分布和高风险浓度如何?下表给出了答案。测试集观测在三个可解释性区域中的分布、区域内违约率及区域AUC。台湾结果复现自Kanziga(2026)表5.5,Zindi结果由本论文产生。完全可解释区域集中了最高违约率借款人(台湾69.5%、Zindi 53.8%)。注意一个微妙的机制:ρ(x)在概率尺度上定义,因此当逻辑回归基线对某个借款人给出接近0或1的极端预测时,残差校正的影响会被“稀释”,这个人自然落入完全可解释区域。也就是说,最能被解释的恰恰是“逻辑回归已经有把握”的那批人;而逻辑回归越没底、越需要机器学习补刀的人,反而越容易掉进黑箱区域。这个结构性偏差,正是公平性问题滋生的土壤。接下来看看这套框架具体怎么搭建。整个过程分五步走。第一步,训练逻辑回归基线。这里没有用原始特征直接建模,而是先做了证据权重(Weight of Evidence,WoE)编码。逻辑回归基线:p_LR(x)=σ(βᵀx+β₀),其中σ是Sigmoid函数,β是特征权重向量,β₀是偏置项。WoE编码:WoE_k=ln((g_k/G)/(b_k/B)),其中g_k和b_k分别是第k个分箱内好客户与坏客户的计数,G和B是对应总数。WoE编码把分类变量的非线性效应线性化,并保留评分卡每项可审计的分解结构。第二步,计算响应残差。响应残差:r_i=y_i−p_LR(x_i)。严格来说,广义线性模型更标准的做法是用Pearson残差或Deviance残差,但这里选原始响应残差的原因很务实:它直接给二级学习器一个回归目标,并且与深度残差网络的残差学习范式一脉相承(He等,2016)。第三步,用梯度提升树拟合残差。梯度提升残差学习器:r̂(x)=f_GBM(x)=Σνh_m(x),其中h_m是第m轮拟合的回归树,ν是学习率。论文用XGBoost作为实现(Chen和Guestrin,2016),LightGBM(Ke等,2017)作为敏感性检验。第四步,把两者按自适应权重组合成混合预测,并定义可解释性比例。混合预测:p_Hybrid(x)=clip(p_LR(x)+α*(x)r̂(x),0,1),其中α*(x)是随输入变化的权重。这里的核心在于α*(x)不是固定常数,而是一个不确定性自适应的加权机制。论文设计了一个巧妙的策略:当逻辑回归对某个样本的预测信心不足(概率接近0.5)时,加大残差校正的权重;当逻辑回归已经很有把握时,压住残差校正的作用。不确定性代理变量:u_LR(x)=4·p_LR(x)·(1−p_LR(x)),取值范围[0,1]。当p_LR=0.5时u=1表示最不确定,p_LR接近0或1时u接近0表示很确定。自适应权重:α*(x)=α_min+(α_max−α_min)·u_LR(x)^γ,γ控制不确定性到权重映射的曲率。三个超参数用5折分层交叉验证在AUC上网格搜索确定。第五步,概率校准。尽管混合预测已被clip到[0,1],但其输出并非天然校准的概率。论文用普拉特缩放(Platt Scaling)做后处理。Platt校准:p_cal(x)=1/(1+exp(a·p_Hybrid(x)+b)),参数a、b在留出验证折上估计。校准效果通过可靠性图和期望校准误差(ECE)评估。最终模型配置。继承自Kanziga(2026)表4.2。表2:测试集预测性能。台湾结果复现自Kanziga(2026)表5.1,Zindi结果由本论文产生。在Zindi东非数据上,混合模型AUC达0.869,Brier从0.158砍到0.085,降幅46%;在台湾基准上Brier降约23%。图1:Zindi FSD测试集诊断。左图:三个模型的ROC曲线,校准后的混合模型几乎全程与独立XGBoost曲线重合,并显著优于逻辑回归基线;右图:可靠性图与期望校准误差(ECE)。Platt校准使混合模型接近对角线,独立逻辑回归在均衡类别加权下严重失准(ECE=0.234)。表9:成对AUC比较。分层配对引导法95%置信区间(B=2000)和DeLong单侧p值(H₁:混合模型AUC>对比模型AUC)。台湾结果复现自Kanziga(2026)表5.7。逻辑回归与混合模型差距在统计上显著,混合模型与XGBoost差距不显著。在台湾信用违约基准上,混合模型保持了独立XGBoost的区分度(ΔAUC=+0.001,95% CI [−0.004, +0.006]),但同时Brier降低约23%,且把最高违约率的借款人集中在完全可解释区域内。精度追上了黑箱子,解释性却没丢——这就是残差学习框架“开口说话”的方式。