“见好就收”,而且收手的时机还是模型自己定的。
测试时计算分配难题:多算无用、少算不够
SVR核心机制:自验证信号如何当上“计算调度员”
联合判定−置信度强化学习:训练时如何把校准错误转化为分配错误
固定视野训练+自适应推断:为什么这种分离是妙招
实验结果:2.99轮超越10轮固定预算,token减半精度不减
局限性分析与未来方向:过早停止仍是最大短板
龙迷三问
置信度和判定是怎么从模型输出里解析出来的?SVR要求模型在生成时按固定的结构化格式输出推理过程、答案、判定和置信度。比如自检查提示会要求模型显式地写“VERDICT: Correct/Incorrect/Unsure”和“CONFIDENCE: 0~100”之类的字段,再由程序化解析器提取。解析失败的判定统一归类为Unsure,解析失败的答案视为错误。由于有固定的fallback规则,模型的输出即使格式有瑕疵也不会让调度器直接崩溃。
训练时每轮都要给中间答案打分,这需要人工标注吗?不需要额外的人工过程式标注。SVR选的任务都是数学推理类,有标准答案或规则化检查器,每一轮生成的答案可以直接和参考答案对比自动判断对错。真正的限制在于,自动评估器的可得性决定了这个训练框架能不能迁移到其他任务上。
如果模型每轮都输出“Correct+置信度100%”,SVR是不是第一轮就该停了?训练奖励里专门设计了过度自信惩罚项:当模型在答案错误时给Correct判定且高置信度,会收到严厉的惩罚。而且固定视野训练强制模型即使第一轮“自信”了也必须继续走完后续轮次,让模型有机会看到“我第一轮其实错了但还很自信”的修正过程。最终结果显示平均停轮数是2.99轮而不是1轮,说明模型学会了在适当的谨慎和自我肯定之间找平衡。
龙哥点评
论文创新性分数:★★★★☆
自验证信号从“质量描述”升级为“计算分配控制信号”,联合判定−置信度RL的奖励设计把校准误差和目标函数直接挂钩,思路新颖且自洽。实验合理度:★★★★☆
基线覆盖全面,采样数做了严格对齐,还加了固定预算的预言机引导参考做系统级对比。唯一的小遗憾是主实验只报了一个全局阈值0.85,诊断性阈值扫描的结果没有充分展开。学术研究价值:★★★★☆
把置信度校准和自适应推理这两个原本平行的方向连了起来,对后续研究“模型何时该相信自己”这一类问题有直接的启发意义。稳定性:★★★☆☆
对阈值γ有一定敏感度,不同难度分布下最佳停止点会漂移;全局单一阈值在混合题集上能work,但还没达到“免调参”的稳健程度。适应性以及泛化能力:★★★☆☆
七个数学基准上的泛化表现扎实,但训练依赖自动评估器给中间轮次打标签,限制了向代码、工具调用、开放生成等领域的直接迁移。硬件需求及成本:★★★★☆
部署侧非常友好:2B模型加平均约3轮推理,单卡即可跑服务。训练侧需要4块A800做全参数RL,对一般研究组有一定门槛,但对工业界不算高。复现难度:★★★★☆
方法描述细致,训练框架基于ms-swift和vLLM,奖励定义也清晰。GRPO的稳定复现仍有一些工程细节要处理,但整体不算难。产品化成熟度:★★★☆☆
对数学推理类API服务而言,自适应的token节省是实打实的收益,可以直接降低推理成本。但在金融、医疗等高风险决策场景中,过早停止的风险还需要更充分的评测来兜底。可能的问题:自验证信号在高难度、多步骤推理中的可靠性仍有天花板;全局阈值γ的敏感度讨论不多;训练依赖任务特定的自动评估器,限制了范式向通用任务推广。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群。大模型群正在热议自适应测试时计算,快来一起聊!