← 返回 PaperDaily
大模型与智能体
EMNLP 2026新方法Epi2Diff:靠推理片段预测题目难度,SAT平均提升8.1%
题目难度不只是“题面难不难”,更像是“解题过程有多折腾”。这篇论文把大模型推理轨迹拆成认知片段,再去预测人类会觉得题有多难,思路挺对路。
龙哥读论文
发布于 2026-08-20 00:20:05
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥导读: 题目难度不只是“题面难不难”,更像是“解题过程有多折腾”。这篇论文把大模型推理轨迹拆成认知片段,再去预测人类会觉得题有多难,思路挺对路。
原论文信息如下:
题目难度预测这件事,表面看像是在猜“这道题有多难”,本质上却是在猜“人会在这道题上折腾多久、卡在哪一步、要付出多少脑力”。只盯着题面文本,往往只能看到冰山一角;真正决定难度的,常常是解题过程里那些看不见的认知负担。
这篇论文的切入点很有意思:不再把大语言模型的推理轨迹当成一段“长文本”,而是把它拆成一串有功能分工的认知片段 ,再用这些片段去预测人类会觉得题目有多难。说白了,就是不看AI“说了多少”,而是看它“怎么想、怎么绕、怎么返工”。
图1:Epi2Diff整体框架示意图。先生成大语言模型推理轨迹,再把每一句映射成认知片段,提取长度、片段分布和转移特征,最后与题目语义嵌入融合,用于人类试题难度预测。
预测人类试题难度:只靠文本还不够
题目难度预测并不是新问题。教育测量里早就有经典的经典测验理论 和项目反应理论 (CTT/IRT)来估计题目难度,但这些方法有个老毛病:要先收集大量考生作答数据,成本高、周期长,新题尤其难受。题目还没正式上线,先得拿去“实测一遍”,这对出题方来说一点也不优雅。
后来,文本特征、BERT、RoBERTa 这类小模型开始接棒,能从题干里直接学难度信号。但问题也很明显:题面文本能告诉模型“这题长什么样”,却不一定告诉模型“人做这题时会怎么卡”。在教育场景里,难度不是纯语义属性,更像是题目诱发的解题负担 。同样一段文字,有的题看着平平无奇,做起来却像在原地拧螺丝;有的题看着唬人,实际就是纸老虎。
这篇论文的判断很直接:只看题面,不够;要看解题过程留下了什么痕迹。 于是,作者把目光转向了大语言模型的推理轨迹。大模型现在不只是“给答案”,很多时候还会吐出一长串思考过程。虽然这些过程不是人类大脑的直接记录,但至少是一个可规模化的“解题代理信号”,比单纯盯着题干更接近真实难度形成机制。
核心秘籍:认知片段——从“想多久”到“怎么想”
要把推理轨迹变成可用信号,第一步不是算长度,而是先给它“分段贴标签”。论文借用了 Schoenfeld 的 Episode Theory(认知片段理论 )来描述解题过程。这里的 episode 不是电视剧集,而是解题过程中功能不同的状态片段:Read(阅读)、Analyze(分析)、Plan(计划)、Implement(实施)、Explore(探索)、Verify(验证)、Monitor(监控)。论文还额外加了一个 Answer(作答)片段,用来表示最终答案提交。这样一来,一段乱糟糟的推理文本,就被拆成了更像“解题流程图”的结构。
这一步的关键不在于“分得多细”,而在于“分得有没有意义”。如果只统计总字数,那很多信息会被冲掉:有的题是一路猛冲型,有的题是反复验证型,有的题则是先读半天、再计划、再实施、最后还要回头检查。对难度预测而言,这些差别比单纯的长度更重要。因为真正让人累的,往往不是字数本身,而是脑子被迫来回切换状态。
从实现上看,论文先用 ThinkARM 的句子级标注数据训练了一个认知片段分类器。ThinkARM 数据来自 Omni-MATH 推理轨迹,并由 GPT-5 标注,再配合人工验证集做测试。分类器本身用的是 RoBERTa,最终在人工金标准测试集上拿到 0.799 的准确率和 0.761 的宏平均 F1。这个分类器随后就被当成自动贴标签器,用来给新的推理轨迹逐句打上认知片段标签。换句话说,先训练一个“识别解题状态”的小助手,再让它去批量给推理轨迹做结构化。
这一步听起来朴素,实际上很关键。因为原始推理轨迹往往又长又啰嗦,里面有重复、废话、修正和自我打断。直接把整段文本喂给下游模型,容易把“噪声”也当成“信号”。认知片段的价值就在于:它把原本散乱的过程,压缩成了少量更稳定的功能状态,既保留了过程信息,又降低了输入的混乱度。
Epi2Diff框架:语义+过程特征的强强联合
Epi2Diff,全称是 Episode to Difficulty ,意思很直白:把“认知片段”映射成“题目难度”。它不是只看一个信号,而是把题目表示拆成两部分:一部分是题目本身的语义嵌入,另一部分是推理轨迹诱发的过程特征。前者回答“这题讲的是什么”,后者回答“这题会把人折腾成什么样”。
过程特征一共分三类。第一类是长度特征 ,包括总 token 长度、思考部分长度和答案部分长度。这个特征很朴素,但很有必要,因为有些题确实会逼着模型“多想几轮”。第二类是片段分布特征 ,统计每种认知片段各占多少 token、占比多大。第三类是转移特征 ,记录片段之间是怎么跳转的,比如从 Analyze 跳到 Implement 的次数,或者从 Verify 回到 Plan 的次数。
这里最值得注意的是转移特征。很多人做过程建模时只爱数“出现了什么”,不爱看“怎么流动”。但解题过程恰恰是动态的:先读、再分析、再实施、再验证,或者反过来验证失败后回去重做。两道题如果片段占比差不多,转移模式仍可能完全不同,而这种不同往往更能反映难度。简单说,题目难不难,不只是看脑力花了多少,还要看脑力是不是被迫反复折返。
在最终预测时,论文还引入了“多角色”推理:让模型分别扮演直接解题者、弱学生、中等学生和强学生,生成多组轨迹,再把这些轨迹的过程特征做聚合。这个设计挺聪明,因为同一道题对不同水平的人来说,解题负担并不一样。强者可能一眼看穿,弱者可能在第一步就开始迷路。把不同“学生视角”都纳入进来,能让表示更稳,也更接近真实教育场景。
最后,下游并没有上一个复杂神经网络,而是用 XGBoost 做分类或回归。这个选择很务实:当特征已经被结构化到位时,树模型往往比再堆一个大模型更稳、更省算力,也更方便看特征重要性。论文不是在比谁的参数多,而是在比谁能把“过程证据”组织得更像样。
四大基准测试上的全面超越,解读背后过程证据
论文在四个真实教育基准上做了验证:SAT Math、SAT Reading & Writing、Cambridge English Qualifications 和 USMLE。前两个是分类任务,后两个是回归任务。对比对象也很全,既有 BERT、RoBERTa、ModernBERT 这类小模型微调方案,也有 GPT-4o、GPT-5、QwQ-32B、Qwen3-32B 这类零样本和少样本提示方案,还有全参数微调与 LoRA 微调的 LLM 方案。这个对比面算是比较完整,没有故意挑软柿子捏。
结果非常清楚:Epi2Diff 在四个测试集上都拿到了最好成绩。尤其值得注意的是,很多看起来“更大、更强”的 LLM 提示方法,在这些任务上并没有占到便宜,甚至在回归任务里连 R² 都能掉成负数,场面有点尴尬。反而是把推理轨迹结构化之后,再交给 XGBoost 这种朴素但靠谱的模型,效果更稳定。这说明题目难度预测并不等于“让大模型直接说难不难”,而是要把大模型的过程信息变成可学习的证据。
更有意思的是,SAT Math 的提升最明显。这个结果和方法设计是对得上的:数学题通常更依赖多步推理、步骤验证和中间状态管理,正好是认知片段最擅长刻画的地方。阅读题也有提升,但幅度相对温和,说明过程特征并不是“万金油”,它更擅长抓住需要多轮思考和多次切换状态的题目。
消融结果最能说明问题。只用语义特征,效果不算差,但明显不够;只用长度特征,基本就是“看谁写得长”;只用片段分布或只用转移特征,都会比纯长度更有信息量;而语义与过程特征联合后,效果最好。换句话说,题目本身讲什么,和题目会把人怎么折腾,这两部分缺一不可。光有题面像看说明书,光有过程像看监控录像,合起来才像一份完整的案件卷宗。
特征重要性分析进一步把这件事说透了。真正有用的并不是“推理越长越难”这么粗暴的结论,而是某些片段类型和转移模式更能区分题目难度。比如 Implement 占比上升、Verify 占比下降、Analyze 增多,往往对应更难的题。这个现象很合理:难题通常不会让模型一路顺滑输出,而是逼着它进入更多实施与修正环节,甚至在局部来回试错。
这里还能看出一个很重要的结论:难题不只是更长,而是更结构化、更操劳。 更长只是表象,真正的差异在于认知资源被如何分配、如何反复切换、如何在验证失败后重新组织思路。这个发现对教育测量很有价值,因为它给“难度”提供了比文本长度更接近机制层面的解释。
“难”题的本质:不只是更长,而是更结构化、更“操劳”的解题过程
如果只看字数,很多人会误以为“长就是难”。但这篇论文给出的答案更成熟:长不一定难,乱才难;更准确地说,是需要更多实施、验证和状态切换的题更难 。这也是为什么认知片段比简单长度更有解释力。它不是在统计“说了多少”,而是在统计“思路怎么跑偏、怎么回头、怎么重组”。
当然,这个方法也不是没有边界。首先,认知片段标签来自自动分类器,虽然效果不错,但本质上还是代理标注,不是人脑扫描仪。其次,推理轨迹来自大模型,模型的“思考方式”并不等同于人类真实解题过程,所以它更适合作为可规模化的过程信号,而不是心理学意义上的直接证据。最后,这套方法对推理轨迹质量有依赖,如果模型输出本身很乱、很短、或者根本不按套路来,过程特征也会被削弱。
控制实验也很重要。它证明了提升不是单纯因为“生成了更多轨迹”,而是因为“不同能力角色”带来了更丰富、更有区分度的过程视角。这个细节挺关键,说明作者不是靠堆采样骗分数,而是确实在利用角色条件化的推理差异来增强表示。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“如何更可解释地预测人类会觉得一道题有多难”。核心做法不是只看题面文本,而是把大语言模型的推理轨迹拆成认知片段,再从片段长度、分布和转移模式里提取过程证据。
认知片段里的 Read、Implement、Verify 是什么意思? Read 是阅读题目,Analyze 是分析信息,Plan 是规划步骤,Implement 是真正动手推导,Verify 是检查结果,Monitor 是监控过程,Explore 是探索备选思路,Answer 是最后提交答案。它们合起来描述的是解题过程的功能状态,而不是普通文本分句。
为什么不用更大的模型直接预测难度? 因为“更大”不等于“更懂教育测量”。实验里,很多 LLM 提示和微调方法并没有稳定胜过结构化过程特征。题目难度不是让模型随口猜一个标签,而是要把过程中的负担、切换和验证行为提炼出来,这恰好是结构化特征更擅长的地方。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆。把大模型推理轨迹结构化成认知片段,再用于人类题目难度预测,这个思路比单纯做文本分类更有新意,也更贴近教育测量的过程视角。
实验合理度: ★★★★☆。基准、对比和消融都比较完整,尤其是控制推理次数的实验,能说明提升不是靠“多生成几次”糊出来的。
学术研究价值: ★★★★☆。它把“题目难度”从静态文本问题推进到过程建模问题,对教育评估和可解释建模都有启发。
稳定性: ★★★☆☆。方法有结构,但依赖推理轨迹质量和自动片段标注,换模型、换领域时还需要再验证。
适应性以及泛化能力: ★★★☆☆。在 SAT、Cambridge、USMLE 上有效,说明有一定泛化性,但更像是适合“有推理过程”的题目,而非所有场景都通吃。
硬件需求及成本: ★★★★☆。下游用 XGBoost,推理特征又是结构化统计,训练和部署成本不高;真正贵的是前面的轨迹生成与标注,但整体仍比大模型端到端微调更省。
复现难度: ★★★☆☆。代码开源是加分项,但依赖外部大模型轨迹、句子级标注和多数据集处理,完整复现仍有一定门槛。
产品化成熟度: ★★★☆☆。适合教育测量、题库预估、出题辅助等场景做原型,但离“直接上线替代人工标定”还有距离。
可能的问题: 认知片段来自代理标注而非真实人类过程,且对推理轨迹质量敏感;方法更像“高质量辅助证据”,不是一把能砍平所有题型的万能刀。
主要参考文献
Chenguang Wang, Ming Li, Xinyue Zeng, Zhuochun Li, Hong Jiao, Tianyi Zhou, Dawei Zhou. Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction. arXiv:2606.28186v1, 2026.
项目主页:https://github.com/c-steve-wang/Epi2Diff
原文链接:https://arxiv.org/pdf/2606.28186v1.pdf
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群