← 返回 PaperDaily 大模型与智能体

EMNLP 2026新方法Epi2Diff:靠推理片段预测题目难度,SAT平均提升8.1%

题目难度不只是“题面难不难”,更像是“解题过程有多折腾”。这篇论文把大模型推理轨迹拆成认知片段,再去预测人类会觉得题有多难,思路挺对路。

EMNLP 2026新方法Epi2Diff:靠推理片段预测题目难度,SAT平均提升8.1%
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥导读:
题目难度不只是“题面难不难”,更像是“解题过程有多折腾”。这篇论文把大模型推理轨迹拆成认知片段,再去预测人类会觉得题有多难,思路挺对路。


原论文信息如下:
论文标题:
Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
发表日期:
2026年06月
发表单位:
Virginia Tech, University of Maryland, MBZUAI, University of Pittsburgh
原文链接:
https://arxiv.org/pdf/2606.28186v1.pdf
开源代码链接:
https://github.com/c-steve-wang/Epi2Diff
项目链接:
https://github.com/c-steve-wang/Epi2Diff
题目难度预测这件事,表面看像是在猜“这道题有多难”,本质上却是在猜“人会在这道题上折腾多久、卡在哪一步、要付出多少脑力”。只盯着题面文本,往往只能看到冰山一角;真正决定难度的,常常是解题过程里那些看不见的认知负担。
这篇论文的切入点很有意思:不再把大语言模型的推理轨迹当成一段“长文本”,而是把它拆成一串有功能分工的认知片段,再用这些片段去预测人类会觉得题目有多难。说白了,就是不看AI“说了多少”,而是看它“怎么想、怎么绕、怎么返工”。
图1:Epi2Diff整体框架示意图。先生成大语言模型推理轨迹,再把每一句映射成认知片段,提取长度、片段分布和转移特征,最后与题目语义嵌入融合,用于人类试题难度预测。

预测人类试题难度:只靠文本还不够

题目难度预测并不是新问题。教育测量里早就有经典的经典测验理论项目反应理论(CTT/IRT)来估计题目难度,但这些方法有个老毛病:要先收集大量考生作答数据,成本高、周期长,新题尤其难受。题目还没正式上线,先得拿去“实测一遍”,这对出题方来说一点也不优雅。
后来,文本特征、BERT、RoBERTa 这类小模型开始接棒,能从题干里直接学难度信号。但问题也很明显:题面文本能告诉模型“这题长什么样”,却不一定告诉模型“人做这题时会怎么卡”。在教育场景里,难度不是纯语义属性,更像是题目诱发的解题负担。同样一段文字,有的题看着平平无奇,做起来却像在原地拧螺丝;有的题看着唬人,实际就是纸老虎。
这篇论文的判断很直接:只看题面,不够;要看解题过程留下了什么痕迹。于是,作者把目光转向了大语言模型的推理轨迹。大模型现在不只是“给答案”,很多时候还会吐出一长串思考过程。虽然这些过程不是人类大脑的直接记录,但至少是一个可规模化的“解题代理信号”,比单纯盯着题干更接近真实难度形成机制。

核心秘籍:认知片段——从“想多久”到“怎么想”

要把推理轨迹变成可用信号,第一步不是算长度,而是先给它“分段贴标签”。论文借用了 Schoenfeld 的 Episode Theory(认知片段理论)来描述解题过程。这里的 episode 不是电视剧集,而是解题过程中功能不同的状态片段:Read(阅读)、Analyze(分析)、Plan(计划)、Implement(实施)、Explore(探索)、Verify(验证)、Monitor(监控)。论文还额外加了一个 Answer(作答)片段,用来表示最终答案提交。这样一来,一段乱糟糟的推理文本,就被拆成了更像“解题流程图”的结构。
这一步的关键不在于“分得多细”,而在于“分得有没有意义”。如果只统计总字数,那很多信息会被冲掉:有的题是一路猛冲型,有的题是反复验证型,有的题则是先读半天、再计划、再实施、最后还要回头检查。对难度预测而言,这些差别比单纯的长度更重要。因为真正让人累的,往往不是字数本身,而是脑子被迫来回切换状态。
表9:不同难度题目的代表性推理轨迹特征
表9:Qwen3-32B生成的代表性 SAT 数学推理轨迹特征。随着难度上升,总推理长度和 Implement(实施)占比增加,而 Verify(验证)和 Read(阅读)占比下降;Analyze(分析)也会增加。
从实现上看,论文先用 ThinkARM 的句子级标注数据训练了一个认知片段分类器。ThinkARM 数据来自 Omni-MATH 推理轨迹,并由 GPT-5 标注,再配合人工验证集做测试。分类器本身用的是 RoBERTa,最终在人工金标准测试集上拿到 0.799 的准确率和 0.761 的宏平均 F1。这个分类器随后就被当成自动贴标签器,用来给新的推理轨迹逐句打上认知片段标签。换句话说,先训练一个“识别解题状态”的小助手,再让它去批量给推理轨迹做结构化。
这一步听起来朴素,实际上很关键。因为原始推理轨迹往往又长又啰嗦,里面有重复、废话、修正和自我打断。直接把整段文本喂给下游模型,容易把“噪声”也当成“信号”。认知片段的价值就在于:它把原本散乱的过程,压缩成了少量更稳定的功能状态,既保留了过程信息,又降低了输入的混乱度。

Epi2Diff框架:语义+过程特征的强强联合

Epi2Diff,全称是 Episode to Difficulty,意思很直白:把“认知片段”映射成“题目难度”。它不是只看一个信号,而是把题目表示拆成两部分:一部分是题目本身的语义嵌入,另一部分是推理轨迹诱发的过程特征。前者回答“这题讲的是什么”,后者回答“这题会把人折腾成什么样”。
图2:认知片段标注与特征抽取流程
图2:认知片段标注与特征抽取流程示意。推理轨迹先切分为句子,再由片段分类器逐句标注为八类认知状态,随后统计长度、片段分布和转移特征。
过程特征一共分三类。第一类是长度特征,包括总 token 长度、思考部分长度和答案部分长度。这个特征很朴素,但很有必要,因为有些题确实会逼着模型“多想几轮”。第二类是片段分布特征,统计每种认知片段各占多少 token、占比多大。第三类是转移特征,记录片段之间是怎么跳转的,比如从 Analyze 跳到 Implement 的次数,或者从 Verify 回到 Plan 的次数。
图3:题目语义与过程特征的联合表示
图3:题目语义表示与过程表示的联合方式。语义嵌入来自 Sentence-BERT,过程表示由长度、片段分布和转移矩阵拼接而成,最后形成统一的题目表示。
这里最值得注意的是转移特征。很多人做过程建模时只爱数“出现了什么”,不爱看“怎么流动”。但解题过程恰恰是动态的:先读、再分析、再实施、再验证,或者反过来验证失败后回去重做。两道题如果片段占比差不多,转移模式仍可能完全不同,而这种不同往往更能反映难度。简单说,题目难不难,不只是看脑力花了多少,还要看脑力是不是被迫反复折返。
在最终预测时,论文还引入了“多角色”推理:让模型分别扮演直接解题者、弱学生、中等学生和强学生,生成多组轨迹,再把这些轨迹的过程特征做聚合。这个设计挺聪明,因为同一道题对不同水平的人来说,解题负担并不一样。强者可能一眼看穿,弱者可能在第一步就开始迷路。把不同“学生视角”都纳入进来,能让表示更稳,也更接近真实教育场景。
最后,下游并没有上一个复杂神经网络,而是用 XGBoost 做分类或回归。这个选择很务实:当特征已经被结构化到位时,树模型往往比再堆一个大模型更稳、更省算力,也更方便看特征重要性。论文不是在比谁的参数多,而是在比谁能把“过程证据”组织得更像样。

四大基准测试上的全面超越,解读背后过程证据

论文在四个真实教育基准上做了验证:SAT Math、SAT Reading & Writing、Cambridge English Qualifications 和 USMLE。前两个是分类任务,后两个是回归任务。对比对象也很全,既有 BERT、RoBERTa、ModernBERT 这类小模型微调方案,也有 GPT-4o、GPT-5、QwQ-32B、Qwen3-32B 这类零样本和少样本提示方案,还有全参数微调与 LoRA 微调的 LLM 方案。这个对比面算是比较完整,没有故意挑软柿子捏。
表1:四个基准上的主结果
表1:四个题目难度预测基准上的主结果。Epi2Diff 在 SAT Math、SAT Reading、Cambridge 和 USMLE 上都取得了最优表现;其中 SAT 相关分类任务上的平均相对提升达到 8.1%,回归任务上也明显优于强基线。
结果非常清楚:Epi2Diff 在四个测试集上都拿到了最好成绩。尤其值得注意的是,很多看起来“更大、更强”的 LLM 提示方法,在这些任务上并没有占到便宜,甚至在回归任务里连 R² 都能掉成负数,场面有点尴尬。反而是把推理轨迹结构化之后,再交给 XGBoost 这种朴素但靠谱的模型,效果更稳定。这说明题目难度预测并不等于“让大模型直接说难不难”,而是要把大模型的过程信息变成可学习的证据。
更有意思的是,SAT Math 的提升最明显。这个结果和方法设计是对得上的:数学题通常更依赖多步推理、步骤验证和中间状态管理,正好是认知片段最擅长刻画的地方。阅读题也有提升,但幅度相对温和,说明过程特征并不是“万金油”,它更擅长抓住需要多轮思考和多次切换状态的题目。
表2:SAT Math上的消融实验
表2:SAT Math 上的消融实验。这里分别比较了仅语义、仅长度、仅片段分布、仅转移,以及它们的组合效果,能看出过程特征不是摆设。
消融结果最能说明问题。只用语义特征,效果不算差,但明显不够;只用长度特征,基本就是“看谁写得长”;只用片段分布或只用转移特征,都会比纯长度更有信息量;而语义与过程特征联合后,效果最好。换句话说,题目本身讲什么,和题目会把人怎么折腾,这两部分缺一不可。光有题面像看说明书,光有过程像看监控录像,合起来才像一份完整的案件卷宗。
表3:特征重要性分析
表3:SAT Math 上的特征重要性总结,结合置换重要性与 SHAP 重要性分析,展示了哪些过程特征更能影响预测。
特征重要性分析进一步把这件事说透了。真正有用的并不是“推理越长越难”这么粗暴的结论,而是某些片段类型和转移模式更能区分题目难度。比如 Implement 占比上升、Verify 占比下降、Analyze 增多,往往对应更难的题。这个现象很合理:难题通常不会让模型一路顺滑输出,而是逼着它进入更多实施与修正环节,甚至在局部来回试错。
图4:不同题目难度下的代表性片段分布
图4:不同难度题目的代表性片段分布对比。更难的题通常伴随更高的实施负担和更复杂的状态切换。
图5:不同题目难度下的转移热力图
图5:不同难度题目的转移热力图。高难度题目的状态转移更“折腾”,验证、实施和分析之间的往返更频繁。
这里还能看出一个很重要的结论:难题不只是更长,而是更结构化、更操劳。更长只是表象,真正的差异在于认知资源被如何分配、如何反复切换、如何在验证失败后重新组织思路。这个发现对教育测量很有价值,因为它给“难度”提供了比文本长度更接近机制层面的解释。

“难”题的本质:不只是更长,而是更结构化、更“操劳”的解题过程

如果只看字数,很多人会误以为“长就是难”。但这篇论文给出的答案更成熟:长不一定难,乱才难;更准确地说,是需要更多实施、验证和状态切换的题更难。这也是为什么认知片段比简单长度更有解释力。它不是在统计“说了多少”,而是在统计“思路怎么跑偏、怎么回头、怎么重组”。
图6:代表性题目级认知片段画像
图6:代表性题目级认知片段画像。不同题目在片段结构、长度和转移模式上会呈现出明显差异。
当然,这个方法也不是没有边界。首先,认知片段标签来自自动分类器,虽然效果不错,但本质上还是代理标注,不是人脑扫描仪。其次,推理轨迹来自大模型,模型的“思考方式”并不等同于人类真实解题过程,所以它更适合作为可规模化的过程信号,而不是心理学意义上的直接证据。最后,这套方法对推理轨迹质量有依赖,如果模型输出本身很乱、很短、或者根本不按套路来,过程特征也会被削弱。
表8:匹配推理次数的控制实验
表8:匹配推理次数的控制实验。即便推理次数相同,只要引入了能力分层的角色设定,效果仍然更好,说明提升并不只是“多采样”带来的。
控制实验也很重要。它证明了提升不是单纯因为“生成了更多轨迹”,而是因为“不同能力角色”带来了更丰富、更有区分度的过程视角。这个细节挺关键,说明作者不是靠堆采样骗分数,而是确实在利用角色条件化的推理差异来增强表示。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“如何更可解释地预测人类会觉得一道题有多难”。核心做法不是只看题面文本,而是把大语言模型的推理轨迹拆成认知片段,再从片段长度、分布和转移模式里提取过程证据。

认知片段里的 Read、Implement、Verify 是什么意思?Read 是阅读题目,Analyze 是分析信息,Plan 是规划步骤,Implement 是真正动手推导,Verify 是检查结果,Monitor 是监控过程,Explore 是探索备选思路,Answer 是最后提交答案。它们合起来描述的是解题过程的功能状态,而不是普通文本分句。

为什么不用更大的模型直接预测难度?因为“更大”不等于“更懂教育测量”。实验里,很多 LLM 提示和微调方法并没有稳定胜过结构化过程特征。题目难度不是让模型随口猜一个标签,而是要把过程中的负担、切换和验证行为提炼出来,这恰好是结构化特征更擅长的地方。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把大模型推理轨迹结构化成认知片段,再用于人类题目难度预测,这个思路比单纯做文本分类更有新意,也更贴近教育测量的过程视角。

实验合理度:★★★★☆。基准、对比和消融都比较完整,尤其是控制推理次数的实验,能说明提升不是靠“多生成几次”糊出来的。

学术研究价值:★★★★☆。它把“题目难度”从静态文本问题推进到过程建模问题,对教育评估和可解释建模都有启发。

稳定性:★★★☆☆。方法有结构,但依赖推理轨迹质量和自动片段标注,换模型、换领域时还需要再验证。

适应性以及泛化能力:★★★☆☆。在 SAT、Cambridge、USMLE 上有效,说明有一定泛化性,但更像是适合“有推理过程”的题目,而非所有场景都通吃。

硬件需求及成本:★★★★☆。下游用 XGBoost,推理特征又是结构化统计,训练和部署成本不高;真正贵的是前面的轨迹生成与标注,但整体仍比大模型端到端微调更省。

复现难度:★★★☆☆。代码开源是加分项,但依赖外部大模型轨迹、句子级标注和多数据集处理,完整复现仍有一定门槛。

产品化成熟度:★★★☆☆。适合教育测量、题库预估、出题辅助等场景做原型,但离“直接上线替代人工标定”还有距离。

可能的问题:认知片段来自代理标注而非真实人类过程,且对推理轨迹质量敏感;方法更像“高质量辅助证据”,不是一把能砍平所有题型的万能刀。


主要参考文献

Chenguang Wang, Ming Li, Xinyue Zeng, Zhuochun Li, Hong Jiao, Tianyi Zhou, Dawei Zhou. Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction. arXiv:2606.28186v1, 2026.
项目主页:https://github.com/c-steve-wang/Epi2Diff
原文链接:https://arxiv.org/pdf/2606.28186v1.pdf

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。