← 返回 PaperDaily 大模型与智能体

AIES 2026新论文:AI作业能证明什么?

生成式AI最先冲击的,不是考试分数,而是“证书还能证明什么”这件事。这篇论文不跟风喊禁用或放开,而是把教育评估拆成了更硬核的四件事:能委派什么、还要证明什么、靠什么证据证明、以及如何保护学生。

AIES 2026新论文:AI作业能证明什么?
原论文信息如下:
论文标题:
What Does the Credential Still Certify? Cognitive Stewardship for AI-Mediated Education

发表日期:2026年07月

发表单位:School of Informatics, University of Edinburgh, Edinburgh, United Kingdom

原文链接:https://arxiv.org/pdf/2607.19988v1.pdf

证书还能证明什么?AI时代教育的认知管理

生成式AI一来,教育里最尴尬的事就发生了:一份看起来很漂亮的作业,未必还能证明它是学生自己“想出来、做出来、会解释”的。这篇论文没有跟风喊“全面禁用”或者“全面放开”,而是把问题拎得很清楚:证书到底还在认证什么,哪些认知工作可以委派给AI,哪些必须留给学习者本人完成。
说白了,以前很多学校默认“交上来一份作品 = 这个人会了”。现在这个等号被AI打得有点站不稳:写作、编程、翻译、总结、做方案,AI都能插一脚。问题不在于“学生有没有用AI”,而在于用了AI之后,老师还能不能从提交物里看出这个人到底学没学会。这才是这篇论文真正盯住的硬问题。
封面
图1:机构层面的AI指导,边界比证据更清楚,替代比支持更容易说清楚,但真正支撑证书有效性的证据标准和保护措施却更薄。

一个框架:把AI使用从“可以/不可以”变成“能证明什么”

论文提出了一个核心概念:educational delegation,教育委派。意思不是“AI能不能用”,而是“学习者把哪些认知操作交给了AI,哪些还必须自己保留”。这比简单的允许/禁止高明得多,因为AI在教育里扮演的角色本来就不止一种。
论文把AI介入分成了几类:access support(访问/可达性支持,比如翻译、语音转文字)、feedback support(反馈支持,比如给建议、挑毛病)、process support(过程支持,比如辅助规划、写草稿、调试代码)、substitution(替代,也就是AI直接替学习者把该做的活干了),以及output verification(输出核验,学习者检查AI结果是否正确)。
这里的关键不是分类本身,而是分类后要继续追问:这门课到底想认证什么能力?如果认证的是“会写文章”,那AI替你写完就很危险;如果认证的是“会判断AI建议对不对”,那AI反而可以成为训练材料。也就是说,政策不是先问“AI行不行”,而是先问“证书要证明谁会什么”。
表1:以教育委派为中心的评估模式示意。
表1:以教育委派为中心的评估模式示意。边界、证据和保护措施要跟“被认证的能力”一起变:基础能力可能要限制委派,专业工作流可以允许更广泛的AI辅助,但必须能解释选择;输出核验甚至可以直接变成被考核的能力。
论文把这个框架进一步收束成四个要素:学习主张委派边界证据标准保障措施。学习主张是学校要认证的能力;委派边界是AI能干什么;证据标准是学生还要拿出什么来证明自己;保障措施则负责把隐私、公平、可达性、申诉、替代路径这些事兜住。
这套设计最有价值的地方在于,它把“AI治理”从一种情绪判断,改成了一个可操作的证据逻辑。学校不能只会说“这个能用,那个不能用”,还得回答:为什么这样用之后,证书仍然可信。这才是认知管理的本体,不是管机器,是管“证书和能力之间那根线”有没有断。

案例拆解:写作课和编程课怎么调整?

论文没有停留在抽象口号上,而是拿写作课和编程课做了两个很接地气的例子。因为这两门课最容易被AI“顺手接管”,也最容易暴露一个事实:最终作品漂亮,不等于学习过程真实
先看写作课。传统写作作业往往默认,交上来的文章就能证明学生会找资料、会组织论证、会修改表达。但在AI时代,这个默认值有点站不住。一个学生完全可能让AI帮忙选题、搭框架、找引用、润色语言,最后交出一篇“看起来像人写的好文章”。如果学校还按老办法只看成品,就会把“AI写得不错”误判成“学生学得不错”。
所以论文建议把写作课拆成多个证据点:前期可以要求学生做选题说明、资料地图、初稿批注;中间可以安排AI反馈工作坊,看学生如何接受或拒绝建议;最后除了成文,还要有一份修订说明或口头答辩。这样一来,AI可以参与反馈和润色,但学生必须展示自己对论证、来源、修改决策的把握。真正被认证的不是“文章长得好”,而是“学生知道为什么这样写”
再看编程课。这里的坑更明显。完全禁止AI代码生成,听起来像是在保护基本功,但也容易和真实工作流脱节;完全放开,又会出现“学生连自己交了什么都看不懂”的尴尬局面。论文给出的思路是:把基础能力和专业流程分开考。短小任务里保留无AI或极少AI的调试、追踪、错误定位;项目任务里允许AI写样板代码、生成测试、辅助重构,但要求学生解释设计选择、跑通测试、指出AI生成代码中的错误,并说明修复过程。
这套做法很像把“会开车”和“会用导航”分开考。未来工作里,导航几乎一定会用;但如果连方向盘、刹车、路况判断都没练过,那导航越聪明,出事越快。编程也是一样,AI能写代码不代表学生会编程,学生要证明的是:能读、能改、能测、能负责
表1:以教育委派为中心的评估模式示意。
表1里的例子其实已经把这个逻辑说透了:基础流利度、反馈吸收、专业工作流、输出核验、高风险证书,这几类场景的边界完全不同。真正聪明的政策,不是给所有课程发同一张“AI通行证”,而是根据被认证的能力,决定AI能帮到哪一步。

30所大学政策审计:分类能力超强,证明逻辑薄弱

论文接着做了一件很实在的事:去审计了30所大学公开发布的生成式AI评估指导。这里用的是一个预先设定好的评分代码本,简单说就是一套写死的规则,拿来检查公开政策有没有把“学习主张、边界、证据、保障”说清楚。为了减少单一模型偏差,研究里让4个开源大模型按同一套规则去编码,再取平均值。
这一步很重要,因为它不是在测“学校有没有文件”,而是在测“文件能不能被学生和老师读懂并用起来”。也就是说,公开政策是不是只会说“可以/不可以”,还是能进一步说明:为什么这样做后,作业仍然能作为证书证据
图1:机构层面的AI指导,边界比证据更清楚。
图1:机构层面的AI指导,边界比证据更清楚,替代比支持更容易写明白,但真正支撑证书有效性的证据标准和保护措施却更薄。
审计结果最扎眼的地方,是边界语言明显比证据语言更强。很多学校能比较顺手地写出“什么能用、什么不能用、什么要披露”,但一到“学生还必须证明什么”就开始含糊。换句话说,政策越来越像交通规则,知道哪条路能走;但像不像考试说明书,就不一定了。
表2:30所大学政策审计中的经验模式。
表2:30所大学政策审计中的经验模式。边界语言超过证据语言,保障措施稀疏,替代场景最清楚,整体上更像“分类政策”而不是“证书有效性治理”。
论文还做了六类场景压力测试,包括访问支持、反馈支持、过程支持、替代、输出核验,以及编程工作流。结果很有意思:AI替代最容易被说清楚,因为它最像传统意义上的“代做”;但越接近真实学习支持,政策越容易出现“能不能用说了,怎么证明却没说”的情况。
图2:六类场景下的政策回答类别。
图2:六类场景下的政策回答类别。证据很薄的条件往往只能给出“条件性允许”的回答,却拿不出真正可用的证据要求;而更可操作的政策,会把条件、证据和保障一起说清楚。
保障措施这块也挺能说明问题。隐私是最常见的,说明学校知道“别乱上传学生数据”;但申诉、可达性、工具公平、供应商治理、非AI替代路径这些,出现得就没那么稳定了。也就是说,很多政策更像是在管“AI使用痕迹”,而不是在保护“公平证据”。这就有点尴尬了:监控做得越像样,不代表评估越公平
图3:30所机构的政策原型与分组数量。
图3:30所机构的政策原型与分组数量。这个图最想传达的不是“谁更严谁更松”,而是政策清晰度更像一条设计梯度:有没有把边界、证据和保障连成一条线,差别非常大。
表4:政策原型分类。
表4:政策原型分类。经验模式并不是简单的“宽松 vs 严格”,真正的分界线是政策有没有把边界和证据、保障连起来。
如果把结果压缩成一句话,就是:很多大学已经会“分类AI使用”,但还不会“证明证书为什么仍然成立”。这不是一个小缺口,而是评估逻辑的核心缺口。会写规则,不等于会设计证据;会管理风险,不等于会保护学习。
表5:匿名政策画像。
表5:匿名政策画像。这里的重点不是点名哪所学校,而是看公开文本在“边界—证据—保障”的连接上到底缺了哪一块。

结论:政策要的是“证据”,不是“监管”

这篇论文最值得记住的,不是它又发明了一个新词,而是它把教育AI治理的重心往前推了一步:真正该管的不是“AI有没有碰过作业”,而是“作业还能不能证明学习者具备被认证的能力”
这套思路对学校很现实。以后如果还用一句“AI禁止”或者“AI允许”来糊弄,迟早会撞上两个问题:一是评估和真实工作流脱节,二是证书越来越像“流程合规证明”,而不是“能力证明”。论文给出的方向是,政策必须把证据写出来,把边界写清楚,把保障也写到位。否则,文件看上去很完整,实际上证书的逻辑已经漏风了。
从工程视角看,这篇工作也挺有启发:它不是在做一个“万能检测器”,而是在做一套证据设计框架。这比单纯查AI痕迹靠谱得多,因为真正稳定的治理,往往不是抓作弊,而是把考试、作业、项目、答辩、反馈、申诉这些环节重新串起来。
当然,这篇论文也有边界。它的审计基于公开政策文本,能看见“说了什么”,但不一定完全看见“学校实际怎么做”;四个开源大模型做编码能提高稳定性,但也不能替代专家人工核查。可即便如此,它仍然把一个长期被混在一起的问题拆开了:AI治理不是单纯的风控,教育证书也不是单纯的流程审批

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它解决的是教育里一个越来越棘手的老问题:作业和项目还能不能证明学生真的会了。AI出现后,单看成品已经不够,论文提出要把“能委派什么、还要证明什么、靠什么证据证明”重新讲清楚。

文中的“cognitive stewardship”是什么意思?可以理解成“认知管理”或者“认知托管”,强调学校要管理AI和人类之间的认知分工,但不是为了管死,而是为了让学习、证据、公平和责任还能对得上号。

为什么论文说“边界比证据更清楚”很危险?因为只说AI能不能用,只能说明规则;真正决定证书是否有效的,是学生还必须拿出什么证据来证明自己。边界清楚但证据模糊,就像交通灯很亮,但地图没画,开车还是容易迷路。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“AI能不能用”提升到“证书还能证明什么”,切中了教育AI治理的关键痛点,框架感很强。

实验合理度:★★★★☆

公开政策审计的设计比较扎实,四模型编码也比单模型稳一些,但仍然属于文本治理审计,不是行为层面的全量验证。

学术研究价值:★★★★★

把教育评估、AI治理和证书有效性连起来了,研究问题非常正,后续能继续长出很多实证和政策工作。

稳定性:★★★☆☆

框架本身稳,但落地效果高度依赖学校是否愿意重做作业设计和证据设计,单靠一纸政策不够。

适应性以及泛化能力:★★★★☆

适用于写作、编程、设计、研究训练等多类任务,但不同学科要重新定义“什么算证据”。

硬件需求及成本:★★★★★

几乎不吃硬件,主要成本在政策设计、课程重构和人工审核,不是算力烧钱型工作。

复现难度:★★★☆☆

方法和代码本身不复杂,但公开政策的收集、清洗、编码和一致性控制需要比较细的人工工作。

产品化成熟度:★★★☆☆

可作为高校AI教学治理和课程设计的参考框架,但要真正产品化,还需要结合学科、年级、风险等级做细化模板。

可能的问题:公开政策审计看得到“说法”,看不到“执行”;框架很漂亮,但学校若不重做作业和答辩设计,落地还是会打折。


主要参考文献

Kai Yao. What Does the Credential Still Certify? Cognitive Stewardship for AI-Mediated Education. AIES 2026.
原文链接:https://arxiv.org/pdf/2607.19988v1.pdf

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。