论文接着做了一件很实在的事:去审计了30所大学公开发布的生成式AI评估指导。这里用的是一个预先设定好的评分代码本,简单说就是一套写死的规则,拿来检查公开政策有没有把“学习主张、边界、证据、保障”说清楚。为了减少单一模型偏差,研究里让4个开源大模型按同一套规则去编码,再取平均值。这一步很重要,因为它不是在测“学校有没有文件”,而是在测“文件能不能被学生和老师读懂并用起来”。也就是说,公开政策是不是只会说“可以/不可以”,还是能进一步说明:为什么这样做后,作业仍然能作为证书证据。图1:机构层面的AI指导,边界比证据更清楚,替代比支持更容易写明白,但真正支撑证书有效性的证据标准和保护措施却更薄。审计结果最扎眼的地方,是边界语言明显比证据语言更强。很多学校能比较顺手地写出“什么能用、什么不能用、什么要披露”,但一到“学生还必须证明什么”就开始含糊。换句话说,政策越来越像交通规则,知道哪条路能走;但像不像考试说明书,就不一定了。表2:30所大学政策审计中的经验模式。边界语言超过证据语言,保障措施稀疏,替代场景最清楚,整体上更像“分类政策”而不是“证书有效性治理”。论文还做了六类场景压力测试,包括访问支持、反馈支持、过程支持、替代、输出核验,以及编程工作流。结果很有意思:AI替代最容易被说清楚,因为它最像传统意义上的“代做”;但越接近真实学习支持,政策越容易出现“能不能用说了,怎么证明却没说”的情况。图2:六类场景下的政策回答类别。证据很薄的条件往往只能给出“条件性允许”的回答,却拿不出真正可用的证据要求;而更可操作的政策,会把条件、证据和保障一起说清楚。保障措施这块也挺能说明问题。隐私是最常见的,说明学校知道“别乱上传学生数据”;但申诉、可达性、工具公平、供应商治理、非AI替代路径这些,出现得就没那么稳定了。也就是说,很多政策更像是在管“AI使用痕迹”,而不是在保护“公平证据”。这就有点尴尬了:监控做得越像样,不代表评估越公平。图3:30所机构的政策原型与分组数量。这个图最想传达的不是“谁更严谁更松”,而是政策清晰度更像一条设计梯度:有没有把边界、证据和保障连成一条线,差别非常大。表4:政策原型分类。经验模式并不是简单的“宽松 vs 严格”,真正的分界线是政策有没有把边界和证据、保障连起来。如果把结果压缩成一句话,就是:很多大学已经会“分类AI使用”,但还不会“证明证书为什么仍然成立”。这不是一个小缺口,而是评估逻辑的核心缺口。会写规则,不等于会设计证据;会管理风险,不等于会保护学习。表5:匿名政策画像。这里的重点不是点名哪所学校,而是看公开文本在“边界—证据—保障”的连接上到底缺了哪一块。
Kai Yao. What Does the Credential Still Certify? Cognitive Stewardship for AI-Mediated Education. AIES 2026.原文链接:https://arxiv.org/pdf/2607.19988v1.pdf