← 返回 PaperDaily 大模型与智能体

坦佩雷大学百人实证:多智能体AI进课堂,学生仅批准56%的AI需求故事

当别人还在纠结AI会不会让学生“躺平”时,坦佩雷大学直接把多智能体AI工具扔进需求工程课堂,用100人的实证给出答案:精心设计的教学流程,能让AI从“代写工具”变成“思维陪练”。56%的批准率背后,是学生批判性思维的觉醒。

原论文信息如下:
论文标题:
将人工智能融入软件工程教育中的需求质量学习:一项TPACK引导的实证研究
发表日期:
2026年7月
发表单位:
芬兰坦佩雷大学(Tampere University)软件工程研究中心(TASE)
原文链接:
https://arxiv.org/pdf/2607.28176v1.pdf
开源数据集链接:
https://doi.org/10.6084/m9.figshare.31440988(工具说明);https://doi.org/10.6084/m9.figshare.31430224(共享表格);https://doi.org/10.6084/m9.figshare.31430221(反思问卷);https://doi.org/10.6084/m9.figshare.31442422(参考分析)

期末交作业前夜,多少学生一边盯着ChatGPT生成的需求文档,一边心里发虚:这玩意儿看着像模像样,但真的能满足用户吗?与其让学生偷偷用AI,不如直接把AI请进课堂,光明正大地教他们怎么用、怎么挑、怎么改。芬兰坦佩雷大学的一群研究者就是这么干的,而且用了100人的课程数据,认认真真做了一次教育实验。
这项研究的题目是《将人工智能融入软件工程教育中的需求质量学习:一项TPACK引导的实证研究》,作者来自坦佩雷大学软件工程研究中心。论文的核心并不复杂:把一个人家自研的多智能体AI需求分析工具,嵌入到一门硕士需求工程课程的个人作业里,然后设计了一套长达六步的作业流程,从手动改需求到AI生成、迭代精化、对比、互评再到反思,最后用前后测对比、互动日志、问卷加开放式编码的混合方法,来回答三个研究问题。
一句话概括结论:AI不会自动毁掉学生的思考能力,但前提是,教学设计得先把“思考”焊死在流程里。

引言:AI走进课堂的“灵魂拷问”

大语言模型在软件工程领域的渗透速度,快到教材都来不及改版。需求工程(RE)这门课尤其敏感,因为它的核心活动——需求获取、分析、规格说明、验证——几乎全部建立在自然语言的表达与理解之上。用大模型生成用户故事、精化需求甚至做优先级排序,已经是论文里反复验证过的可行方向。
但问题也随之而来:学生用AI写作业,到底是学会了还是学会了偷懒?既有研究已经报告过,学生感知到AI工具对理解力和生产力的帮助,但同时也暴露出过度依赖、表面化使用、对AI输出缺乏批判性评估等隐患。更麻烦的是,很多AI进课堂的尝试停留在“用没用过”“好不好用”的层面,缺乏系统的教学论支撑,实验设计也比较粗糙。
这项研究的出发点正是想回答一个更本质的问题:AI不是能不能支持需求工程任务,而是应该如何从教学法上编排它。为此,作者引入了教育技术领域一个经典的理论框架——TPACK(技术-教学-内容知识框架),让AI、教学法和学科内容三者形成对齐,而不是让技术单飞。
先亮个数据。这项研究覆盖了100名选课学生,其中74人完成了AI整合的作业,72份有效数据进入分析。学生使用AI工具时,中位数生成16.5条用户故事,但只有约9.5条被批准,中位批准率56%。换句话说,将近一半的AI输出被学生毙掉了或者改掉了,这不是“AI说了算”,而是“学生说了算”。
这篇论文的贡献可以拆成三块。第一,把TPACK框架真正落到了AI辅助的需求工程教育场景里,给出了一套可复制的作业设计模板;第二,用实证数据证明,结构化的教学流程能显著塑造学生的AI使用方式,把学生从被动接受者变成主动评估者;第三,发现AI对不同需求质量维度的影响并不均匀,结构明确的属性(比如可测试性、价值性)收益明显,而解释性属性(比如可协商性)则出现了复杂变化。

问题背景与相关调研:AI融入软件工程教育的“两张皮”

论文引言部分给出了一组非常重要的背景判断:需求工程教育(REE)对模糊性的推理、干系人沟通和文本化描述能力要求极高,这使得它天然地既受生成式AI影响巨大,又对学生的分析判断力提出更高的要求。AI工具能生成语法上合理的需求,但“合理”不等于“正确”,更不等于“有价值”。
既有文献的分量也不小。Cheng等人的系统综述归纳了生成式AI在需求工程活动中的应用,点出了信任和人类-AI协作上的持续性挑战。Guardado等人的跨校实证研究显示,引导式的大模型使用能提升学生对需求工程实践的理解,但学术诚信、过度依赖和批判性评估缺失等问题也随之而来。Sah等人的综述则指出,AI在软件工程教育中的很多尝试仍然是探索性的,缺乏扎实的教学论基础和严格的实证验证。Tiwari和Rathore则从另一个角度提出,需求工程教育需要结构化的LLM融入方案,不能放任学生“自由搏击”。
一句话总结这些背景研究:技术跑得太快,教学法跟不上,“两张皮”现象严重。绝大多数AI教育研究要么聚焦学生主观感受,要么停留在课程实验报告层面,缺少一个能同时解释“技术怎么用”和“教学怎么设计”的统一理论框架。
TPACK框架正好补上了这个缺口。它强调教学内容知识(CK)、教学法知识(PK)和技术知识(TK)三者的联动。落到需求工程教育里:CK就是需求质量框架,比如INVEST(Independent、Negotiable、Valuable、Estimable、Small、Testable)和ISO/IEC/IEEE 29148标准;PK就是对比分析、互评、反思这类结构化学习机制;TK就是支撑需求生成和分析的AI工具。只有这三者咬合在一起,AI才能成为分析推理的脚手架,而不是自动化替代品。
带着这个理论透镜,作者明确了三个研究问题:RQ1研究AI工具如何被嵌入课程作业以支持结构化的分析、反思和迭代精化;RQ2研究AI工具如何影响学生对需求质量的理解和应用;RQ3研究学生对AI工具有用性、可信度和局限性的感知,以及他们是否对AI输出保持批判性评估。

方法概述:当AI遇上TPACK,作业设计才是真正的“算法”

本研究的实验场景是坦佩雷大学计算机科学硕士项目的一门需求工程课程,5个学分,每年约100人选课。课程包含20小时讲座、10周个人作业、两次掌握度测验和一个3-4人的小组项目。AI工具被嵌入到第四周的个人作业中,这个作业要求学生回顾并改进自己在前期作业中产出的需求,对齐INVEST质量框架。
之所以选这个作业切入,是因为课程历史数据暴露了一个顽固痛点:学生写出来的需求总是太模糊、太偏向解决方案、可测试性差、缺乏明确的价值论证。即使老师在课堂上反复用案例讲解INVEST,作业质量依然一言难尽。这几乎是所有需求工程课程老师的共同噩梦。
AI工具本身是坦佩雷大学软件工程研究中心自研的多智能体原型,包含四个功能模块:F1智能体配置,用户可以选择代表不同干系人的智能体并指定角色;F2需求生成,智能体根据产品愿景、最小可行产品描述和目标用户协同生成初始用户故事;F3需求分析与精化,用户通过反馈循环

当AI走进需求工程课堂:是自动化帮手还是思维脚手架?

打开任何一款大语言模型工具,输入“帮我写几条用户故事”,不到十秒就能得到一段语法通顺、结构完整的需求文本。如果只看这个画面,很多人会下意识地担心:以后的学生还能学会自己写需求吗?
这项研究的答案比较反直觉:AI会不会让学生“废掉”,关键不在AI,而在作业设计。芬兰坦佩雷大学的研究者们做了一个大胆的实验——把自家研发的多智能体AI需求分析工具直接放进一门硕士需求工程课程的个人作业里,用一套精心编排的六步任务流程,让AI扮演的不是“代写员”,而是“陪练员”。研究覆盖了100名选课学生,其中74人完成了作业,72份数据进入最终分析,样本量在教育实证研究里并不算小。
研究想回答三个问题:第一,如何把AI工具有效嵌入课程作业,让学生进行结构化分析、反思和迭代精化?第二,AI工具如何影响学生对需求质量的理解和应用?第三,学生如何感知AI工具有用性、可信度和局限,他们是否对AI输出保持批判性评估?
一句话概括核心发现:当教学流程把“比较、判断、修改、反思”焊死在任务链里时,学生不会无脑照搬AI输出。数据显示,AI工具生成的故事中位数是16.5条,学生最终批准的中位数只有9.5条——一半多的AI产出被拦在门外。这正是批判性思维在真实学习场景中的样子:不是挥舞着“AI有害论”的旗帜,而是让学生学会与AI共事,同时保持自己的判断力。

TPACK框架:让AI整合有据可依的“三叶草”设计

搞教育研究的人对TPACK不会陌生,但做软件工程的读者可能第一次听。这里简单展开一下。TPACK是“技术-教学法-内容知识框架”(Technological Pedagogical Content Knowledge)的缩写,由Mishra和Koehler在2006年提出。这个框架的核心主张很朴素:技术不能脱离教学法和内容单独谈。任何课堂里引入技术工具,都必须同时考虑三类知识——内容知识(Content Knowledge,简称CK,即学科本身的概念与方法)、教学法知识(Pedagogical Knowledge,简称PK,即怎么教、怎么设计学习活动)和技术知识(Technological Knowledge,简称TK,即工具的能力与限制)。三者交叉融合,才能产生真正有效的技术整合,而不是“为了用AI而用AI”。
把TPACK翻译到这项研究的语境里:CK对应的是需求工程的核心知识——如何写出高质量需求,具体落到INVEST框架(Independent、Negotiable、Valuable、Estimable、Small、Testable六个维度,中文可译为独立性、可协商性、价值性、可估算性、小粒度、可测试性)以及ISO/IEC/IEEE 29148标准;PK对应的是结构化学习机制——对比分析、互评打分、反思问卷;TK对应的则是那款多智能体AI工具。三者不是各自独立的叠加,而是互相咬合的齿轮。TPACK的价值在于,它给那些“AI进课堂”的随意尝试按下了暂停键,逼着设计者回答一个关键问题:你做的每个步骤,到底是为了让AI替学生做,还是为了让学生借AI学会更多?
论文中使用的AI工具并非现成的商用产品,而是坦佩雷大学软件工程研究中心自研的多智能体原型。它包含四个核心功能:F1智能体配置——用户可以选择代表不同干系人的智能体,并指定其角色;F2需求生成——基于产品愿景、最小可行产品描述和目标用户,多个智能体协同生成初始用户故事;F3需求分析与精化——用户可以通过反馈循环和手动编辑,对生成的故事进行迭代完善;F4需求优先级排序——由选定的智能体协同完成需求排序,不过这个功能在本次作业研究中没有启用。下方的截图直观展示了这四个界面的设计形态,每一个功能模块都对应着TPACK框架中的一个教学意图。
图1:多智能体AI工具功能截图
图1:多智能体AI工具功能截图。四个面板清晰地展示了从配置智能体、生成故事到精化与排序的完整能力。
多智能体的设计不是炫技。它让AI在同一任务中扮演多个干系人视角——产品经理、终端用户、测试工程师——从而把“视角单一”这个LLM的老毛病转变成教学杠杆。学生需要主动配置这些智能体,思考“我到底需要谁来审这条需求”,这本身就是一种深度参与。

六步任务流:如何用教学设计“驯服”AI工具

教学设计是整个研究的灵魂。这里的核心套路可以概括为八个字:先手动、后AI、再对比、终反思。作业被精心拆成六个步骤,每一步都紧盯着一个特定的学习目标。
第一步,手动改进。学生从之前作业产出的需求中选出一批,完全不借助AI,按照INVEST六维标准手动改写成用户故事。这一步骤的重量在于:它先把学生自己的质量标准立起来,让后面的“对比”有据可依。
第二步,AI辅助生成。学生使用AI工具配置多智能体角色,输入产品愿景、目标用户等上下文信息,让AI生成一批替代的用户故事方案。此时AI的角色是“第二意见提供者”,而不是“答案生成器”。
第三步,迭代精化。学生审查AI生成的故事,通过反馈循环和手动编辑让故事更完善,然后明确执行批准动作。这个“明确批准”的设计很巧妙——它把学生的参与度从“看一眼就抄”提升到了“负责最终输出”的高度。
第四步,对比。学生把手动改进的故事和AI生成并精化后的故事放在一起,从清晰度、具体性、INVEST对齐度等维度做系统比较。这一步是认知冲突的触发器,也是整个设计中最有可能引发深度学习的环节。
第五步,互评。所有学生的故事被汇总到共享表格,每个人要评估另一位同学的故事,给出结构化INVEST评分并书写理由。被评的同学可以表示同意或不同意。这种同伴互评机制在需求工程教育中并不新鲜,但和AI辅助生成叠加在一起后,就形成了一条完整的“生成-审查-批判-辩护”逻辑链。
第六步,反思。学生完成一份包含20个必答封闭式问题和5个选答开放问题的反思问卷,记录自己与AI工具互动的过程、选择的理由、感知到的优缺点。
图2:AI工具整合的作业工作流程
图2:AI工具整合的作业工作流程。六步流程从手动改进开始,经过AI生成、迭代精化、对比、互评,最终以反思收尾。
这套流程之所以行得通,关键在于它把AI嵌入的位置放得很晚——学生必须先手动产出一个“自己的版本”,才允许看AI的版本。这样一来,AI不是学生思考的替代品,而是学生思考的对照物。对比环节中,学生被逼着用自己的质量标准去评估AI生成的内容,而不是被AI的输出牵着鼻子走。整个流程的预计工作量是2到3小时,对一门个人作业来说强度适中,完全能嵌入正常的周度节奏。

56%的批准率:学生如何用批判性眼光审视AI输出

先把最硬核的数据亮出来,这是研究第一个研究问题(RQ1)的核心产出。
表1:学生与AI工具互动情况汇总(N=72)
表1:学生与AI工具互动情况汇总(N=72)。AI人均生成16.5条故事,学生只批准了9.5条,批准率中位数56%。
每人中位数生成16.5条故事,但最终只批准9.5条。近一半的AI产出被学生在审查后放弃或修改。这一数据清晰地说明,学生并没有把AI当成“免检答案机”,而是当成“初步草稿生成器”。24%的学生明确报告编辑过AI输出,75%的学生对至少一条AI故事做了精化操作,29人进行了1到2轮精化,25人进行了3轮以上精化,只有18人没有做任何修改。如果再叠加56%的批准率来看,被动全盘接受AI输出的学生实际上是少数派。
图3:学生在作业4中使用AI工具的时间分布
图3:学生在作业4中使用AI工具的时间分布。绝大多数学生(52人)使用时间为15至60分钟,符合课程设计的预期工作量。
时间投入也值得一提。72%的学生报告使用AI工具的时间在15到60分钟之间,这个数字和课程设计者预估的2到3小时总工作量相符。相对较短的使用时长恰好说明,学生把AI当作任务链中的一环而非全程依赖的对象——该想的时候自己想,该用的时候才用。
图4:学生在作业4中的精化次数分布
图4:学生在作业4中的精化次数分布。75%的学生对AI生成的至少一条故事进行了修改,29人做了1到2轮精化,25人做了3轮以上。
不过有一个细节需要冷静看待。24%的学生使用时间低于15分钟,说明有少数人仍然停留在“生成即采纳”的表层互动。这也暴露出AI教育整合的一个尴尬现实:设计再精巧,也无法保证每个学生都进入深度思考模式。研究者没有回避这个现象,而是在反思问卷中专门设计了交互模式的选项去捕捉这类行为。
学生反思中高频出现的一个词是“条件性信任”。很多学生描述自己的使用策略是:先看AI的故事是否有INVEST依据,再决定是否采纳;只有那些能清楚说明价值、验收标准明确的故事才会被留下。这种心态比单纯“相信AI”或“不相信AI”都更成熟,也正是批判性评估能力在教学环境中该有的样子。

从INVEST到学习迁移:结构明确属性为何比解释性属性更受益?

第二个研究问题(RQ2)关注的是学习影响,实验设计相当严谨。在AI整合作业开始前,学生需要先对四条用户故事(US1到US4)做一次INVEST六维质量评估;作业完成后,在掌握度测验中再次评估同一组故事。教学团队事先建立了参考评估标准,学生两次评估与参考标准的一致性变化(Δ = 后测一致性 − 前测一致性)就是衡量学习迁移的指标。注意,这里比较的是“与标准答案的一致性”,也就是学生在质量判断上的准确度,而不是学生自己的主观信心。
表2:INVEST评估一致性变化(Δ = 后测 − 前测)
表2:INVEST评估一致性变化(Δ = 后测 − 前测)。Valuable和Testable维度的正向变化最稳定,Negotiable在全部四条故事中均未出现正向变化。
表2的数据呈现出一种非常有信息量的非均匀模式。Valuable(价值性)和Testable(可测试性)这两个维度上的提升最为一致——Testable在US1上提升了0.108,Valuable在US2到US4上均为正向。而Negotiable(可协商性)则表现出令人意外的持续下滑,在US2上下降了0.292,US4也下降了0.127。
怎么理解这种差异?这里可以做一个归类:Valuable和Testable属于“结构明确属性”,它们的判断标准相对清晰——这条故事是否说明了业务价值?验收条件能否被客观验证?而Negotiable属于“解释性属性”,它依赖干系人之间模糊的、动态的协商空间,很难从文本表面直接判断。AI生成的故事往往是完整而确定的表述,这种“确定性”反而削弱了学生对于“需求其实可以进一步协商”的意识。换句话说,AI越流利,学生越难看出哪些地方是可以讨价还价的。
US3和US4的对照更为耐人寻味。US3在参考评估中被认定违反了多个INVEST维度,属于“缺陷明显”的故事,学生在后测中对大部分维度的一致性都提高了。而US4在参考评估中没有任何维度违规,属于“质量合格”的故事,学生在后测中对US4的评估反而出现了轻微分歧。这个反差说明:AI辅助下的学习对学生识别“坏需求”帮助更大,但对于判断“好需求为什么好”却帮助有限。学会挑毛病,比学会欣赏优点,来得更容易。
图5:学生对AI工具支持各INVEST维度理解的感知分布
图5:学生对AI工具支持各INVEST维度理解的感知分布。六成到七成以上学生认为AI在所有维度上都有帮助,包括实际一致性下降的Negotiable。
更有意思的是主观感知与客观表现之间的偏移。图5显示,约三分之二到四分之三的学生认为AI在Negotiable维度上帮助了自己,但表2的数据却显示他们在这一维度上的判断与参考标准的一致性在下降。学生以为自己懂了,实际上被AI的“流畅表达”带偏了。这种感知与表现背离的现象,恰恰是评估教学设计有效性时最需要警惕的盲区——不能只问“你觉得有没有收获”,还要看“你的实际判断准不准”。
放到TPACK框架里解读,这条规律可以表述为:当教学内容(CK)本身具有明确边界时,AI技术(TK)的支持能有效转化为学习收益;当教学内容需要高度语境化解释时,AI的中介作用就可能偏离教学意图(PK)。教学设计者需要选择性地使用AI——用AI教“标准”、“规范”、“结构”是合适的,但用AI教“协商”、“判断”、“权衡”则需要特别谨慎。

给AI+教育融合的启示与边界

第三个研究问题(RQ3)着眼于学生的主观感知。图6展示了可用性、批判性思维支持和置信度三个维度的Likert量表结果。
图6:可用性、批判性思维支持和置信度的Likert量表分布
图6:可用性、批判性思维支持和置信度的Likert量表分布。批判性思维支持获得最多的正面评价,52名学生选择了同意类别。
三项结果形成了一个有意思的组合:学生对工具可用性的评价只是中等偏正面,36人表示正面、16人表示负面,说明工具本身还不够“丝滑”;但对批判性思维支持的认可度却是三项中最高,52人选择了同意类别;对AI改进后输出的置信度也偏向正面,40人表示有信心。这些放在一起可以读出一种态度:工具虽不完美,但确实逼着学生动了脑子。可用性和教育价值是两条评价线,不必强求它们同步提升。
这项研究给AI教育整合实践带来了几条切实的启示。第一,AI工具的角色取决于流程设计,同样的工具放在“直接生成”的作业里就是代写工具,放在“先手写再对比”的流程里就是认知脚手架。第二,TPACK框架可以作为AI课程设计的行动指南,设计者应该在开发阶段就明确CK、PK、TK三者的对齐关系,而不是事后补课。第三,AI对不同类型知识的影响是不同的,对于标准明确的质量维度,AI是强有力的教学助手;对于依赖协商和语境的维度,AI可能会产生干扰,教学上需要额外的干预措施。
当然,研究自身也有一圈清晰的边界。首先,这项研究只覆盖了一门课程、一个工具原型、一届学生,样本来自单一高校,跨文化的可迁移性尚未验证。其次,研究采用的是前后测设计,没有设立不使用AI的随机对照组,无法完全排除其他教学因素对学习成效的干扰。最后,工具本身是研究原型,其多智能体架构和普通商用大模型产品存在差距,结论能否直接推广到ChatGPT等主流工具上还需要谨慎。
从更大的视角看,这篇论文真正的价值不在于“AI能不能用于教学”这个老掉牙的问题,而在于证明了“AI的教学角色是可以被设计的”。当大多数讨论还停留在AI的模型能力对比时,这篇研究把注意力拉回到了教学设计本身——毕竟,工具再强,用不对地方也是一堆算力空转。未来可以做的方向包括:更长周期的追踪研究以检验学习效果的持久性、在更多类型的RE任务中验证六步流程、以及开发专门针对“可协商性”这类薄弱维度的教学干预模块。

龙迷三问

下面是龙哥对大家可能的一些问题的解答:

TPACK框架里的三个知识维度,在这篇论文里分别对应什么?内容知识(CK)就是需求质量框架,包括INVEST六维度和ISO/IEC/IEEE 29148标准;教学法知识(PK)是六步任务流中用到的结构化学习机制,比如对比分析、互评打分和反思问卷;技术知识(TK)是那款多智能体AI工具,它支持干系人角色配置、用户故事生成和迭代精化。

为什么可协商性(Negotiable)这个维度不升反降?可协商性是个高度语境化的属性,它要求判断一条需求是否留下了足够的协商空间。AI生成的故事通常表述完整、语气确定,这种“确定性”会给人一种“需求已经定稿”的错觉。学生参考AI输出后,反而更容易忽略需求中需要跟干系人进一步确认的地方。这个结果揭示了一个重要现象:AI输出越流畅,某些批判性判断越容易被遮蔽。

这项研究的结论可以直接搬到其他课程吗?课程内容性质不同,效果可能会打折扣。这项研究的INVEST质量评估具有相对清晰的结构化标准,所以AI辅助的前后测提升比较明显。如果是高度依赖模糊判断和人际协商的课程内容,就需要额外设计针对性的教学干预来弥补AI可能带来的“假性确定感”。论文的六步任务流模板可以借鉴,但具体环节要根据课程内容重新设计。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

成熟教育理论TPACK嫁接到AI辅助需求工程教学,给出可复制的六步流程和实证数据,是全新场景+成熟理论的组合应用,创新方向清晰但不属于开宗立派级别。

实验合理度:★★★★☆

混合方法设计扎实,前后测对照、互动日志、问卷、开放式编码多源三角验证;但没有随机对照组,无法完全排除其他教学因素的干扰。

学术研究价值:★★★★☆

填补了TPACK框架在AI需求工程教育中应用的实证空白,揭示的“结构明确属性受益、解释性属性受干扰”规律对后续研究具有直接启发意义。

稳定性:★★★☆☆

主要结论建立在单门课程、单学期数据上,跨学期、跨校、跨课程稳定性未经检验;部分维度(如Small)的波动方向不一致,结论对外部条件比较敏感。

适应性以及泛化能力:★★★☆☆

六步任务流设计可以迁移到其他软件工程课程,但研究只在需求工程场景验证过;工具依赖多智能体架构,换成通用大模型API后流程可能需要重新适配。

硬件需求及成本:★★★★★

AI工具调用云端大模型,学生端只需要浏览器,教学运行成本低;实际花费取决于底层大模型API的调用量,对课程预算友好。

复现难度:★★★★☆

论文公开了工具说明、共享表格、反思问卷和参考分析数据集,整个课程设计可以按图索骥;但工具本身是研究原型,需要向TASE团队申请使用权限,并非一键式公开部署。

产品化成熟度:★★☆☆☆

研究验证了教学设计的有效性,但AI工具本身仍是研究原型,UI体验一般(可用性评分中等),尚未达到开箱即用的产品级标准;六步任务流模板可以直接复用,工具需要产品化打磨。

可能的问题:研究中“前后测一致性变化”的基准是教学团队自己定义的参考评估,本质上是“向老师看齐”而非绝对客观标准;AI工具自研属性较强,外部研究者复现时面临工具可用性门槛;样本量虽达72人,但分维度、分故事细分后某些格子的数据量偏少,部分结论只能作为趋势性参考。


主要参考文献

[1] Cheng et al. Systematic Literature Review on the Application of AI in Requirements Engineering Activities.
[6] Guardado et al. Guided LLM Use in Requirements Engineering Education: Perceptions and Concerns.
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球