← 返回 PaperDaily 大模型与智能体

英国开放大学最新研究:FCI经典送分题竟藏30年教学盲区

答对物理题就等于懂物理吗?英国开放大学最新研究给物理教育圈敲了一记警钟:学生们把牛顿第三定律"背"会了,却没"懂"会。一道经典送分题,竟揭开了物理教育里藏了30多年的"假阳性"难题。

原论文信息如下:
论文标题:
学生对"汽车-卡车问题"的回答告诉了我们什么:对力概念量表中两道题的调查研究
发表日期:
2025年8月
发表单位:
英国开放大学、英国爱丁堡大学
原文链接:
https://arxiv.org/pdf/2609.01477v1.pdf
开源数据集链接:
https://ordo.open.ac.uk/
写在前面:如果是物理专业的读者,对"力概念量表"应该不会陌生——这套诞生于1992年的经典测试题,三十多年来一直是物理教育研究的"标配工具"。而本篇论文,恰恰是对这套经典工具的一记精准"爆头"。
从“汽车推卡车”看牛顿第三定律的教学困境 如果让龙哥出一道上过大学物理的人都可能翻车的题,那一定少不了那个经典的“汽车推卡车”(car-truck problem): 一辆汽车推着一辆卡车在路上行驶。问:汽车对卡车的力,与卡车对汽车的力,哪个大? ——很多人的第一反应是:汽车在推卡车,当然是汽车用的力更大啊!但学过牛顿第三定律的同学会立刻反驳:作用力与反作用力大小相等、方向相反,无论汽车是在加速还是匀速,这两个力始终大小相等。 这个知识点本身并不难,难得是——物理教育研究者发现,不少学生即便在这道题上“答对了”,他们脑子里的物理图像也是错的。也就是说,一道看似考察牛顿第三定律的选择题,很可能正在批量制造“假阳性”(false positive)——学生蒙对了选项,或者用错误推理撞上了正确答案,而教师却误以为他们真的掌握了知识。 英国开放大学联合爱丁堡大学等机构的一项新研究,恰恰盯上了这个“假阳性”问题。他们对674名英国大学物理系学生的作答过程做了一次“解剖”,用选择题(Multiple-Choice,简称MC,即从若干预设选项中选出答案的题型)和自由文本(Free-Text,简称FT,即学生自己组织语言输入答案的题型)两种格式对照测试,并在每道题后面追加一道“你刚才用了哪条物理定律?”的子问题。 结果很有意思:在汽车加速推卡车的题(FCI Q15,即力概念量表中的第15题)上,答对的学生有95%都能正确指出自己用了牛顿第三定律;但在汽车匀速推卡车的题(FCI Q16,即第16题)上,很多答对的学生却把自己的依据归结为牛顿第一定律或叠加原理,而不是牛顿第三定律。 换句话说:一道几乎所有学生都能答对、被教师视为“送分题”的经典题目,可能正在掩盖一个普遍存在的深层误解——把“单个物体上平衡力”和“两个物体间相互作用力”混为一谈。 今天,龙哥就来和大家一起拆一拆这篇论文。 力概念量表(Force Concept Inventory,以下简称FCI)是1992年由Hestenes等人推出的经典测试工具,经过1995年的修订,形成了至今仍被广泛使用的30题版本。这套量表的每个题目都被设计为对应某条牛顿定律,而每个错误选项则对应一种特定的错误概念(misconception)。 在多选题中,Q15和Q16的错误选项是完全一样的,选项B对应“质量更大意味着力更大”,选项C对应“最活跃的施力者产生最大的力”,选项D对应“只有主动施力者才产生力”,选项E对应“障碍物不施力”。 原文中关于Q15的MC版本和FT版本的对比如下图所示。可以看到,自由文本版本不再提供可选的选项,而是要求学生用不超过20个词写下自己的回答。 图1:力概念量表第15题(NMQ第34题)的选择题版本与自由文本版本对比,左为MC形式,右为FT形式 用“有没有比”形容这道题再合适不过了,命题组在出FT版本时可谓用心良苦——把“比大小”这个动作藏进了问句里,逼着学生自己组织物理语言,从源头上堵住了“猜答案”的可能。 选择题vs自由文本:哪种方式更能揭示学生理解? 学生作答的过程往往充满各种“小心思”:选项措辞的引导、猜测的成分、多选题时的排除法……而自由文本回答则逼着学生把内在推理过程外显为语言表述。FT题目在设计上就要求学生自己说出“谁比谁大、大多少、为什么”,很难靠蒙混过关。 那么,把同一道题分别做成MC和FT,学生的作答表现会一样吗? University A是苏格兰一所研究密集型大学(该校2019/20至2023/24学年的历史数据是本文的重要参照)。在2024/25学年的前测环节,该校有272名学生参与了牛顿力学测验(Newtonian Mechanics Quiz,简称NMQ),其中Q15的FT版本收到了142份有效回复,MC版本收到了135份。为了公平比较,研究人员特别选取了那些前测和后测都拿到同一种题目格式的学生,构成“配对样本”——Q15有45份MC和47份FT,Q16有42份MC和57份FT。 先看Q15,作答数据见下图。 图3:University A全体数据集Q15的MC与FT作答对比(a)前测(135份MC与142份FT)与(b)后测(135份MC与110份FT),误差线表示95%置信区间 可以看到,无论MC还是FT,前测中最受欢迎的选项都是C(“汽车对卡车的力大于卡车对汽车的力”),而到了后测,正确选项A的比例大幅上升。两种格式呈现的整体作答分布模式高度相似——MC组和FT组的学习增益(learning gain,即后测正确率减去前测正确率的差值)并没有显著差异。 这说明什么?至少说明在Q15这道需要学生意识到“相互作用力与运动状态无关”的题目上,换成FT作答并不会显著改变学生的表现。可是,单看作答正确率并不能判断学生是否“真懂”。研究人员真正关心的,是在那些答对的FT回复里,有多少学生能自发给出符合牛顿第三定律的推理。 下面是研究人员的发现——很多答对的学生给出的理由是:“相等”“一样”“他们是一样的”。这些简短回答虽然判断正确,却无法从中判断学生到底用了牛顿第三定律还是牛顿第一定律。相反,少数学生给出了可以推断推理路径的答案,例如:“相等(牛顿第三定律)”“汽车施加的力更大,因为卡车在加速”。从这些回答可以初步看到,哪怕都选对了选项,背后的推理逻辑也千差万别。 到了Q16,情况变得更加微妙。汽车和卡车处于匀速运动状态时,Q16的FT版本和MC版本作答情况见下图。 图4:University A全体数据集Q16的MC与FT作答对比(a)前测(135份MC与142份FT)与(b)后测(109份MC与136份FT),误差线表示95%置信区间 这张图几乎可以用“完美”来形容——无论MC还是FT,无论前测还是后测,选A(正确选项)的学生比例都高达87%以上。如果只看正确率,这道题几乎没什么教学价值,因为它“太简单了”:前测就有近九成学生会做,后测更是高达95%,根本没有给教学效果留下可测量的提升空间——这就是论文中提到的“天花板效应”(ceiling effect,指测试项过易导致大多数被试得分接近满分,从而无法区分能力差异的现象)。 但是,学生的FT回答暴露了一个耐人寻味的细节:有相当一部分答对的学生给出的理由是“没有力”“力为零”“他们处于平衡状态,因为速度恒定”。这类回答在物理上其实是错误的——两个物体接触并相互挤压时,即便整体在做匀速直线运动,相互作用力依然存在且成对出现。 可见,“选对”和“真懂”之间,真的隔着一道鸿沟。 定律选择子问题:揭开“假阳性”回答的面纱 论文最妙的设计在于:每道题后面都追加了一个小问题——Q15LS和Q16LS,让学生勾选自己刚才用了哪些物理定律。选项包括牛顿第一定律(N1)、牛顿第二定律(N2)、牛顿第三定律(N3)和叠加原理(Superposition Principle,简称SP)。 牛顿第一定律即惯性定律,说的是物体在不受外力或所受合外力为零时,将保持静止或匀速直线运动状态;牛顿第二定律即F=ma,说的是物体加速度的大小与所受合外力成正比,与质量成反比,方向与合外力方向一致;而牛顿第三定律描述的则是两个物体之间的相互作用力大小相等、方向相反,作用在不同物体上。叠加原理则指多个力同时作用在一个物体上时,它们的净效果等于各个力的矢量加和。 题目设计如下方图所示,四个选项可以多选。 图2:定律选择子问题的题干与选项示例(以Q16LS在NMQ中第37题的形式展示) 在上图中可以看到,命题者特意为叠加原理写了一个具体例子——“两个大小相等、方向相反的力同时作用在一个物体上,则它们的矢量和为零,物体处于平衡状态。”这个选项巧妙地将叠加原理和牛顿第一定律联系在了一起,也给了后面分析中的“混用空间”。 先看Q15LS的结果。 图5:前测与后测中答对与答错Q15的学生在Q15LS上的定律选择作答UpSet图,横条为选择各定律的学生总数,竖条为各组合占比 这张图的信息量很大。UpSet图是近年来兴起的一种可视化方式,用于展示集合之间的交集关系——左侧横条表示每个定律被选择的总人数,中间的竖条则表示不同定律组合的选中人数。图中可以看到,前测中答对Q15的119名学生里,有95%都正确勾选了N3,且其中大部分人只勾了N3这一个选项,表现出相当笃定的理解。相比之下,答错的153名学生里,只有39%勾了N3,却有88%勾了N2——他们明显在用“受力产生加速度”的框架去解释汽车推卡车的加速过程。 这可能意味着:答错Q15的学生并不是没有学过牛顿第三定律,而是被“加速”这个描述带偏了,不自觉地切换到了牛顿第二定律的思考框架中。后测时答对率上升到了69%,其中答对者中仍有95%正确关联N3,并且只选N3的学生占比进一步增加。 再看Q16LS的结果,这张图才是全文的高潮。 图6:前测与后测中答对Q16的学生在Q16LS上的定律选择作答UpSet图 Q16的作答正确率极高,前测就有88%左右的学生答对。可是在那些答对的学生中,前测时只有35%单独勾选了N3,还有37%勾选了N3同时混选其他定律。更值得注意的是:高达50%的答对者勾选了N1——他们把一个本应使用牛顿第三定律解释的问题,当成了牛顿第一定律中“匀速直线运动”的例子;另有31%的答对者勾选了叠加原理。 这里面藏着一个典型的物理概念混淆:在一辆匀速行驶的汽车中,汽车与卡车之间的作用力与反作用力是一对相互作用力,它们大小相等、方向相反,但这与“单个物体所受合力为零”是完全不同的两套逻辑。前者是牛顿第三定律的应用场景——两个物体之间的力总是成对出现,后者则属于牛顿第一定律的范畴——一个物体的运动状态没有变化时,它所受到的合外力为零。 许多学生把“卡车匀速=卡车受力平衡”和“卡车与汽车之间的力等大反向”混为一谈,用N1或SP去解释了一个应该用N3解释的问题。结果就是:题目答对了,但物理图像画错了。如果只统计答题正确率,教师会以为这些学生已经掌握了牛顿第三定律,可实际上他们掌握的只是牛顿第一定律的某种通俗版本——“匀速运动的东西不受力”。 这种在选择题中对、在定律选择中错的作答模式,正是论文开头提到的“假阳性”。如果FCI只是用来评估教学的整体效果,那么这种假阳性或许还可以接受;但如果教师用这些题来诊断学生的具体概念缺陷,并据此安排后续教学,那么被掩盖的错误概念将成为后续学习的隐患。 跨大学验证:研究结果的普适性与差异 以上的现象是否只是苏格兰A大学的“地方特色”呢?研究人员把同样的测试题目带到了英格兰的另外五所大学(B-F),收集了112份前测作答。跨大学的对比实验结果如下图所示。 图7:Q15的MC与FT前测作答对比(a)University A(n=272)与(b)Universities B-F合并(n=112),误差线表示95%置信区间 可以看到,无论是A大学还是B-F大学,MC与FT两种格式的作答分布模式几乎一致:C是前测中最多的错误选项,A是后测中最多的正确选项。这说明至少在英国的理工科大一新生群体中,“汽车加速推卡车时卡车受力更大”这个错误直觉具有很强的普遍性。 图8:Q16的MC与FT前测作答对比(a)University A(n=269)与(b)Universities B-F合并(n=112),误差线表示95%置信区间 Q16也如出一辙:所有大学的学生几乎都选了正确选项A,高正确率和天花板效应在英国高校中是普遍现象。可一旦追问定律选择,问题就暴露出来了。 图9:Q15LS中University A与Universities B-F的答对与答错学生的定律选择UpSet图对比 从University A到Universities B-F的数据都反复证实了同一种模式:在Q15上,答对者倾向正确使用N3,答错者倾向使用N2;在Q16上,无论是否答对,都有大量学生将N1或SP误用为解释依据。 图10:Q16LS中University A与Universities B-F的答对学生的定律选择UpSet图对比 当然,不同大学之间也存在一些值得留意的差异。B-F大学中直接选“X”(研究人员认为无法匹配到任何一个MC选项的作答)的FT回答比例略高,说明不同学生群体在自由组织物理语言时的表达习惯存在差异。但总体来看,“Q15答错多用N2、Q16答对但混用N1/SP”的核心结论,在英国六所大学间表现出高度的跨校一致性。 对概念清单设计的启示与未来方向 那么,这项研究对物理教育到底有什么实践价值呢? 它首先给所有使用FCI等概念清单的教师提了一个醒:答对不等于理解。FCI作为全球应用最广的力学概念测试工具,其分数被无数教学研究用来评估教学改革的效果。当你的实验组和对照组在FCI上的得分相差两分时,你能否确定这两分反映的是真实的概念理解差异,还是只是“学生碰巧猜对了更多选项”或“错误推理撞上了正确答案”呢? 其次,这项研究为“如何在测试中识别假阳性”提供了一套可以操作的方法论:在同一道概念题后面追加一道“定律选择”子问题。当学生回答“力是相等的”并同时勾选N1时,教师就能清楚地看出他是在用平衡力的框架解答相互作用力问题——K-12科学教师口中常说的“力的拔河比赛”比喻和“匀速运动物体不受力”的前概念在这里产生了清晰的碰撞。 从本质上说,研究者利用的原理很简单:要求学生为自己的答案提供“法律依据”——也就是指出自己使用的基本原理。这比单纯提供“解题过程”更能反映学生对物理知识结构的组织方式。原理层面的错位,才是最难察觉的深层概念误解。 这种“定律选择子问题”的设计还具备很好的成本效益:它不需要教师逐字逐句阅读长篇大论,多选题式的勾选本身就能快速给出结构化的答案,而且可以通过现有学习管理系统自动评分。对于动辄几百人的大学基础物理课堂,这种设计提供了一个在评分成本和诊断深度之间取得平衡的可选方案。 当然,这项研究也存在其边界。首先,配对样本较小(Q15只有92人、Q16只有99人),统计功效受限;其次,FT答案的归类需要人工判断“是否与某一MC选项对齐”,这一过程难以完全避免主观性;此外,所有参与大学都来自英国,其结果能否直接推广到其他国家或非物理专业的学生群体,还有待更多数据验证。 龙迷三问 下面是龙哥对于大家可能的一些问题的解答:

Q1:这个研究说的“假阳性”到底是什么?学生把题目做对了,但并不是因为掌握了题目想要考查的那个概念,而是通过错误推理、个人直觉或者排除法“蒙”对了答案。这种现象在教育测量中被称为“假阳性”。本研究发现,在Q16(匀速推车)中,大量答对的学生其实在用牛顿第一定律或叠加原理解释这道本应使用牛顿第三定律的题——答案对了,但物理图像错了。

Q2:那“牛顿第三定律”的教学到底应该怎么改进?论文给出的启示是:不要只满足于学生能判断“力的大小相等”,还要让学生能在具体情境中区分“一对相互作用力(作用在两个物体上)”和“平衡力(作用在同一个物体上)”。教学中有一种典型做法是让学生在解决一个问题后,再回答“你用了哪条定律”,用这种外显化的方式逼着学生反思推理链条,从而暴露那些被选项掩盖的错误概念。相比单纯的多选题或计算题,这种“题目+定律选择子题”的组合能更准确地判断学生是否建立了正确的概念关联。

Q3:自由文本题型是不是一定比选择题更好?不一定。本研究的实验数据表明,在正确率层面,MC和FT版本的作答表现没有显著差异——换成FT并不会自动让学生答得更好或更差。FT的独特价值并不在于提高正确率,而在于它可以额外提供学生的推理过程和语言表述,让教师看到学生在MC模式中被隐藏起来的思维路径。例如Q16中回答“没有力”的学生,如果只做MC,他们同样会选A,但教师永远不会发现他们“以为匀速运动时物体之间不存在力”这个深层误解。最好的做法可能是结合两者:用MC保持大规模测试的便利性和标准化,同时针对关键概念设置少量FT或定律选择子问题作为诊断工具。

龙哥点评

论文创新性分数:★★★★☆用“题目+定律选择子题”的组合方式诊断概念理解,把“假阳性”问题从一个理论担忧变成了可量化检测的实证研究对象,设计思路很巧妙。

让“定律选择子题”这种测量工具与经典FCI问题成功结合,虽然单个元素并不完全原创,但组合方式本身提供了新的诊断维度。

实验合理度:★★★★☆研究覆盖六所大学的674份有效作答,并对比了University A此前五个学年的历史数据,对配对样本和全样本分别做了分析,设计比较严谨。配对样本略小,使统计分析效力受到一定限制。

学术研究价值:★★★★☆该研究为物理教育领域中“选择题是否能有效测量概念理解”这一长期争论提供了新的实证证据,并给出了一套可复制的诊断工具设计思路。对教育测量方法论有参考价值。

稳定性:★★★★☆研究结果在苏格兰和英格兰六所大学之间表现出很高的一致性——Q15用错N2、Q16混用N1/SP的模式反复出现,说明该结论并非某个学校的个案现象。结果稳定。

适应性以及泛化能力:★★★☆☆目前研究只覆盖了英国大学的物理专业大一学生,将这些结论直接外推到高中、非物理专业或不同文化背景群体时需要谨慎。定律选择子题的措辞也需要在不同语言文化中重新验证。

硬件需求及成本:★★★★★全文只涉及纸笔或网页问卷,不需要任何特殊硬件或实验设备。主要成本在于FT答案的人工标记阶段——但也只需要标一次,之后就能复用为标准答案。额外说明:这项研究的核心就是教育测量而非算法,几乎零硬件门槛。

复现难度:★★★★☆研究者在开放数据平台ordo.open.ac.uk上提供了数据集,给复现提供了很大便利,实验工具NMQ也随论文给出了详细说明。不过FT答案的“与MC选项对齐”分类需要研究者进行主观判断,这方面存在一定的复现门槛,不同标记者的判断标准未必一致。

产品化成熟度:★★★☆☆这套“定律选择子问题”的测试设计可直接复制到大学物理入门课程中,其成本低、实施简单,但目前还没有形成标准化评分规则或教师培训流程。将其转化为可广泛推广的教学工具还需额外的产品化工作。

可能的问题:配对样本量偏小(Q15仅92人、Q16仅99人),统计功效受限;FT答案的归类依赖人工判断,存在主观性;全部样本来自英国大学,跨文化普适性有待验证;对答错Q16的学生未做深入分析,这部分数据量过少。

主要参考文献
[1] Pathak, A. K., Parker, M. A. J., Galloway, R. K., James, A. J. A., Jordan, S. E., & Nylk, J. What do student responses to the car-truck problems tell us? An investigation into two Force Concept Inventory questions. arXiv:2609.01477v1.
[2] Hestenes, D., Wells, M., & Swackhamer, G. (1992). Force Concept Inventory. The Physics Teacher, 30(3), 141-158.
[3] Hestenes, D., & Halloun, I. (1995). Interpreting the Force Concept Inventory: A response to March 1995 critique. The Physics Teacher, 33(8), 502-506.
[4] 数据集地址:https://ordo.open.ac.uk/

end
被牛顿第三定律绕晕了?来群里一起聊聊物理教育里的那些"坑"!欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 物理教育+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
wechat_helper dianzan

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对力概念量表(FCI)中两道"汽车推卡车"经典题,英国开放大学团队对6所高校674名学生开展随机选答或自由作答对比实验,发现匀速情境下约90%的学生答对,但半数以上选错物理定律依据,看似正确的答案背后可能藏着更深的概念误解。
这篇工作最值得看的点是什么?MC和FT版本的结果模式相似;Q15正确率从40%(前测)提升至71%(后测);Q16正确率高达90%以上但定律选择子问题揭示潜在误解;与1992年原始数据相比有显著差异
这篇工作的边界或风险在哪里?优点:(1) 创新性地结合MC和FT格式,深入揭示学生概念理解;(2) 定律选择子问题有效识别“假阳性”回答;(3) 多大学数据增强结果普适性;(4) 纵向分析提供个体层面洞察。缺点:(1) 匹配数据集样本量较小(45-57人);(2) FT回答分类存在主观性;(3) 仅聚焦两题,结论推广需谨慎;(4) 未深入分析性别差异。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

通过修改版牛顿力学测验(NMQ),将FCI中汽车-卡车问题(Q15和Q16)随机以选择题或自由文本形式呈现,并附加定律选择子问题,以深入探究学生回答背后的概念理解。

实验合理度:★★★★☆

回答正确率、选项分布百分比、定律选择模式分析

学术研究价值:★★★★☆

通过修改版牛顿力学测验(NMQ),将FCI中汽车-卡车问题(Q15和Q16)随机以选择题或自由文本形式呈现,并附加定律选择子问题,以深入探究学生回答背后的概念理解;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:有效识别“假阳性”回答;(3) 多大学数据增强结果普适性;(4) 纵向分析提供个体层面洞察。缺点:(1) 匹配数据集样本量较小(45-57人);(2) FT回答分类存在主观性;(3) 仅聚焦两题,结论推广需谨慎;(4) 未深入分析性别差异。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。