← 返回 PaperDaily
大模型与智能体
SIGCSE 2025最新研究:超半数学生天生就“挑老师”?一学期数据揭示偏好如何悄悄改变
上网课时,同一个知识点好几位老师都讲了视频,你会固定只点某一位老师的来看吗?本期论文用一整学期的点击流数据告诉你:超过一半的学生打一开始心里就有“偏向”,而且这个偏好还会随着学期推进悄悄改变。教育技术还能这么量化研究,有点意思。
龙哥读论文
发布于 2026-08-14 08:31:05
阅读 3
查看原文
原论文信息如下:
新学期开始,拿到课程表的那一刻,你是不是就开始盘算:这门课选哪位老师的班比较好?那位老师给分高、这位讲得细、还有一位听说特别幽默…… 这种“挑老师”的行为在大学校园里太常见了。但大家有没有想过:学生对老师的这种偏好,到底是一开始就有的,还是随着上课慢慢形成的?如果同一个知识点有好几位老师都讲了,学生会固定只挑其中一位来看吗?
过去的研究告诉龙哥,学生对老师的偏好会影响学习动机、归属感甚至学业成绩。但以往的研究大多依赖课程结束后的问卷或访谈,只能捕捉到某个时间点的静态偏好,很难回答“偏好是怎么形成和变化的”这个问题。毕竟在传统课程结构里,学生一旦选定了某个老师的课,整个学期基本就没机会接触其他老师了,哪来的“偏好演变”可说呢?
不过,伊利诺伊大学厄巴纳-香槟分校的几位研究者搞了一个“新玩法”。他们从2020年秋季开始,把一门大规模CS1入门课程从传统课堂改成了一种异步在线学习模式。在这门课里,同一个知识点可能有好几位老师的讲解视频并排放在那里,学生可以自由选择看谁的。这一设计本来是出于教学灵活性的考量,但研究者们敏锐地意识到:学生的每一次点击选择,不就是在“用脚投票”表达对老师的偏好嘛!于是,他们收集了整整两个学期、超过1200名学生的点击流日志,展开了一场关于教师偏好如何形成与演变的追踪研究。
学生真的会挑老师吗?——来自大规模CS1课程的实证探索
先说说这项研究到底想回答什么问题。论文标题叫《Investigating the Presence and Development of Student Instructor Preferences in a Large-Scale CS1 Course》,翻译过来就是“在大规模CS1课程中调查学生对教师偏好的存在与发展”。这篇论文发表在2025年2月26日至3月1日于匹兹堡举行的SIGCSE TS 2025(第56届ACM计算机科学教育技术研讨会)上,是计算机教育领域最顶级的会议之一。
研究者想探究的核心问题有三个:第一,学生是不是在课程开始之前就带着某种先入为主的教师偏好?第二,这种偏好在一个学期的时间里是怎么演变的?第三,学生的性别和先前的编程经验会不会影响他们的偏好?
为了回答这些问题,他们依托一个非常特别的学习平台来收集数据。这个平台就是接下来要介绍的重点。
多教师在线平台:如何让学生自由选择讲解视频
这个平台是伊利诺伊大学香槟分校CS1课程自2020年秋季起采用的异步在线教学系统。跟传统的“一个老师对着PPT录一整节课”不同,这门课的每个知识点都被拆解成了三五分钟的短视频或者交互式代码讲解(interactive walkthrough),而且同一个知识点往往有好几位老师分别录制的版本。
从图1可以看到,视频播放器下方会并列展示多位老师的头像。学生点谁的头像,就播放谁的讲解。这个设计的初衷很朴素:让不同教学风格的老师对同一概念做“加法式”的补充讲解,学生哪个没听懂就再看另一位老师的版本。这种“短内容+多版本”的设计,既方便学生反复观看不理解的知识点,也让不同老师的风格得以保留。
为了保证内容质量的一致性,平台还制定了详细的创作规范:每条讲解要覆盖哪些关键概念和示例、代码走查要在哪里录制、视频上传到YouTube后插到页面的哪个位置,都有明确指引。创作者还能查看已有内容以避免重复。这样一来,不同老师录制的讲解虽然风格各异,但核心知识点是一致的——这为后续比较“学生到底偏好谁”提供了干净的实验环境。
这里有个细节值得注意:当同一个知识点有多位老师(比如讲师A和讲师B)的讲解时,系统会随机选一位老师的视频作为默认播放。不过这个随机分配在页面刷新后保持稳定——也就是说,学生每次回到这个知识点,看到的默认讲解都是同一位老师的。同时,整节课的所有知识点都会保持同一位老师优先展示,以避免学生因为顺序切换而感到混乱。
这种设计妙就妙在:默认视频是随机分配的,但学生完全可以自由地点击另一位老师的头像来切换。正因为默认分配是随机的,学生每一次“主动切换”都可以被看作是对某位老师偏好的真实表达。这可比问卷里“你更喜欢哪位老师”这种问题靠谱多了——毕竟行为不会说谎。
课程的其他结构也值得一提:学生每天完成一系列在线课程,包括文本、代码示例、交互式讲解、编程练习以及计分的编程调试任务;每周有一次监考的机考;学期后半段还要完成一个Android编程项目。整个课程运行得很成功,大约80%的学生能拿到A档成绩,不及格率不到4%。
偏好分数:从点击流数据中量化学生选择
有了平台,接下来就是怎么把“偏好”变成可计算的数字。研究者们选择只关注两位主讲教师(讲师A和讲师B)之间的视频选择,助教的视频不纳入计算。
偏好分数的计算逻辑很巧妙:当默认视频是讲师B的时候,学生主动切换到讲师A的次数比例,减去当默认视频是讲师A的时候,学生主动切换到讲师B的次数比例。用公式表示就是:
n(A|B)/(n(B|B)+n(A|B)) - n(B|A)/(n(A|A)+n(B|A))
其中n(A|B)表示“默认是B但学生看了A”的次数,n(B|B)表示“默认是B且学生也看了B”的次数,以此类推。这个分数的取值范围是-1到1:分数为1表示只看讲师A,-1表示只看讲师B,0表示完全没有偏好。
这个公式妙在哪里?它巧妙地把“默认分配”这个随机因素考虑了进去。如果只看“学生看了A多少次”,没法排除默认推荐带来的影响——毕竟有些学生可能只是懒得切换。而这个差值公式把“从B切到A”和“从A切到B”这两件事放在天平两端,谁重谁轻一目了然。
研究者按周汇总每个学生的偏好分数,然后设定了一个阈值:分数绝对值大于等于0.2算作“有偏好”(偏好A或偏好B),小于0.2算作“无偏好”。这个0.2的阈值是根据分数分布中最大的间隔经验性地确定的,他们还测试了0.15和0.25作为稳健性检验,结果在统计显著性上基本一致。
研究数据来自2021年秋季和2022年秋季两个学期,分别有662名和559名学生,这些学生都至少对两位老师都有过充分的视频观看记录。课程开始前的调查还收集了学生的自我报告性别和先前编程经验(5点李克特量表,5代表经验最丰富)。
*表格超出部分左右可以滑动
Table 1: Self-reported characteristic data
表1:自我报告特征数据(包括性别与先前编程经验的分布情况)
数据准备及实验设计
第一步是考察“先入为主的偏好”是否存在。研究者把每个学生前20%的视频观看记录单独拿出来计算偏好分数,以此代表学生在对老师们形成深入了解之前的初始偏好。这个设计很聪明——前20%的记录大致对应学期初期的学习行为,那时候学生对老师的教学风格还不太熟悉,如果在这时就已经表现出明显的倾向,那多半是某种先入为主的印象在起作用。
第二步是追踪偏好的演变轨迹。研究者分析了整个学期每周的偏好分数变化,并把初始偏好与学期偏好(基于全部观看记录)做了对比。这样不仅能看出“有没有偏好”,还能看出“偏好有没有变”。
第三步是考察学生特征的影响。研究者用Kruskal-Wallis检验比较不同性别和不同先前经验水平的学生在偏好分数上的差异,再用卡方检验分析偏好模式(偏好A、偏好B、无偏好这三种离散类别)与学生特征之间的关联。之所以用非参数的Kruskal-Wallis检验,是因为偏好分数的分布明显偏离正态分布(Shapiro-Wilk正态性检验确认了这一点)。
实验结果:初始偏好确实存在
如果有人说,学生选老师全凭随缘,那这篇论文第一个不同意。SIGCSE TS 2025上发布的这项研究,用1200多名学生整整两个学期的点击流数据证明:学生不仅会挑老师,而且挑得相当有主见。
先看几个核心数字:超过一半的学生(56.5%)在课程刚开始不久就已经有了明确的偏好对象;在早期偏好讲师A的学生里,到学期末只有35%还保持同样的选择;而一开始没有偏好的学生,有63%最后发展出了新偏好。学生的“挑老师”行为并不是一次性决策,而是随着课堂推进不断调整的动态过程。
这里先解释一下题目里的CS1是什么。CS1的全称是Computer Science 1 ,也就是计算机科学导论课,通常是计算机专业学生的第一门编程课。而SIGCSE是ACM计算机科学教育特别兴趣组(Special Interest Group on Computer Science Education) ,它的年度技术研讨会是计算机教育领域最顶级的学术会议。这篇论文就发表在这个会议上,作者来自伊利诺伊大学厄巴纳-香槟分校(UIUC)教育学院与工学院的跨学科团队。
过去研究教师偏好,大多靠课程结束后的问卷或访谈,问学生“你更喜欢哪位老师”。这种办法有两个天生短板:一是只能捕捉填问卷那一刻的静态偏好;二是学生往往只会接触到一位老师,根本没有机会做比较。这篇论文的特别之处在于,研究者把目光投向了一个天然支持“货比三家”的学习环境,用学生每一次实际点击行为代替了自我报告。这种由真实操作留下的痕迹,在学术上叫点击流数据(Clickstream data) 。
多教师在线平台:如何让学生自由选择讲解视频
要理解这份数据为什么珍贵,得先看看这门课的平台设计。自2020年秋季起,UIUC的CS1课程从传统大班授课改成了异步在线模式。学生每天完成一系列在线日课,每节课由文本、代码示例、交互式讲解、编程练习和计分的调试任务组成。其中交互式讲解(interactive walkthrough)是核心模块,它把一段代码的逐行解释录制成短视频,配合高亮和注释展示给学生。
这里的关键创新在于:同一个知识点,往往有好几位老师分别录制了讲解版本。学生在播放器下方能看到多位老师的头像并列摆放,点谁的头像,就播放谁的讲解。为了不让默认排序影响选择,系统会随机从两位主讲教师(讲师A和讲师B)中选一位作为默认视频。这个随机分配是稳定的——学生每次回到同一节课,看到的默认讲解都是同一位老师,整节课的所有知识点也保持一致,避免连续内容因随机排序而割裂。
为什么这个“随机默认”如此重要?因为学生完全可以把默认视频看完就关掉,但也可以主动点击另一位老师的头像切换过去。默认分配是随机的,学生每一次主动切换,就成了一次真实偏好表达。这比问卷里“你更喜欢谁”靠谱得多——行为不会说谎。
不过,多位老师录同一个知识点,内容质量如何保证一致?平台设计了一套结构化创作流程:每位参与录制的老师都会收到一份详细指南,明确每个讲解要覆盖的关键概念和示例代码。比如循环那一课的指南里,一个讲解要求演示while循环的功能,另一个要求对比while和for在变量作用域上的差别。代码走查直接在浏览器里录制,录制页面就是学生最终看到讲解的页面,确保创作者清楚学生看到的上下文;视频则先上传到YouTube再嵌入到课程页面相应位置。这样一来,不同老师的讲解风格各异,但核心知识点保持一致——研究者才有底气把学生的选择差异归因于“对老师的偏好”,而不是“内容质量不同”。
顺带一提,这门课的整体运转相当成功:大约80%的学生能拿到A档成绩,不及格率不到4%。课程还支持学生用Kotlin或Java两种语言完成项目,每周有监考的机考,学期后半段有一个Android编程项目。优秀的课程数据基础,让偏好分析建立在真实教学场景之上,而不是实验室里的人为设计。
偏好分数:从点击流数据中量化学生选择
平台再好,如果无法把偏好变成可计算的数字,研究仍然无从谈起。UIUC团队采用的方法很巧妙:只关注两位主讲教师(讲师A和讲师B)之间的视频选择,助教录制的视频不纳入计分;再按周汇总每个学生的观看记录,计算一个偏好分数。
这个分数怎么读?1分表示只看讲师A,-1分表示只看讲师B,0分表示完全没有偏好。
那为什么要用差值结构,而不直接看某位老师的观看次数?因为默认视频是随机分配的,如果只看绝对次数,会把不少“懒得切换”的学生也误算成偏好。差值结构把两组情况放在天平两端:如果学生真的喜欢A,那么在默认是B的时候他们愿意主动切到A,而默认是A的时候他们会老实看A;一正一反,偏好自然显形。
有了连续分数,还需要一个判定“有没有偏好”的界线。论文把绝对值大于等于0.2算作“有偏好”,其中正数为偏好A,负数为偏好B;小于0.2算“无偏好”。这个0.2不是拍脑袋定的,而是研究者观察分数分布后,在最大间隔处确定下来的阈值。他们还额外测试了0.15和0.25,统计结果与0.2基本一致,说明结论对阈值选择并不敏感。
研究最终纳入2021年秋季662名和2022年秋季559名学生,这些学生都对两位老师有足够的观看记录,参与度过低的学生被排除在外。课程开始前的问卷还收集了学生的自我报告性别与先前编程经验(1到5的五级李克特量表,5代表经验最丰富)。
偏好动态演变:从初始偏好到学期偏好的转变
拿到每个人的偏好分数之后,研究者把数据切成两个时间窗口:初始偏好用每个学生前20%的观看记录计算,代表学生还没有深入了解两位老师时的“先入为主”;学期偏好则用整个学期的观看记录计算,代表最终的稳定状态。
先看初始偏好。超过一半的学生在课程早期就表现出明确的偏好方向:39.1%偏好讲师A,17.4%偏好讲师B,剩下43.5%暂时没有偏好。这个比例说明,很多学生并不是一张白纸走进教室的——同学的评价、老师的口碑,甚至只是头像的观感,都可能让学生在还没正式听课前就有了倾向。
接下来看偏好怎么变。论文把每个学生的每周偏好分数画成了轨迹图,见图2。
从左侧初始偏好组的轨迹可以明显看出,偏好讲师A的人群(红色)整体有一个下滑趋势:一开始信誓旦旦只看A的同学,随着学期推进,不少人转向了B。相比之下,偏好讲师B的人群(蓝色)轨迹平坦得多,说明一开始就看中B的学生更“专一”。
更直观的数字是这样的:在早期偏好A的211名学生里,只有73人(约35%)到学期末仍然保持对A的偏好;而早期偏好B的94名学生中,64人(约68%)到学期末依然选择B。此外,一开始无偏好的235人中,有148人(约63%)在学期结束时发展出了明确的偏好。
这组对比说明,学生的教师偏好是动态调整的,而且调整方向并不对称。有人越处越喜欢,也有人渐渐路人。传统的期末问卷只能拍下一个静止的瞬间,根本看不到这个过程。
性别与经验:谁在影响学生的教师偏好?
学生自身的特点会不会影响他们喜欢哪位老师?论文重点考察了两个变量:性别和先前编程经验。
研究者首先用了Kruskal-Wallis检验 ——一种不要求数据满足正态分布的非参数检验方法,适用于比较三个及以上独立组之间的差异。结果显示:在初始偏好阶段,不同性别学生的偏好分数没有显著差异(H(2)=0.85,p=0.655),说明男生女生走进教室时的“起跑线”是一样的。
但到了学期偏好,差异出现了:Kruskal-Wallis检验显示性别组之间的偏好分数有显著差异(H(2)=11.48,p=0.003),效应量η²=0.015,属于小效应。两两比较发现,女生平均更偏好讲师A,而讲师A恰好是女性;男生则平均更偏好讲师B,讲师B是男性。从图3可以直观看到这个变化。
论文还把偏好分数分成了三个离散类别——偏好A、偏好B、无偏好,用卡方检验 (检验两个分类变量之间是否独立的统计方法)验证同样的关联。结果显示性别与学期偏好模式显著相关(χ²(4)=17.31,p=0.002),Cramer's V=0.06,效应量较小。具体来看:女生群体里有25.1%偏好讲师A,只有19.0%偏好讲师B;男生正好反过来,29.4%偏好讲师B,18.9%偏好讲师A。这个“倾向同性别老师”的现象,与以往STEM教育领域的研究结论是一致的。学生可能更容易把同性别老师当作榜样,也更愿意向其学习。
再看先前编程经验。同样,初始偏好没有显著差异(H(2)=2.38,p=0.667),不同经验水平的学生一开始的偏好分布差不多。但学期偏好在经验组之间出现了显著差异(H(2)=9.53,p=0.049,η²=0.009),虽然效应量很小。Wilcoxon两两比较显示,自评经验为4或5的学生和自评经验为1的学生之间存在显著差异:经验越多的学生,越倾向偏好讲师A。图4展示了不同经验组的偏好分数分布。
表3汇总了性别、经验分组在初始偏好模式和学期偏好模式上的卡方检验结果,可以对照着看。
一个值得注意的细节是:这里出现差异的主要是学期偏好,初始偏好几乎都不显著。也就是说,性别和经验带来的分化不是一进教室就有的,而是在与老师的反复互动中逐渐显现的。这个“从无到有”的过程,恰恰是传统单次问卷研究抓不到的。研究者很诚实地提醒:性别与经验的效应量都偏小,结论应当谨慎解读,不能夸大。
教育启示与未来展望:多教师模式的实践价值
知道了偏好会变、偏好因人而异,又能怎样?论文在讨论部分给出了几个非常务实的落点。
第一个启示是:多教师模式不是花架子,而是对学生真实需求的回应。因为偏好是动态的,学生今天觉得A的讲解透彻,过两周可能发现B的版本更对胃口。传统教学把学生按班级锁死在某一位老师名下,等于剥夺了学生根据需求调整的机会。有条件开设大课的教学单位,可以认真考虑“同知识点多版本讲解”的内容组织方式。当然,这需要平台层面的协调,否则老师们各录各的,知识点覆盖不一致,反而给学生添乱。
第二个启示是:教师队伍的多元化值得认真对待。研究中观察到的“同性别偏好”提示,增加教师性别多样性就可能影响不同群体的学习体验和归属感。对那些在STEM领域代表性不足的群体来说,能遇到一个“像自己”的老师,可能是坚持下去的一股隐性推力。
论文也清醒地划定了结论边界:研究者无法完全排除教学风格、节奏差异等混杂因素的影响——也许女生偏好讲师A不是因为性别,而只是因为A讲得更细、例子更贴近生活。此外,数据来自同一所学校的两届CS1课程,结论能否推广到其他学科、其他教学场景,还需要更多跨机构研究来验证。下一步方向包括:纳入教学风格的可测量特征、扩展到多门课程多个学校、用访谈等定性方法挖掘偏好背后的深层原因,以及直接检验偏好与学习成果之间的关系。
对于计划引入多教师模式的机构,论文的建议很实际:不要一上来就全线铺开,先挑几个课程主题试点,收集教师和学生的反馈,再逐步扩大范围。
龙迷三问
这篇论文到底在解决什么问题? 伊利诺伊大学香槟分校借助多教师在线学习平台,追踪662名CS1学生一整学期的点击流数据,发现56.5%的学生在开学之初就存在教师偏好,且性别与编程经验会明显影响最终偏好走向。这项研究为多教师协作教学与个性化学习提供了全新视角。
这篇工作最值得看的点是什么? 研究发现超过半数学生在课程初期已表现出教师偏好;学生偏好随时间动态演变,约63%无初始偏好的学生最终形成了偏好;性别和先验编程经验与学期末偏好显著相关,女性学生倾向于偏好女性教师,高经验学生倾向于偏好教师A。
这篇工作的边界或风险在哪里? 优点:(1) 利用真实学习平台产生的细粒度点击流数据,避免了传统问卷调查的主观性和一次性测量的局限;(2) 提出了一种量化偏好分数的方法,能够追踪偏好的动态变化;(3) 研究设计巧妙,利用平台随机分配默认教师的特点,构建了偏好度量指标。缺点:(1) 偏好分数计算仅基于视频选择行为,未考虑其他学习行为;(2) 仅在两学期的一个课程中进行,样本代表性有限;(3) 未控制教师教学风格差异等潜在混淆变量;(4) 偏好阈值(0.2)的确定缺乏理论依据。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
利用多教师在线学习平台产生的点击流日志数据,通过量化学生选择不同教师视频的频率差异,追踪学生教师偏好的形成与演变过程。
实验合理度: ★★★☆☆
现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。
学术研究价值: ★★★★☆
利用多教师在线学习平台产生的点击流日志数据,通过量化学生选择不同教师视频的频率差异,追踪学生教师偏好的形成与演变过程;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: ;(2) 提出了一种量化偏好分数的方法,能够追踪偏好的动态变化;(3) 研究设计巧妙,利用平台随机分配默认教师的特点,构建了偏好度量指标。缺点:(1) 偏好分数计算仅基于视频选择行为,未考虑其他学习行为;(2) 仅在两学期的一个课程中进行,样本代表性有限;
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!