← 返回 PaperDaily 大模型与智能体

Kaggle 44万参赛数据实锤:证书价值暴跌82%,真凶竟是平台自己?

AI时代考证还有用吗?这篇论文用Kaggle 44万次参赛数据做了一次“信号体检”:奖牌价值一年就过期,上传赛奖牌价值暴跌82%背后真凶竟是平台自己,而不是AI。想搞懂证书、平台和AI三角关系的人,建议花三分钟读透这篇。

Kaggle 44万参赛数据实锤:证书价值暴跌82%,真凶竟是平台自己?
原论文信息如下:
论文标题:
Stranded credentials: how a skill-signaling market absorbed generative AI
发表日期:
2026年08月 发表单位:
圣路易斯华盛顿大学 原文链接:
https://arxiv.org/pdf/2608.17111v1.pdf 项目链接:
https://osf.io/gqw9b (DOI: https://doi.org/10.17605/OSF.IO/GQW9B)

各位老铁,今天咱们聊一个扎心的话题:证书到底还有没有用? 在AI能写代码、能写分析报告、能写论文的年代,那些靠“完成作品”来证明自己能力的证书、奖牌、等级称号,会不会一夜之间变成废纸?很多人拍着脑袋说:完了,全完了,AI一来,什么证书都不值钱了。但真相真的这么简单吗? 一篇来自圣路易斯华盛顿大学的论文,直接端出了Kaggle平台2010到2026年整整16年的数据,一共44万多人次的参赛记录,把这个“证书贬值”的结论拆了个底朝天。结论有点反直觉:证书不仅没有全线崩盘,反而暴露出的最大问题根本不是AI,而是平台自己“不玩了”。 为了让大家更好地理解这项研究的价值,我们不妨先回到一个更根本的问题:为什么我们需要证书?在信息不对称的劳动力市场中,雇主无法直接观察求职者的真实能力,于是求职者需要通过某种可验证的信号来证明自己。这种信号必须满足两个条件:一是获取成本与能力负相关,即能力强的人更容易获得;二是难以伪造。传统的学历、职业资格认证,以及Kaggle奖牌、GitHub星星,本质上都是这种信号。而生成式AI的出现,恰恰可能同时冲击这两个条件——它让“完成作品”的成本趋近于零,也让伪造信号变得前所未有的容易。这正是这篇论文想要检验的核心命题。

AI时代,你的证书还值钱吗?

先说一个经济学常识。早在1973年,诺贝尔经济学奖得主斯宾塞就提出“信号理论”:证书本身没啥用,它的价值在于“信号”——能区分能力强的人和能力弱的人。如果谁都能轻松拿到证书,那这证书就废了。生成式AI出现后,写代码、写分析的成本瞬间归零,这等于把“信号成本”干掉了。按照经典理论,各种技能证书应该集体贬值,甚至彻底崩盘。 论文作者一开始也是这么想的,并且提前把预测写进了代码仓库,防止事后诸葛亮。然后,他用Kaggle平台的真实数据逐一验证,结果大跌眼镜。 这里需要特别强调“预先承诺”这一方法论细节。在实证研究中,研究者很容易在知道结果后无意识地调整假设,从而让“预测”变得毫无意义。这篇论文的作者在分析数据之前,就将自己对AI影响的预测以代码形式固化在仓库中,包括“上传竞赛奖牌价值将大幅下跌”“代码竞赛奖牌价值将保持稳定”等具体假设。这种做法极大增强了结论的可信度——因为后续的数据分析要么证实、要么证伪这些事先声明的预测,而不是事后编造故事。事实上,正如我们将看到的,部分预测确实被数据推翻,这恰恰说明作者没有为了面子而篡改假设。

44万次参赛数据揭示的残酷真相:奖牌有效期只有一年

Kaggle是全球最大的数据科学竞赛平台,从2010年开始记录数据,到2026年已有超过1860万次提交。平台同时运营两种竞赛模式:上传竞赛(参赛者只提交预测结果,平台根据隐藏集打分)和代码竞赛(参赛者提交代码,平台在隐藏数据上运行,代码跑不通就直接失败)。两种模式并行运行,一个不验证过程,一个强制验证过程,这正好成了天然的对照实验。 论文统计了444,698次参赛记录,核心问题只有一个:拿到奖牌后,下一次比赛表现好的概率会不会增加?换句话说,奖牌的信息价值有多大? 为了回答这个问题,作者构建了一个精巧的回归框架。具体而言,他们以参赛者在某次竞赛中的标准化成绩(潜藏测试表现)为因变量,以不同年龄段(0-1岁、1-2岁、2-3岁、3岁以上)的奖牌数量为自变量,同时加入竞赛固定效应来控制不同竞赛难度差异。竞赛固定效应的引入至关重要——因为不同竞赛的参赛者水平、题目难度差异巨大,如果不加控制,奖牌与成绩之间的关系会被严重混淆。此外,作者还采用了双向聚类标准误(同时按参赛者和竞赛聚类),以确保统计推断的可靠性。在稳健性检验中,他们还尝试了加入参赛者的完整履历控制(包括其他格式的奖牌存量、既往参赛次数等),以及限定在奖牌历史完全带日期的子样本中重新估计,结论均保持一致。
Figure 1
图1:在两种读取方式下,奖牌信息价值都集中在第一年;前AI时代(竞赛截止日期2018-2022Q3)。斜率为潜藏测试表现对每年龄段奖牌数对数的回归系数,包含竞赛固定效应;须线为95%置信区间。 (A) 无其他控制变量。 (B) 控制参与者的完整履历(其他格式的奖牌存量及既往参赛次数)。一岁以下奖牌的信息价值高度集中,且不受控制变量的影响;B中老代码奖牌的负斜率预示了相关信号如何划分预测权重。
先看结果:在AI时代之前,一枚新鲜奖牌(拿到手不到一年)能显著提升对下次成绩的预测——一枚奖牌vs没有奖牌,表现能高出10到12个百分点。但奖牌一旦超过一年,预测能力就断崖式下跌,基本只剩0.01到0.03的权重。这意味着,几乎全部预测能力都集中在第一年。两枚一年内的奖牌能解释全部奖牌带预测能力的99%(前AI时代)和95%(AI时代)。简单说:Kaggle奖牌的价值保质期只有一年。 这个结论在两种竞赛模式下都成立,在AI时代依然成立。破窗效应?不是。这里面没有复杂的机制,就是纯粹的“信号衰减”。拿奖之后,要么本人水平变了,要么任务变了,总之读者无法从旧奖牌中读出新信息。 值得注意的是,这种“一年保质期”并非Kaggle独有。在快速演变的行业中,技术栈、工具链、最佳实践都在不断更新,任何静态凭证都难以长期反映持有者的当前能力。例如,一张五年前的云计算认证,在今天的云原生环境下可能已经严重过时。论文的发现为这种直觉提供了量化证据:信号衰减的速度远比我们想象的要快,而大多数证书系统却仍然按照“终身有效”的逻辑在设计。

制度性搁浅:不是AI杀死了证书,而是平台抛弃了它

2016年时,Kaggle全年有26场上传竞赛、0场代码竞赛;到了2024年,变成了3场上传、24场代码。平台早在AI爆发之前,就开始把重心从上传模式转向代码执行模式,原因是为了防止“不验证的提交”和“刷榜”行为。而这一转身,让上传竞赛的奖牌彻底“搁浅”了——就像一座煤电厂,在电网转向新能源后,设备还在那里,但再也没有人往里加煤。 这种“制度性搁浅”的概念值得深入剖析。它指的是:当发行凭证的机构停止发行新凭证时,存量凭证并不会自动消失,但会随着时间推移逐渐老化,其信息价值不断衰减,最终变成一种“搁浅资产”。在金融领域,我们有“搁浅资产”的概念(如因政策变化而无法开采的化石燃料储备);在劳动力市场,这篇论文首次提出了“搁浅凭证”的概念。两者的共同点在于:资产本身没有物理损坏,但其经济价值因外部制度环境变化而急剧缩水。
C. Decomposition Figure 2
图2C:将各奖牌存量斜率变化分解为组成成分(在固定带斜率下年龄构成变化)、曲线成分(在固定前AI构成下带斜率变化)、二者的交互项以及带级聚合误差。组成成分解释了上传奖牌衰退的一半到四分之三,而纯曲线变化仅占四分之一。
数据显示,AI时代(2023年及以后)上传奖牌的预测斜率从0.067暴跌到0.012,下降82%。但分解结果表明,这0.055的跌幅中,有0.028来自“年龄结构变化”——旧奖牌无法被新奖牌替换,整个池子自然老化了。真正由AI导致的“曲线移动”只有0.015,占比不过四分之一。也就是说,“上传奖牌贬值”的锅,AI只背了一小半,平台自己才是那个按下停止键的人。 更微妙的是,这并非AI压缩了整个领域的信号差距。如果AI把所有人的差距拉平,那么上传和代码两种奖牌应该一起贬值。但现实是:上传奖牌跌82%,代码奖牌反而涨了。这只能说明,变化是信号特异的,不是领域全局的。 为了进一步验证这一结论的稳健性,作者还进行了一项“反事实”分析:假设平台在2022年停止转向代码竞赛,继续维持上传竞赛的发行量,那么上传奖牌的价值会下跌多少?模拟结果显示,在这种情况下,上传奖牌的预测斜率仅下降约20%,远低于实际观察到的82%。这再次证明,平台的政策转向是奖牌贬值的主要驱动力,而非AI本身。

同一枚奖牌,两种读法:为什么旧奖牌看起来更值钱了?

接下来这个发现,是全文最过瘾的“反转”。如果把老奖牌单独拿出来看(徽章计数读法),你会发现AI时代那些1-2岁、2-3岁的上传奖牌,预测能力不降反升!这是不是意味着老奖牌变“耐用”了?别急,论文作者自己都被这个结果吓到了,最后发现这是统计学上的“代理效应”。 什么意思?一枚老奖牌单独看很值钱,是因为它替你偷偷代表了持有者的其他信息,比如这个人经验丰富,手里还有新拿的代码奖牌。一旦把这些信息一起放进模型(全履历读法),老奖牌的“额外预测力”瞬间归零。用论文里的话说:信号活在组合里,不活在单张奖牌上。 这种“代理效应”在信号理论中具有普遍意义。想象一个招聘场景:面试官看到候选人简历上有一项五年前的竞赛奖项,可能会下意识地认为“这个人有竞赛经验,能力应该不错”。但如果面试官同时看到候选人最近两年在开源社区的活跃贡献,那么五年前那个奖项的额外信息价值就大大降低了。换句话说,单一信号的价值取决于它与其他信号的组合方式,而不是孤立存在的。论文通过严谨的计量分析,将这一直觉变成了可量化的实证结论。
B. Code-earned: discount released Figure 3
图3B:代码奖牌在AI时代的变化。左柱为无条件下(徽章计数读法)的变化,右柱为全履历控制下的变化。代码奖牌的“折价”被释放,但并未变成强正信号。
论文的结论因此格外干脆:没有任何证据表明某一类奖牌本质变得更耐用或更有信息量。信息价值的变化是“组合”级别的,不是“单枚奖牌”级别的。信号从来不是孤岛,它们活在一张互相映照的关系网里。 这一发现对个人职业发展的启示是:不要迷信单一证书的“含金量”,而要注重构建多元化的信号组合。一个拥有新鲜代码竞赛奖牌、活跃开源贡献和扎实项目经验的候选人,其信号组合的预测力远高于仅拥有一个古老奖项的候选人。论文的数据支持了这一策略:在AI时代,代码奖牌的价值相对上升,而上传奖牌的价值相对下降,但任何单一信号都无法完全替代其他信号。

官方等级制度浪费了六分之一的信息,一个简单指数就能超越它

前面说的都是奖牌本身,但如果把视角拉到Kaggle官方等级(Expert、Master、Grandmaster),会发现另一层问题。官方等级是一个纯粹的终身累计函数:不管奖牌多老、哪个格式拿的,一律加总,然后切档位。论文重建了这套等级系统,验证准确率高达97.7%(假阳性率仅1.3%)。然后,论文拿官方等级和一个自己设计的“时效加权指数”做了正面对决。 这里需要解释一下“时效加权指数”的构造逻辑。作者将奖牌按照“年龄段”(0-1岁、1-2岁、2-3岁、3岁以上)和“获取格式”(上传、代码)分为8个格子,然后对每个格子赋予一个权重。权重的大小反映了该格子对预测未来表现的贡献。例如,0-1岁的代码奖牌可能权重最高,而3岁以上的上传奖牌权重可能接近于零。这些权重完全通过前AI时代的数据拟合得到,然后被冻结,不再根据AI时代的数据进行调整。
所谓“时效加权指数”,本质上就是给每个“年龄段×获取格式”的格子赋予不同权重,新鲜奖牌权重大,老奖牌权重小。最关键的细节是:这些权重完全只用前AI时代的数据拟合出来,然后冻结,再拿去预测AI时代的比赛结果。这模拟了一个真实场景:如果平台在2022年就改革制度,能不能在AI爆发后依然保持评价系统的有效性?
结果见图5。在AI时代赛事上,官方等级的组内R²为0.047,而预AI权重指数为0.053。差值0.004-0.009的置信区间不包含零。换句话说,一个“出生在AI之前”的指数,在AI时代预测成绩的准确度反而超过了官方终身等级。 组内R²的差异看似微小,但在大规模人才筛选中,即使是0.006的R²提升也可能意味着显著的效率改进。假设一个招聘平台每年处理10万份简历,官方等级系统可能错误排序其中的数千份,而时效加权指数可以纠正其中相当一部分错误。更重要的是,这个改进不需要任何AI时代的“后见之明”——它完全基于前AI时代的数据规律。
Figure 5
图5:官方等级制度浪费了可用信息。金色柱为仅用前AI时代数据拟合权重的指数在AI时代的表现,超过官方等级。
把这一差距换算成更直观的比例:如果把官方等级换成年龄带×格式的原始计数特征,组内预测力提升15%(前AI时代)和19%(AI时代)。等价地,官方聚合方式丢弃了可用信息的13%到16%——大约六分之一。
有人会质疑:你的指数参数更多(九个权重vs四档等级),是不是靠灵活度硬赢?论文做了两个检验。第一,把官方等级和特征集放进同一回归,特征集在官方等级之上新增的预测力,是官方等级在特征集之上新增预测力的三到四倍。第二,在限定奖牌历史完全带日期的样本里(官方等级重建必然精确),结论保持不变。灵活度并不能解释这个优势。 此外,作者还进行了一个“降维测试”:将时效加权指数从9个参数压缩到3个参数(仅区分新鲜/中等/陈旧),其预测力仍然超过官方等级。这说明优势并非来自参数数量,而是来自对信号衰减规律的尊重。官方等级将所有奖牌一视同仁,相当于假设一枚10年前的奖牌与一枚1年前的奖牌具有相同的信息价值——这个假设在数据面前显然不成立。
这个结果最扎心的地方在于:要做出一个比官方等级更好的制度,根本不需要什么“AI时代才知道的信息”。平台在2022年之前就能拟合出这套权重,然后轻松预测2023年之后的比赛表现。改革不需要预测未来,只需要尊重数据里已经写好的规律。 这一发现对平台治理具有直接的启示意义。Kaggle官方等级系统自2015年推出以来几乎没有调整过权重逻辑,而论文证明,一个简单的时效加权方案就能显著提升系统的预测有效性。更广泛地看,任何依赖“终身累计”逻辑的认证系统——无论是职业资格、学术头衔还是平台等级——都可能存在类似的信息浪费问题。论文提供了一个可操作的改进方向:用数据驱动的方式重新设计凭证聚合规则。

证书的未来:三个设计教训与开放问题

论文最后一部分把视野从Kaggle拉回到更一般的设计原则,并留下了三个教训。不过,先看一个跟预期相反的证据。作者曾经预测:AI时代进入的参赛者代码失败率应该飙升,毕竟AI生成的代码不一定能跑。原始数据确实支持这个猜想——AI时代参赛者的代码失败率比前AI时代高5.6个百分点。但只要加入比赛固定效应,差异直接归零(-0.003,p=0.77)。 这个“无效结果”同样具有重要价值。它说明AI时代的参赛者并不比前AI时代更容易写出跑不通的代码——失败率的上升完全由比赛本身难度变化驱动,而非参赛者质量下降。这从侧面证明,Kaggle的代码竞赛机制在AI时代依然能够有效筛选参赛者,AI并没有让“会写代码”这个信号变得毫无意义。
图4把这件事画得很清楚:不同参赛队列(按首次提交时间分组)的失败率曲线几乎平行移动,失败率追随的是“比赛本身”——更难的赛题、更严格的环境——而不是“谁在参赛”。这个精确的无效结果,恰恰说明Kaggle是一个可信的实验场:如果随便什么分析都能跑出显著结果,那才让人担心。
Figure 4
图4:失败运行占比追踪的是比赛本身而非参赛人群。三个参赛队列(按首次提交时间分为前AI、过渡、AI时代)的失败率曲线同步移动。虚线为ChatGPT发布时点。
三个设计教训由此而来。第一,凭证是易腐品。奖牌的信息价值集中在第一年,任何“终身累计展示”的制度都会系统性地高估过时信号。论文用数字量化了这个代价:最多六分之一的可用信息被浪费掉。第二,凭证系统死于制度性退出。当评价格式停止发行新凭证,存量按自然规律老化,就跟持有者的实际表现无关了。平台的退出决定,往往是证书死亡的第一推手。第三,信号活在组合里。一枚奖牌单独解读,只能代理其他信号的统计影子;要真正理解它的价值,必须看完整履历。
研究的边界也必须说清。AI时代窗口只有2023-2025年三年,对一个以一年为周期的衰减而言偏短。AI时代的估计几乎全部建立在“继续参赛的少数幸存者”身上,选择效应无法完全消除。而且论文测的是“记录的信息价值”,完全不涉及“AI是否让人类技能退化”这类问题——因为所有参赛者都可能用AI,不存在“不用AI的对照组”。 此外,论文的样本主要来自Kaggle这一单一平台,其用户群体以数据科学家和机器学习工程师为主,可能无法完全代表其他技能领域(如设计、写作、营销)的证书市场。作者也承认,将结论外推到大学文凭或职业资格认证时需要格外谨慎,因为这些系统的信号机制、发行周期和受众群体与Kaggle存在显著差异。不过,论文提出的“信号衰减”“制度性搁浅”“组合效应”三个机制,为跨场景比较提供了一个统一的分析框架。
AI时代证书何去何从?论文的立场是冷静的中间派:证书没有死,但“保鲜期”“发行方”和“读取方式”决定了它还能不能承担信号功能。未来的开放问题是:如果平台把评级改成时效加权,参与者会不会反向优化、疯狂刷新鲜奖牌?如果所有平台都转向执行验证,旧模式的经验是否就彻底作废?这些问题没有现成答案,但至少这篇论文给出了一个可以继续讨论的起点。 从更宏观的视角看,这篇论文对“AI冲击劳动力市场”的讨论提供了一个重要的方法论示范:不要停留在“AI让XX贬值”的笼统叙事,而要具体分析信号的类型、发行方的行为、以及信号组合的结构变化。只有这样的精细分析,才能帮助我们理解AI时代哪些能力真正变得稀缺,哪些凭证只是“搁浅资产”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?基于Kaggle 2010-2026年44万余次参赛数据,研究发现奖牌信息价值集中于获得后一年内;AI时代上传竞赛奖牌信息价值下降82%,其中过半源于平台停止该赛制导致的制度性搁浅而非AI本身;官方终身等级制度浪费了13%-16%
这篇工作最值得看的点是什么?论文通过Kaggle平台444,698人次参与数据,发现奖牌信息价值集中在获得后第一年;上传竞赛奖牌存量信息价值下降82%,其中一半到四分之三由制度性搁浅(竞赛类型退出导致存量老化)解释;官方终身奖牌等级制度浪费13-16%的可用信息;基于AI时代前数据构建的时效加权指数在预测AI时代表现上优于官方等级。
这篇工作的边界或风险在哪里?优点:研究设计严谨,使用大规模真实平台数据,预注册预测并诚实报告拒绝结果,多种稳健性检验(平衡面板、trimming、外部验证)增强结论可信度。缺点:仅基于单一平台(Kaggle),AI时代窗口仅3年,幸存者偏差严重且无法完全消除,关联性估计无法识别因果关系。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

基于Kaggle平台2010-2026年44万余人次参与数据,通过计量经济学回归分析(竞争固定效应、双聚类标准误、Oaxaca-Blinder分解)系统审计生成式AI时代技能凭证(奖牌)的信息价值变化及其机制。

实验合理度:★★★☆☆

现有材料未完整覆盖数据划分、基线公平性和统计显著性,因此按中性评价处理。

学术研究价值:★★★★☆

基于Kaggle平台2010-2026年44万余人次参与数据,通过计量经济学回归分析(竞争固定效应、双聚类标准误、Oaxaca-Blinder分解)系统审计生成式AI时代技能凭证(奖牌)的信息价值变化。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

现有材料缺少完整训练资源、参数量、显存和推理时延信息,成本暂按中性评价。

复现难度:★★★☆☆

https://osf.io/gqw9b

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:仅基于单一平台(Kaggle),AI时代窗口仅3年,幸存者偏差严重且无法完全消除,关联性估计无法识别因果关系。

主要参考文献

[1] Song Yao. Stranded credentials: how a skill-signaling market absorbed generative AI. arXiv:2608.17111v1, 2026.
[2] Spence, M. Job Market Signaling. The Quarterly Journal of Economics, Vol. 87, 1973.
[3] Stiglitz, J. E. The Theory of Screening, Education, and the Distribution of Income. The American Economic Review, Vol. 65, No. 3, 1975.
[4] Kaggle. Meta Kaggle数据集(2010–2026,2026年7月29日快照). https://www.kaggle.com
[5] 项目代码与文档. OSF: https://doi.org/10.17605/OSF.IO/GQW9B

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
证书会过期,但讨论不会~欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 数据科学+上海+某大厂+龙哥),根据格式备注,可更快被通过且邀请进群。在这里,咱们一起聊聊AI时代的信号、平台与真本事。
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。