← 返回 PaperDaily 大模型与智能体

史前手印性别识别不再靠猜!三角验证框架准确率达88%

把不确定性当成信号而非噪声,用深度学习让万年手印“开口说话”。这套三角验证框架不仅给出预测,还告诉考古学家“这句结论到底有几分把握”。想看看AI和考古学怎么擦出火花?这篇值得一读。

史前手印性别识别不再靠猜!三角验证框架准确率达88%
原论文信息如下:
论文标题:
Decoding the Past: An Uncertainty-Aware Deep Learning Framework for Sex Attribution in Prehistoric Hand Stencils

发表日期: 2026年08月

发表单位: Azyri(美国迈阿密)、墨西哥华雷斯自治大学、宾夕法尼亚州立大学、西班牙豪梅一世大学

原文链接: https://arxiv.org/pdf/2608.14539v1.pdf

开源代码链接: 原文数据可用性声明中提供,详见论文。

开源数据集链接: 原文数据可用性声明中提供,详见论文。

史前手印中的性别密码:AI如何破解万年之谜?

在西班牙埃尔卡斯蒂略洞穴(El Castillo Cave)幽深的岩壁深处,散落着一批旧石器时代的红色手印。先民们把手按在石壁上,用赭石颜料吹出一个个手掌形状的“负片”。这些手印被视为人类最早的符号行为之一,被考古学家当作“签名”“仪式符号”甚至“护身符”。但两万多年过去了,一个基础问题依然悬而未决——这些手印的主人,到底是男还是女?
考古学家当然也想了很多办法。传统形态测量学靠手长、指长、指间比例(比如著名的2D:4D食指与无名指长度比)来区分性别,听上去挺科学,实际效果却一言难尽。先不说成年男性与女性之间手部尺寸存在大面积重叠,单单是“现代人群和史前人群的体型差异”这一项,就足以让训练好的判别公式直接失效。传统方法在跨人群迁移时准确率往往只有60%–65%,和抛硬币相比,也只能说是“略胜一筹”。更头疼的是,同一只手的喷绘图案,不同人测量尺寸最多可以差出5毫米
(a) img_26 (b) img_28 (c) img_31 (d) img_38
来自埃尔卡斯蒂略洞穴(Snow 2006)的四幅史前手印图像。可以看到,受颜料侵蚀、岩石纹理和光照不均的影响,手印边界的勾勒并不轻松。
过去二十多年,研究者尝试过各种花式操作:早期用Fisher线性判别分析,后来有人引入SVM(支持向量机),再后来又有人用手工标注地标点的几何形态测量学,最近的2025年工作甚至把深度学习模型搬了进来。表1展示了这一领域代表性研究的不同技术路线——可以说,从手工特征到自动特征,从线性判别到深度神经网络,考古学家能试的基本都试过一遍。
Table 1
表1:按训练数据、测试数据、特征提取方式、决策规则与实验协议分类的史前手印性别归属研究对比。缩写:LDA为线性判别分析,DNN为深度神经网络,SVM为支持向量机。
但问题在于:这些方法大多默认“输入是干净的”。可史前手印偏偏不干净——颜料扩散、岩石裂缝、轮廓残缺,连手工描边都费劲。更要命的是,史前手印没有生物学真值(ground truth),你根本没法知道两万年前那只手到底属于谁。面对这种三重不确定性,硬套一个“端到端分类器”然后自信地输出一个性别标签,多少有点自欺欺人。
这篇由美国Azyri公司、墨西哥华雷斯自治大学、宾夕法尼亚州立大学和西班牙豪梅一世大学合作完成的论文,给出的解法思路很别致:不试图消除不确定性,而是把不确定性显式建模、传播、聚合,让最后输出的结论带着置信度、证据强度和“我有多大把握”的可视化解释。简单说,AI不仅要告诉考古学家“这是女性”,还要告诉他“这句话有几分可信,依据是什么”。

不确定性感知框架:从图像到结论的全程把控

整个框架从一张模糊的史前手印照片开始,到最后输出性别结论和置信度,共分三个主要阶段(图2):阶段一完成轮廓提取与增强,阶段二是集成分类,阶段三则通过多重证据做后验解释与一致性校验。
Figure 2
图2:不确定性感知推理系统总览,用于量化史前洞穴手印中的性别二态性。(图片由Gemini Notebook基于作者提示词生成)

阶段一:轮廓提取与增强——让不确定性“显形”

阶段一的操作思路可以概括为“不把鸡蛋放在一个篮子里”。
首先,每张史前手印图像都会走两条处理路径:原始图像色调增强版本。为什么要做两份?因为洞穴岩壁上的手印往往颜色深浅不一、受光照影响严重,只取一种视觉解释太冒险,双路径可以避免“赌错方向”。这就是所谓的源级不确定性建模。
接下来是人工勾勒轮廓。传统做法是让一位专家描一条“最靠谱”的边界。这里改成在原始和增强图像上各描一条独立轮廓,得到两个主要轮廓S₁和S₂。为什么不让同一个人在两张图上描出尽可能一致的边界?恰恰相反,两条轮廓之间的差异,正好反映了标注层面的不确定性——不同观察者对边界的判断不会完全一致(图7)。这种差异不再被当作噪声丢掉,反而成为后续增强的“原材料”。
(a) Manual contouring (b) Original hand stencil (c) Enhanced hand stencil
图7:原始版与增强版手印图像上的人工轮廓描绘对比。左侧是轮廓标注过程,(b)和(c)分别展示原始图像与增强图像的视觉差异。
拿到S₁和S₂之后,文章又设计了四种二值运算来生成更多形态变体:

AND运算(交集)Sand:取两条轮廓共有区域,得到“最保守”的手形。

OR运算(并集)Sor:取两条轮廓的并集,得到“最宽松”的手形。

AVG运算(逐像素平均)Savg:对两条轮廓的二值图逐像素取平均,得到介于两者之间的概率图。

形态学中间集Smid:对两条轮廓做形态学中间集合运算,类似求几何意义上的“中位曲线”。

于是,原本两条轮廓就扩展成了六个二值变体:S₁、S₂、Sand、Sor、Savg、Smid。图6完整展示了这一“从两张图到六个变体”的流程。
Figure 6
图6:轮廓提取与增强流程(阶段一)。从左到右:手工轮廓在原始与增强手印上进行,随后提取两个主要轮廓并进行几何归一化。数据增强阶段在提取的轮廓之间执行四种二值运算(AND、OR、AVG和形态学中间集)。最后,3D组合算子将六个结果变体(两个主要轮廓+四个二值增强)组合成三通道表示。
接下来的操作很关键:六个二值变体各自只是一张单通道图,而主流的图像分类模型(比如EfficientNet)吃的是三通道输入。论文把六个变体按五种策略组合成三通道表示,就好比把不同“视角”的手形叠在同一张RGB图里:
公式1
第一组组合S₁₂O:以S₁为第一通道、S₂为第二通道,叠加OR运算结果Sor为第三通道,得到“宽松版”三通道表示。
公式2
第二组组合S₁₂V:以S₁、S₂为前两通道,叠加AVG平均结果Savg,得到“平均版”三通道表示。
公式3
第三组组合S₁₂M:以S₁、S₂为前两通道,叠加形态学中间集Smid,得到“中位版”三通道表示。
公式4
第四组组合S_AOV:前两通道换成交集Sand和并集Sor,第三通道为平均结果Savg。
公式5
第五组组合S_AOM:前两通道为Sand和Sor,第三通道为形态学中间集Smid。五种组合方式共同完成对边界不确定性的“枚举式”采样,为每个手印生成12个合理的轮廓实现。

阶段二:当代X光数据训练与双架构集成

分类器不是在史前手印上训练的——因为根本没有史前真值可用。论文选用了RSNA骨龄挑战数据集(北美放射学会骨龄挑战数据集),里面包含14036张儿童左手X光片,受试者年龄从1个月到19岁,自带性别标注。这个数据集选用得很有讲究:它覆盖了从婴幼儿到青少年的完整发育阶段,而史前手印中恰好有大量儿童和青少年参与创作的证据。表2展示了数据集的划分情况。
Table 2
表2:RSNA骨龄挑战数据集样本统计。训练集12611张,验证集1425张,测试集200张(男女各100张)。
X光片在送入模型前,先用Segment Anything Model(SAM,Meta提出的通用分割模型)做零提示分割,自动提取手部轮廓。图3展示了几张测试集X光片和对应轮廓的效果。
Figure 3
图3:当代测试集X光图像(上排)及其提取的轮廓(下排)代表样本。每列展示一个案例,标注了性别与年龄。
Figure 4
图4:训练集、验证集和测试集中不同性别的骨龄分布。可以看到样本在10–16岁年龄段最为集中,此时手的性别二态性已稳定显现。
模型架构上,研究选了两种“性格迥异”的骨干网络:EfficientNet-B3(经典的基于神经架构搜索的卷积网络,以效率著称)和MobileViT-S(把卷积与Transformer混合在一起的轻量级视觉模型)。每种架构各训练10个实例,最终得到两组各10个模型的集成。同一架构不同初始化、不同数据划分训练出的10个模型,个体之间有差异,集成之后既提升鲁棒性,又提供了天然的“分歧度”信号——如果10个模型对同一个手印看法不一致,那模型自己就在“告诉你”这个样本很棘手。

三角验证策略:预测、流形与归因的三重印证

集成模型输出了性别预测和置信度,但论文的野心不止于此。它设计了三种证据来源交叉验证,也就是所谓的三角验证策略
第一条证据线是集成预测本身。以EfficientNet-B3集成在单个轮廓变体上的输出为例,通过sum和max两种聚合规则决定最终类别,同时计算所有变体对预测类别的支持比例(SSR,即Support for the predicted class across all silhouette variants),用这个比例来度量内部一致性。
第二条证据线是无监督潜空间分析。把模型倒数第二层的特征用UMAP(Uniform Manifold Approximation and Projection,均匀流形逼近与投影)压缩到二维平面,如果一个手印的周边邻居大多是某一性别,那它在流形结构上就形成了独立于监督信号的天然佐证。为了把这种局部关系变成可量化的证据,论文再用k-NN(k-Nearest Neighbors,k近邻分类器)对每个样本的最近邻进行投票,得到与集成预测相对独立的“流形认证”。图8展示了其中一个EfficientNet-B3模型生成的二维流形。
Figure 8
图8:由其中一个EfficientNet-B3模型生成的可解释二维流形,为减少视觉杂乱,每个手印仅使用了三种轮廓变体Sand、Sor、Smid。不同色点代表不同性别或年龄组的嵌入位置。
第三条证据线是可解释性归因。论文使用LayerCAM(层间类激活映射,CAM即Class Activation Mapping类激活映射的一种层级化变体),生成模型分类时的空间注意力热图,判断模型究竟是靠手指长度、手掌形状这类生物学上合理的性别二态性特征做决策,还是在拿背景纹理糊弄人。图11展示了通过几何中位数聚合后的LayerCAM归因图。
Figure 11
图11:通过几何中位数聚合12个轮廓变体和10个EfficientNet模型实例得到的鲁棒LayerCAM归因图。颜色越亮,表示模型在分类时越依赖该区域。
当三条证据线指向同一结论时,预测被认为是“形态学上稳定”的;反过来,三者在某些案例上的冲突会直接拉低内部一致性指标,提醒研究者该案例属于“歧义样本”。图10的敏感性分析显示,SSR值在不同k-NN参数设定下稳定保持在0.5以上,说明这种流形认证不是偶然。
Figure 10
图10:平均SSR(所有轮廓变体中对预测类别的支持比例)作为k的函数。在k∈[1,50)范围内,SSR始终高于0.5,表明k-NN预测对k值选择不敏感,结果可靠。
Table 5
表5:在10个EfficientNet-B3实例的二维流形中,12个轮廓变体的k-NN聚合分类性能汇总。

实验结果:当代验证与史前应用的双重检验

先看当代数据上的表现。表3展示了两种架构在按年龄分层测试集上的准确率。在10–17岁年龄段,两种架构的集成分类准确率均超过了88%,其中MobileViT-S集成的表现尤为突出。整体来看,sum聚合规则总体略优于max聚合规则。值得一提的是,这一结果建立在严格按年龄分层、分别统计的基础上——论文没有把“总体准确率好看”当作唯一目标,而是把各年龄段的差异明明白白摆出来。
Table 3
表3:EfficientNet-B3和MobileViT-S在当代数据上的性能表现。展示按年龄分层的测试集结果以及训练集和验证集的整体结果。单个模型实例的结果以平均准确率±标准误(SEM)表示,同时给出sum和max聚合规则下的集成准确率。方括号表示包含边界值,圆括号表示不包含。
图9的混淆矩阵进一步揭示了错误的分布规律:几乎所有性别分类错误都集中在儿童组,尤其是青春期前的样本。这其实完全符合生物学直觉——6岁男孩和6岁女孩的手部形态差异本来就非常小,谁来了都难分。真正支撑史前应用的是那些手部性别二态性已经稳定的年龄组。
Figure 9
图9:两种集成架构(EfficientNet-B3与MobileViT-S)在按年龄分层的测试数据上的混淆矩阵,采用sum聚合规则。
接下来是最具悬念的部分——史前手印应用。论文选取了9个旧石器时代手印作为案例,其中4个来自埃尔卡斯蒂略洞穴,5个来自科斯凯、肖维、佩什梅尔等著名洞穴(图5)。这些案例并非随机抽样,而是特意选择了以往研究提出过初步性别假设的手印,通过新框架来复盘旧结论是否站得住脚。
Figure 5
图5:探索性研究(Mollineda等,2025)中分析的五个史前手印图像,标签注明来源洞穴。
从9个案例的预测情况来看,这组案例被设计得颇有层次感:一部分手印在集成预测、流形邻居和LayerCAM归因上高度一致,属于“高置信度案例”;另一部分则在三条证据线之间存在明显分歧,被明确标记为形态学上的模糊样本。这种“有的说得死,有的摊开手”的输出方式,恰恰是考古学家最需要的——因为在现实考古推理中,知道“不确定性有多大”和得到结论本身同等重要。
Table 4
表4:9个史前手印案例在不确定感知框架下的预测、置信度与内部一致性汇总。案例选择与Mollineda等研究保持一致,方便直接对比。
Table 6
表6:整合空间归因模式与聚合模型的解释性分析结果,展示模型预测与解剖学先验知识之间的对应关系。

考古学意义与局限性:AI不是万能钥匙

这篇论文最大的贡献,或许不在于把史前手印性别预测的准确率推高了多少,而在于把“不确定性”从考古推理的噪声变成了可量化的信号。以往的研究者面对预测结果只有一个干巴巴的性别标签,没法判断这次预测到底靠谱不靠谱。而这个框架输出的是一整套“证据包”:模型聚合成分、流形邻域结构、归因热区分布,三者互相衬托,让考古学家可以在更完整的证据链基础上做判断。
同时也要清醒地看到局限性。真实生物学性别史前无法观测,当代人群与旧石器人群之间跨万年尺度的形态差异不可能靠算法完全抹平;而且论文展示的只有9个案例,样本量小,更像是“框架可用性演示”而非“系统级大规模验证”。手工轮廓勾勒仍然需要专家介入,耗时且带有主观性,会限制框架的高通量应用。如果未来能结合自动化轮廓提取并纳入更多样化的史前样本,整套方法论的说服力会更上一层楼。

未来展望:从性别推断到更广泛的考古AI应用

这套不确定性感知框架的适用范围显然不止手印性别识别。同一个“多种实现生成 + 集成模型 + 多证据三角验证”的思路,完全可以迁移到更广的考古AI场景:比如岩画动物物种判别、陶器纹饰的工艺溯源、古文字符的自动化分类,甚至化石骨骼的性别与年龄推断。这些任务的共性都是——没有真值、样本退化、需要跨域迁移。换句话说,只要考古学家还在跟“残缺证据”打交道,这套方法论就有用武之地。
更进一步看,框架中“用多模型多实现生成不确定性边界 + 用可解释性工具验证决策依据”的范式,对整个AI可解释性社区也有参考价值。它示范了如何在低标注、高噪声领域把黑盒模型改造成能给出“证据化结论”的推理工具。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?面对史前洞穴手印,考古学家一直在争论创作者是男是女。本文提出不确定性感知深度学习框架,通过双图像处理、剪影增强与多模型集成,让性别推断准确率超过88%,并输出可靠置信度。
这篇工作最值得看的点是什么?在当代数据上,EfficientNet-B3集成在12-19岁年龄组达到88.4%准确率,在6-12岁组达到85.4%。在史前数据上,9个案例中多数产生稳定预测,部分高置信度案例(SSR=1, ACM>0.5)与历史假设一致,部分案例显示分歧。
这篇工作的边界或风险在哪里?优点:(1) 创新性地将不确定性管理贯穿整个分析流程,从图像处理到最终决策;(2) 三角验证方案(集成预测、潜在空间分析、可解释性归因)提供多维度证据;(3) 结构化剪影增强策略有效处理轮廓不确定性;(4) 置信度指标(SSR和ACM)为考古解释提供量化依据。缺点:(1) 依赖当代数据训练模型,跨时代泛化性存在根本性局限;(2) 手动轮廓标注仍受主观性影响;(3) 样本量小(仅9个案例);(4) 未进行超参数优化,可能未达到最佳性能。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆不确定性感知框架的思路在考古AI交叉领域算得上有新意,但整体依然建立在已有集成学习和可解释性方法之上,属于“组合式创新”多于“原理性突破”。

实验合理度:★★★★☆当代数据集上的年龄分层评估做得很扎实,统计口径清楚,训练和验证划分合理;但史前部分只有9个案例,更像框架演示而非严格验证,扣一星。

学术研究价值:★★★★☆把不确定性量化和可解释AI引入考古推断,对“低标注、高噪声、跨域迁移”场景有很好的示范效应,研究方法论本身有迁移潜力。

稳定性:★★★☆☆双图像处理+多轮廓+多模型集成显著提高了预测稳定性,但跨领域迁移仍受制于X光到手印的模态鸿沟,遇到高退化手印时预测方差会明显放大。

适应性以及泛化能力:★★★☆☆在当代数据上跨年龄表现令人满意,但史前案例仅覆盖少数西欧洞穴,跨人群、跨岩画类型、跨保存状态的泛化能力缺乏证据。

硬件需求及成本:★★★★☆EfficientNet-B3和MobileViT-S均属轻量架构,单卡即可完成训练;但手工轮廓标注阶段需要专业人员投入,整体人力成本不低。

复现难度:★★★☆☆论文在数据可用性声明中提供了代码和数据线索,RSNA数据集可公开申请,但史前手印轮廓的标注依赖原始图像与专家判断,复现时较难保证完全一致。

产品化成熟度:★★☆☆☆当前形态更像考古研究辅助工具,距离产品化还差一个“自动化轮廓提取+专家校准闭环”;作为研究原型是合格的,直接面向博物馆或考古工地输出结论则还不够成熟。

可能的问题:9个史前案例的样本量不足以构成统计学检验;LayerCAM归因与性别二态性区域的对应关系多为定性描述,缺乏定量指标;当代数据与史前形态之间的架构鸿沟并未被正面解决,只是通过不确定性区间做了软性缓冲。


主要参考文献

[1] Becerra K, Mederos B, Snow D, et al. Decoding the Past: An Uncertainty-Aware Deep Learning Framework for Sex Attribution in Prehistoric Hand Stencils[J]. arXiv preprint arXiv:2608.14539, 2026.
[2] Snow D. Sexual dimorphism in Upper Palaeolithic hand stencils[J]. Antiquity, 2006, 80(308): 390-404.
[3] Wang M, et al. Machine learning for sex determination of prehistoric hand stencils[J]. Journal of Archaeological Science, 2010.
[4] Galeta P, et al. Hand size and sexual dimorphism in prehistoric hand stencils: A cross-population test[J]. American Journal of Physical Anthropology, 2014.
[5] Mollineda R A, et al. Deep learning for sex prediction from prehistoric handprints[J]. 2025.
[6] Fernández-Navarro J, et al. A multi-source approach to sex and age estimation in Paleolithic hand stencils[J]. 2025.
[7] Kirillov A, et al. Segment Anything[C]. ICCV 2023.
[8] Larson D B, et al. RSNA Bone Age Challenge[J]. Radiology: Artificial Intelligence, 2018.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
万年的手印,AI来听。
性别之谜,代码里寻。
不确定性,不再是困窘,
加入龙哥读论文,一起破译远古的回音!🔍
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。