← 返回 PaperDaily 大模型与智能体

只用自我中心视频,ResNet-18学出偏心度偏好

这篇论文最有意思的地方,不是它又堆了一个更大的模型,而是它故意把模型“眼前能看见什么”这件事掐得很死,然后看它到底会学出什么。结果很反常识:中心看细节,周边看场景,连脑区对齐都能对应上。

只用自我中心视频,ResNet-18学出偏心度偏好
原论文信息如下:
论文标题:
Eccentricity-Constrained CNN Training Reveals Adaptive Information Coding Around the Visual Field
发表日期:
2026年07月
发表单位:
California State University, San Bernardino; Carnegie Mellon University
原文链接:
https://arxiv.org/pdf/2607.19316v1.pdf
如果只看结果,这篇工作其实挺“老实”:没有上来就说模型更大、更深、更猛,而是反过来把模型的视野掐窄,再看它到底会学出什么。结果却很有意思——中心视野更像“细节党”,周边视野更像“场景党”,而且这种分工不只是分类分数上的小聪明,连人脑视觉皮层里的偏好也能对上号。🤨
这类研究最容易被误解成“又做了一个视觉分类实验”。其实它真正想问的是:自然经验本身,会不会把视觉系统训练出不同的偏心度编码。如果答案是肯定的,那就说明“中心看人脸、周边看场景”不只是神经科学里的一张漂亮图,而是从日常第一视角经验里慢慢长出来的组织规律。

中央vs周边,信息利用差异显著

先把概念说人话。所谓偏心度,指的是视觉刺激落在视野中心还是边缘。中心区域像“高清镜头”,能看清细节;周边区域像“广角镜头”,更适合抓整体布局和大场面。人类视觉系统并不是平均使用这两块区域的:看脸、读字时,中心更吃香;看街景、房间、户外环境时,周边往往更有用。
这篇论文的起点,就是把这个常识变成可检验的机器学习问题:如果只给模型看中心,或者只给它看周边,它会不会真的学出不同的表示?更进一步,这种差异会不会和人脑视觉皮层里的区域偏好一致?为了回答这个问题,论文没有用普通静态图像集,而是用了带眼动信息的自我中心视频数据。这一步很关键,因为第一视角视频里,什么东西出现在中心、什么东西掉到周边,本来就更接近真实生活。
图1:方法总览。VEDB帧和眼动元数据被处理为不同偏心度约束输入,随后用SimCLR进行预训练,并在下游分类与fMRI编码任务中评估。
图1:方法总览。VEDB帧和眼动元数据被处理为不同偏心度约束输入,随后用SimCLR进行预训练,并在下游分类与fMRI编码任务中评估。
这里的缩写也顺手解释一下。VEDBVisual Experience Dataset,中文可理解为“视觉经验数据集”;SimCLRSimple Framework for Contrastive Learning of Visual Representations,中文通常译作“视觉表征对比学习的简单框架”;NSDNatural Scenes Dataset,即“自然场景数据集”。这些名字不花哨,但都很实在:一个负责提供真实第一视角经验,一个负责学表征,一个负责验证人脑对齐。

自我中心数据训练,模型效果良好

方法上最核心的动作,其实就一句话:把同一帧图像切成“只看中心”和“只看周边”两种版本,再分别训练模型。论文里用了四种输入条件:Baseline(原图)、Fovea-Gaze(以眼动位置为中心的局部裁剪)、Periph(去掉中心后只保留周边)、Periph-NF(周边图像再加上 NeuroFovea 变换)。其中 NeuroFovea 是一种模拟周边低分辨率特性的“类视网膜”变换,能把周边信息变得更像生物视觉里的粗粒度编码。
训练骨干网络选的是 ResNet-18,不是那种动不动上百层的“堆料型选手”。这反而有好处:架构足够标准,实验差异更容易归因到输入方式,而不是模型复杂度。训练目标用的是 SimCLR 的对比学习。通俗点说,就是让同一张图的两种增强视图彼此靠近,不同图像尽量分开。这样做的好处是,不需要人工标很多标签,模型也能先学到比较通用的视觉表示。
图2:VEDB模型在预训练和线性探测阶段的性能曲线。
图2:VEDB模型在预训练和线性探测阶段的性能曲线。
从实验设计看,这里有一个很“工程化”的点值得注意:所有条件都走同一套两阶段流程,先自监督预训练,再用冻结骨干做线性探测。也就是说,比较的不是“谁更会调参”,而是“谁真的学到了更有用的表示”。论文还特意把数据切分做到会话级别,避免相邻帧泄漏,这一点很重要,不然视频数据最容易出现“前一帧见过、后一帧认出来”的假聪明。
结果上,模型没有翻车。更准确地说,是在自我中心数据上训练出来的表征,足以和中等规模的非自我中心数据集竞争。这是这篇工作的一个核心信号:即便 VEDB 的语义覆盖不如 ImageNet 那么花里胡哨,数据也更有时间相关性,但它仍然能学出对下游任务和脑区预测都不差的表示。换句话说,真实经验的统计结构,本身就挺有料。

实验结果分析:为什么它能 work

先看一个最直观的现象:Fovea-Gaze 在不少任务上更占优,尤其是那些和细节、人物、屏幕、社交信息有关的类别。这个结果并不神秘。中心裁剪把大量无关背景切掉了,留下的往往正是分类最有辨识度的局部线索。对“电脑工作”“社交”“玩游戏”这类场景来说,中心区域常常包含脸、手、屏幕、桌面小物件,信息密度很高,模型自然更容易抓住。
相反,周边模型在某些户外或大动作场景里更有优势,这也符合常识:滑板、飞盘、打球这类动作,主体往往不总是在中心,反而周围环境和整体布局更能提供线索。论文里还观察到 Periph 和 Periph-NF 之间存在差异,说明“只保留周边”之外,周边信息到底是保留了真实细节,还是被模拟成了更粗糙的纹理编码,也会影响模型学到什么。这一点挺关键,因为它说明周边视觉不是简单的“看不清”,而是“以另一种编码方式看清”。
图3:基于17个任务标签的混淆模式进行多维尺度分析,不同类别之间的相对距离表示更容易被混淆。
图3:基于17个任务标签的混淆模式进行多维尺度分析,不同类别之间的相对距离表示更容易被混淆。
再往深一层看,论文没有只盯着准确率,而是看了类别之间的混淆结构。这个思路比单纯报一个分数更有信息量,因为它能告诉读者模型到底把哪些任务看成一类。结果显示,模型自己会把“做饭”“洗碗”“解数独”这类偏静态、室内、局部动作的任务聚在一起,也会把“走路”“探索”这类移动型任务聚在一起。也就是说,自监督学习并不只是学到纹理和边缘,它还能从第一视角经验里长出某种语义组织。这比很多“看起来分得开,实际上只是分数好看”的工作要实在得多。
表1:预训练与线性探测的汇总指标。
表1:预训练与线性探测的汇总指标。
如果只看下游迁移,结论也挺耐人寻味。VEDB 预训练模型在场景分类上的迁移明显比在人脸分类上更强。这个结果其实很符合数据分布:第一视角视频里,场景信息天然更丰富,人脸虽然也会出现,但并不是主菜。所以模型学到的表示更容易泛化到 Places365,而不是 VGGFace2。这里没有“模型突然会看脸”的神话,反而是很朴素的数据统计学:喂什么数据,模型就更擅长什么
更有意思的是,Fovea-Gaze 在人脸和场景两个迁移任务上都比周边模型更强。这个结果看上去有点反直觉:既然场景更适合周边,为什么中心裁剪还赢了?论文给出的解释比较谨慎,核心意思是:Places365 这种场景分类并不是纯粹靠“看大环境”,而是也混入了不少局部语义线索,比如建筑物、标牌、室内物体、人物关系等。也就是说,场景任务并不等于“只看周边”,中心区域同样可能含有关键语义。
表2:按条件差异排序的域内分类代表类别。
表2:按条件差异排序的域内分类代表类别。
这张表的价值不在于“谁多了几个百分点”,而在于它把差异拆到了具体类别上。比如“玩电子游戏”“电脑工作”“社交”这类任务,中心裁剪更容易赢;而“滑板”“飞盘”“打球”这类任务,周边模型更容易占优。虽然不是每个类别都严格符合这个规律,但大方向很清楚:中心更像局部信息放大器,周边更像场景结构扫描仪。这类分析比只报一个总分更接近论文想回答的本质问题。

fMRI验证:模型不是只会“做题”,还得对上大脑

如果说前面的分类实验还只是“模型自己说自己学得不错”,那 fMRI 编码模型就相当于把模型拉去和人脑对账。这里用的是 编码模型:先把图像喂给预训练好的网络,取出不同层的特征,再用线性回归去预测某个脑区的体素响应。预测得越准,说明模型表示越接近人脑在看同一张图时的表征。
图4:fMRI编码模型性能。
图4:fMRI编码模型性能。
这里最值得注意的不是“某个模型把某个脑区分数刷高了多少”,而是整体趋势:用自我中心经验训练出来的模型,在人类视觉皮层上能达到和中等规模非自我中心数据集相近的预测能力。这件事挺重要,因为它说明“数据像不像真实生活”,不只是一个数据集审美问题,而是会影响模型是否贴近脑表征。
更细一点看,论文做了脑区级别的比较。结果显示,在 PPAParahippocampal Place Area,海马旁回场景区)和 RSCRetrosplenial Cortex,后扣带/脾后皮层)这些场景选择性脑区里,周边模型比中心模型更占优;而在 V1 里,中心模型又更好。这就很像人类视觉系统的老套路:低级视觉更偏中心高分辨率,高级场景区更吃周边统计。论文不是把这个规律“讲出来”,而是用模型和 fMRI 一起把它“对出来”。
表3:各脑区不同模型条件之间的编码性能比较。
表3:各脑区不同模型条件之间的编码性能比较。
论文还做了 unique variance,也就是“某个模型自己独占解释了多少方差”。这个分析很有说服力,因为它能避免两个模型都看起来不错、但其实学的是同一套东西。结果显示,周边模型在 PPA 和 RSC 里有更高的独特解释力,而中心模型在 V1 里更强。说白了,这不是简单的“谁分数高谁赢”,而是“谁更像这个脑区真正偏好的信息来源”。

偏心度与脑区匹配:不是巧合,是组织原则

这篇论文最有价值的地方,在于它把“中心/周边差异”从行为现象、神经现象,推进到了自然经验塑形的层面。也就是说,不是先验地假设大脑就该这样分工,而是让模型在更接近真实生活的数据上自己长出来,再去看它是否与脑区组织一致。结果恰好说明:偏心度偏好很可能不是孤立出现的,而是任务统计、视野位置和皮层组织一起协同塑造的。
不过,这里也要说一句实话:论文的效应整体是小而稳定,不是那种一眼把对手打穿的夸张结果。尤其在迁移到人脸任务时,VEDB 训练并没有占到便宜,说明数据内容覆盖仍然有限。换句话说,这项工作更像是在证明一个组织规律,而不是宣告某种万能训练范式。它的强项是“解释结构”,不是“碾压榜单”。这点很重要,科研里最怕的就是把结构性发现吹成性能神药。
补充图4:基线VEDB模型在各功能脑区中的编码性能与体素噪声上限关系。
补充图4:基线VEDB模型在各功能脑区中的编码性能与体素噪声上限关系。

方法探讨与未来方向

这篇论文给后续工作留下了几个很实在的切口。第一,第一视角数据+眼动信息是很有潜力的训练材料,但数据质量和语义覆盖仍然是瓶颈。第二,周边与中心并不是非黑即白的二分法,真实视觉系统里更可能存在连续的、多尺度的偏心度编码。第三,当前实验主要是 ResNet-18 + SimCLR,后续完全可以去试更强的 backbone、不同自监督目标,甚至和时序建模结合,看这种偏心度偏好会不会更明显。
更现实一点说,这类方法如果想走向更广泛应用,不能只盯着“神经科学对齐”这个漂亮标签,还得回答工程问题:第一视角数据采集成本高不高,眼动同步稳不稳,周边变换会不会引入额外偏差,训练是否会受任务类别分布影响很大。尤其是当目标从“解释脑区”转向“做产品”时,数据的偏置会立刻变成问题。模型也许能学到偏心度规律,但未必适合直接搬到通用视觉系统里。
不过,论文真正值得记住的,不是某个单点指标,而是它提供了一种很干净的研究范式:把视觉系统的组织假说,转成可控数据、可控训练和可验证脑区对齐。这比单纯堆一个大模型然后说“看,效果不错”更有学术含金量,也更接近真正能解释机制的研究路线。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:这篇论文到底解决了什么问题?它想回答的不是“哪个模型更大”,而是“自然第一视角经验会不会让模型学出中心/周边不同的信息编码方式”。结果表明,中心更偏细节和局部语义,周边更偏场景结构,而且这种差异还能在人脑视觉皮层里找到对应。

问题2:SimCLR、线性探测、编码模型分别是什么意思?SimCLR 是自监督对比学习方法,先让模型学会“什么样的图像表示算相似”;线性探测就是把骨干网络冻结,只训练一个简单分类器,看表示好不好;编码模型则是把图像特征映射到脑区响应,检验模型表示是否接近人脑。三者合起来,既看“会不会分类”,也看“像不像大脑”。

问题3:为什么周边模型在场景脑区里更有优势?因为场景选择性脑区本来就更依赖大范围布局、空间关系和整体结构,而这些信息在周边视野里更容易保留。论文的 unique variance 分析进一步说明,这种优势不是偶然波动,而是有稳定的独占解释力支撑。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

创新点不在“换个大模型”,而在“用偏心度约束的自我中心数据去检验视觉编码假说”,这个切口挺干净,也挺像真正的机制研究。

实验合理度:★★★★☆

数据切分、冻结骨干、跨任务迁移、fMRI 编码和 unique variance 都比较完整,比较像一套能自圆其说的证据链。

学术研究价值:★★★★★

它不是在追一个短期榜单,而是在回答视觉系统如何被自然经验组织,这种问题本身就值得做,也容易启发后续神经科学与表征学习研究。

稳定性:★★★☆☆

结果方向比较一致,但效应整体偏小,且对数据分布依赖明显,离“拿来就能稳跑产品”还有距离。

适应性以及泛化能力:★★★☆☆

对场景相关任务和脑区对齐很有启发,但对人脸等内容覆盖较少的任务泛化一般,说明数据统计仍然限制上限。

硬件需求及成本:★★★☆☆

ResNet-18 和线性探测不算重,但第一视角视频、眼动同步、fMRI 验证都不便宜,真正贵的不是算力,是数据和实验资源。

复现难度:★★★☆☆

方法本身不复杂,但依赖特定第一视角数据、眼动和脑成像流程,复现门槛主要卡在数据而不是代码。

产品化成熟度:★★☆☆☆

更像研究范式而非产品方案,适合做认知建模、视觉机制分析或特定场景的表征研究,不适合直接上生产线。

可能的问题:效应较小,数据覆盖偏窄,fMRI 结论虽稳但离通用结论还有距离;更像一篇把方向讲清楚的论文,而不是把问题一口气做满的论文。


主要参考文献

Dylan M. Diaz, Margaret M. Henderson. Eccentricity-Constrained CNN Training Reveals Adaptive Information Coding Around the Visual Field. arXiv:2607.19316v1, 2026.
Chen et al. SimCLR: A Simple Framework for Contrastive Learning of Visual Representations. 2020.
Allen et al. Natural Scenes Dataset (NSD). 2022.

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。