← 返回 PaperDaily 视觉与图像

告别无穷受试者实验!UIC用PS视觉模型秒测散点图感知

这篇论文把图形感知领域的老底给掀了——四十年跑实验攒下来的编码排名,被一个彩虹色图的反转案例直接打脸。作者主张别再做无穷无尽的受试者实验,而是把可视化当作图像,用视觉计算模型来评估。用散点图相关性判断做验证,模型居然复现了人类感知曲线。想搞明白人到底怎么看图,这篇值得细读。

告别无穷受试者实验!UIC用PS视觉模型秒测散点图感知
原论文信息如下:
论文标题:
Marks, Channels, and Dead Ends: Stop Running Graphical Perception Studies and Start Modeling Visualizations as Images
发表日期: 2026年08月
发表单位: 伊利诺伊大学芝加哥分校电子可视化实验室
原文链接: https://arxiv.org/pdf/2608.07834v1.pdf

图形感知研究为何走到尽头?

图1 彩虹色图反转案例
上方为两组“找不同”图组,四个标量场中有一个与其他不同。在一项实证研究中,彩虹(turbo)色图让参与者最可能找出异类图,而感知均匀(blues)色标表现最差——与既定指南完全相反。下方:在相同数据集和相同找不同任务下,最佳色图本身也随异类图的区别方式而反转。
先说一个让人哭笑不得的现象:在可视化研究领域,几十年来的“科学结论”告诉设计师,彩虹色图是定量数据可视化的反面教材。结果一篇新研究用了一个更贴近真实科研场景的“找不同”任务,发现彩虹色图居然能吊打那些被反复推荐的“感知均匀”色标。这就好比龙哥练了二十年武功,突然有人告诉你,最厉害的那招其实是前滚翻。
go I am not angry.jpg
这篇论文来自伊利诺伊大学芝加哥分校电子可视化实验室,标题也相当直白:别再跑图形感知实验了,把可视化当作图像来建模。作者认为,图形感知实验这条路已经走进了死胡同,再多的受试者实验也救不回来。
要理解这篇论文在批判什么,得先回顾一下图形感知研究的来龙去脉。1984年,Cleveland和McGill做了一项里程碑式的研究,把人看图表的过程拆解成一系列基本感知任务,比如估计柱子的长度、判断扇形的角度、比较点的大小,并以此给视觉通道排了个座次:沿公共轴的位置最准,其次是长度、角度、面积,颜色垫底。这个“通道排名”后来写进了无数可视化教科书,也成了Tableau等商业工具的底层设计依据。
接下来的四十年,这个领域做的事情基本就是“填格子”:换一种图表类型,换一个感知任务,跑一组受试者实验,往经验矩阵里填一个结果。Heer和Bostock用众包平台把经典实验复现了一遍,后面又有大量工作测试不同颜色通道、不同任务类型、不同图表变体。到今天,图形感知研究的论文数量已经数以百计,整个知识体系看上去相当庞大。
但问题恰恰出在这个“填格子”的模式上。可视化设计空间的组合爆炸远超想象:编码通道、任务类型、数据分布、微观设计参数——每一个维度都在相互影响。哪怕是同一个散点图,数据点密集一点和稀疏一点,人的感知表现可能就有质的差异。用穷举实验去覆盖这个空间,就像用勺子舀干大海,既不可持续,也无法外推。
更麻烦的是,实验结果之间经常互相打架。就拿颜色编码来说,既有研究说彩虹色图在定量信息传达上很糟糕,又有新研究发现它在某些推理任务里反而比“正确”的设计更好。设计师翻指南的时候,可能今天看到一个说法,明天又看到相反结论,最终只能凭感觉来。图形感知研究耗费了如此多的人力物力,到头来却没法给人一个确定的答案,这条路是不是该换个方向了?
论文进一步指出,这种“填格子”式的研究范式在方法论上存在一个根本性的缺陷:它假设感知效果可以分解为独立通道的线性叠加,但真实视觉系统的工作方式是非线性的、整体性的。视觉皮层对图像的处理不是先分解成独立的“长度通道”“角度通道”再分别评估,而是通过一系列复杂的、相互耦合的滤波和统计操作来提取整体结构。因此,任何基于独立通道假设的实验结论,在推广到真实可视化场景时都可能失效。这也解释了为什么实验室里得出的通道排名,在实际应用中经常与直觉相悖。

编码器-解码器不对称:理论根基的崩塌

论文对图形感知研究的批评,归结起来就是四个字:编码器-解码器不对称。这里的编码器指设计者把数据映射到视觉标记和通道的规则,解码器指人的视觉系统。传统可视化理论假设,人看图的过程是“逆向解码”——比如看柱状图时把柱子的长度反算回数值。但现实中,人很少这样看图。看散点图时,关心的不是某个点的具体坐标,而是点云整体的形状、聚簇、趋势。这些是图像整体浮现出来的特征,不是编码规范里单个通道能预测的。
换句话说,编码理论在“规格说明”的层面上分析可视化,而视觉系统在“像素图像”的层面上处理可视化。两者之间隔着一道鸿沟。更致命的是,最终到达视觉系统的图像并不由编码规范单独决定,而是由编码规则、数据分布、甚至字体粗细这类微观参数共同涌现出来的。图1展示的彩虹色图反转案例,就是这种涌现特征最直观的证据。
为什么彩虹色图在某些任务里反而更好?论文给了一个很精彩的解释:颜色通道本身确实不适合恢复精确数值,但彩虹色图会把连续的标量场切分成红、绿、蓝等颜色类别,在图像上形成“色带”。这些色带虽然严格来说是伪影,却意外地成了人类感知空间分布的有效线索——它把连续场离散化,就像直方图分箱帮助人理解分布一样。靠颜色类别来推理,比靠颜色深浅来解码数值更符合视觉系统的天然能力。由此可见,驱动感知表现的是数据与编码互动后涌现的图像级结构,而不是编码规范本身。
数据分布的影响同样不容忽视。对图标阵列做估计任务时,仅仅改变图标的排列方式(随机排列、按行排列、按对角线排列),人的估算误差就会出现系统性差异。而像散点图、平行坐标这类依赖位置通道的图表,空间排列往往由数据本身决定,设计师几乎没有控制权。这意味着,一个可视化的效果可能在设计时根本无法预知,必须等看到实际数据渲染出的图像才能判断。
微观设计参数的影响更是被传统理论彻底忽视。视觉搜索不对称性是一个来自认知科学的老发现:在一堆O里找一个Q很轻松,但在一堆Q里找一个O却很费劲。而如果把字符加粗,后者的难度会骤降。注意,这里只改了笔画粗细而已,连颜色、形状、大小都没动。可视化里的字体、透明度、标记边框宽度这类微设计选择,传统编码理论根本不屑于建模,但它们对感知的影响可能大得惊人。
图2 Q与O的搜索不对称
图2:在O中寻找Q(左)很快,但在Q中寻找O(中)则困难得多。如果字符加粗(右),在Q中找到O就会突然变得容易。这种看似微小的设计变化,会极大地影响显示中容易看到的内容。
论文还指出,传统图形感知研究的实验设计本身也存在问题。大多数实验采用“受控刺激+单一任务”的模式,被试在实验室里观看精心构造的图表,完成指定的判断任务。这种设置与真实使用场景相去甚远——真实用户面对的是包含多种图表类型、复杂数据分布、动态交互界面的信息环境,他们的注意力是分散的,目标是多元的。因此,实验室里得出的感知阈值和通道排名,在真实场景中的预测力十分有限。

摘要统计视觉模型:图像空间的新范式

既然问题的根源在于“编码理论分析的是规格,而人眼处理的是图像”,那解决方案就很自然了:把可视化当作图像来研究,用接受像素输入的计算模型来模拟视觉系统。论文提出了一个理论框架:视觉感知属于图像空间(Visualization Perception Belongs in Image Space)。可视化之所以有效,不在于它用了哪种编码规范,而在于数据特征在图像经过视觉系统的变换后,仍然保留在感知表示中、能被下游任务访问到。
要在这个层面上做分析,需要一种能刻画视觉感知表示的计算模型。论文找到的候选者是视觉科学中的摘要统计表征(Summary Statistical Representations)。“摘要统计”是指视觉系统不是把场景中的每个物体逐一编码,而是快速提取整个场景的总体属性——平均大小、平均朝向、整体颜色分布。大量实验证据表明,人可以在200毫秒内从图像中提取这些聚合属性。可视化感知恰恰高度依赖这种摘要统计:看散点图时判断趋势、聚类、相关性,本质上都是在做整体统计,而不是逐点解码。
论文采用的Portilla-Simoncelli模型(简称PS模型)正是摘要统计计算化最成熟的代表。这个模型最早用于纹理合成,后来被发现能解释一类非常有趣的视觉现象——metamers:两张物理上完全不同的图像,如果它们的摘要统计量相同,人在感知上就认为它们一样。这说明PS模型的统计特征确实抓住了视觉系统用来表征图像的关键信息。
图3 PS模型分析散点图图像
图3:通过PS模型分析散点图图像。图像先被一组多尺度、多朝向的Gabor子带滤波器分解(上方为傅里叶域中的滤波器组合;中间为空间域对应的滤波器响应)。随后各通道激活被汇总(均值、偏度、自相关等)并交叉相关,形成摘要感知表示。这种特定的摘要特征(例如某些方向和尺度上激活的增减,以红/蓝显示)为判断数据特征提供了感知信号。
PS模型处理图像时,输入会经过一组多尺度、多方向的Gabor滤波器,这些滤波器类似初级视觉皮层中的复杂细胞,对特定朝向的边缘和线条产生响应。统计量不仅包括各通道的均值、方差、偏度这些单通道特征,还包括不同通道之间的相关性——这正是感知系统编码“特征共现关系”的方式。整个计算流程和人眼早期视觉通路的神经架构有很强的对应关系。图4展示了一个很有意思的结果:用PS模型的摘要统计去投影200个散点图,这些点在统计空间里的排列方式居然自然地编码了相关系数——点的大小就代表Pearson相关系数。这说明散点图的统计特征里本身就含有可提取的相关性线索。
图4 基于摘要图像统计的散点图投影
图4:基于摘要图像统计的200个散点图投影。点的大小表示Pearson相关系数。
PS模型的另一个优势在于其参数空间与视觉神经科学的紧密联系。模型中的每个统计量都可以对应到视觉皮层中特定类型神经元群体的响应模式。例如,不同朝向的Gabor滤波器对应V1区简单细胞的方向选择性,跨尺度的统计相关性则与V2区的整合机制有关。这种神经可解释性使得模型的预测结果不仅具有行为学意义,还能为理解视觉系统的内在工作机制提供线索。

散点图相关性判断:模型验证与人类对比

为了证明图像空间评估路线的可行性,论文选择了散点图相关性判断作为概念验证任务。散点图相关性判断是可视化感知研究中最经典也研究最充分的任务之一:给看两张散点图,问它们的相关系数哪个更大?人扫一眼就能给出直觉判断,但这个过程如何建模,一直没有很好的计算解释。
论文提出的评估框架可以形式化为一个“可视化解码”问题。对于给定任务T和可视化V,定义解码损失L(f_{T,V}, V),其中f_{T,V}是一个能够从图像中提取任务所需信息的解码函数。如果存在一个解码函数能让损失足够小,说明这个可视化在感知上是可读的;反之则说明信息在图像空间里已经丢失了。由此,可视化设计的优劣,就能统一放在“解码难度”这个标尺上衡量。
公式1
公式(1):min_{f_{T,V}} L(f_{T,V}, V) ≤ ε。含义是:对于给定任务T和可视化V,存在一个解码函数f_{T,V},能把从图像中恢复任务相关信息的损失压到足够小的阈值ε以内。换句话说,这个可视化所载的信息在感知上是可访问的。
公式2
公式(2):L(f_{T,V_good}, V_good) < L(f_{T,V_bad}, V_bad)。含义是:在相同的解码函数空间中,好可视化解码损失的期望下限,低于差可视化解码损失的期望下限。这个框架把“可视化好不好”从编码规范的评价,转变成了解码难度高低的评价。
具体操作上,论文的做法很直接:生成大量相关系数不同的散点图,经过PS模型提取摘要统计特征,再训练一个分类器,让分类器根据统计特征判断相关系数的大小。然后把这个“虚拟被试”的表现和人类实验数据放在一起比较。这里用到的基线是人类实验中的最小可觉差(Just Noticeable Difference,简称JND)——也就是要多大相关系数差异,人才能以75%的正确率区分两张散点图。对比结果如图5所示。
图5 模型预测JND与人类实验对比
图5:Harrison等人的JND数据(红色和黄色分别对应高估和低估方法)与本文模型预测(蓝色)的对比。JND表示散点图对之间需要达到的相关性差异,以便在75%的情况下做出正确判断。圆点表示单个参与者的JND,菱形表示带有95%置信区间(CIs)的均值。可以看到,模型和人类参与者的平均敏感性非常接近。
结果表明,模型预测的JND曲线和人类实验数据高度吻合:相关性越强时,可分辨的差异阈值越大;模型在低相关区间的高敏感性、高相关区间的低敏感性,都和人一致。模型CIs更窄是因为“虚拟被试”可以大量生成,这也从侧面说明,基于计算模型的评估在统计功效上反而有优势。
图6 合成的Mongrels图像
图6:从相关性递增的散点图图像合成的Mongrels。原始图像在顶部。Mongrels通过迭代强制白噪声图像匹配原始图像的摘要统计量生成。
论文还用图6展示了另一种更直观的检验:Mongrels(合成怪物)。从一张白噪声图像出发,迭代调整它让摘要统计匹配目标散点图。合成出来的图像在感知上和原散点图几乎难以区分。这说明PS模型的摘要统计确实抓住了散点图图像的感知本质——人眼所“看到”的散点图,很大程度上就是这些统计特征,而不是每个点的精确位置。这也解释了为什么人能在极短时间内对散点图相关性做出判断:因为视觉系统本来就不需要逐点读数据,它只提取统计摘要就够了。
论文还进一步分析了模型在不同散点图参数下的表现。他们测试了不同点大小、不同点密度、不同背景噪声水平下的JND预测,发现模型的预测曲线始终与人类数据保持一致的形状。这暗示PS模型捕捉到的感知机制具有一定的鲁棒性,不是对特定实验设置的过拟合。当然,这些额外的参数扫描也揭示了模型的局限性:当点密度极低或极高时,模型的预测误差会增大,说明PS模型对极端数据分布的适应性还有待改进。

未来展望:通用可视化解码模型的挑战

论文将这项概念验证视为一个更大研究议程的起点。最终目标不是用一个PS模型只预测散点图相关性,而是建立一个通用可视化解码模型(Generalizable Visualization Decoder)——一个以像素为输入、能够预测人在任意图表样式和任务下感知表现的计算模型。这个方向一旦走通,会带来连锁反应:设计指南可以从“基于经验排名”升级为“基于感知模型预测”;自动可视化推荐系统可以不再依赖手工规则;图表无障碍评估也能用模型快速扫描。
但挑战也很大。第一,PS模型的建模层级是早期视觉皮层,能解释散点图相关性判断这样的低层任务,但面对涉及语义理解的可视化任务(比如读图例、理解坐标轴标签、比较不同图组),还需要在模型之上叠加更高层的认知模块。第二,当前PS模型的统计量是通用的自然图像统计量,可视化图像往往是白底黑线、高对比度、稀疏图形元素,与自然图像的统计特性差异较大,是否需要对统计量做适配或扩展,仍需实验验证。第三,从散点图到柱状图、折线图、热力图、平行坐标,不同图表类型对应的感知机制可能存在差异,通用模型需要在统一框架下覆盖这些差异。第四,要训练一个高性能的通用模型,需要大规模的高质量人类感知数据——这在某种程度上又回到了“跑实验”上,只不过对实验的利用方式从“填格子”变成了“喂模型”。
论文还讨论了PS模型与其他计算视觉方法的关系。近年来,深度学习模型在图像分类、目标检测等任务上取得了巨大成功,那么能否直接用深度神经网络来建模可视化感知?论文认为,深度模型虽然表征能力强,但缺乏PS模型那样的神经可解释性,且需要大量标注数据训练。更重要的是,深度模型学到的特征往往与任务高度耦合,难以泛化到新的可视化任务。相比之下,PS模型基于视觉科学的先验知识,参数空间更紧凑,更适合作为可视化感知的通用表征。
尽管如此,这篇论文提出的方向仍然值得重视。它把可视化评估的立足点从“编码规范”拉回到“感知图像”,为图形感知研究提供了一个新的理论地基。如果说图形感知实验花四十年建了一座大厦,这篇论文更像是在问:这栋楼的地基,是不是打错位置了?

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?伊利诺伊大学芝加哥分校团队发表观点论文,直言图形感知研究范式存在编码器-解码器不对称的根本缺陷,主张将可视化作为图像用视觉计算模型评估,并通过散点图相关性实验复现人类感知曲线作为概念验证。
这篇工作最值得看的点是什么?模型预测的JND与人类参与者的平均阈值高度一致,在所有六个基准相关水平上,模型JND估计落在人类数据95%置信区间内或紧邻其边界,并再现了Weber定律预测的敏感性随基准相关水平增加而单调递减的特征。
这篇工作的边界或风险在哪里?优点:1)提出根本性范式转变,从编码理论转向图像空间分析;2)模型具有可扩展性,可应用于多种可视化类型;3)生物合理性,基于视觉皮层处理机制;4)能捕捉编码理论和图形感知研究忽略的涌现图像属性。缺点:1)仅建模早期视觉处理(V1/V2),忽略工作记忆、注意力和高级认知;2)需要为每个新任务重新学习判别函数;3)对复杂语义任务适用性有限;4)未提供完整工具实现。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

把图形感知研究从“编码规范本位”转到“图像空间本位”,提出用计算视觉模型替代受试者实验,理论框架的颠覆性和统一性都很强。

实验合理度:★★★★☆

用散点图相关性判断作为概念验证非常稳妥,JND对比和Mongrels合成都很有说服力;但任务类型和图表类型都还比较单一。

学术研究价值:★★★★★

为可视化评估提供了一个全新的理论范式,未来无论做通用解码模型还是设计新的感知实验,都绕不开这篇论文提出的问题框架。

稳定性:★★★☆☆

PS模型在高层次理解任务上的表现是短板,超过散点图相关性判断之外,模型的预测可靠性还有待验证。

适应性以及泛化能力:★★★☆☆

目前只在散点图一种图表类型上做了验证,柱状图、折线图、热力图等常见图表尚未覆盖,通用化道路还很长。

硬件需求及成本:★★★★☆

PS模型提取统计特征的计算量在常规CPU上即可运行,不需要高端GPU,成本远低于大规模神经网络。

复现难度:★★★★☆

PS模型有现成实现,散点图合成和统计提取流程比较清晰;论文未完全披露实验细节,但复现门槛总体不高。

产品化成熟度:★★☆☆☆

目前是研究工具,离“给设计师实时推荐最优图表”的产品形态还有距离;但用来做大规模自动化感知筛选,具备一定潜力。

可能的问题:论文只在散点图相关性判断一个任务上验证了PS模型的有效性,对于更复杂的图表类型和任务,模型的适用性尚无实证。另外,将图形感知研究一竿子打倒,可能忽略了那些在编码层面依然有参考价值的实验结果。通用可视化解码模型的落地,可能需要先解决更大规模人类感知数据的获取问题。总体而言,这仍是一篇极具启发性的范式开创之作。


主要参考文献

[1] Cleveland, W. S., & McGill, R. Graphical perception: Theory, experimentation, and application to the development of graphical methods. Journal of the American Statistical Association, 1984.
[2] Portilla, J., & Simoncelli, E. P. A parametric texture model based on joint statistics of complex wavelet coefficients. International Journal of Computer Vision, 2000.
[3] Harrison, L., Yang, F., Franconeri, S., & Chang, R. Ranking visualizations of correlation using Weber's law. IEEE TVCG, 2014.
[4] Heer, J., & Bostock, M. Crowdsourcing graphical perception: Using mechanical turk to assess visualization design. CHI, 2010.
[5] Reda, K., Sharma, S., Miranda, F., Renambot, L., & Boorboor, S. Marks, channels, and dead ends: Stop running graphical perception studies and start modeling visualizations as images. arXiv:2608.07834, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完这篇论文,是不是也想找人聊聊可视化、聊聊图像感知?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像感知+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,总有一个适合你~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。