← 返回 PaperDaily 大模型与智能体

不再纠结选哪个EEG基座:逐样本智能路由,7个数据集全部提升

EEG基础模型已经多到“选择困难”,但这篇论文发现:没有哪个基座模型能对所有脑电样本通吃。昆山杜克大学提出的EEG-AS把模型选择做成逐样本的智能决策,推理时只跑一个轻量锚定模型,却能隔空猜测其他所有基座模型的预测行为,平均准确率从53.7%飙到66.9%。做脑电基座模型部署、神经解码评测的朋友值得一读。🎯

不再纠结选哪个EEG基座:逐样本智能路由,7个数据集全部提升
原论文信息如下:
论文标题:
EEG-AS: Instance-Level Foundation Model Selection for EEG Foundation Models via Behavior Reconstruction
发表日期:
2026年09月
发表单位:
昆山杜克大学、安卡拉大学
原文链接:
https://arxiv.org/pdf/2609.00653v1.pdf

引言:一个“平均最好”的基座模型,为什么还会翻车

脑电图(EEG)是一种非侵入式的神经活动记录手段,在临床诊断、运动想象、情绪识别、视觉解码和认知负荷评估等领域应用得非常广。这两年,一批EEG基础模型(Foundation Model,简称FM)借着大规模无标注脑电数据预训练的东风冒了出来。它们有的采用Transformer、有的走卷积路线,有的专攻跨数据泛化,有的强调大规模subject适应性。模型多了,自然就产生一个新问题:到底该用哪一个?
目前最常见的做法,是先在某一个基准数据集上把各个模型跑一遍,选出平均准确率最高的那个,然后所有样本都交给它。这种“单最佳求解器”(Single Best Solver,SBS)的部署策略隐含了一个假设:在同一个数据集内部,这个模型对所有脑电样本的适用性是一致的。
但这个假设在真实脑电数据上根本不成立。不同被试的脑电信号差异极大,同一个被试在不同试次、不同时间窗里的信号也千差万别。一个在平均指标上最漂亮的基座模型,面对某些具体样本时可能就是会“看走眼”。正因如此,不同的基座模型往往错在不同的样本上:模型A判对了样本1却判错了样本2,模型B可能正好相反。这种基座模型在单个样本层面的互补性,远比它们在数据集层面的平均分数竞争更加重要,但也更容易被忽略。
这篇来自昆山杜克大学与安卡拉大学的工作,把上述观察量化成了一个非常直观的“鸿沟”:在所有7个公开EEG基准数据集上,理论最优分配器(Virtual Best Solver,VBS/Oracle,即每个样本都选到真正对它最优的基座模型)的平均准确率高达83.7%,而SBS只有53.7%。中间这整整30个百分点的差距说明:如果能在实例级别上为每个EEG样本都选到合适的基座模型,性能提升空间远比换一个更强的单模型要大得多。🤚

问题背景及相关工作:从“单模型打天下”到自动算法选择

要理解EEG-AS的价值,得先理解两个背景概念:EEG基础模型和算法选择(Algorithm Selection,AS)。
先看EEG基础模型。近年来,EEG领域的基座模型主要通过自监督预训练从大规模无标注脑电数据中学习可迁移的神经表示,再在下游任务上进行微调或线性探测。比较有代表性的包括基于生物信号的Transformer架构BIOT、覆盖多种EEG范式的大规模脑模型LaBraM、主打跨被试大规模预训练的REVE、采用十字交叉时空建模的CBraMod,以及面向通用可靠脑电解码的EEGPT等。这些模型在架构设计、预训练策略和表示学习范式上差异巨大,也正因如此,它们在面对多样化的下游脑电解码任务时会表现出明显的“互补性”。
再看算法选择。算法选择是自动机器学习中一个经典研究方向,最早由Rice在1976年形式化,Kerschke等人在2019年做了系统性的综述。算法选择问题的核心洞察非常朴素:不存在某个算法能在所有问题实例上都表现最好,算法的性能是实例相关的。传统AS方法主要靠手工特征来训练性能预测模型,后来逐渐引入CNN、图神经网络以及基于Transformer的表示学习,以便自动提取问题实例的特征。但无论是传统AS还是后续的深度学习方法,绝大部分工作都集中在布尔可满足性问题、组合优化、分子对接等场景,把“实例级AS”系统性引入EEG基础模型部署的,此前几乎没有。

EEG基础模型选择:一个被忽视的实例级挑战

手里有了一批EEG基础模型(Foundation Model,FM)之后,最常见的操作方式是:把所有候选模型放到验证集上跑一圈,谁的准确率最高就固定用它。这个思路简单直接,却隐藏着一个很少有人去戳的假设——同一个模型在一个数据集内部的每一个样本上都同样靠谱。
真去搓一遍数据就会发现,这个假设经常不成立。脑电信号是出了名的非平稳:不同被试的波形形态差异大,同一被试的不同试次也会因为注意力、疲劳、心理状态的变化而剧烈波动。于是就会看到一种很“分裂”的现象:模型A在某几个样本上判得准,模型B在另外几个样本上判得准;如果把每个样本都交给真正适合它的那个模型,整体性能能往上蹿一大截。
本论文用的候选池里有七个来路各异的EEG FM:BIOT、EEGPT、BENDR、CBraMod、CSBrain、LaBraM、REVE。它们在七个公开基准上的“数据集级冠军”其实并不固定:ADFTD和BCIC-2a上夺冠的是REVE,MIMUL-11和Workload上的是CSBrain,SEED-V和SEED-VII上的是EEGPT,THINGS-EEG-2上又是REVE。连“整个数据集选一个最佳模型”这样的粗粒度选择,最优选都会随数据集切换而变化,更不用说粒度细到每个样本了。
这种观察正是自动机器学习里“算法选择”(Algorithm Selection,AS)问题的出发点:算法的性能是实例相关的,不存在一个打遍天下无敌手的模型。本论文把脑电FM部署正式建模为一个实例级AS问题。给定一个EEG实例xi,每个FM mk都有一个效用函数ρ(mk, xi),表示它在这个样本上表现如何。理论上的性能上界是“上帝视角”的Oracle/Virtual Best Solver(VBS),即每个样本都挑到真正最优的那个模型:
Oracle最优分配公式
这里的ρ通常取0或1,表示该FM是否把这个样本分类正确。与之相对的Single Best Solver(SBS)则是固定使用整个数据集上平均表现最好的那一个FM。在两个端点之间,存在一段可以被“动态路由”吃掉的性能空档。EEG-AS瞄准的,正是这段空档。

EEG-AS核心机制:从单个锚定模型重建全部行为

看到这里,估计很多人会想:那我把七个FM都跑一遍,每个样本谁分数高就用谁,不就行了?理论上很美,现实中这是典型的“打肿脸充胖子”。EEG FM的参数量通常以千万甚至上亿计,推理需要把脑电数据重新映射到各自的特征空间;逐样本全量跑七个模型,延迟和算力都很难接受。
EEG-AS换了个思路:能不能只跑一个便宜的“锚定模型”(anchor model),然后借助它对当前样本的“反应”,脑补出其他六个模型会给出什么预测?这样做只需要执行一个anchor模型加一个轻量选择器,就能实现近似“全模型池尽调”的效果。
整体框架如图1所示,由三个模块组成:EEG表示模块、条件Token预测器(Conditional Token Predictor)、基于Token的模型选择器(Token-based Model Selector)。
EEG-AS整体框架图
图1:EEG-AS整体框架。训练阶段,所有FM的预测Token作为特权信息可用;推理阶段只执行锚定模型,再通过条件Token预测器重建其余FM的行为。
为了在不运行全部FM的情况下描述每个EEG样本,EEG-AS先抽取一个推理时可用的EEG表示zx。它由一个冻结的BIOT编码器提取深度嵌入ex,再拼接一组手工设计的神经生理学特征hx得到。论文表示框架对“用什么编码器”并不挑剔,只要它能不执行候选FM就拿到即可;选BIOT的一个直接好处是它够小,只有约3.4M参数,既能当表示提取器,又能当anchor。
更关键的设计在“行为表示”这一层。每个FM在某个样本x上都会输出一个类别概率向量,论文把这个向量叫预测Token:tk = φk(x) ∈ ℝC。它不是一个硬标签,而是保留置信度和类间偏好信息的完整概率分布。把七个FM的Token拼起来,就得到一个“特权Token矩阵”:
特权Token矩阵公式
训练阶段,这个T矩阵是能拿到的;但在推理阶段它不存在,因为要凑齐它就得执行全部FM。这里引用了一个经典的学习范式:Learning Using Privileged Information(特权信息学习,由Vapnik和Vashist于2009年提出)。训练时把“测试时无法获得的信息”当成老师,帮模型建立从可见信息到目标输出的映射;部署时特权信息被拿掉,模型只能基于可见信息做推断。
EEG-AS的玩法是:只把anchor模型的Token ta作为推理时可见的观测,让条件Token预测器Pψ去估计其余非anchor模型的Token:
条件Token预测公式
为什么anchor的Token管用?因为它是“实例相关”的:同一个BIOT面对不同样本,会给出不同概率分布;这个分布暗含了当前样本属于哪一类、分类边界模糊不模糊、BIOT对它的把握大不大。这些上下文信息是静态的EEG表示zx给不了的。
重建出完整Token矩阵后,选择器要给每个FM打一个相关分数s = fθ(zx, T̃) ∈ ℝK,选分数最高者作为最终被路由到的模型:
模型选择公式
注意,选择器用的“标签”不是分类标签,而是这个FM在当前样本上是否预测正确。多个FM可能同时答对同一个样本,所以构造监督时不能简单用one-hot,而是对每个样本在“答对的模型”和“答错的模型”之间建立两两排序约束,用pairwise logistic ranking loss做优化。与此同时,重建部分用均方误差约束预测Token和真实Token尽量接近。最终联合损失写成:L = Lsel + λLtoken,论文取λ=1.0。
联合优化损失公式
推理阶段的整体流程是:先抽出zx,执行anchor模型BIOT拿到ta;条件预测器补全其余六个FM的Token;直接把观测到的ta和补全的Token拼回矩阵T̃;选择器给出分数并取最大值。如果被选中的恰好不是BIOT,还要把那个FM真正跑一次,拿它的输出作为最终预测。
把它想成一个“模型路由器”会更直观:BIOT先以很低成本试水,判断当前样本更适合哪个大模型,再把请求转给真正干活的那个。这样既避免了全模型池的穷举式推理,又比固定绑死一个模型要灵活得多。

实验验证:7个基准数据集上的显著提升

评价一个FM选择框架,不能只看一个数据集。本论文按照EEG-FM-Bench的评测协议,在七个公开EEG基准上做了验证,覆盖的任务类型相当全:临床诊断、运动想象、情绪识别、视觉解码和认知负荷评估。表1给出了这些数据集的粗略画像。
表1 七个EEG基准数据集概览
表1:EEG基准数据集概览。可以看到任务类型、类别数、受试者数和通道数差异很大,从9人的运动想象数据到88人的临床数据都有。
主结果如表2所示。SBS在七个数据集上的平均准确率为53.7%,Oracle/VBS为83.7%,中间有30个百分点左右的鸿沟。EEG-AS把平均成绩提升到66.9%,相当于吃掉了SBS到Oracle之间大约44%的性能差距,并且在七个数据集上全部超过SBS。作为对比,两个传统AS模型MLP AS和Random Forest AS分别只能到64.8%和62.7%;用可学习全局Token做预测的Global Token Predictor是65.4%;能直接看到全部真Token的Privileged Teacher拿到69.0%,可以看作EEG-AS在这个评价体系下的一个特权参考上界。
其中提升最夸张的是BCIC-2a:SBS只有31.9%,Oracle高达80.2%;EEG-AS在该数据集上也拿下了所有可部署方法中的最优结果——56.0%,比最强的可部署基线高出4.9个百分点。在ADFTD、SEED-V、SEED-VII和Workload上,EEG-AS同样做到可部署方法中的最好成绩。
表2/表3 总体选择性能与输入表示消融
表2/表3:上为七个EEG基准上的总体AS准确率对比,下为输入表示消融。总体表格里,SBS和Oracle是确定性参考,其余为三个随机种子均值±标准差。可以看到EEG-AS的平均16.0%提升主要来自对实例级互补性的利用。
表3的消融揭示了另一个有意思的结论:手工特征和FM嵌入不是“二选一”,而是互补的。只用BIOT嵌入、去掉手工特征时,平均掉到64.4%,SEED-V和Workload下降尤其明显;只用手工特征、去掉BIOT嵌入时,平均为66.3%,BCIC-2a从56.0%掉到48.6%。两种信息合在一起,才能同时照顾到模型难以表达的信号统计特征和任务相关的深层表示。
论文还重点验证了anchor条件的作用。从表4可以看到,如果把anchor Token直接拿掉,平均选择准确率会下降;如果用一个数据集级别的可学习全局Token来替代“当前样本的BIOT Token”,性能会进一步变差。这说明真正有帮助的不是“有一个额外向量”,而是“这个向量包含当前样本被某个具体模型评判后的即时反应”。
表4 anchor条件有效性消融
表4:实例级anchor条件的有效性消融。w/o Anchor Token表示去掉真实BIOT Token,Global Token Predictor表示用可学习全局Token替代;EEG-AS则保留当前样本的BIOT Token作为条件。
那么,重建目标应该用“模型有没有答对”这种简单标签,还是用完整概率分布?表5给出了答案:用完整Token做监督,平均准确率66.9%;只监督正确性,则只有65.4%。原因不难理解——正确的硬标签丢掉了模型的置信度信息,而两个FM可能在“判对同一个样本”时给出截然不同的概率分布,这些分布差异恰恰是区分模型行为的关键线索。
表5 监督目标对比
表5:条件FM行为重建的监督目标对比。Correctness Supervision只预测模型是否正确,Token Supervision重建完整预测Token;后者在多数数据集上更优。
看到平均成绩从53.7%一路上探到66.9%,龙哥先代大家掏出这张表情包:
621df26778f05KkH

深入分析:行为重建质量与性能差距来源

一个自然的问题是:EEG-AS真的能把“没跑过的FM行为”重建出来吗?论文给出的答案是:能重建出相当一部分。平均来看,预测Token与真实Token的余弦相似度为0.66,按概率排序的Spearman秩相关系数为0.67;但预测的“最优模型”与真实最优模型的Top-1一致率只有0.53。
换句话讲,模型的行为模式不难学,但要在每个样本上精准猜出“谁才是真正的最佳选择”,还是明显更难。图2给出了每个数据集上更细致的重建质量分布。
图2 各数据集token重建质量指标
图2:各数据集上的Token重建质量指标(三随机种子均值±标准差),包括余弦相似度RD、FM排序的Spearman秩相关ρD,以及按真实/重建Token选出的最佳模型Top-1一致率。
表8和表7则分别考察了重建分析的细节和anchor选择的鲁棒性。若把默认anchor从BIOT换成REVE,在“统一部署”设置下平均成绩几乎不变(66.9%对67.0%)。这说明EEG-AS并不依赖某一个特定anchor“泄露答案”,条件重建机制能从不同FM的实例级反应中学到类似规律。默认选BIOT更多是工程上的务实选择:参数少、既能提取表示又能产生Token,部署负担最小。
表6/表7 anchor基座模型鲁棒性分析
表6/表7:左为不同anchor FM的鲁棒性分析,右为anchor同时负责EEG表示提取和Token生成时的统一部署结果。不同anchor下平均成绩波动很小,说明框架对anchor选择不敏感。
表8 Token重建定量分析
表8:Token重建分析。整体上重建质量有信号但不够完美,尤其是Top-1一致率尚有明显提升空间。
论文还诚实地分析了“为什么EEG-AS在某些数据集上提升不明显”,把原因拆成三条。
第一,性能提升空间受SBS到Oracle之间的“选择余量”限制。像THINGS-EEG-2,SBS已经到89.1%,Oracle是96.9%,即使路由完美也只能再挤8个百分点左右;EEG-AS在有限余量下拿到90.5%,已经接近可部署方法的最优。
第二,Token重建得好,不等于选得准。最典型的例子是SEED-VII:重建质量指标不错(秩相关0.76),但最终选择准确率并不高。更扎眼的是,Privileged Teacher哪怕拿着全部真实Token,也只有43.5%,而Oracle有76.1%。这说明“知道每个FM怎么想”和“知道怎么选”是两码事,模型选择本质上是一个决策对齐问题,而不只是动作预测问题。
第三,FM之间的多样性决定了选择能有多大的甜头。如果两个模型在绝大多数样本上行为高度相似,它们的Token就提供不了区分度;候选池子里的模型差异越大,实例级路由的价值越高。

局限与未来展望

客观来看,EEG-AS还只是一篇“早期但方向感很强”的工作。它的训练依赖一个离线特权阶段:要先把候选模型池里每个FM在每个训练样本上的预测Token全部跑出来并缓存。这个一次性成本会随着模型数量和样本量线性增长,好在训练阶段不要求实时,很多场景可以接受。
当前框架的任务目标主要围绕分类正确率展开,没有覆盖EEG领域常见的回归式解码(比如连续情绪效价估计)或者序列标注任务。另外,Top-1一致率只有0.53,说明“猜中当前样本最优模型”仍然是一个有明显瓶颈的环节。未来至少有三个可以发力的方向:一是让选择器学习更丰富的决策信息而不只是0/1正确率;二是把EEG-AS的路由思想扩展到更大的模型池甚至多模型集成;三是结合在线学习,让选择策略随新数据分布动态更新。
对于一个拥有多个EEG基础模型、希望做“模型服务路由”的团队来说,EEG-AS提供了很清晰的范式:与其继续卷一个新模型把平均分数往上推一两个点,不如把已有模型的“互补红利”系统地捡起来。这个思路在EEG之外的其他生物信号领域,大概率也值得复制。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?脑电基础模型众多却难选最优?昆山杜克大学提出EEG-AS,首个实例级脑电基座模型选择框架,只执行一个锚定模型即可重建所有基座模型行为并按样本选最优,平均准确率提升13.2个百分点,追平SBS与理论最优间44.0%的差距。
这篇工作最值得看的点是什么?EEG-AS在7个数据集上均优于SBS,平均准确率从53.7%提升至66.9%,在5个数据集上取得最佳可部署性能,缩小了SBS与Oracle间44.0%的性能差距。
这篇工作的边界或风险在哪里?优点:首次提出实例级EEG基础模型选择问题,通过行为重建实现高效选择,框架对表示选择具有灵活性,消融实验全面。缺点:依赖锚定模型质量,token重建质量与最终选择性能间存在差距,在部分数据集上提升有限。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出EEG-AS框架,通过条件token预测器从单个锚定基础模型的预测token和EEG表示中重建其他不可用基础模型的行为,实现无需穷举执行整个模型组合的实例级基础模型选择。

实验合理度:★★★★☆

选择准确率(Accuracy),包括数据集平均和实例平均准确率

学术研究价值:★★★★☆

提出EEG-AS框架,通过条件token预测器从单个锚定基础模型的预测token和EEG表示中重建其他不可用基础模型的行为,实现无需穷举执行整个模型组合的实例级基础模型选择;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

EEG-AS推理时仅需执行一个锚定FM(BIOT,3.4M参数)和轻量级预测器/选择器,避免执行全部7个FM,计算开销显著降低。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:,通过行为重建实现高效选择,框架对表示选择具有灵活性,消融实验全面。缺点:依赖锚定模型质量,token重建质量与最终选择性能间存在差距,在部分数据集上提升有限。

主要参考文献

[1] Zhang Y, Piao R, Keles H O, Misir M. EEG-AS: Instance-Level Foundation Model Selection for EEG Foundation Models via Behavior Reconstruction. arXiv:2609.00653, 2026.
[2] Rice J R. The Algorithm Selection Problem. Advances in Computers, 1976.
[3] Kerschke P, Hoos H H, Neumann F, Trautmann H. Automated Algorithm Selection: Survey and Perspectives. Evolutionary Computation, 2019.
[4] Vapnik V, Vashist A. A New Learning Paradigm: Learning Using Privileged Information. Neural Networks, 2009.
[5] Xiong et al. EEG-FM-Bench

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球