← 返回 PaperDaily 前沿研究

SperidLabs视频分割与开放词汇分割新作:ENEAS让F1从19.5%升至87.6%

论文基本信息 原文标题: ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation 首次公开: 2026 年 9 月 3 日 主要署名单位: SperidLabs 具体领域: 视频分割与开放词汇分割 核心亮点: Church Statues 上 F1 从 SAM 3 的 19.5% 升

SperidLabs视频分割与开放词汇分割新作:ENEAS让F1从19.5%升至87.6%

论文基本信息

原文标题:ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation
首次公开:2026 年 9 月 3 日
主要署名单位:SperidLabs
具体领域:视频分割与开放词汇分割
核心亮点:Church Statues 上 F1 从 SAM 3 的 19.5% 升至 87.6%
原论文:https://arxiv.org/abs/2609.03756
项目页:https://speridlabs.com/research/eneas
代码:https://github.com/speridlabs/eneas
代码许可:Apache License 2.0

龙哥导读

分割模型已经很会画边界,真正难的是判断“它到底是不是你要的东西”。ENEAS把这个矛盾拆成两道门:视觉嵌入先高速分流,只有拿不准的候选才交给视觉语言模型复核;在真假人像与逼真雕像混杂的 Church Statues 上,F1由 SAM 3 的19.5%升至最高87.6%。

先看最强进展。面对提示词“person”,SAM 3在论文自建 Church Statues 场景里拿到83.7%的召回率,却只有11.1%的精确率;ENEAS-4B把精确率推到97.5%,同时保留79.6%的召回率,最终F1从19.5%跃升到87.6%

这里的张力很典型:SAM 3不是“看不见”,恰恰是看得太积极——壁画里的人脸、雕像的四肢、石材上的肤色纹理,都可能被当成真人。ENEAS的贡献也不是把分割边缘再磨细一点,而是在几何分割之前补上一层“语义验真”

Church Statues上SAM 3与ENEAS的精确率召回率F1对比

原论文 Table 1|PaperDaily依据公开数据重绘。SAM 3保持最高召回,但大量把艺术品当真人;ENEAS-2B与4B以少量召回交换显著更高的语义纯度。数据来源:ENEAS论文。

01 边界画对了,为什么语义仍然会错

文本可提示分割把一句自然语言变成像素掩码,通常包含三个问题:画面里有没有目标、目标是哪一个、边界在哪里。过去的进步主要集中在第三问,模型越来越会找到轮廓;但开放世界里,前两问往往更决定结果能不能用。

论文归纳了三类失败。第一类是时间幻觉:指定物体离开画面后,逐帧检测器为了满足文本提示,会转而抓住窗帘、头发或相似物体;第二类是空间碎裂:极近距离下,模型只分出画中人物、笔触或局部纹理,而不是完整画框。

第三类最棘手:语义误判。雕像、画中人、倒影在视觉上确实像“person”,掩码甚至可能非常工整,但它们在任务语义上不是活人。对于3D重建,这种误报会把本该保留的雕塑挖掉,错误成本远高于普通展示场景。

Figure 2原论文蓝色画作的目标消失与极近距离跟踪对比

原论文 Figure 2 高清裁图(论文以CC0 1.0发布)|三行依次是Grounded SAM、SAM 3与ENEAS,五列沿视频推进。绿色对勾代表正确,红叉代表漂移、误分或碎片化;读者可以直接检查场景、掩码和行列差异。

Figure 2最值得盯住最后一列。画作几乎占满视野后,逐帧模型容易把提示词“painting”理解成画面内部最显眼的图案;ENEAS的跟踪分支则沿时间维护“正在跟的是这一幅画”的实例记忆。它守住的不是某一帧最像什么,而是跨帧身份是否还是同一个。

02 一套接口,两条路线:跟住一个,或找出一类

ENEAS接收自然语言提示与一组帧,帧可以是有顺序的视频,也可以是无序图片集合。若提示指向具体实例,例如“那幅蓝色画”,系统走实例跟踪;若提示指向类别,例如“person”或“chair”,系统走语义发现。

实例跟踪建立在SeC架构上。ENEAS先用Florence-2在参考帧里把文本落到候选区域,再让带概念级记忆的跟踪器向前、向后传播掩码;目标不可见时,正确输出应该是全零掩码,而不是找一个外观相近的替身。

实例跟踪的核心关系

Mt = T(It | r0, Ht)

It是当前帧,r0是文本在参考帧定位出的初始区域,Ht是此前帧累积的记忆,T输出当前掩码Mt。直觉上,r0回答“从谁开始”,Ht回答“此前一直在跟谁”,两者共同压住重新检测造成的身份漂移。

语义发现则不能只传播初始目标,因为新的人或椅子会在后续帧进入画面。它必须逐帧重新提出候选,但又不能把每个候选都交给昂贵VLM。于是论文真正的新意落在一个成本递增、候选递减的级联决策流上。

03 Figure 1:便宜模型先筛,贵模型只审灰区

Figure 1从左到右给出五个节点。输入是当前帧It与提示词p;Region Proposal先用Florence-2提出尽量不漏目标的区域集合Rt;Embedding Verification再用SigLIP 2给每个候选计算独立相似度s(r)。

Figure 1 ENEAS语义发现决策流

原论文 Figure 1|PaperDaily依据论文方法重绘。高分候选直接送入掩码生成,低分候选丢弃;只有落在拒绝阈值与接受阈值之间的候选进入语义复核,VLM判为真后再回到主路径。方法来源:ENEAS论文。

第一根箭头强调“先广撒网”。区域提议阶段宁愿多给几个框,也不要提前漏掉目标;第二根箭头才开始做语义过滤。嵌入分数高于接受阈值τacc就直接放行,低于拒绝阈值τrej就丢弃,中间区域才进入VLM复核。

关键阈值方程

s(r) ≥ τacc:接受;s(r) < τrej:丢弃;其余:交给VLM验证

这两个阈值不是普通的“置信度大于0.5”。它们共同定义一个不确定区间:区间越窄,VLM调用越少、速度越快,但语义漏网风险更高;区间越宽,复核更严,却会增加延迟。ENEAS所谓Adaptive,核心就是让计算量随场景歧义程度变化。

最后,SAM 2.1只负责把通过验真的区域变成像素掩码。这个职责拆分很关键:Florence-2负责“提谁”,SigLIP 2负责“像不像”,Qwen3-VL负责“本质上是不是”,SAM 2.1负责“边界画在哪”。每个组件做自己更擅长的一问。

根据论文方法整理的伪代码

    输入:帧 It,类别提示 p,拒绝阈值 τrej,接受阈值 τacc
    候选集合 Rt = Florence2(It, p)
    accepted = []
    for region r in merge_duplicates(Rt):
        score = mean_prompt_ensemble_siglip_score(r, p)
        if score >= τacc:
            accepted.append(r)
        elif score < τrej:
            continue
        else:
            isolated_crop = mask_neighbor_candidates(It, r)
            verdict = Qwen3VL_binary_judge(isolated_crop, p)
            if verdict == true:
                accepted.append(r)
    输出:对 accepted 中每个区域调用 SAM 2.1 生成实例掩码

    伪代码里决定成本的不是最后一行,而是两个分支:高置信候选不惊动VLM,明显错误候选也不惊动VLM。只有中间那段既像目标、又可能是替身的区域,才值得支付语义推理费用。

    04 四次设计转弯,才得到现在这条级联

    论文没有把最终结构包装成一步到位。第一阶段曾尝试密集场景描述:先给所有显著物体生成文字与框,再用文本嵌入过滤,最后把带编号的全图与裁剪拼成复合提示交给VLM。结果是开放集描述会给普通物体乱贴专名,多个物体还可能被合并进同一框。

    更糟的是,多目标编号关联让VLM必须进行长推理,论文报告每帧延迟从至少15秒起步,复杂画面还会继续增加。这个失败很有价值:把所有理解工作一次性塞给“最聪明的模型”,往往同时放大生成误差、关联难度与推理成本。

    第二阶段改成文本条件区域提议,再用对比式视觉语言嵌入过滤。问题出在Softmax竞争:候选里若同时出现麦克风、桌子等显著属性,目标类别分数会被其他类别挤压,导致一个稳定阈值无法同时适配不同场景。

    第三阶段换成SigLIP式逐对Sigmoid评分,让每个图像—文本对独立判断,不再要求“person”和“microphone”互相竞争。论文还使用原生宽高比编码与多种文本模板取平均,缓解训练时整图、推理时裁剪区域之间的分布偏移。

    第四阶段才把轻量VLM放进灰区。为了避免周边人物干扰,系统把邻近候选像素遮黑,只让裁判关注当前区域;同时关闭自由展开的深度推理,要求输出结构化二元结论。论文称单次复核在其资源受限硬件上约一秒,较最初方案已是数量级下降。

    恍然大悟

    05 Figure 3:发现新目标,也要拒绝几何噪声

    跟住一个实例与发现一类目标的最大区别,是后者不能依赖初始帧名单。新的人会走入画面,椅子会从箱子后露出来,所以语义发现必须不断重新观察;代价是每次重新观察都会带来新的误报机会。

    Figure 3原论文人物与椅子多实例语义发现对比

    原论文 Figure 3 高清裁图(CC0 1.0)|上半部分用“real person”提示检查窗帘干扰,下半部分用“chair”提示检查纸箱和桌面干扰;四列可直接核对基线与ENEAS的掩码差异。

    上半部分验证“人”的语义纯度:即使画面里有大幅人像艺术品,系统仍应聚焦真实人物。下半部分更偏几何混乱:箱子、桌面、柜体与椅子存在局部形状相似,Grounded SAM出现灾难性过分割,而ENEAS把这些候选挡在验证链中。

    在图示的这段跟踪片段中,掩码与可视化ID呈现出较稳定的局部连续性;这不等于系统已经解决通用跨帧关联。语义发现仍逐帧运行,新实例没有通用的持久身份连接模块;论文把用跟踪记忆连接逐帧发现列为未来工作。

    06 Figures 4–5:从“长得像”走向“本质上是”

    Figure 4是平面艺术品测试。对“real person”提示,SAM 3持续把背景中的波普画人物分出来;ENEAS多数时候能利用画布平面、材质与场景上下文,把它判成非生命表示,同时保留前景真人。

    Figure 4原论文波普画人物与真人语义歧义对比

    原论文 Figure 4 高清裁图(CC0 1.0)|上下两行分别是SAM 3与ENEAS,四列展示画作、真人同框与极端特写;红叉标出语义或上下文失败,绿勾标出正确保留真人、拒绝二维画作。

    最后一列是论文没有回避的反例。只剩下眼睛与皮肤色块时,VLM也缺乏判断“这是画还是人”的上下文,ENEAS同样会泄漏。语义推理不是魔法,它依赖材质、平面性、周边环境等可见证据。

    Figure 5把难度提升到三维雕像。雕像具有真实体积、四肢、脸部与类似皮肤的纹理,视觉形状比画中人更接近真人;SAM 3几乎把所有雕塑都分成“person”,而ENEAS在多数帧中拒绝这些候选。

    Figure 5原论文逼真雕像与真人语义歧义对比

    原论文 Figure 5 高清裁图(CC0 1.0)|六列来自教堂雕像场景;上行可直接看到SAM 3在雕像上的大面积掩码,下行显示ENEAS多数时候拒绝雕像,第三、四列的红叉也诚实暴露背景行人漏检。

    这张图揭示了论文最深的一层:开放词汇分割不能只把语言映射成视觉原型,还要判断目标属于什么实体类别。边界正确但实体类别错误,在3D资产清理、博物馆数字化、零售盘点与视频分析里都可能产生更昂贵的下游损失。

    07 Table 1:F1跃升,究竟从哪里来

    Table 1采用Precision、Recall与F1,因为Church Statues主要检验“预测出来的实例究竟是不是活人”,不是传统跟踪里的位置与关联质量。SAM 3的83.7%召回说明它捕捉目标很积极,但11.1%精确率意味着结果中绝大多数是错误实体。

    论文用一句很直观的话解释这个数字:大致每找到一个真人,就会产生约八个艺术品误报。ENEAS-2B把精确率提到94.7%,召回降到73.5%,F1达到82.8%;4B裁判又把召回补到79.6%,精确率升到97.5%,F1达到87.6%。

    因此“F1从19.5%升至87.6%”不是所有分割场景的普遍倍率,而是强语义歧义数据上的精度修复。这项结果足够亮眼,但不能外推成ENEAS在通用视频分割基准上也有同等幅度。

    08 Tables 2–3:常规基准是小幅赢,不是全面碾压

    论文还在SAM 3官方SA-Co/VEval评估器下,把样本按提示拆成实例跟踪与语义发现两组。HOTA看总体跟踪质量,DetA看检测,AssA看跨帧关联,LocA看定位,TETA则综合文本与跟踪相关因素;这些数值都越高越好。

    Tables 2和3实例跟踪与语义发现指标对比

    原论文 Tables 2–3|PaperDaily依据公开数据重绘。左侧为实例跟踪,右侧为语义发现。ENEAS在HOTA、AssA与TETA上小幅领先;SAM 3在两组LocA以及语义发现DetA上略高。数据来源:ENEAS论文。

    实例跟踪中,ENEAS与SAM 3的HOTA分别是26.70与26.51,TETA是17.86与16.65;最大的结构性优势出现在AssA,90.77对90.18。语义发现中,HOTA是9.23对9.19,TETA是9.53对9.10,差距依然很小。

    反过来,SAM 3的LocA在实例跟踪是89.22,高于ENEAS的87.86;语义发现是75.38,高于74.25。这组表格把叙事拉回现实:ENEAS在通用评估上主要改善身份关联与整体稳定性,定位精度并没有同步占优。

    09 Table 4:只用嵌入,为何怎么调阈值都不圆满

    Table 4是整篇最能支撑方法必要性的消融。仅靠Florence-2区域提议,精确率10.5%、召回79.6%、F1仅18.6;加入宽松嵌入阈值后,F1升到65.5,但逼真雕像仍会以中高分穿过过滤器。

    Table 4语义验证模块消融对比

    原论文 Table 4|PaperDaily依据公开数据重绘。宽松单阈值保住召回却漏掉艺术品,严格单阈值将精确率推到94.3%却把召回压到67.4%;加入只处理不确定区间的VLM后,精度与召回重新靠拢。数据来源:ENEAS论文。

    把阈值收紧到0.80,精确率确实升到94.3%,但召回掉到67.4%,F1为78.6。原因是低光、遮挡、远处小目标与非常规姿态会拉低真人候选的嵌入分数;一个只看相似度的硬阈值,无法同时拒绝逼真雕像、保住困难真人。

    ENEAS-2B采用0.10—0.90的不确定区间,把中间候选交给VLM,F1升到82.8;4B进一步升到87.6。消融真正证明的是“分工”:嵌入擅长稳定处理两端,VLM擅长处理两端之间的语义争议。

    10 阈值、延迟与模型大小:准确不是免费的

    论文Table 5继续扩大不确定区间。Fast配置0.40—0.60只让16.2%的候选进入VLM,平均每帧1.04秒,F1为74.3;Robust配置0.10—0.90把激活率提高到78.1%,平均3.29秒,F1为82.8。

    如果所有候选都交给2B VLM,平均延迟达到5.05秒,F1反而降到79.1。论文将其解释为过度推理:小目标、遮挡裁剪本来可由稳定嵌入判断,VLM在缺少视觉线索时反而引入随机错误;选择性调用比“全部交给大模型”更准也更快。

    在较普通的Moving Boxes场景里,把接受阈值放宽到0.40后,VLM激活率降到27.0%,平均每帧1.14秒,F1达到98.0%,且论文报告零假阳性。这说明同一套结构能按场景复杂度切换,但这些数字来自不同数据场景,不能直接当成统一速度榜。

    模型大小也有明确代价。2B裁判在Robust配置下每帧3.29秒、F1 82.8;4B达到F1 87.6,却需要5.02秒,延迟增加约52%。这是一套离线精度优先系统,而不是实时视频流的免费插件。

    11 和SAM 3、SAMURAI放在一起看,路线差在哪

    SAM 3提出Promptable Concept Segmentation,用短名词短语、图像示例或二者组合,在图像与视频中检测、分割并跟踪所有匹配实例。它把图像级检测器与基于记忆的视频跟踪器放在共享骨干上,还公开了SA-Co基准,是ENEAS必须正面对比的强基线。

    ENEAS没有否认SAM 3的检出能力,Table 1甚至显示它召回最高。ENEAS补的是另一层:当候选“视觉上像、实体上不是”时,用嵌入加条件VLM做语义裁决;换句话说,SAM 3扩大了可提示概念分割的覆盖面,ENEAS尝试提高高歧义场景的语义纯度。

    SAMURAI则是另一条轴线。它从SAM 2出发,用运动感知记忆选择改善拥挤、快速运动、自遮挡下的零样本视觉跟踪,重点是如何选更可靠的历史记忆、减少视频误差传播;它面向“同一个目标怎样继续跟稳”。

    ENEAS的实例跟踪同样重视记忆,但借助SeC的概念级表示,并额外加入文本初始化;更重要的是,它还有逐帧语义发现与本体误报过滤。两者不是同一张榜上的简单替代:SAMURAI更像运动与记忆工程,ENEAS更像文本入口、身份记忆与语义验真的组合系统。

    对比来源

    SAM 3:https://arxiv.org/abs/2511.16719

    SAMURAI:https://arxiv.org/abs/2411.11922

    12 开源可用性:代码公开,不等于轻量即插即用

    官方仓库以Apache 2.0开源,包版本标记为0.1.0、开发状态为Alpha,支持Python 3.10到3.12。实例跟踪会自动下载SeC与文本定位相关模型;通用类别分割还需要CUDA GPU、SAM 2.1、SigLIP、Florence-2,以及通过本地Ollama服务运行的Qwen3-VL。

    这条依赖链意味着,ENEAS的创新更像一个可组合的系统架构,而不是单模型权重。优势是每个模块都可替换,2B与4B裁判、阈值和编码器尺寸都能调整;代价是模型下载、显存、服务进程、版本兼容与端到端排障都需要工程投入。

    对团队而言,真正的采用问题不是“仓库能不能打开”,而是错误成本是否高到值得支付语义复核延迟。若任务只是社交视频特效,偶发误报可能可接受;若掩码将直接删除3D资产、生成训练标签或触发自动盘点,精度优先级会完全不同。

    13 局限:裁判再聪明,也救不回没进候选框的人

    第一道上限来自候选召回,但不能把所有漏检都归给区域提议。Florence-2若没有为远处、小尺寸或重遮挡目标产生候选框,后面的嵌入与VLM确实无从补救;Table 4里RPN baseline、宽松嵌入和ENEAS-4B的召回都为79.6%,可视为该实验下候选阶段形成的召回天花板线索,而不是对每个漏检来源的逐例证明。

    后续验证同样会制造假阴性:严格嵌入的召回只有67.4%,ENEAS-2B为73.5%,说明真实候选可能被相似度阈值或VLM误拒绝。因此应区分“提议阶段根本没框到”和“已有候选在过滤、验证阶段被拒绝”两类失误。

    第二道上限来自上下文。极端特写、低分辨率裁剪、拥挤街道中的密集候选,都会让裁判缺少材质与场景证据,或让验证成本随候选数量上升。论文把Robust配置定位在单L4 GPU约三秒每帧,明确不是实时方案。

    第三道上限来自评估规模与数据代表性。Church Statues非常适合放大“雕像还是人”的语义矛盾,但它是论文针对3D重建采集的特定场景;SA-Co/VEval上的总体优势很小,说明更多跨数据集、跨提示词、跨文化艺术品与复杂天气验证仍然必要。

    此外,Figure 3所示片段里的ID较稳定,不等于系统已具备通用持久关联模块:语义发现仍逐帧运行,新实例的长期跨帧身份连接仍是论文提出的未来工作,系统也不输出可用于分数型评估的校准置信度。ENEAS解决的是“先把语义误报压下来”,还没有一次性解决开放世界视频理解的全部问题。

    14 龙哥点评:真正的进步,是知道何时不该相信视觉

    第一,ENEAS抓住了一个真实而昂贵的问题:边界正确,不代表任务正确。在3D重建里,一次把雕像当路人删除的假阳性,可能直接破坏资产;这种错误成本不对称,让“语义纯度”比通用召回更重要。

    第二,最值得借鉴的不是某个具体模型,而是条件计算的组织方式。便宜、稳定的嵌入处理大多数样本,昂贵、灵活的VLM只处理灰区;这类“快系统筛两端、慢系统审争议”的结构,可以迁移到内容审核、OCR纠错、机器人感知与数据清洗。

    第三,漂亮结果必须和代价一起读。87.6%的F1来自4B裁判与约5.02秒每帧的离线配置;在官方SA-Co/VEval上,提升是小数点级,定位还略低。好论文不是只给一个冠军数字,而是把什么时候值、什么时候不值讲清楚。

    对研究者,值得继续追的是把VLM判断蒸馏回嵌入过滤器,让灰区随经验缩小;对工程团队,应先测自己的假阳性成本与候选密度,再选Fast或Robust阈值;对普通读者,这篇工作最直观的启发是:视觉AI下一阶段不只是“看得更清楚”,而是“知道眼前这个像目标的东西,究竟算不算目标”。

    15 龙迷三问

    一问:为什么不直接让VLM分割?因为逐候选、逐帧调用VLM成本高,而且小裁剪缺少上下文时也会出错。ENEAS让VLM只做二元语义裁决,把像素边界交给专门的分割模型,职责更清晰。

    二问:F1从19.5%到87.6%,能否理解为替代SAM 3?不能。这个增益来自特定高歧义Church Statues场景;通用SA-Co/VEval上双方接近,SAM 3的定位指标还略高。更准确的说法是ENEAS补强语义验真,而不是全面替代。

    三问:最可能先落地在哪里?不是要求30帧实时的直播滤镜,而是对误删、误标极敏感的离线流程:3D重建清理、博物馆与电商资产处理、视频数据标注、无序图像集合筛选,以及需要保守掩码的自动化分析。

    主要参考资料

    ENEAS论文
    https://arxiv.org/abs/2609.03756

    ENEAS官方项目页
    https://speridlabs.com/research/eneas

    ENEAS官方代码仓库
    https://github.com/speridlabs/eneas

    SAM 3论文
    https://arxiv.org/abs/2511.16719

    SAMURAI论文
    https://arxiv.org/abs/2411.11922

    本文基于龙哥读论文PaperDaily数据库及PaperMiner的MCP进行汇总整理。

    本文为论文解读与技术评论。实验数字以论文公开版本为准;技术流程图与对比卡由PaperDaily依据论文事实原创重绘,不复刻原图像素。工程采用前请结合正式代码、模型依赖与自有数据复核。

    end

    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

    LONGGE AI COMMUNITY

    把每天读到的论文,变成长期积累

    加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

    加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

    龙哥读论文知识星球二维码 微信扫码加入知识星球