← 返回 PaperDaily 视觉与图像

广工等三校提出RVSD:剪掉67%视觉token,视觉大模型反而更少幻觉

大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。

广工等三校提出RVSD:剪掉67%视觉token,视觉大模型反而更少幻觉
原论文信息如下:
论文标题:
RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language Models
发表日期:
2026年09月
发表单位:
广东工业大学自动化学院,香港城市大学计算机科学系,广州中医药大学第二附属医院
原文链接:
https://arxiv.org/pdf/2609.02731v1.pdf

paperdaily_reaction_gif

大型视觉语言模型(LVLMs)的视觉幻觉问题,本质上是个“看图说话翻车现场”——模型明明没看见那个物体,却说得言之凿凿。现在的缓解手段大多要么费数据(需要额外训练)、要么费时间(需要多轮解码),而剪掉视觉token的稀疏化方法虽然省算力,却容易把真正关键的“证据”给误删了。
广东工业大学联合香港城市大学、广州中医药大学第二附属医院提出RVSD(Retrieval Vision Sparse Decoding,检索式视觉稀疏解码),用一套完全免训练、即插即用的单次解码框架,把“剪枝”和“按需找补”同时做了。结果很有意思:不仅仅幻觉少了,解码效率还提升了,长文本生成下的鲁棒性也稳住了。

视觉幻觉的“稀疏化悖论”:剪枝与保真的两难困境

要理解RVSD在做什么,得先搞清楚当前缓解视觉幻觉的几条技术路线大概是怎么个生态。论文里给了非常清晰的一张对比图,把主流范式分成了四类。
图1:缓解LVLMs视觉幻觉的几种代表性范式对比
图1:缓解LVLMs视觉幻觉的代表性范式对比:(a) 基于训练的齐方法 (b) 解码干预 (c) 稀疏解码 (d) 本文RVSD
第一种是训练对齐路线,代表方法比如RLHF、偏好优化这类,通过额外的监督信号让模型学会“说实话”。效果确实有,但要额外训练、要标注数据,成本不小。第二种是检索增强生成(RAG)路线,靠外部知识库给模型“递小抄”,但有额外的存储和检索开销。第三种是解码干预,典型如VCD(视觉对比解码)、M3ID这类方法,通过扰动视觉输入或干预注意力来抑制语言先验,但经常要多次迭代解码,延迟代价比较大。
最近比较受关注的是第四种——稀疏化解码。这种做法会丢掉一部分视觉token,换来推理加速,同时也能去掉一些“干扰性”视觉信息,减少幻觉。听起来两全其美。但这类方法有个通病:剪枝标准大多是模态无关的,也就是说它只看统计上重不重要,不看语义上重不重要。如果某个视觉token虽然整体冗余,但恰恰包含了决定性的细节信息,一旦被剪掉就再也找不回来了。
论文把这个问题叫稀疏化-幻觉悖论(Sparsification-Hallucination Paradox):越想通过稀疏化提升效率,就越可能误删关键视觉证据,幻觉反而变得严重。而且这个问题会随着生成长度的增加被进一步放大。
图2:稀疏化-幻觉悖论示意
图2:稀疏化-幻觉悖论,以代表性稀疏解码器VASparse在LLaVA-1.5上使用CHAIR数据集为例
这里的CHAIR(Caption Hallucination Assessment with Image Relevance,基于图像相关性的描述幻觉评估)是评估生成式幻觉的经典指标,专门统计模型在图像描述任务中生成的物体名称是否真的出现在图片里。图2展示了一个扎心的现象:现有的SOTA稀疏解码器,比如VASparse,随着生成长度从短到长,幻觉率持续爬升,生成得越长越容易“放飞自我”。
简单类比一下:稀疏化相当于给模型做“信息减脂”,目的是让注意力更聚焦、推理更高效,但减脂和营养不良之间往往只有一线之隔。RVSD的出发点是:既然“吃进去的”可能会被误删,那能不能把删掉的东西做成一个“可召回的记忆库”,等真正需要的时候再按需取用?这样一来,剪枝照做、效率照提,但关键视觉信息不再是一次性损失,而是随用随取。

RVSD核心机制:语义引导稀疏化+按需检索补偿

RVSD的整体架构如图3所示。主体流程分两个阶段:第一阶段是语义导向的token选择,把视觉token分成两份——一份是活跃稀疏集(active sparse set),用于当前正常的解码计算;另一份是延迟记忆库(deferred memory bank),先“雪藏”起来。第二阶段是SSVR(Semantic-Space Visual Retrieval,语义空间视觉检索)机制,当前解码出现“心里没底”的情况时,就从记忆库里把相关视觉证据捞回来,重新校准输出的概率分布。整个过程只有一次前向传播,不需要额外的训练,也不需要反复解码。
图3:RVSD框架总览
图3:RVSD框架总览,包含两个阶段。阶段1执行语义导向的token选择,阶段2通过SSVR机制按需检索视觉证据并重新锚定解码过程

动态稀疏性模块:什么该留,什么该“下放”

一个很自然的思路来动态剪枝:既然文本中有些词更重要(比如名词、动词往往比虚词携带更多信息),那视觉token的重要程度就应该由它对“当前最该关注的文本词”的关注程度来决定。具体来说,在解码的第 t 步,RVSD先计算每个已生成文本token的“显著性权重”,这个结果是用最后一层隐藏状态的L2范数经过温度缩放后的softmax值来衡量文本重要性的。温度系数τ在这里可以控制权重的集中程度。这一步的意义在于,它筛选出当前解码轨迹中最需要被关注的文本token子集,再让这些token去告诉模型:你们觉得哪几个视觉区域是现在最该盯着的。
公式:文本显著性权重计算
公式4:文本显著性权重计算,其中h表示隐藏状态,τ为温度参数
接下来通过头部文本token对视觉token的交叉注意力来判断哪些视觉区域与之相关。这时用到的就是标准的交叉注意力权重公式:文本侧query和视觉侧key做点积后除以√D做缩放,再经过softmax归一化。由于视觉token通常很多,RVSD会先选定一个“主要文本token集合”,然后在这个集合内部做加权聚合。
公式:交叉注意力权重计算
公式2:文本到视觉的交叉注意力权重计算,W_Q与W_K为对应层的query和key投影矩阵,D为隐藏维度
不过,单看某一时刻的注意力往往噪声不小,模型看走眼是常有的事。为了避免“一锤子买卖”,RVSD对视觉相关度分数做了时间维度的平滑处理,让上一时刻的分数以η的比例保留下来,与当前时刻的分数指数滑动平均。这相当于给决策过程加了“记忆缓冲”,不至于因为某一步的注意力抖动而误删重要证据。等分数算稳了之后,只保留Top-K个最重要的视觉token进入活跃集S,剩下的全部放去延迟记忆库P。
公式:视觉相关度分数聚合
公式5:视觉相关度分数的加权聚合计算,β为文本显著性权重,A为交叉注意力权重
公式:时间平滑更新
公式6:时间平滑更新,η为平滑系数
当保留的视觉token数量k远小于总数N_v时,每层注意力的计算复杂度就能从O((t+N_v)²)降到O((t+k)²)。
公式:活跃集与延迟集划分
公式7:活跃稀疏集与延迟记忆库的划分,TopK取前k个最高分token

SSVR机制:解码“心虚”时,自动翻记忆库

动态稀疏化负责“怎么剪才不伤筋骨”,但模型生成是步步为营的过程——上一步的剪枝决策做到完美,不代表后面生成的每一步都对视觉证据有充分把握。所以RVSD设计了SSVR机制,它包含三个环节:不确定性触发的检索门控、跨模态检索、轻量注入。
第一个环节是判断模型什么时候“心里没底”。RVSD的做法是扫描中间部分层的归一化预测熵:如果某一层的预测概率分布特别“平”,p值比较分散,说明模型目前对下一个词该说什么没有把握,那就必须去看看被“下放”的视觉证据了。
公式:归一化预测不确定性
公式8:归一化预测不确定性(熵)计算,N为词表大小
一旦不确定性超过预设阈值γ,SSVR就触发检索操作。这里有个很关键的工程设计:触发之后,不是让整个网络都重新看一遍所有图像,而是把当前解码器某层的隐藏状态作为一个“语义查询”,在共享语义空间里与延迟记忆库中的token算相似度,然后取相似度最高的top-k个token,用softmax权重加权聚合出一个查询条件化的视觉特征。
公式:语义相关性检索分数
公式9:语义相关性检索分数计算,q为查询向量,z为延迟记忆库中的视觉token
检索到的视觉证据怎么用?直接把它拼到上下文里会打乱模型的输入分布。RVSD参考了adapter的思路,构造一个“瞬态适配器(transient adapter)”,把检索到的视觉特征构造成适配器的上下投影权重。由于权重的幅值是按宿主FFN(前馈网络)的平均幅值做了对齐的,注入之后不会破坏模型原本的输出分布。最后用一个可调的注入比例α把适配器的输出与当前残差流混合,得到修正后的隐藏状态。需要强调的是,这个适配器只在触发的那一步产生作用,用完即弃,不参与后续任何解码步骤。检索过后的下一步,系统会重置触发标志、释放适配器,让模型像什么都没发生过一样继续跑。
公式:检索特征聚合
公式10:检索到的视觉token按softmax权重进行对角加权聚合
公式:瞬态适配器权重构建
公式11:瞬态适配器的上下投影权重构建,幅值与宿主FFN对齐
整个过程被封装成一个完整的单次前向传播算法流程,具体伪代码如下。
    单次前向传播算法(RVSD):
    输入:LVLM模型M,图像v,文本查询x
    1. 编码视觉token集合Z_v
    2. 循环 t = 1, 2, ... :
       3. 用公式(4)-(6)更新文本显著性和平滑视觉相关度分数
       4. 将视觉token划分为活跃集S_t和延迟记忆库P_t
       5. 定义触发标志trigger
       6. 遍历中间层 l 从 l_s 到 l_e:
          7. 用公式(8)计算该层的不确定性分数
          8. 如果 trigger 为真且 不确定性 > 阈值γ:
             9. 用公式(9)以当前隐藏状态查询延迟记忆库
             10. 取top-k个token并按公式(10)聚合特征
             11. 按公式(11)构建瞬态适配器权重
             12. 按公式(13)融合检索到的视觉证据
             13. 重置trigger
          14. 结束
       15. 用公式(3)在活跃集S_t上进行token预测
    16. 循环结束
    输出:生成的响应序列

    公式(13)的融合策略

    公式(13)是检索后的融合策略:新隐藏状态o由原来的残差流h和检索信号a按照权重(1-α)和α进行加权混合。这个α是RVSD中一个非常关键的超参数,它直接决定了模型在多大程度上信任“外部检索到的视觉证据”。如果太小,找回来了也起不到纠偏作用;如果太大,又可能让模型的输出偏离原本的语言风格。论文在后面的实验里专门分析了几组不同α取值的效果差异。
    公式:融合策略
    公式13:融合策略,α控制原始残差流与检索视觉证据的混合比例

    三大骨干模型上的全面验证:效果与效率兼得


    判别式幻觉基准:POPE、MME与AMBER-判别

    先看判别式幻觉评估。POPE(Polling-based Object Probing Evaluation,基于轮询的目标探测评估)是判断模型能否正确回答“图里有没有某个物体”的经典基准,分随机、流行、对抗三个划分,对抗划分里最难,因为候选物体往往跟图中内容高度相关,模型很容易被语言先验带偏。
    表1:POPE-MSCOCO判别基准上的性能对比
    表1:在POPE-MSCOCO判别基准上的性能对比,覆盖随机、流行与对抗三种划分,绿点表示相对基础模型的提升,红点表示下降
    从表1可以清楚看到三点。第一,RVSD在三个骨干模型(LLaVA-1.5、LLaVA-NEXT、Qwen-VL)的所有划分上都拿下了最高准确率,并且几乎在所有情况下都拿到最高F1分数。第二,增益最大的是对抗性划分:LLaVA-1.5上的准确率和F1分别提升了8.9和5.4个百分点,LLaVA-NEXT上分别提升7.0和7.3个百分点。这说明RVSD最难啃的场景——模型很容易被语言先验误导的地方——恰恰是它发挥最猛的地方。第三,对比方法的表现参差不齐。VCD和M3ID有一定提升但幅度有限,VTI和AvisC在某些配置下甚至不升反降,而RVSD是稳定地全面开花。值得一提的是,RVSD完全不需要改动模型参数。考虑到对比的几个基线要么需要额外构造扰动图,要么对注意力权重做干预、步子迈大了容易扯着蛋,RVSD这种“顺其自然、只在不确定时介入”的策略确实更优雅一些。
    MME(Multimodal Evaluation,多模态评估)幻觉子集也是判别式评测的重要一环,这里看的是模型对存在性、数量、位置、颜色这几类属性的判断力。RVSD在MME上同样全面超越基线,除了整体总分提升明显,位置和颜色这些细粒度属性感知能力也被明显拉高了。
    图5:MME幻觉子集上的性能对比
    图5:在MME幻觉子集上与基线的性能对比,覆盖物体级(存在性、数量)与属性级(位置、颜色)探测

    生成式幻觉基准:CHAIR与AMBER-生成

    来看生成式幻觉的结果。CHAIR指标分两个层面:句子级幻觉率CHAIR_s和实例级幻觉率CHAIR_i,前者看有多少句子包含幻觉物体名,后者看幻觉的物体名占总提及物体名的比例。AMBER生成式评估里还额外报告了CHAIR、幻觉率和整体打分。
    表2:CHAIR与AMBER基准上的生成性能对比
    表2:CHAIR基准与AMBER基准的生成式描述性能对比,加粗为最优结果
    RVSD在CHAIR上实现了全部三个骨干模型的最优幻觉率,同时生成长度没有明显缩水。AMBER上的结果和CHAIR保持了一致——判别式准确率和F1在LLaVA-1.5与LLaVA-NEXT上均拿最高,生成式幻觉率也降到了最低。这里需要提示一下,关于CHAIR等基准的MCP同基准检索对比,当前仅有部分定性结论,具体数值能核实的主要来自论文原文表2。毕竟各家的评估split和采样配置可能不同,直接跨论文硬比数值不一定公平,只能说在本文报告的设置下占优。

    通用能力不掉队:MM-Vet验证

    幻觉降了,通用能力会不会跟着受损?往往是这类方法最容易被质疑的地方。论文用MM-Vet做了全面体检,覆盖识别、OCR、知识、生成、空间几个维度。
    图4:MM-Vet逐维度分数对比
    图4:基础解码与RVSD在MM-Vet各维度上的分数对比,RVSD在全部维度上都有提升
    结果显示,RVSD在所有三个骨干模型上不仅没有掉点,反而每个维度都有小幅提升:LLaVA-1.5的总分从30.0升到33.1,LLaVA-NEXT从42.1升到42.7,Qwen-VL从36.7升到38.4。有意思的是,知识维度(Know)的提升最明显,论文给的解释是:恢复被剪掉的视觉证据,对知识密集型推理同样有正向帮助。可以这样理解,模型在做知识问答时往往需要把视觉细节和语言知识相互印证,如果一上来就把视觉细节丢了,知识也就成了无源之水。

    效率优势:延迟降低,峰值显存不升反降

    作为解码侧方法,效率自然是要重点考察的。表4给出了不同方法在每token解码延迟、峰值显存占用、TFLOPs和首token延迟(TTFT)上的对比。
    表4:推理效率对比
    表4:RVSD与代表性解码侧幻觉缓解方法的推理效率对比,报告每token解码延迟、峰值GPU显存、TFLOPs和TTFT
    从效率结果可以看出RVSD“免费午餐”成色几何。表中每token延迟(毫秒/次)大概是多少、显存开销多少、TFLOPs多少,论文里都给了明确的对照数据。因为RVSD只保留了一小部分视觉token参与常规解码,推理开销比密集解码方案更低;而稀疏解码带来的加速也没有因为“记忆库”的存在而完全泡汤——延迟只是略有增加,还远低于对比解码方法动不动就要多跑一次前向的开销。感兴趣的读者可以直接翻原文表4核对详细数字。

    消融与超参分析:每个组件都不可或缺

    方法设计上RVSD有两个核心组件:语义导向的稀疏选择模块和SSVR检索模块。论文在MME全量基准上做了组件的消融实验,完整验证每个模块的作用。
    表3:组件级消融实验
    表3:在LLaVA-1.5的全量MME基准上进行组件级消融,评估语义导向稀疏选择模块与SSVR模块各自的贡献
    消融结果显示,单独去掉语义导向的稀疏选择、只保留SSVR时,性能有显著下滑;而只保留语义稀疏化、去掉SSVR检索时,性能也不如完整版。这说明“有选择的剪”和“按需的找”是协作关系,两者缺一不可。还可以从另一个角度看:即使只用稀疏化部分,MME的总分也已经超过了普通解码基线,说明RVSD把token剪得准这件事本身就足以带来幻觉抑制收益;SSVR则在此基础上再加了一大截,而且主要补在长尾细节上。
    再看看超参分析。论文里最核心的超参有两个:检索特征与残差流的融合比例α,以及单次检索最多取回的token数k_c。对(α, k_c)不同配置的分任务表现差异,论文用热力图方式呈现出来。
    图6:MME子任务级超参热力图
    图6:非基线超参配置下的MME子任务级Δ热力图,Δ=该配置分数−基线配置分数
    从图6可以看到一个有意思的现象:不同子任务对α的偏好不同。颜色这类需要较强细粒度视觉证据的任务,往往喜欢更大一点的α;而位置这类相对粗粒度的任务,α的影响没那么敏感。这说明把α固定为一个全局值其实是做了妥协,如果能做到按任务类型或按解码步骤自适应调节α,可能还有进一步的提升空间。
    表8:超参敏感性分析
    表8:在POPE-MSCOCO对抗划分上对LLaVA-1.5的超参敏感性分析,各分块内最优已加粗
    表8则报告了多个超参数在POPE对抗划分上的敏感性,包括保留token数k、显著性平滑系数、检索阈值γ、检索数量上界K、注入比例α等。总体来看,RVSD的超参在较大范围内都能保持稳定的性能提升,没有出现“调参如炼丹,一个小数点毁所有”的脆弱迹象。这些实验共同说明一个结论:RVSD的增益不是靠某个灵光一现的单一技巧,而是靠“稀疏化保主干、检索补细节”的系统配合。

    从RVSD到未来:可信赖LVLM推理的新范式

    RVSD的核心贡献在于,它把“解码时稀疏化”和“按需视觉检索补偿”两个原本分属不同技术脉络的思路,统一到了一个单次前向的解码框架里。这种“先删后补”的模式解决了视觉幻觉缓解里的一个结构性矛盾:既想通过剪枝降低计算开销,又不想因为剪枝而丢失关键视觉证据。将token剪掉不是扔掉,而是挪进了延迟记忆库;这样在需要的时候依然可以“翻旧账”,用很轻量、可复原的方式实现视觉基础的动态补充。
    从论文报告的实验结果来看,RVSD在POPE、MME、CHAIR、AMBER等多个评测基准上都取得了稳定增益,且长文本条件下的鲁棒性相比传统稀疏解码器也更让人放心。图8的定性比较案例进一步展示了它在更复杂场景中的表现,密集物体、细粒度属性依赖都能把幻觉压住。
    图8:更具挑战性的长文本生成定性案例
    图8:更多挑战性长文本生成样本的定性对比,红色为幻觉内容,绿色为基于输入图像的可靠内容
    也可以把RVSD放进更长的技术演进坐标里看。早期的VCD通过对比扰动输入下的logits差异来抑制语言先验,需要在每次解码时额外构造一个扰动分支,延迟开销高。M3ID进一步改进了扰动策略,但本质上还是“对比”的思路。到了RVCD(Retrieval-based Visual Contrastive Decoding),研究者开始引入外部检索图库来辅助对比解码,但它需要一个离线数据库支撑。RVSD与这些方法的本质差异在于:它不再需要任何外部数据库,检索的是模型自己的延迟记忆库。这样一来,既保留了检索增强带来的“关键时候有人拉一把”的优势,又免去了维护外部数据存储与检索的开销。VTI与AvisC这类注意力干预方法,则是直接修改注意力权重,虽然也能降低幻觉,但同样要密集处理全部视觉token。而RVSD通过稀疏化显著降低了主体解码的计算量,检索分支是低频触发的,平均开销被控制得很低。
    当然,作为一篇新方法论文,RVSD也还有一些可以进一步探讨的地方。比如,检索触发阈值γ和中间层扫描窗口[l_s, l_e]的选择目前是经验性的,对未知领域的泛化能力还有待大规模验证。再比如,如果视觉token数量极大(如超高分辨率图像),完整的延迟记忆库本身也可能成为不小的存储开销。此外,当前报告的结果主要基于7B规模的模型,向更大规模(如70B甚至更大)迁移时的表现如何,也值得持续观察。这些问题并不减损RVSD本身的价值,毕竟方向对了,剩下的只是把路修得更宽。

    融会贯通

    结合PaperDaily已收录的一些同赛道论文来看,过去的视觉幻觉缓解基本是“倒掉洗澡水也倒掉孩子”的局面,剪枝类方法尤其明显。另一条路线的训练对齐方法(比如RLHF、偏好优化)效果虽好但门褵高,很多中小团队负荷不起。RVSD这种免训练、即插即用、还带一点“后悔药”功能的方法,天然更适合快速验证和轻量落地。如果后续实验公允性没有问题,它在应用层面的想象空间会比同类对比解码方法都宽不少。不过还是需要提醒读者,跨论文横向比数值时要留意各家基准的划分设置与采样参数,目前库里在这几个基准上尚未抽到足够同配置的硬数值来交叉验证,所以先以论文自洽报告为准。

    龙迷三问

    下面是龙哥对于大家可能的一些问题的解答:
    这篇论文到底在解决什么问题?大视觉语言模型常“看图说话”产生幻觉。
    这篇工作最值得看的点是什么?RVSD在POPE、MME、CHAIR、AMBER和MM-Vet五个基准上均取得最优性能,在三个不同架构的LVLM骨干上一致提升,且在长上下文生成场景下保持鲁棒性。相比Vanilla,在POPE对抗性分割上最高提升+8.9准确率,在CHAIR_S上降低14.4,同时保持与Vanilla相同的推理延迟。
    这篇工作的边界或风险在哪里?优点:(1) 训练-free且即插即用,无需额外训练数据或标注;(2) 单次前向传播内完成稀疏化和按需检索,计算开销低;(3) 语义引导的token选择保留关键视觉信息,优于模态无关的剪枝方法;(4) 不确定性触发的检索机制在需要时恢复视觉依据,有效缓解长上下文生成中的幻觉累积。缺点:(1) 熵阈值需要针对不同骨干网络手动调整;(2) 简单点积相似度检索可能不如学习式语义投影精确;(3) 在Qwen-VL上的F1分数提升不如准确率提升显著;(4) 未在更大规模模型(如13B/34B)上验证。
    如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

    龙哥点评

    论文创新性分数:★★★★☆

    提出RVSD框架,通过语义引导的token稀疏化与语义空间视觉检索机制,在单次前向传播中实现视觉token的动态剪枝与按需补偿,以缓解大视觉语言模型中的视觉幻觉。

    实验合理度:★★★★☆

    POPE准确率与F1分数,MME感知与认知分数,CHAIR_S与CHAIR_I,AMBER准确率/F1/CHAIR/HalRate/Score,MM-Vet总分及各维度分数

    学术研究价值:★★★★☆

    提出RVSD框架,通过语义引导的token稀疏化与语义空间视觉检索机制,在单次前向传播中实现视觉token的动态剪枝与按需补偿,以缓解大视觉语言模型中的视觉幻觉;更关键的是问题定义是否可复用到同类任务。

    稳定性:★★★☆☆

    现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

    适应性以及泛化能力:★★★☆☆

    现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

    硬件需求及成本:★★★☆☆

    相比Vanilla解码,RVSD将TFLOPs降低15.6%,TTFT降低20.2%,内存使用减少2.2%,延迟保持与Vanilla相同(1.00×)

    复现难度:★★★☆☆

    现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

    产品化成熟度:★★★☆☆

    论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

    可能的问题:(1) 熵阈值需要针对不同骨干网络手动调整;


    *本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

    转发文章 微博 X LinkedIn Facebook
    龙哥读论文 · PaperDaily

    本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

    LONGGE AI COMMUNITY

    把每天读到的论文,变成长期积累

    加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

    加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

    龙哥读论文知识星球二维码 微信扫码加入知识星球