← 返回 PaperDaily 视觉与图像

北大&字节提出UEAP-4k:专治画质增强“翻车”,AP50提升5.7个点!

刷短视频时,原图里正常的人脸经过平台"画质增强"后,可能变得僵硬或文字扭曲。这是平台在后台对用户生成内容(UGC)进行压缩、编码、解码、再增强的结果。

北大&字节提出UEAP-4k:专治画质增强“翻车”,AP50提升5.7个点!
原论文信息如下:
论文标题:
Fine-Grained Anomaly Perception in Wild UGC-Enhanced Images: A Comprehensive Dataset and Diference-Fusion Framework
发表日期:
2026年09月
发表单位:
北京大学,抖音/字节跳动,中国传媒大学
原文链接:
https://arxiv.org/pdf/2609.02529v1.pdf

短视频平台背后的"隐形杀手":增强算法如何悄悄破坏画质?

刷短视频时,原图里正常的人脸经过平台"画质增强"后,可能变得僵硬或文字扭曲。这是平台在后台对用户生成内容(UGC)进行压缩、编码、解码、再增强的结果。虽然大部分时候画面更清晰,但生成式增强算法偶尔会在局部区域制造瑕疵,比如人脸变形、文字乱码、纹理"脑补"不该出现的细节。

这些局部问题很危险。人脸是关键区域,修崩了会引发投诉;文字区域语义敏感,恢复错一个字可能改变视频意思;纹理生成错误涉及"造假"争议,影响平台信任。增强算法带来的画质问题已成为短视频时代的"质量事故"。

现有图像质量评价(IQA)方法只能给整张图打分,无法识别局部问题。视觉异常检测(VAD)方法只关注当前图像异常,不考虑异常是否由增强算法引入。北京大学与字节跳动联合研究定义了UGC图像增强的细粒度异常感知(UEAP)任务,专门捕捉增强过程引入的局部质量问题。本文将拆解UEAP-4k数据集、DFAP-UGC方法框架和LADTP训练策略。

UEAP-4k:首个真实场景UGC增强异常感知基准数据集

真实业务问题常从数据开始。团队将"增强翻车"从玄学变成可量化研究的学问。

新任务定义

UEAP任务输入为增强前的原始UGC图像 Iʳ和增强后的图像 Iᵉ,目标是找出增强图里变差的局部区域,并输出异常框、异常类别、严重程度评分。UEAP通过成对比较,能从源头"撇清关系"。下表对比了UEAP与其他视觉质量检测任务的差异。

表1:新任务UEAP与其他相关视觉质量检测任务的对比。NR-IQA和FR-IQA分别指真实失真场景下的无参考和全参考图像质量评价,VAD指视觉异常检测。输出中的Localization、Classification和Regression分别对应异常/失真定位、异常/失真分类和异常/失真严重程度评分。✓表示是,✗表示否。这些标签针对各任务的大多数场景定义。所提出的UEAP任务不需要高质量参考,但提出了更严格的输出要求

UEAP不依赖高质量参考,要求框位置、判断类别、评严重程度,四项输出要求叠满,符合真实业务场景诉求。

异常类别与标注

论文将异常框定为人像、文字、纹理效果异常,覆盖用户视觉注意力最高、对真实性最敏感的区域。严重程度评分用负向区间打分,标注流程严格人工进行,标注员对比原始参考图和增强目标图,只标记增强后变差的区域。下图展示标注界面和示例。

图1:UEAP-4k标注界面与示例。标注员将参考图像与增强图像并排比较,在增强图像上绘制边界框,选择一种异常类型,并给出从-5到-1的严重程度评分

多人标注同一张图,论文设计贪心标签合并策略统一标注:按异常类别聚类,同类别中IoU大于0.5的框视为同一异常,框坐标和严重程度取平均,类别由多数投票确定;孤点框保留。

核心统计信息

数据集UEAP-4k包含4222对样本,13662个异常框。人像效果异常最多,占58%;纹理效果异常占23.1%;文字效果异常占18.9%。58%的翻车事故出在人像上,说明"人脸美化增强"最容易出问题。

每张图平均有3.24个异常框,长尾延伸到最多33个异常框。约75%的样本不超过4个框,90%不超过6个框,但有少数样本问题密集。

图2:标签统一后的UEAP-4k统计。左图为每个样本异常框数量的直方图,右图为累计分布图

DFAP-UGC:差异融合驱动的异常感知新框架

有了数据,接下来自然就是设计方法。UGC增强异常感知难点在于增强前后图像差异细微。论文提出DFAP-UGC方法,通过增强图特征、参考图特征和绝对差异特征三者融合,关注增强带来的变化信号。DFAP-UGC框架分为主检测通路、区域验证通路和质量排序通路。

图3:DFAP-UGC方法总体框架图。输入增强后的'问题图像'与增强前的'参考图像',它们共享同一个Swin主干网络提取特征;模型融合问题特征、参考特征与显式差异特征,经密集Transformer编码器生成空间查询;区域验证通路在Stage-2高分辨率特征上对每个预测框做局部证据验证;质量通路估计每个框的定位质量以校准排序,训练全过程使用LADTP自动调节子任务权重

下面我们把DFAP-UGC的几条通路拆开来看。

共享编码器跟差异融合

编码阶段很有讲究。问题图像Iᵖ和参考图像Iʳ都统一缩放到448×448分辨率,塞进同一个共享权重的Swin-Transformer小模型(Swin-T)主干。共享权重保证了两路特征天然对齐,差异信号变得可靠。

Swin-T的Stage-2特征图分辨率是56×56,Stage-3特征图分辨率是28×28。主检测通路用Stage-3特征构建"三重差异表示":在Stage-3上计算增强特征Fᵖ₃、参考特征Fʳ₃跟它们俩的绝对差异D₃:

公式1:Stage-3差异特征D₃等于增强图像特征F₃ᵖ与参考图像特征F₃ʳ之差的绝对值。这个显式的差分特征是整个差异融合操作的基础

再经过通道拼接、线性投影、GELU激活、层归一化,完成融合:

公式2:融合特征Z由问题特征、参考特征和差异特征通道拼接后,经线性层W_f、GELU激活函数与层归一化(LN)处理得到。这里的拼接语义是:问题特征负责看当前画面,参考特征负责回忆原状,差异特征负责高亮变化

三者通道拼接让模型对每一个空间位置都拥有完整的信息线索,知道画面现在长什么样、原来长什么样、以及哪里发生了实质性的变化。

密集Transformer编码器

融合后的特征Z被压成28×28的784个密集token,每token对应一个空间锚点。为了让模型感知每个token的空间位置信息,代码加上二维正弦位置编码(2D Sine positional encoding),一起送进六层Transformer编码器做全局关系建模:

公式3:编码器输出H等于六层Transformer编码器对融合特征Z加位置编码P的处理结果,共784个输出token,每个token都做后续检测的输入特征

为什么要用"密集查询"而不是像DETR那样只用少量的可学习object query?关键在于任务目标的大小。增强带来的局部异常往往区域都很小,一个28×28的网格上可能只占一两个格点,如果用稀疏query做一对一匹配,很容易漏检。而每个网格位置都放一个query,等于撒下一张密不透风的渔网,小目标也跑不掉。

对这些密集query,检测头的预测方式可以理解为:每个anchor位置有一个初始锚框(默认宽高设为0.15),box head预测出一个相对锚框的偏移量,两者叠加得到最终框坐标。分类和严重程度则从token特征各接一个线性头获得:

公式4:预测框b̂ᵢ通过sigmoid作用在锚框aᵢ的logit加MLP_b输出偏移量之上。这里框的宽高和中心点均被归一化到0到1之间 公式5:类别预测p̂ᵢ是token特征经过分类权重W_c得到的三个前景类别的logit,严重程度评分ŝᵢ则通过sigmoid后乘-5映射到[-5,0]范围内

值得注意的是,网络结构在这里引入了一个区别:预测的严重程度评分ŝ只作为输出属性,并不参与检测置信度的计算。换句话讲,一个框的类别判断和定位质量,不应该被"这处异常有多严重"来干扰——严重度描述的是现象强度,不是"这是不是一个真异常"的直接概率。

任务对齐分配跟检测损失

Dense query的列车开出去了,问题也跟着来了:784个query,哪些该为正样本?哪些该为负?用匈牙利算法做一对一匹配,对局部小异常来说过于稀疏,而且很多围绕异常框边缘的query其实也包含了部分有效上下文特征。因此论文采用了任务对齐分配策略(TAL,Task-Aligned Assignment)。TAL为每个query和每个真实框计算一个对齐分数:

公式6:对齐分数Aᵢⱼ等于分类预测概率的α次方与边界框IoU的β次方之积。论文中取α=1、β=6,让分配过程同时尊重分类置信度和定位质量,只有分类又准、框又正的query才会被选为正样本

每个异常实例我们选取top-5且中心落在框内的查询作为正样本。如果某个真实框内实在没有query中心点,那就退一步选距离框中心最近的query兜底。这种分配策略为每个异常提供多个训练正例,并且要求分类置信度与定位质量对齐,避免了"分类头说很可能是异常、回归头却框偏到姥姥家"的矛盾局面。

分类损失采用了类似Focal Loss的加权交叉熵来压制易分负样本:

公式7:分类损失L_cls为经TAL选出的正样本与密集背景查询上的加权二元交叉熵。权重w_ic对正样本直接取目标值,对负样本则乘上(1-α_f)pᵧ项(γ=2),使容易混淆的高分背景查询得到更大惩罚

定位损失和严重程度回归损失则采用简单直接的回归目标:

公式8:回归损失L_box是预测框与真实框之间归一化坐标的L1距离,L_giou是1与预测框和真实框广义交并比(GIoU)之差。GIoU比普通IoU对框偏移更敏感,能提供更平滑的梯度信号 公式9:严重程度损失L_score取预测严重程度与真实标注之间的L1绝对误差。这个简单回归目标的设定说明任务对极端分数的偏差同样敏感,一个框被评为-2还是-5,在业务上通常意味着完全不同的处理策略

区域验证分支

密集查询的渔网策略能大幅提升召回率,但也带来了副产品:误检变多。特别是有时候增强前后确实"看起来变了一点",但那种变化根本算不上异常——比如正常的锐化、正常的对比度调整,视觉上区域又被提取得特别突出,就成了"高置信度的假阳性"。

为了给这些候选框"验明正身",DFAP-UGC设计了区域验证分支。它的主要思路是:在分辨率更高的Stage-2特征上(56×56),把两路的高分辨率特征也按同样的模式拼接起来,对每个预测框内部作更精密的证据核验:

公式10:Stage-2区域特征R₂也由增强特征、参考特征和两者绝对差拼接而成,只不过分辨率提高到了56×56,能保留更多高频细节和边界结构

对每个预测框,区域验证分支在该高分辨率特征上做双线性网格采样,取出一个3×3的局部区域特征,然后结合来自密集查询的特征以及预测框坐标,输入一个小分类器做"二次判断":

公式11:区域验证输出r̂ᵢ是分类条件logit,输入由主路query特征hᵢ、按预测框从R₂池化出的区域特征,以及经stop-gradient处理(sg表示停止梯度)的预测框坐标拼接而成。坐标需要套stop-gradient让该分支只学习和验证当前框的特征,不回传梯度干扰主检测头的优化

训练时该分支用类别条件的二元交叉熵损失,且加入了难负样本挖掘机制——特别针对那些视觉上很突出,但事实上不构成异常的区域做压制:

公式12:区域验证损失L_reg是基于正样本归一化的类别条件二元交叉熵。训练目标y_regⁱᶜ为预测框与该类所有真实框IoU的最大值是否达到0.5的指示;w_reg包含类别权重和困难负样本权重

Dense-IoU质量分支

真正的业务场景里,模型输出的"候选异常框"往往要按置信度从高到低排队,送到人工审核或者下游策略模块去处理。如果置信度只是一堆来自分类器的乐观估计,那排名就会被带偏——排在最前面的可能不是"最需要处理的异常",而是分类器最有把握的"普通货色"。

为此,DFAP-UGC又焊接了一个Dense-IoU质量分支,专门学"我刚才预估的这个框到底有多准"。它的输入是主干检测头中detach下来的query特征和detach的预测框坐标:

公式13:Dense-IoU质量输出q̂ᵢ由质量头Q处理停止梯度的query特征与停止梯度的预测框坐标得到。detach设计让这个分支只学习'打分'而不干预检测头自己的'开框' 公式14:质量损失L_qual同样是类别条件二元交叉熵。与区域分支最大的区别在于质量分支的IoU阈值τ_qual取0.3,更宽松,目标值也更平滑,回归的是'到底有多准'的连续概念,而不是一个生硬的二分类

预测框和某一类真实框的IoU如果大于0.3,质量分支就以该最大IoU作为回归目标;如果低于0.3,目标就是0。这种设计使质量输出成为真正意义上的"定位质量估计器"。

到了推理阶段,DFAP-UGC把三个头的预测概率乘在一起,得出最终的置信度:

公式15:推理置信度C_ic由主路分类概率σ(p̂_ic)、区域验证概率σ(r̂_ic)和质量概率σ(q̂_ic)的0.5次方三者的乘积得到。质量概率开根号是为了在不至于过度压低高分候选的前提下,保有排序校准能力

每个查询按单标签模式解码,取各类别中置信度最大的作为最终预测类别,再做IoU阈值0.5的类别内非极大值抑制(NMS),得到最终输出集合{框、类别、严重程度}。

LADTP:让模型学会"先定位、再分类"的动态训练策略

多任务学习有个经典难题:分类、定位、严重度评分、区域验证、质量估计这五个子任务,各自损失的量纲不同、难度不同,如果一上来就固定权重同时训练,很容易顾此失彼。论文给了一个非常接地气的判断:在这个任务组合里,定位是所有子任务的地基——框都画不准,谈何分类和评分?分类得再准,框歪到隔壁去也是白搭。

也正因如此,论文提出了LADTP(局部感知动态任务优先级,Locality-Aware Dynamic Task Prioritization)训练策略,让模型在训练过程中自己看"定位学得怎么样"来动态调节当前该重点优化哪个任务。

思路起底

LADTP的核心思想有两条。第一,定位质量用GIoU损失实时衡量。当定位还一塌糊涂的时候,也就是GIoU损失居高不下的时候,就应降低分类、评分等子任务的损失权重,让模型先把全部算力集中在"把框画准"这件事上。第二,当定位精度上去了,GIoU损失降下来了,再根据各个子任务当前各自的难度动态放开权重——哪个任务还比较吃力,就给哪个任务多分点权重。

这里的朴素直觉是:就像人解一道复杂的应用题——第一步肯定要把题目里涉及的物理量全部找对,才能去谈列方程和求解。早期阶段如果硬让模型同时优化几十个目标,往往会导致"样样通、样样松",不如先集中火力把地基打牢。

动态权重计算

LADTP的实现过程按epoch推进,使用滑动平均来做平滑更新。每个epoch结束后,模型统计该轮所有子任务的平均原始损失值,将其转换成KPI分数。对于定位相关的损失(L_box、L_giou),KPI映射范围控制在0到2;其余任务(L_cls、L_score、L_reg、L_qual)映射范围放宽到0到3:

公式16:对框回归与GIoU两个定位类子任务,KPI值κ等于e的负裁剪损失次方,裁剪范围限制在[0,2]。损失越低KPI越接近1,损失越高则KPI向e⁻²坠落 公式17:对分类、评分、区域验证、质量估计这四个子任务,KPI转换的裁剪范围为[0,3],容忍损失的区间更大 公式18:滑动平均的平滑KPI状态K在每一轮按指数移动平均(EMA)方式更新,ρ为平滑系数。EMA能让损失在batch之间的随机波动被抚平,保留真实的训练趋势

得到平滑KPI后,按DTP风格的公式更新各子任务的权重——任务当前KPI越低,代表这个任务越难,权重反而要越大:

公式19:基本动态任务权重w等于-(1-K)的r次方再乘log(K)。如图所示,当KPI高时权重小、KPI低时权重大,把优化压力自动推向当前最吃力的任务

定位感知调节因子

LADTP最特殊的地方是它对"非定位任务"额外乘了一个定位感知的调节因子。当定位还处于困难期,也就是GIoU的KPI比较低的时候,这个因子就像一根"缰绳",牢牢勒住分类、评分、验证这些旁路任务,让整个网络心无旁骛地先练好定位:

公式20:定位感知调节因子η是GIoU的KPI经过sigmoid变换后的值,式中指数为-4(K_giou-1)。当K_giou明显低于1时调节因子接近0,旁路任务权重几乎被完全压制;当K_giou超过1时调节因子快速上升,旁路任务开始获得正常学习空间——这个切换过程是平滑连续的,不是生硬的开关

最终,定位类任务的权重按基本动态权重更新,非定位类则在基本权重上乘以调节因子η:

公式21:最终损失权重λ的更新规则。定位类子任务只乘基础动态权重w,而非定位类子任务还要额外乘以定位感知因子η,使分类与评分的优化节奏与定位能力严格挂钩

这套训练策略实际达到的效果是:模型在训练早期基本是"先一门心思学定位"的纯检测器,定位能力逐步变好之后再逐步把注意力让渡给分类、评分、区域验证和质量排序。这种"先生存、后发展"的思路,正好呼应了论文希望解决的多任务干扰问题。

在框架训练阶段引入动态系数调节并不是什么全新招数,但把"GIoU定位质量"当作核心任务优先级门控信号、再配合EMA平滑动态调节分类与质量分支注意力,在细粒度异常感知这个场景里是具有实用价值的设计创新。

实验结果:全面超越经典检测器改编基线

一个数据集加一个新框架,到底实战表现如何?论文在UEAP-4k上设计了几个关键实验。由于UEAP此前没有现成的竞赛基线,作者改编了三个经典检测器作为参照:两阶段的Faster R-CNN、单阶段YOLO系列早期的YOLOv1,以及比较新的YOLOv12n。四个模型都在相同训练集上训练,保证公平对比。

从测试集结果的对比中可以明显看出,DFAP-UGC在核心检测指标上表现更好,尤其在一些强调定位精度的严格指标上拉开差距,而这一优势得益于其成对差异融合和密集查询机制的互补。对比方法中,Faster R-CNN作为两阶段方法,在定位精度上表现尚可;YOLOv1版本较旧且思想与结构相对简单;YOLOv12n作为最新YOLO家族成员,单图检测能力本身就比较强。但它们的共同问题是处理不了"成对比较"的场景语义——不知道增强前后发生了什么变化,只把增强后的图像当普通单图做目标检测,自然很难分辨增强新增的异常与原先就存在的模糊噪点。

表2:DFAP-UGC与改编基线方法Faster R-CNN、YOLOv1/v12n在测试集上的对比结果

实验还额外做了充分的消融分析,凡是移除或削弱模型一个关键部件的变体,性能都会出现不同程度滑坡。下表展示了几组代表性消融的结果。

表3:DFAP-UGC变体在测试集上的消融结果。每个变体从完整模型中移除或削弱一个组件。其中' w/o TAL'用密集焦点监督替换任务对齐分配;'Problem-only fusion'移除参考与差异特征;'w/o regional HN'关闭区域分支的困难负样本挖掘;'w/o box-aware quality'在质量头输入中移除预测框特征

从表3能看出几个很有意思的现象。把任务对齐分配换成朴素焦点监督后指标明显变差,说明先让分类与定位对齐的关键作用。最引人注目的是"Problem-only fusion"这一组——只看增强图像不看参考图像,性能出现大幅下降。这给出了强有力的证据:在处理增强引入的局部变化时,显式成对比较是核心引擎,缺少参考侧的"原貌记忆",模型就只能瞎猜哪些变化是新引入的缺陷。

为了直观展示模型的实际输出质量,论文也给出了可视化案例。从定性结果看,DFAP-UGC预测的框与人工标注的重合度整体较高,特别是对密集排列的文字和纹理纹理区域能做到逐个覆盖,而Faster R-CNN、YOLOv1、YOLOv12n等基线的结果则出现了程度不一的漏检或误检:

图4:UEAP-4k上的定性推理样例。每个样例从左到右依次为:参考图像、增强图像上的人工标注真值、DFAP-UGC预测结果、Faster R-CNN预测结果、YOLOv1预测结果、YOLOv12n预测结果

综合来看,DFAP-UGC在UGC增强异常感知这一新任务上作为第一个专门设计的框架,为后续研究提供了扎实的基线和数据集支撑。

R-C.jpeg

此位置的表情包贴合"审慎乐观"的情绪:数据集和框架都做得实在,但也只是这个方向迈出的第一步,后续仍有大量优化空间

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?短视频增强算法常在脸部、文字、纹理上“翻车”。北大和字节跳动构建首个UGC增强异常感知基准UEAP-4k,并提出差异融合框架DFAP-UGC,可同时输出异常位置、类型与严重度,AP50较基线提升5.7个点。
这篇工作最值得看的点是什么?DFAP-UGC在AP50(0.4328)、mAP(0.2038)和R50(0.8106)上均优于所有对比方法,相比最强Faster R-CNN基线AP50提升5.70个百分点,mAP提升3.18个百分点;严重度MAE与最优基线相当。
这篇工作的边界或风险在哪里?优点:(1) 首次定义UEAP任务并构建真实场景基准数据集UEAP-4k;(2) 显式差异融合设计有效利用非理想参考图像信息;(3) LADTP训练策略创新性地根据定位质量动态调整任务权重。缺点:(1) 方法复杂度较高,多分支设计增加推理开销;(2) 严重度分数预测精度有限(MAE约0.32);(3) 类别间性能不均衡,人像异常占比过高可能引入偏置。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出DFAP-UGC框架,通过显式融合增强前后图像的差异特征,结合密集空间查询、区域验证和质量感知排序,实现UGC增强图像中细粒度局部异常的定位、分类和分级。

实验合理度:★★★★☆

AP50、mAP(IoU 0.50:0.05:0.95)、Recall(R50)、严重度分数MAE。

学术研究价值:★★★★☆

提出DFAP-UGC框架,通过显式融合增强前后图像的差异特征,结合密集空间查询、区域验证和质量感知排序,实现UGC增强图像中细粒度局部异常的定位、分类和分级;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

未明确给出具体FLOPs,训练50个epoch,batch size为8,使用AdamW优化器,学习率5×10⁻⁵(backbone为5×10⁻⁶)。

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 方法复杂度较高,多分支设计增加推理开销;(2) 严重度分数预测精度有限(MAE约0.32);(3) 类别间性能不均衡,人像异常占比过高可能引入偏置。

主要参考文献

Zhong Y, Chen G, Ma Q, et al. Fine-Grained Anomaly Perception in Wild UGC-Enhanced Images: A Comprehensive Dataset and Difference-Fusion Framework[J]. arXiv preprint arXiv:2609.02529, 2026. Guo M, Haque A, Huang D A, et al. Dynamic task prioritization for multitask learning[C]//Proceedings of the European Conference on Computer Vision (ECCV), 2018: 270-287. Feng C, Zhong Y, Gao Y, et al. TOOD: Task-aligned one-stage object detection[C]//2021 IEEE/CVF International Conference on Computer Vision (ICCV), 2021: 3490-3499. Liu Z, Lin Y, Cao Y, et al. Swin transformer: Hierarchical vision transformer using shifted windows[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2021: 10012-10022. Rezatofighi H, Tsoi N, Gwak J, et al. Generalized intersection over union: A metric and a loss for bounding box regression[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2019: 658-666. Dosovitskiy A, Beyer L, Kolesnikov A, et al. An image is worth 16x16 words: Transformers for image recognition at scale[C]//International Conference on Learning Representations, 2021. Lin T Y, Goyal P, Girshick R, et al. Focal loss for dense object detection[C]//Proceedings of the IEEE International Conference on Computer Vision, 2017: 2980-2988.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球