密歇根大学提出PE-Mamba:双向Mamba扫描,AI假图检测冲到96.6%!
AI生成的假图肉眼越来越难辨,可检测器却还停留在“加权平均”的老路子。本文提出的PE-Mamba,把Transformer层间特征当有序序列,用双向Mamba扫描来聚合取证线索,只训练1.3%参数就把主流假图检测基准刷到新SOTA,思路清奇又实用。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
AI生成的假图肉眼越来越难辨,可检测器却还停留在“加权平均”的老路子。本文提出的PE-Mamba,把Transformer层间特征当有序序列,用双向Mamba扫描来聚合取证线索,只训练1.3%参数就把主流假图检测基准刷到新SOTA,思路清奇又实用。
Text-to-SQL最磨人的不是不跑,而是“跑得动、结果是错的”。MIRA把历史修正记忆拆成乐高式独立修复项,再用数据库证据精准激活——261次成功修复、仅18次误伤,SQL纠错玩出了手术级精度。
水下照片又绿又灰还带雾?武汉大学等机构的最新PROTEUS让你一键还原!它把“退化信息”从累赘变成向导,既用它引导特征调制,又用它控制跳跃连接复用。仅2.61M参数,U90的PSNR刷到25.50dB,LPIPS更是把第二名从0.086打到0.081,轻量又能打,值得一读。
本论文针对视觉Transformer在分布偏移下依赖背景等虚假相关性的顽疾,提出概念引导微调(CFT)。仅用1500张图、无需人工标注,让模型注意力从背景转向鸟喙、鱼鳍这类判别性语义概念,五个OOD基准一致提升。CVPR 2026 Highlight,代码已开源,可复现性强,值得细读。
视频恢复网络费尽心思聚合相邻帧信息,却可能在局部区域修出更糟的结果。福州大学这篇ANCHOR不改造网络,而是把低质当前帧当作"锚点",用物理痕迹推断每一处该信网络还是该信原图,纯后处理就能让多种SOTA模型继续涨分。这种"事后纠错"的思路把"何时该相信时间聚合"这个被忽视的问题摆上了台面,值得一读。
视频大模型对着画面侃侃而谈,却常常“睁眼说瞎话”?中科院团队提出VADER,一个纯推理期干预的训练无关框架,让LLaVA-Video-7B在EventHallusion上飙到72.60%,还顺手超越了依赖额外训练的TPO与RRPO。不微调也能这么能打,值得一读。
戴智能眼镜开电话会,周围人声嘈杂听不清?边缘小模型算力不够,云端大模型又太慢——Meta这次让云边“组队打怪”,边缘只加1.5%参数就能蹭到云端大模型的“听力”,在64毫秒延迟下硬是把语音增强的SI-SDR拉高了3.77dB。真·云边协同新范式,值得一看。
图像修复这事儿,有点像老小区改造:有的地方墙皮脱落要重刷,有的地方只脏了一小块。可现在的扩散修复模型偏爱"一刀切",全图一样的约束力度、一样的步长节奏,既不省算力还容易把好区域修出问题。江苏大学这篇ACM MM 2026论文,用局部认知不确定性给模型装了一双"会看重点的眼睛",该补的补、该跳的跳,LPIPS平均降12.78%、采样时间省8.42%,还能即插即
图2:HD-REC整体架构。(a)HDQ通过全局共享粗粒度量化和自适应路由细粒度量化构建语义ID。(b)DAS MoE结合常驻共享专家与动态选择的特化专家。
零样本图像描述三年没挪窝,这篇论文用多检查点对齐评分框架,推理阶段把CIDEr从108.0干到117.6。不重训描述器、不吃配对数据,全靠把评分器插在更多位置上——早该这么干了!
高铁上视频卡成PPT?低轨卫星物联网连不上?这篇南洋理工联合西电、UCD等机构的最新工作,用一套结构化稀疏感知的SS-EP算法,把OTFS免授权随机接入的联合活跃用户检测与信道估计性能,直接推到了逼近理想上限的水平,而且人家还保留了可承受的复杂度。搞6G高移动接入的,这篇值得认真读一下。
多元时间序列预测最被忽视的角落,其实是未来变量之间"一起涨跌"的结构关系。这篇来自悉尼科技大学、清华和港科大广州的工作提出CvLoss,一个即插即用的损失正则项,不改模型结构就能在114组受控对比中拿下111胜,推理还零开销。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球