视频生成告别翻车?PhysRAG先检索再注入
这篇 PhysRAG 很像给视频生成模型补了一本“物理常识小抄”:先把高质量物理视频筛出来,再把相关参考视频检索出来喂给模型。结果不光物理更靠谱,视觉质量也没掉链子,挺适合想看“RAG 怎么跨到视频生成里”的读者。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
这篇 PhysRAG 很像给视频生成模型补了一本“物理常识小抄”:先把高质量物理视频筛出来,再把相关参考视频检索出来喂给模型。结果不光物理更靠谱,视觉质量也没掉链子,挺适合想看“RAG 怎么跨到视频生成里”的读者。
这篇论文很实用,专治“摘要模型表面正常、背后作妖”。白盒能顺藤摸瓜找出毒样本,黑盒还能只靠模型行为做审计,最后连被污染的摘要习惯都能拉回来,属于防御论文里少见的“检测+修复”双保险。
这篇工作把 3C 279 在 2017 年 EHT 观测窗口里的“全身检查”做得很完整:从射电、光学到伽马射线,喷流一边变亮一边“闹脾气”。看完会发现,喷流高能辐射到底从哪儿来,真不是一句“激波来了”就能糊弄过去的。
TIGER专治人脸视频修复里的三大顽疾:身份偏移、视角纠缠和“修得像但不像本人”。它把身份、几何和生成先验一起拉上场,还顺手做了一个大规模数据集,属于能打又能落地的那种。
这篇论文把“RL到底把工具调用能力藏在哪儿”这件事,直接追到跨编码器里的单个特征上了。更有意思的是,它不仅能定位,还能在推理时把能力拧出来,甚至让基础模型也跟着“蹭到一点”。
这篇论文挺有意思,核心不是让AI帮人飞得更稳,而是让AI知道什么时候该帮、什么时候该收手。宾大这套L2C把“教练”这事做成了强化学习问题,FPV无人机实验也给出了挺硬的结果。
语义搜索最怕什么?不是搜不准,而是搜得准了也把隐私一起送走。这篇论文不装“万能防弹衣”,而是老老实实把文档侧、查询侧、访问模式三件事拆开,给出一个能跑、能测、还能说清边界的混合方案。
这篇论文最有意思的地方,不是“又训练了一个SAE”,而是把Qwen3的内部表示拆成了能看、能评、还能直接干预的特征字典。更妙的是,它不只讲“重构得像不像”,还真的拿拒答行为做了因果干预,实用味很足。
这篇 SpikeTimer 挺有意思,专门给脉冲神经网络做“时间锁”。授权输入正常跑,非授权输入直接被压到随机猜水平,还能扛住微调、剪枝和逆向工程,属于把版权保护做成了“时序门禁”。
这篇论文最有意思的地方,是把原本“玄学味很重”的GAN训练,硬生生拆成了可解的高维动力学问题。类条件、相关性、非零均值这些看起来很乱的因素,最后都被压进了一个有效协方差里,理论和实验还能对上。
这篇论文把“GAN为什么会学、什么时候会崩”讲得很透:不是只看单个特征强不强,而是看它们凑在一起后的有效协方差。相关性这回不只是添乱,处理得好还能把弱信号抬进可学习区间,挺有意思。
这篇 Velox 有点意思:不靠时间对应,不靠复杂输入,只拿动态点云就想把 4D 几何和外观一起学明白。更妙的是,它不止会“记住”4D,还能拿去做视频转4D、3D追踪和布料仿真,算是把潜在表征这张牌打得挺顺。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球