首次把DPO用到视频配音,CLIP分数冲到13.65
视频配音总是慢半拍?清华联手上海AI Lab把RLHF里的偏好优化搬进了视频配音任务,音画同步和听感双双拉满,还顺手解决了重建损失"听着对、感觉不对"的老毛病。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
视频配音总是慢半拍?清华联手上海AI Lab把RLHF里的偏好优化搬进了视频配音任务,音画同步和听感双双拉满,还顺手解决了重建损失"听着对、感觉不对"的老毛病。
KAN架构虽然把可学习的函数搬到了每条边上,但训练时却只盯着聚合后的节点输出,边函数本身一直缺一个直接的优化目标。哈工大与港大这篇FS-JEPA,直接把自监督预测学习搬进了KAN聚合前的函数空间,用多半径签名当预测目标,把最强KAN方法平均Dice拉高2.25个百分点,思路清奇又扎实。
VGGT、DA3这类3D视觉基础模型,前向一次就能出位姿、深度和点云,但训练时没做显式多视角几何约束,结果经常“自相矛盾”。本方法把特征匹配得到的2D像素对应点当作伪真值,在测试时给模型补上显式几何约束,单场景最快2分钟完成自适应,6个模型、4个数据集位姿与几何估计全部一致提升,主打一个即插即用。
想象你在家里开着VR远程会议,头顶一圈RGB-D相机从六个角度同时拍摄。你以为自己只是坐着聊天,实际上,你手边的手机、墙上的照片、桌上的文件,甚至镜子里一闪而过的倒影,都正被多台相机同步捕捉,并实时融合成一个可自由旋转视。
RAG系统的知识库就像一面可以随时被外人涂改的墙——只要往里面塞几篇精心构造的文档,AI助手就可能一本正经地输出攻击者想要的错误答案。南京信息工程大学与美团提出RAGSieve,不给模型加补丁、不依赖干净语料库,而是用“自己身边的检索结果”当参照物,把攻击成功率从67.4%压到14.0%。
强子世界也玩“套娃”?LHCb发现的Tcc(3875)本身已经被认为是D-D*强子分子,巴西团队这回来了一手“分子上再叠积木”:把一颗π介子扔向Tcc,用相干固定中心近似算了一通,预言在4055 MeV附近出现近阈值类共振增强。思路清奇,结果还会更清晰。
放疗中反复CT辐射剂量高,低剂量CBCT图像质量又不够用?这篇ECR 2026论文用条件扩散模型做CBCT到CT合成,还专门较真了“输入图像怎么表示”这件事——结果发现,看似更粗糙的FDK重建反而能让扩散模型发挥更大潜力,PSNR相对提升超过20dB,思路很值得借鉴。
多模态目标检测要落地,先把“双分支胖模型”瘦下来。InterPruner首次把结构化剪枝搬到RGB-红外检测上:剪掉一半通道,FLIR精度反而涨0.6%,70%剪枝率下依然稳得住。轻量化的正确姿势,这篇给了一个参考答案。
夜深人静,研究员对着硬盘里几十TB的野外小鼠录音发愁:录音里除了小鼠50kHz以上的超声“对唱”,还有空调、风扇、鼠笼碰撞、脚步等各色噪声,信号早被压到墙角。
水下照片总是蓝绿蒙蒙一片?印度理工学院这次把海洋光学的"家底"全搬进了合成数据——十种Jerlov水体、深度依赖辐照度、生物荧光一次建模到位。合成数据FID比最强竞品直降46%,四个增强架构跨六个真实数据集全面反超。搞水下视觉的朋友,这份物理知识+数据工程的双拼值得仔细品品。
这几年文生图模型卷得飞起,从扩散模型到自回归模型,画质越来越惊艳,英语提示词玩得风生水起。无论是谷歌的Nano Banana,还是阿里的Qwen-Image,你用英语输入"一只在沙滩上戴墨镜的柯基",出图效果基本都能当壁。
当只有两张随手拍的模糊照片、还没有相机位姿时,3D重建还能做吗?本论文不仅做了,还用级联的2D→3D引导把Deblur-NeRF真实场景PSNR提升了1.19dB、合成场景提升了2.11dB。这种极简输入设定对XR、手持设备3D内容生成非常有吸引力。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球