EviReform:多跳问答检索新范式!边查边问补全证据链,Recall@5飙升5.59
多跳问答里有个坑:第一轮检索到的证据,往往已经暴露了原问题没写明的“桥接信息”,可后续检索却还死死盯着原问题不放。EviReform的做法很直接——看完证据,反手改查询:把没查到的部分写成残差查询,再和原问题一起喂给图检索。结果:三个多跳数据集上,Recall@5最高涨了5.59个点。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
多跳问答里有个坑:第一轮检索到的证据,往往已经暴露了原问题没写明的“桥接信息”,可后续检索却还死死盯着原问题不放。EviReform的做法很直接——看完证据,反手改查询:把没查到的部分写成残差查询,再和原问题一起喂给图检索。结果:三个多跳数据集上,Recall@5最高涨了5.59个点。
做AI的都知道,图像分类这活儿,看着简单,做起来全是坑。尤其是当你把模型从实验室搬到现实世界,面对的不是单一数据集的“温室环境”,而是医疗影像、卫星图、人脸表情、日常物体照片混在一起的“修罗场”。
图像配准要做到亚像素精度,传统傅里叶-梅林方法经常"差口气"。这篇论文把辅助函数方法无缝融入傅里叶-梅林框架,缩放、旋转、平移误差全面下降,还不靠深度学习,适合资源受限的落地场景。
序列推荐(Sequential Recommendation,SR)的任务是根据用户过去买过、看过、点过的一串东西,猜用户下一个最可能想要什么。
CT基础模型很强,但诊断这事,光给个"恶性概率57%"谁敢签字?亚利桑那大学把两个CT基础模型蒸馏成8个放射科概念+结节尺寸的可编辑预测器:内部AUROC 0.86、外部0.73,关键是预测能逐项拆解还能手动干预——AI终于肯"说人话"了。
视频配音总是慢半拍?清华联手上海AI Lab把RLHF里的偏好优化搬进了视频配音任务,音画同步和听感双双拉满,还顺手解决了重建损失"听着对、感觉不对"的老毛病。
KAN架构虽然把可学习的函数搬到了每条边上,但训练时却只盯着聚合后的节点输出,边函数本身一直缺一个直接的优化目标。哈工大与港大这篇FS-JEPA,直接把自监督预测学习搬进了KAN聚合前的函数空间,用多半径签名当预测目标,把最强KAN方法平均Dice拉高2.25个百分点,思路清奇又扎实。
VGGT、DA3这类3D视觉基础模型,前向一次就能出位姿、深度和点云,但训练时没做显式多视角几何约束,结果经常“自相矛盾”。本方法把特征匹配得到的2D像素对应点当作伪真值,在测试时给模型补上显式几何约束,单场景最快2分钟完成自适应,6个模型、4个数据集位姿与几何估计全部一致提升,主打一个即插即用。
想象你在家里开着VR远程会议,头顶一圈RGB-D相机从六个角度同时拍摄。你以为自己只是坐着聊天,实际上,你手边的手机、墙上的照片、桌上的文件,甚至镜子里一闪而过的倒影,都正被多台相机同步捕捉,并实时融合成一个可自由旋转视。
你有没有被电商AI导购气得牙痒痒过?明明说了“今天就要”,它偏给你推明天才发货的。京东和人大这篇新研究,就是让购物Agent学会从真实用户的吐槽和购买行为中自己进化,不用人工标注,推荐效果直接起飞。
RAG系统的知识库就像一面可以随时被外人涂改的墙——只要往里面塞几篇精心构造的文档,AI助手就可能一本正经地输出攻击者想要的错误答案。南京信息工程大学与美团提出RAGSieve,不给模型加补丁、不依赖干净语料库,而是用“自己身边的检索结果”当参照物,把攻击成功率从67.4%压到14.0%。
强子世界也玩“套娃”?LHCb发现的Tcc(3875)本身已经被认为是D-D*强子分子,巴西团队这回来了一手“分子上再叠积木”:把一颗π介子扔向Tcc,用相干固定中心近似算了一通,预言在4055 MeV附近出现近阈值类共振增强。思路清奇,结果还会更清晰。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球