东南大学GraphLoom:只训160万参数,多模态RAG三大基准全面效果亮眼
多模态RAG最让人头疼的不是"找不到证据",而是"证据太多太吵"。东南大学这篇GraphLoom把Llama-3.1-8B冻住,只训练160万参数,用可靠性校准的证据路由在三大多模态问答基准上全面超强基线,还把幻觉率压到10.5%。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
多模态RAG最让人头疼的不是"找不到证据",而是"证据太多太吵"。东南大学这篇GraphLoom把Llama-3.1-8B冻住,只训练160万参数,用可靠性校准的证据路由在三大多模态问答基准上全面超强基线,还把幻觉率压到10.5%。
还在为AI视频生成几秒就崩、动作循环重复而头疼?UCLA携手字节跳动Seed团队祭出LoL大招,让视频生成一口气跑12小时不带喘的,关键还不用重新训练模型!
这是一篇纯数学论文,没有代码、没有数据集、没有实验曲线,却把“可微逼近保持像”这个硬核几何问题从紧致情形一路推到了局部紧致情形。对于研究几何、拓扑和可微映射的读者来说,这个结果的分量不亚于顶会SOTA。想理解数学中“光滑化”到底有多讲究,这篇值得静下心来读。
协同驾驶最怕的不是"看不见",而是"看见了却说不清谁看到的"。G-MARK用知识图谱把车辆间的观测证据变成显式可追溯的推理对象,遮挡推理提升42.2%、通信成本压缩25.6倍,是轻量级可落地的协同推理新范式。做自动驾驶、车路协同的朋友值得一读。
GNSS接收机的跟踪环路,一直是导航接收机设计中“牵一发动全身”的地方。这篇来自萨马拉大学的论文,没有堆砌高深理论,而是老老实实把积分间隔、相关器间距和滤波器参数这三个工程变量的实测结果摆出来,还附带了FPGA实现的经验教训。想搞懂GPS接收机怎么调优的同学,这篇值得花十分钟细读。
做光场显微的都知道,帧率和空间信息常常“按下葫芦浮起瓢”。这篇来自UCLA的工作,用Fisher信息把SLIM和FLFM在相同探测器带宽下的账算得明明白白:SLIM用更少的行读出,换来了更高的三维信息效率。做计算成像、显微系统设计或者想优化相机读出架构的朋友,值得一读。
24小时动态心电(Holter)是诊断心律失常的金标准,但多模态大模型在超长时序信号面前几乎“失灵”。浙大等团队开源Holtercare-Bench基准与Holtercare-23K数据集,用信号-视频-文本三模态对齐,让GPT-5、Qwen3-VL等模型首次系统性接受“心电马拉松”考验——微调后时序定位准确率飙到99.7%,差距比想象中更大。
这篇论文把扩散模型里最"玄学"的分数网络,用小波基展开成了完全可解析的形式——不用梯度训练,闭式岭回归直接算出最优去噪器。更妙的是,三种相关性结构把"数据里哪些统计量最重要"变成了可量化的诊断工具。理解扩散模型内部机制,这篇值得一读。
当机器人灵巧手在仿真里“摸”东西时,最大的谎言就是:接触跟真实世界差不多。这篇来自UC San Diego与Amazon FAR的新作,请来了Pieter Abbeel坐镇,把触觉接触信息直接变成神经动力学的条件信号,用大规模仿真预训练+少量真实数据微调,把灵巧操作里最难搞的“接触不连续”问题治得服服帖帖。MSE最低压到0.0058,任务成功率从52.6%飙
康奈尔大学CVPR 2026新作,用电影解说视频自动构建8231个问答对,提出无参考评估新范式。结果发现GPT-4o、Claude 3.5等顶级模型看电影,视觉几乎帮不上忙,纯靠字幕反而分更高,值得所有做多模态的人细品。
论文由Sichen Pan和Simon Scheuring完成(通讯作者为Simon Scheuring),发表在Nature Communications上,提出了名为SPIDER(Scanning Probe Mic。
4K分辨率下改图,既要改得准、还要改得快、更要纹理细节不丢失,这可能吗?阿里千问与上海交大给出的答案是:61秒,一个细节都不少。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球