一张图看懂仓库级RAG去噪:北航MRCoder,加速52%准确率提升
仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R
继2025年6月推过智能体基准评测之后,龙哥又盯上了智能体自演化的“可靠性”痛点。东南大学这篇DREvo,把历史经验当作“过期货”来查保质期,还能自动提炼出下一步修改方向,五个基准全超之前方法,平均提升16.2%,自我进化终于不再原地打转!
中国乡村道路的自动驾驶一直是个“数据荒漠”。这篇论文不光造了个包含14类乡村特有害物的数据集,还系统测了13个检测器,用实验打脸“合成数据越多越好”的朴素直觉——最佳比例是1:0.5!对于想低成本落地乡村自动驾驶的团队,这份报告就是现成的“避坑指南”。
极端场景下车牌只有12像素宽,笔画宽度2-3像素,常规OCR盲猜等于送分给负分。这篇ICIP 2026挑战赛高分方案证明了:把超分做到位(HAT 4倍提升),再搭配两个架构差异够大的识别器做集成,最后根据计分规则(+2/-1/0)设定弃权阈值,即使没有外部数据和私有模型,照样拿到9.73 wECR。核心思路很简单:先让字看得清,再让模型认得出,认不出的时候就
视频实例分割通常需要昂贵的视频标注和复杂的时序建模,但QueenVIS仅用单帧图像训练就拿到了接近SOTA的结果。它通过两个轻量辅助头把外观和空间先验注入Transformer查询,推理时零参数开销,在长视频上提升10.3 AP,简直是为标注稀缺场景量身打造。方法干净、实用,值得工程团队关注。
两个看似不同的排列模式避让家族,居然通过反转互补操作建立起完美双射,而且还和斐波那契数列有染。本文用Lehmer码这把钥匙,给321-avoiding和321-avoiding排列的偏序结构来了个“底朝天”,几何上的“翻转与下落”解释更是让人拍大腿。组合数学爱好者不容错过。
视频实例分割的“天价标注”让人头疼,QueenVIS却告诉你:只用单帧图像训练,效果堪比视频监督!它通过两个超级简单的辅助头(特征预测+中心预测)把外观和空间先验注入查询向量,推理时零开销、零参数增加。在YouTube-VIS长视频上直接飙了10.3 AP,比很多视频监督模型还稳。代码已开源,值得一试!
非光滑初值(间断、无导数)是SPDE数值分析的头号难题。传统理论认为初值多光滑收敛阶就有多高。但IIT Goa这篇2026年的工作,通过巧妙解耦噪声与初值正则性,证明即便初值只有L²正则,也能达到由噪声决定的β阶最优收敛。数学干净利落,数值实验完美吻合。对计算数学和随机PDE数值解感兴趣的朋友,这篇值得细品。
RoPE、2D-RoPE这些位置编码从哪来?这篇论文用一个“构成操作”统一了它们,还理论证明了路径无关的充要条件。基于此设计的JoFormer在值侧也做旋转,ImageNet提了0.4%,长度外推比降到1.02×——对于想理解位置编码本质的读者,这篇是不可错过的代数教科书。
序列推荐通常只用one-hot标签训练,浪费了用户序列中大量的“未来”信息。本文核心想法极其简洁:让同一个Transformer模型同时担任教师和学生——教师看未来,学生只看过去,通过门控蒸馏只传递“可达”的知识。不需要额外参数、不需要预训练教师、不改推理过程,在SASRec、BERT4Rec、UniSRec三大骨干上平均提升19.8%,远超现有蒸馏策略。强
偏微分方程数值解遇上非光滑初值,收敛阶总是掉下来?IIT Goa团队用一个巧妙技巧解耦初值与噪声的正则性,把最优阶给“夺”回来了!不光有理论证明,数值实验也漂亮地验证了这一点。想看看数学大佬是怎么打好“时间权重”这张牌的?往下翻!
当你在暗光下按下快门,CMOS传感器捕获的RAW数据里,既有光子打上去的散粒噪声,又有电路本身的读取噪声,混合在一起,让那些在实验室里表现神勇的“高斯去噪器”瞬间歇菜。这篇论文不打新网络架构,而是从噪声建模的老祖宗——方差稳定化出发,用一招“甩锅”重尾残差的稳健拟合,愣是把GAT+预训练模型这条老路走通了,而且走得很稳。对于想省掉重新训练模型成本、直接用现有
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球