一张图看懂仓库级RAG去噪:北航MRCoder,加速52%准确率提升
仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R
LLM一发布就被倒卖、二次分发,权属怎么证明?华东师大这篇2026年的工作想了个妙招:把“指纹”藏进模型参数里,而且不是用容易被识破的乱码,也不是用会误触的普通英文,而是用低资源语言组成的“代码混合”语言。更厉害的是,指纹的“构建”和“注入”不再割裂,构建时选的语言直接指导注入时往哪里写。最终结果很硬核:平均困惑度只有96(远低于乱码的1302),注入成功率
历史文档修复一直是NLP领域的硬骨头,尤其是那些需要外部知识才能确定的古代人名、地名。这篇来自韩国江原大学的工作,巧妙地将RAG与大模型微调结合,不仅让命名实体恢复准确率从个位数跃升至38%,还通过了人类专家的实操检验。对于想做RAG落地或古籍数字化的朋友,值得一读。
历史文档像一本被水泡过的《永乐大典》,人名地名糊成一片,传统MLM模型只能干瞪眼。韩国国立江原大学的团队祭出大招——ARI让大语言模型学会“翻书查资料”,用RAG精准找回那些被岁月抹去的名字。在朝鲜王朝实录的修复中,ARI-32B(Qwen3 32B微调版)在命名实体恢复上直接把GPT-5.1按在地上摩擦,效果翻倍。这不仅是个技术活,更像是在帮AI配一副“历
临床大模型最麻烦的事,不是选错答案,而是“答案对了,理由却乱了套”。MIRA-Ev 直接把评测拆成三层,专门盯住证据、成分和关系,连巴斯克语也拉进来了,属于那种一看就知道不是来凑数的基准。
德语小模型最烦的不是训练,而是“先把文本弄成能喂给模型的样子”。这篇工作直接把席勒戏剧做成单文件、可分词、可微调、可一键加载的语料,主打一个零摩擦。
大模型会不会“懂价值观”,先别急着谈对齐,先得看它能不能把价值标签认准。本文把这个前置问题拆成精确识别、排名恢复和定向混淆三层,结果很扎实,也很适合拿来给评测补课。
法律检索里最容易被忽略的坑,不是模型不会找案子,而是评测时偷偷用了“未来才出现的引文”。这篇论文直接把时间篱笆立起来,再把增益拆成三份,谁在虚胖、谁是真材实料,一眼就能看出来。
LLM 幻觉检测最烦的地方,不是“看不出来”,而是“参考样本”和“查询样本”天生不对称。ASK-NN 直接顺着这个现实来做,把近邻检验改成非对称版本,理论和工程都更像样。
这篇论文最有意思的地方,不是又造了一个“拟人化”词典,而是把AI伴侣的社交媒体讨论拆成了能落地分析的十类表达。Reddit和小红书的差异也很直接:一个更像叙事复盘,一个更像情绪直播,文化和平台习惯真的会把“AI像不像人”这件事带偏。
这篇论文不玩虚的,直接拿 DeepSeek-R1 教 Qwen2.5-7B 做数学题,结果不是“玄学提升”,而是能稳定涨分,还顺手把“推理长度一缩水,准确率就掉”这件事讲明白了。对想做小模型蒸馏、数学推理和本地部署的人,都挺有参考价值。
这篇论文不是单纯“把翻译模型做出来”,而是直接拆开看它到底哪里会翻车。短句、无生词时表现还行,一旦句子变长,神经机器翻译的短板就暴露得很诚实;而 grConv 还顺手展示了自己学语法结构的能力,挺有意思。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球