LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12809 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:NLP

共 33 篇
AI · PAPER
视觉与图像

一张图看懂仓库级RAG去噪:北航MRCoder,加速52%准确率提升

仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R

告别误触和乱码,首个构建-注入联合优化指纹框架来了!
大模型与智能体

告别误触和乱码,首个构建-注入联合优化指纹框架来了!

LLM一发布就被倒卖、二次分发,权属怎么证明?华东师大这篇2026年的工作想了个妙招:把“指纹”藏进模型参数里,而且不是用容易被识破的乱码,也不是用会误触的普通英文,而是用低资源语言组成的“代码混合”语言。更厉害的是,指纹的“构建”和“注入”不再割裂,构建时选的语言直接指导注入时往哪里写。最终结果很硬核:平均困惑度只有96(远低于乱码的1302),注入成功率

RAG+LLM修复历史文档,准确率从13%冲到70%,专家都说好
视觉与图像

RAG+LLM修复历史文档,准确率从13%冲到70%,专家都说好

历史文档修复一直是NLP领域的硬骨头,尤其是那些需要外部知识才能确定的古代人名、地名。这篇来自韩国江原大学的工作,巧妙地将RAG与大模型微调结合,不仅让命名实体恢复准确率从个位数跃升至38%,还通过了人类专家的实操检验。对于想做RAG落地或古籍数字化的朋友,值得一读。

RAG修复古籍:韩国团队让GPT-5.1在命名实体恢复上惨败
视觉与图像

RAG修复古籍:韩国团队让GPT-5.1在命名实体恢复上惨败

历史文档像一本被水泡过的《永乐大典》,人名地名糊成一片,传统MLM模型只能干瞪眼。韩国国立江原大学的团队祭出大招——ARI让大语言模型学会“翻书查资料”,用RAG精准找回那些被岁月抹去的名字。在朝鲜王朝实录的修复中,ARI-32B(Qwen3 32B微调版)在命名实体恢复上直接把GPT-5.1按在地上摩擦,效果翻倍。这不仅是个技术活,更像是在帮AI配一副“历

DeepSeek教Qwen7B做题:蒸馏后准确率涨4.76%
大模型与智能体

DeepSeek教Qwen7B做题:蒸馏后准确率涨4.76%

这篇论文不玩虚的,直接拿 DeepSeek-R1 教 Qwen2.5-7B 做数学题,结果不是“玄学提升”,而是能稳定涨分,还顺手把“推理长度一缩水,准确率就掉”这件事讲明白了。对想做小模型蒸馏、数学推理和本地部署的人,都挺有参考价值。

端到端翻译早期真相:长句就掉分
大模型与智能体

端到端翻译早期真相:长句就掉分

这篇论文不是单纯“把翻译模型做出来”,而是直接拆开看它到底哪里会翻车。短句、无生词时表现还行,一旦句子变长,神经机器翻译的短板就暴露得很诚实;而 grConv 还顺手展示了自己学语法结构的能力,挺有意思。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球