LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12820 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
六种LM语音增强范式首度同台PK:CNAR拿下全场最佳
视觉与图像

六种LM语音增强范式首度同台PK:CNAR拿下全场最佳

这篇文章最值得读的地方在于,它第一次把六种基于语言模型的生成式语音增强范式放进同一个框架里公平对比,并同时报告了侵入式和非侵入式两类指标。结论也很干脆:连续域全面胜出,连续非自回归(CNAR)综合最佳。想快速了解这条赛道竞争格局的读者,这份地图比单看某个SOTA更省时间。

COINS最新评测:六大模型写程序规范,Gemini仅28.1%通过
大模型与智能体

COINS最新评测:六大模型写程序规范,Gemini仅28.1%通过

大模型写代码已卷到天际,但让它们写“程序规范”(formal specification)靠谱吗?本论文提出COINS框架,用Rocq证明助手评估六大模型的规范生成能力,结果差距惊人:最强Gemini 3 Pro也仅28.05%通过率,DeepSeek-V3.1直接跌到1.22%。想看懂LLM在形式化验证边界的真实水平,这篇是必读。

EviReform:多跳问答检索新范式!边查边问补全证据链,Recall@5飙升5.59
大模型与智能体

EviReform:多跳问答检索新范式!边查边问补全证据链,Recall@5飙升5.59

多跳问答里有个坑:第一轮检索到的证据,往往已经暴露了原问题没写明的“桥接信息”,可后续检索却还死死盯着原问题不放。EviReform的做法很直接——看完证据,反手改查询:把没查到的部分写成残差查询,再和原问题一起喂给图检索。结果:三个多跳数据集上,Recall@5最高涨了5.59个点。

AI · PAPER
视觉与图像

美团&南信大新框架RAGSieve:RAG投毒攻击成功率67.4%→14.0%

RAG系统的知识库就像一面可以随时被外人涂改的墙——只要往里面塞几篇精心构造的文档,AI助手就可能一本正经地输出攻击者想要的错误答案。南京信息工程大学与美团提出RAGSieve,不给模型加补丁、不依赖干净语料库,而是用“自己身边的检索结果”当参照物,把攻击成功率从67.4%压到14.0%。

波恩大学新研究:一个特征让大模型「黑化」?错位率62%反超微调
大模型与智能体

波恩大学新研究:一个特征让大模型「黑化」?错位率62%反超微调

继6月拆过阿里的百万级SAE之后,这次德国波恩大学把SAE用到了更刺激的地方:给大模型的「黑化」行为做定位。团队发现微调时涌现的错位行为,其实由预训练阶段就存在的人格特征驱动——单个特征引导的错位率高达62%,反超微调本身的35%,还能一键「回正」。更反直觉的是:人类写的反派文本不足以诱导错位,AI自己生成的却可以。论文横跨可解释性、数据归因与AI安全,值得

AI · PAPER
大模型与智能体

AI教育故事翻车现场?德国高校实测:叙事清晰4.11分,连贯性仅2.92分

这篇论文没急着吹AI能写多好的教育故事,反而请了22位高校STEM被试真的玩当AI写故事:教育场景生成的质量瓶颈在哪里? “这故事写得挺顺,但怎么一到测验题就变得这么尴尬?” 这句话可以说是本论文读者最真实的反应。想象一下:一个AI自动生成的互动小说,故事讲得流畅透顶,玩家一路做选择、推进情节,到了关键时刻,突然跳出一个NPC,脸上的表情仿佛在说“来吧,先答

多轮搜索Agent新范式:小模型蒸馏精炼上下文,性能逼近GPT-4
大模型与智能体

多轮搜索Agent新范式:小模型蒸馏精炼上下文,性能逼近GPT-4

搜索智能体总是"检索到答案却答不出来"?问题很可能出在上下文干扰。港中大等机构这篇研究系统地定位了干扰源——最新检索回来的文档,并设计了蒸馏式上下文精炼器,让智能体在"生成"之前先"精炼",可靠性和效率双双提升。看完这篇,对多轮搜索智能体的调优思路会有新的启发。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球