LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12823 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:大语言模型

共 319 篇
AI · PAPER
大模型与智能体

1B vs 70B算什么,LLM推理力度自适应才是真省钱

LLM智能体调芯片,烧的是真实美元。这篇鲁汶大学新作给出两个反常识答案:精心雕琢的长期记忆,不如普通拼接有用;真正决定优化质量与成本比的,是推理力度该何时加码。Ares靠一个耐心计数器动态调度,等成本下PPA优化深度提升23–27%,成本仅SotA的12%——继6月聊过让智能体学会止损之后,省钱这件事从动作层面卷到了芯片设计。

AI · PAPER
大模型与智能体

测试时计算还能这么省?中山大学SVR只需一半token精度反超oracle

数学考试里有个经典场面:学霸写完就交卷,学渣越改越错。大模型推理也有这毛病——简单题算力浪费,难题越修越歪。中山大学这篇新论文,教模型“自我检查”:有把握才交卷,没底就再改一轮。结果平均2.99轮推理,精度反而超过固定10轮,还省了一大半token。这招龙哥看了直呼内行!

AI · PAPER
大模型与智能体

做网络分析别点菜单了,试试张嘴说话——1.7秒延迟的语音新范式

当大语言模型遇上VR网络分析,会擦出什么火花?UC Davis的这项研究把LLM当作“翻译官”,让用户直接用自然语言指挥图形操作——选中高GPA的学生,给妹子节点涂红色,把欺凌关系边高亮…全部动动嘴就行。技术评估显示整套管线延迟仅1.73秒,10位用户亲测后纷纷表示:比打字省心多了!对于想探索沉浸式分析新范式的同学,这篇设计研究绝对值得一读。

AI · PAPER
大模型与智能体

香港中文大学TREK:不用LLM裁判的硬核基准,15个模型全军覆没

继2026年6月聊过EvoMAS和MemInsight之后,又发现一个评估LLM智能体旅行规划能力的硬核基准TREK。它完全不用LLM作为裁判,直接检查每个航班、酒店是否真实存在,时间是否可行,预算是否超支,甚至能检测出用户没明说的隐性需求!结果连最先进的GPT-5.6也才46.2%通过,真是让人大跌眼镜。建议所有做LLM agent的团队都来跑一跑这个基准

AI · PAPER
大模型与智能体

5.5倍吞吐量提升!SK海力士用PNM破解LLM混合长度服务难题

当LLM服务的上下文长度从几百到百万不等时,GPU内存成了最大的短板。SK海力士与KAIST联手拿出硬核方案——NELSSA,把长上下文请求“请”到CXL互联的PNM(近内存处理)芯片上执行,GPU只管短请求和FFN。实测解码吞吐量飙涨5.5倍,P99延迟骤降15倍,而且是在真实硬件上跑出来的!这可能是下一代LLM基础设施的关键拼图。

AI · PAPER
大模型与智能体

告别显存墙!DualDecoder用预测预取颠覆LLM推理

长上下文LLM推理中,KV缓存的内存占用一直是瓶颈,现有稀疏KV方法引入的GPU辅助状态反而成了新“内存墙”。这篇来自复旦大学与蚂蚁集团的论文找到了一个很巧妙的突破口:相邻解码步骤的KV索引具有强可预测性,从而可以用预测性预取彻底替换掉GPU驻留的辅助状态。方法设计的双token解码流水线、层感知传输调度和乒乓缓冲区都很实在,在128K上下文下吞吐量提升最高

AI · PAPER
视觉与图像

一张图看懂仓库级RAG去噪:北航MRCoder,加速52%准确率提升

仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R

AI · PAPER
大模型与智能体

东南大学提出DREvo:5个基准测试全面领先,平均提升16.2%

继2025年6月推过智能体基准评测之后,龙哥又盯上了智能体自演化的“可靠性”痛点。东南大学这篇DREvo,把历史经验当作“过期货”来查保质期,还能自动提炼出下一步修改方向,五个基准全超之前方法,平均提升16.2%,自我进化终于不再原地打转!

AI · PAPER
视觉与图像

CMU惊人发现:不给图也能编诊断,GPT-5.4/Claude 4.7/Gemini 3.1集体翻车

想不想知道,给顶级VLM一个患者描述但完全不给图像,它们会怎么做?这篇CMU的研究发现,模型不仅不会拒绝回答,还会根据种族、年龄、性别编出不同的诊断,甚至存在“表面说看不到图、背地填上病名”的阴阳模式。对医疗AI的可信度当头一棒,值得所有临床AI从业者细读。

浙大IMFuse:打破LLM推荐只用最后一层惯例!平均提升6.72%,参数几乎不增加
大模型与智能体

浙大IMFuse:打破LLM推荐只用最后一层惯例!平均提升6.72%,参数几乎不增加

继2025年末佐治亚理工的降噪思路后,浙大团队发现一个更根本的问题:在做LLM增强推荐时,直接取最后一层语义并不合理——中间层保留了互补的细粒度信息,不同物品对层深的偏好也不同。为此他们提出IMFuse,一个即插即用的多层语义聚合模块,仅增加0.03M参数就让推荐性能平均提升6.72%。门槛低、收益高,值得关注。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球