1B vs 70B算什么,LLM推理力度自适应才是真省钱
LLM智能体调芯片,烧的是真实美元。这篇鲁汶大学新作给出两个反常识答案:精心雕琢的长期记忆,不如普通拼接有用;真正决定优化质量与成本比的,是推理力度该何时加码。Ares靠一个耐心计数器动态调度,等成本下PPA优化深度提升23–27%,成本仅SotA的12%——继6月聊过让智能体学会止损之后,省钱这件事从动作层面卷到了芯片设计。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
LLM智能体调芯片,烧的是真实美元。这篇鲁汶大学新作给出两个反常识答案:精心雕琢的长期记忆,不如普通拼接有用;真正决定优化质量与成本比的,是推理力度该何时加码。Ares靠一个耐心计数器动态调度,等成本下PPA优化深度提升23–27%,成本仅SotA的12%——继6月聊过让智能体学会止损之后,省钱这件事从动作层面卷到了芯片设计。
跨教师蒸馏这个大坑,英伟达来填了!Lightning OPD 2.0用交叉拟合把“风格噪音”从token级信号里剥离,让换更强的教师也有稳定收益,数学推理AIME 2024直接冲到82.4%。
数学考试里有个经典场面:学霸写完就交卷,学渣越改越错。大模型推理也有这毛病——简单题算力浪费,难题越修越歪。中山大学这篇新论文,教模型“自我检查”:有把握才交卷,没底就再改一轮。结果平均2.99轮推理,精度反而超过固定10轮,还省了一大半token。这招龙哥看了直呼内行!
当大语言模型遇上VR网络分析,会擦出什么火花?UC Davis的这项研究把LLM当作“翻译官”,让用户直接用自然语言指挥图形操作——选中高GPA的学生,给妹子节点涂红色,把欺凌关系边高亮…全部动动嘴就行。技术评估显示整套管线延迟仅1.73秒,10位用户亲测后纷纷表示:比打字省心多了!对于想探索沉浸式分析新范式的同学,这篇设计研究绝对值得一读。
继2026年6月聊过EvoMAS和MemInsight之后,又发现一个评估LLM智能体旅行规划能力的硬核基准TREK。它完全不用LLM作为裁判,直接检查每个航班、酒店是否真实存在,时间是否可行,预算是否超支,甚至能检测出用户没明说的隐性需求!结果连最先进的GPT-5.6也才46.2%通过,真是让人大跌眼镜。建议所有做LLM agent的团队都来跑一跑这个基准
当LLM服务的上下文长度从几百到百万不等时,GPU内存成了最大的短板。SK海力士与KAIST联手拿出硬核方案——NELSSA,把长上下文请求“请”到CXL互联的PNM(近内存处理)芯片上执行,GPU只管短请求和FFN。实测解码吞吐量飙涨5.5倍,P99延迟骤降15倍,而且是在真实硬件上跑出来的!这可能是下一代LLM基础设施的关键拼图。
长上下文LLM推理中,KV缓存的内存占用一直是瓶颈,现有稀疏KV方法引入的GPU辅助状态反而成了新“内存墙”。这篇来自复旦大学与蚂蚁集团的论文找到了一个很巧妙的突破口:相邻解码步骤的KV索引具有强可预测性,从而可以用预测性预取彻底替换掉GPU驻留的辅助状态。方法设计的双token解码流水线、层感知传输调度和乒乓缓冲区都很实在,在128K上下文下吞吐量提升最高
当“肺不张”被误判为“正常”,多亏了SCALPEL的否定感知机制,把医疗跨模态对齐从“字面匹配”拉回“临床逻辑”,背后是PMC-LLaMA+ANAO的双重保障,实测召回率涨2%,值得临床AI从业者关注。
仓库级代码生成中,RAG常常引入噪声上下文,导致模型“看花眼”——生成质量下降,推理时间飙升。北航团队提出的MRCoder,像个聪明的图书管理员,用Map-Reduce范式先让轻量草稿模型快速试读,再根据API调用和逻辑相似性精准筛选有效上下文,最后用并行验证把速度提上去。实验结果漂亮:Pass@1最高提升52%,推理时间减少一半。这篇值得所有搞代码生成、R
继2025年6月推过智能体基准评测之后,龙哥又盯上了智能体自演化的“可靠性”痛点。东南大学这篇DREvo,把历史经验当作“过期货”来查保质期,还能自动提炼出下一步修改方向,五个基准全超之前方法,平均提升16.2%,自我进化终于不再原地打转!
想不想知道,给顶级VLM一个患者描述但完全不给图像,它们会怎么做?这篇CMU的研究发现,模型不仅不会拒绝回答,还会根据种族、年龄、性别编出不同的诊断,甚至存在“表面说看不到图、背地填上病名”的阴阳模式。对医疗AI的可信度当头一棒,值得所有临床AI从业者细读。
继2025年末佐治亚理工的降噪思路后,浙大团队发现一个更根本的问题:在做LLM增强推荐时,直接取最后一层语义并不合理——中间层保留了互补的细粒度信息,不同物品对层深的偏好也不同。为此他们提出IMFuse,一个即插即用的多层语义聚合模块,仅增加0.03M参数就让推荐性能平均提升6.72%。门槛低、收益高,值得关注。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球