北大阿里新方法:长上下文推理少复读,准确率最高提4.6分
长上下文推理最怕什么?不是算不出来,而是模型一边思考一边疯狂复读输入。北大和阿里这篇论文把“复读”拆成可优化的奖励信号,思路很朴素,效果却很能打。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
长上下文推理最怕什么?不是算不出来,而是模型一边思考一边疯狂复读输入。北大和阿里这篇论文把“复读”拆成可优化的奖励信号,思路很朴素,效果却很能打。
代码代理终于不只是“会不会改对”,而是开始认真算“改一次要花多少钱”。这篇 CodeRescue 把失败后的恢复动作拆成可路由、可校准、可控预算的流程,思路很实用,工程味也很足。
代码 Agent 失败后,真正值钱的不是“继续堆算力”,而是先判断这次失败到底适合修、重做还是升级。CodeRescue 的厉害之处在于,它把这个经验判断做成了可训练、可校准、还能按预算切换的路由器。
3D场景检索最怕“指令说改一处,系统却把整间屋子都翻了”。这篇工作直接把问题拆成可执行的重排流程,还顺手补了一套新基准,实用性比很多只会讲概念的方案更硬。
Agent 不是不会干活,是经常被“工具海”淹没。本文把 MCP 从直连玩成云端网关,顺手把旧 API、协议兼容、工具筛选和会话路由一起收拾了,属于真能落地的基础设施活。
这篇论文最有意思的地方,不是“又做了一个多模态模型”,而是 冻结基座不动,也能把音频硬塞进统一空间 。更狠的是,文本、图像、视频的原有结果还能保持 bitwise 一致,工程味很足。
视频摘要最容易犯的错,不是总结得不够短,而是把最关键的证据先删没了。HAS偏偏反着来:不做硬挑帧,而是把“高光分布”变成推理时的注意力引导,思路很干净,实验也够实在。
这篇论文最有意思的地方,不是“用了大模型”,而是把大模型按架构边界关进笼子里:只读、不回写、模板版本化。它解决的是真问题——同一份农业洪水日志,怎么同时给农民、保险公司、政府和农场经理看,还不把系统审计性搞丢。
一顶会级别的受控实验,把“给模型套人格”这件事狠狠干了一遍。结果挺反直觉:人格不是万能开关,Claude Opus会认真演角色,GPT-5.5却像没听见。
这篇论文不玩虚的,直接拿白盒代码审计任务开刀:同一任务、同一检查项,只改上下文,看看智能体到底是“真会做”还是“靠短记忆硬撑”。结果很扎心,长上下文确实更容易掉链子,但不是所有任务都这样。
这篇 TokCom 很有意思,表面看是 6G 通信,骨子里其实是在把“传比特”改造成“传语义、传 token、传状态”。它真正想解决的不是带宽多一点少一点,而是 AI 系统在边缘、云和多智能体之间怎么更省、更稳地协同干活。
网络事故最怕的不是出错,而是出错时没人比系统更快。微软 Azure 这篇论文把“告警—诊断—修复—验证”做成了多智能体闭环,还真在生产里跑出了 90% 以上的自主解决率,属于能落地的那种狠活。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球