浙大美团联合提出SkillRise:任务越做越聪明,智能体学会举一反三
让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。
病理图像分析中,细胞空间结构是关键诊断线索,但传统启发式图结构无法自适应学习。G*2-Net巧妙地将图像级图结构学习转化为二阶双层优化问题,用DARTS式一步展开避免高昂计算,在三个数据集上全面超越现有方法。值得关注的是,其可学习图结构为模型提供了更好的解释性。
你家娃的鬼画符,数字笔认不出来?别慌,法国IRISA团队找到了一条捷径——域自适应。仅用少量儿童数据,就让原本只懂成人书写的模型,在儿童手写轨迹重建上直接媲美甚至超越从零训练。这篇论文很务实,不光讲算法,还把从理论到实验的每一步都掰开了细说,值得一看。
潜世界模型能预测未来帧,却可能对动作指令“假装没听见”——这不是开玩笑,论文首次定义了这个叫“上下文坍塌”的致命缺陷。ActSWM只用两个干净约束(动作对比铰链损失+冻结读取器)就让Minecraft石料挖掘成功率从50%飙到95%,还能从GTA视频里反向恢复按键。问题实在、方案漂亮、实验扎实,值得所有做模型预测控制的朋友认真读一读。
别再对着你测出来的YIG薄膜铁磁共振线宽曲线发呆了。MIT团队搬出量子力学里的Lippmann-Schwinger方程,一刀剖开了双磁子散射各向异性的终极秘密——原来缺陷的形状决定了你的器件是“省电”还是“漏电”。一句话总结:缺陷长的方向不对,你所有努力都白费。
继2026年6月龙哥聊过AI检测器泛化难题后,哈尔滨工业大学团队在IJCAI-ECAI 2026挑战赛中给出了一个反直觉的答案:原来音视频之间的一致性假设在通用场景下根本不靠谱,解耦才是王道!DAV-Det以0.8460分夺得第一,简单粗暴但效果惊人。
这篇论文巧妙解决了多模态推荐中一个两难问题:既要利用用户行为信号优化描述,又要保持推理时纯内容生成。快手和南开提出的RecoReward用推荐器作为训练时的“裁判”,让MLLM学会生成对推荐更友好的描述,离线全面领先,在线也有实实在在的提升。思路新颖,工程上也很实用,值得做推荐系统的同学关注。
如果你负责AI在企业中的部署,这个基准是你必须知道的——它直接捅穿了当前智能体在面对几十页公司手册时的无力现状。结果虽然难看,但清晰暴露了需要改进的方向:长上下文指令遵循远未到可用水平。
继6月聊过Mila的Gigapixel自博弈训练之后,Valeo这篇Pictura直接更进一步:把强化学习的观察空间从特权矢量换成了摄像头第一视角的渲染图,彻底消除了部署时的表征鸿沟。500亿步训练后,效果居然还能跟特权基线掰手腕,零样本迁移到Waymo场景甚至反超——这才是自博弈该有的样子。
LLM一发布就被倒卖、二次分发,权属怎么证明?华东师大这篇2026年的工作想了个妙招:把“指纹”藏进模型参数里,而且不是用容易被识破的乱码,也不是用会误触的普通英文,而是用低资源语言组成的“代码混合”语言。更厉害的是,指纹的“构建”和“注入”不再割裂,构建时选的语言直接指导注入时往哪里写。最终结果很硬核:平均困惑度只有96(远低于乱码的1302),注入成功率
语音增强模型部署一直是老大难?这篇来自汉阳大学的最新工作,直接把FastEnhancer-Medium模型编译成纯C int8运行时,在Apple M2上跑到0.069 RTF,比ONNX Runtime快3.3倍,质量只掉了0.006 PESQ,而且完全无依赖!不碰模型结构、不重新训练,全栈优化+int8量化搞定一切,还公开了源代码,简直是把语音增强部署的
API测试最头疼的“冷启动”问题——没有OpenAPI规范、没有历史日志,只有一个请求样本,能自动写出靠谱断言吗?Restor告诉你,用强化学习(GRPO)微调一个轻量LLM,这事儿能成,而且字节跳动已经在生产环境跑起来了,采纳率直接干到96%以上。一篇来自复旦和字节跳动的ISSTA'26工作,实打实的工业级神器。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球