浙大美团联合提出SkillRise:任务越做越聪明,智能体学会举一反三
让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
让AI智能体学会“举一反三”,而不是每次都从零开始。美团、浙大、上交大、新国立联合提出的SkillRise,通过端到端强化学习,让单一策略在执行任务中不断提炼技能文档,并在后续任务中复用。在三大Agent基准上,它用更少的资源,实现了更高的性能和明显的测试时扩展趋势。
如果你负责AI在企业中的部署,这个基准是你必须知道的——它直接捅穿了当前智能体在面对几十页公司手册时的无力现状。结果虽然难看,但清晰暴露了需要改进的方向:长上下文指令遵循远未到可用水平。
LLM一发布就被倒卖、二次分发,权属怎么证明?华东师大这篇2026年的工作想了个妙招:把“指纹”藏进模型参数里,而且不是用容易被识破的乱码,也不是用会误触的普通英文,而是用低资源语言组成的“代码混合”语言。更厉害的是,指纹的“构建”和“注入”不再割裂,构建时选的语言直接指导注入时往哪里写。最终结果很硬核:平均困惑度只有96(远低于乱码的1302),注入成功率
API测试最头疼的“冷启动”问题——没有OpenAPI规范、没有历史日志,只有一个请求样本,能自动写出靠谱断言吗?Restor告诉你,用强化学习(GRPO)微调一个轻量LLM,这事儿能成,而且字节跳动已经在生产环境跑起来了,采纳率直接干到96%以上。一篇来自复旦和字节跳动的ISSTA'26工作,实打实的工业级神器。
食物分割里,豆腐和芝士经常被搞混?国立成功大学这篇工作用一个巧妙的思路——让大语言模型(GPT-o4 mini)根据图像猜出食材名称,再把食材标签嵌入视觉特征或解码器查询中,实现精准分割。两个模块完全即插即用,在FoodSeg103上刷新SOTA达到55.0 mIoU,且仅增加3.8GB显存开销。不用搞什么对齐训练,拿来就能涨点,实用派狂喜!
量子计算硬件越来越容易获取,但从理论论文到实际硬件运行,中间依然隔着巨大的工程鸿沟。PASQAL团队用AI智能体搭建了一座自动化桥梁,让一篇论文或专利在一夜之间变成QPU实验。更震撼的是,他们用AI扫描了633篇Rydberg阵列论文,发现近一半可以直接在现有量子处理器上执行。虽然是智能体,但专家把关依然不可替代——选错观测量的案例让人警醒。值得所有关注量子
犹豫不决本难测,传统多模态融合不灵。PRISM-AH另辟蹊径:轻量网络抽取出结构化证据(冲突时刻、主导模态、韵律特征),再用LLM套上专家知识推理,一次性提升2.24倍。思路新颖,适合搞多模态理解、情感计算的读者。
继6月聊过AI+同伴反馈对学术写作的影响后,这篇论文更直接:AI帮你写邮件,语气竟然比是否用AI更重要!121人16880封邮件的田野实验,结果让人意外——直接效果为零,但情绪中介效应显著。想了解怎么优化你的AI写作工具?这篇必读。
继6月聊过Adobe的定量LLM评判器之后,Google这篇直接将数据审计玩出了新高度。不重训练、不跑几千次微调,靠推理前向传播就能近似Shapley值,把审计搜索空间干掉99.1%,在HelpSteer2和HH-RLHF里揪出了一堆人类标注翻车的样本,甚至发现评估基准里藏着“错误答案才是正确”的坑。对搞LLM对齐、数据质量的同学来说,这是真正的降维打击。
每次跟AI聊天,你都以为只是“好好说话”?宾州州立大学的这篇新研究告诉你,你的语气决定了LLM的“烧钱”速度和回答质量。对GPT-4o吼一顿,竟然比礼貌请求更准更便宜。最高推理成本差异达到44.3%!想省token?先学学怎么“怼”模型。
你是不是经常让ChatGPT帮你评个点子的好坏?但你知道它的评判标准和你一样吗?剑桥学者刚刚揭开了谜底:LLM只认“新不新”,根本不关心“火不火”!这篇论文系统比较了六大主流模型的创造力评估标准,并验证了对实际评分的影响,值得所有用AI做决策的人一看。
NVIDIA开源了Molt,一个专为智能体强化学习(Agentic RL)设计的PyTorch原生训练框架。代码量仅约8600行,却能在吞吐量上与业界顶级的Megatron堆栈掰手腕。对于天天改算法的研究者来说,这简直是福音,终于不用在层层抽象和复杂配置里找东西南北了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球