← 返回 PaperDaily
大模型与智能体
阿里最新研究:让LLM学会“连点成线”,长期部署任务成功率飙升76%!
大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。
龙哥读论文
发布于 2026-08-19 00:20:07
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。
原论文信息如下:
作为龙哥,今天咱们就唠唠阿里这篇关于“大模型长期打工”的论文。思路清晰,实验结果够劲爆。直接上干货!
从零单排到带薪休假:让LLM学会“连点成线”
想象一下,你新入职一家公司,第一天两眼一抹黑。但你很聪明,会自己摸索,一周后成了办公室“老油条”。这就是人类“连点成线”的能力——长期部署,自主学习,自我进化。
现在的LLM更像是“一锤子买卖”的高手。你让它管理仓库,处理入库、优化库存、对接发货,它可能就抓瞎了,搞不定隐含规则,更不用说从经验里学习。
阿里云这篇论文提出了CoD (Connect the Dots) 框架,通过端到端强化学习训练,让LLM不仅能干好手头的活,还能自动积累经验,越干越好。
多步任务串联训练,CoD框架详解:环境探索与上下文更新
CoD框架分为两部分:CoD-Deploy(部署阶段) 和 CoD-Train(训练阶段) 。
左边是传统RL,每次新任务从零学起。右边是CoD,在同一个环境里依次执行Solve-Task 和 Update-Context 的循环。
CoD-Deploy :模型进入新环境处理任务序列x₀, x₁, x₂... 解决完一个任务后执行“Update-Context”,把经验整理成文本“上下文”z。新任务到来时,模型基于更新过的上下文行动。
CoD-Train :把整个部署过程的成败得失当作RL训练数据。目标不是完成孤立任务,而是学会“学习”本身——利用之前任务的结果更新上下文,在后续任务中表现更好。
端到端RL训练实现:告别“头痛医头”,学会“放眼未来”
最大技术难点是信用分配 。整个回合格外长,如何判断“Update-Context”动作的好坏?要看它是否帮助后续任务取得更好成绩。
1. **回报设计**:每个“Solve-Task”有明确奖励,“Update-Context”给格式奖励鼓励写总结。
2. **优势计算**:每个回合的最终回报包括自身奖励和未来所有任务奖励。通过对比多个rollout轨迹,算出“更新上下文”动作让后续任务获利还是亏本。
3. **算法核心**:以GRPO 为基础,将整个任务序列的奖励串联评估,并加入启发式技巧平衡梯度。
简单说,他们不只是让模型“做题”,而是让模型去“出题”并判断“题目”质量。
FrozenLake-Obscure(冰湖迷踪) :经典冰湖Hard模式。四个方向键被随机替换为A、B、C、D。模型必须试错后记下“A是往上走”,才能在后续任务通关。
Alchemy-Random(炼金随机) :随机生成“炼金术”公式,模型需自己试出配方并记在上下文里,考验规划与利用信息的能力。
TerminalSimulator(模拟终端) :模拟Linux/Mac/Windows终端,模型需分辨环境特质(如路径分隔符)并记录下来。
实验成功:跨域泛化能力显著提升
基座模型为Qwen3-8B-Instruct ,两个训练场景:实验A仅在FrozenLake-Obscure上训练,实验B在FrozenLake-Obscure和Alchemy-Random混合数据上训练,任务序列长度均为4。
图3左半部分,任务序列第四个任务(Pos 3)成功率从28%飙升到76%,说明模型学会了利用积累的经验。右半部分,模型在没见过的更大地图和更长序列上依然表现出色,具备域内泛化能力 。
图4中,混合域训练的模型在完全没见过的TerminalSimulator环境也表现优异,实现了跨域泛化 。模型学会了“在新环境里通过试错积累经验并指导后续行动”这一通用技能。
图5显示,细粒度信用分配方法明显优于把整个序列当作整体处理的方法。
实现与使用开放
框架Trinity-RFT 通过“探索者”、“训练器”和“缓冲区”三个核心组件协同工作,可轻松复现实验并开发长期生命周期智能体。
龙迷三问
这篇论文解决什么问题? 核心是让LLM具备长期部署中“自主学习”和“自我进化”的元能力。传统RL是任务驱动,模型无法串联经验。CoD通过全新RL训练流程,让模型学会“如何学习”,在新环境中不断解决任务、积累经验、更新上下文,未来表现更好。
GRPO和细粒度信用分配具体是什么意思? GRPO直接比较同一Prompt下多个回答的奖励来更新模型,无需额外“批评家”。细粒度信用分配指对“更新上下文”动作单独算KPI——看它是否帮助后续任务取得更好成绩,而非一刀切。
这个方法离产品化还有多远? 目前处于概念验证阶段。产品化还需简化上下文管理机制(如引入记忆库),并弥合训练环境与现实世界的差距。但这是一个非常有希望的正确方向。
龙哥点评
论文创新性分数: ★★★★✰
提出“针对长期生命周期智能体的元能力训练”方向,思想前瞻。将动态规划引入多层级RL奖励分配是亮点。核心算法在GRPO上微调,无本质创新。
实验合理度: ★★★★✰
环境设置精巧,评估体系全面。扣一星因仅停留在8B模型和游戏级环境。
学术研究价值: ★★★★★
极高。为“智能体如何自主学习”提供了清晰可验证的研究范式,能“开宗立派”。
稳定性: ★★✰✰✰
训练过程不稳定,存在性能波动,远未达到稳定训练。
适应性以及泛化能力: ★★★★★
最大亮点。跨域泛化到TerminalSimulator表现优异,证明泛化能力极强。
硬件需求及成本: ★★★✰✰
8B模型训练可控,但多任务序列Rollout成本远高于单任务RL,复现门槛不低。
复现难度: ★★★★✰
论文和代码开源,环境设计有巧思。扣一星因训练不稳定,需调整超参数。
产品化成熟度: ★★✰✰✰
目前不行,但技术路线为未来产品化指明了方向。
可能的问题:
核心算法存在启发式修补,训练稳定性待提高。上下文格式和利用方式有巨大优化空间。
主要参考文献
[1] Yanxi Chen, Weijie Shi, Yuexiang Xie, et al. “Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning”. arXiv preprint arXiv:2606.20002v1, 2026.
[2] Zhihong Shao, et al. “DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open Language Models”. 2024.
[3] Qwen-Team. “Qwen3 Technical Report”. arXiv preprint arXiv:2505.03701, 2025.
[4] Xuchen Pan, et al. “Trinity-RFT: A General, Flexible and User-Friendly Framework for Reinforcement Fine-tuning of Large Language Models”. 2025.
[5] Yan Duan, et al. “RL²: Fast Reinforcement Learning via Slow Reinforcement Learning”. arXiv preprint arXiv:1611.02779, 2016.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎交流探讨~ 想了解更多原文细节,可点击 "阅读原文" 。
想让你的LLM也学会“连点成线”超能力?快来龙哥读论文粉丝群交流!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或添加龙哥助手微信号加群 :kangjinlonghelper。
备注:研究方向+地点+学校/公司+昵称 。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群