← 返回 PaperDaily 大模型与智能体

阿里最新研究:让LLM学会“连点成线”,长期部署任务成功率飙升76%!

大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。

阿里最新研究:让LLM学会“连点成线”,长期部署任务成功率飙升76%!
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
大模型做agent已不新鲜,但让它在真实场景长期部署、边工作边学习、自己积累经验,才是终极形态。阿里CoD论文用强化学习端到端训练LLM学会“连点成线”的元能力,任务序列里第四个任务成功率从28%干到76%,还跨域泛化到没见过的任务上。


原论文信息如下:
论文标题:
Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning
发表日期: 2026年6月
发表单位: Alibaba Group
作为龙哥,今天咱们就唠唠阿里这篇关于“大模型长期打工”的论文。思路清晰,实验结果够劲爆。直接上干货! 插图

从零单排到带薪休假:让LLM学会“连点成线”

想象一下,你新入职一家公司,第一天两眼一抹黑。但你很聪明,会自己摸索,一周后成了办公室“老油条”。这就是人类“连点成线”的能力——长期部署,自主学习,自我进化。
现在的LLM更像是“一锤子买卖”的高手。你让它管理仓库,处理入库、优化库存、对接发货,它可能就抓瞎了,搞不定隐含规则,更不用说从经验里学习。
阿里云这篇论文提出了CoD (Connect the Dots) 框架,通过端到端强化学习训练,让LLM不仅能干好手头的活,还能自动积累经验,越干越好。

多步任务串联训练,CoD框架详解:环境探索与上下文更新

CoD框架分为两部分:CoD-Deploy(部署阶段)CoD-Train(训练阶段)
图1:CoD部署与训练可视化(与标准任务逐个RL对比),其中A和B表示不同的训练环境,M表示用于部署或评估的新环境。每个方块代表一个解决任务xi或更新当前环境上下文zi的rollout回合。
图1:CoD部署与训练可视化(与标准任务逐个RL对比)。
左边是传统RL,每次新任务从零学起。右边是CoD,在同一个环境里依次执行Solve-TaskUpdate-Context 的循环。

CoD-Deploy:模型进入新环境处理任务序列x₀, x₁, x₂... 解决完一个任务后执行“Update-Context”,把经验整理成文本“上下文”z。新任务到来时,模型基于更新过的上下文行动。

CoD-Train:把整个部署过程的成败得失当作RL训练数据。目标不是完成孤立任务,而是学会“学习”本身——利用之前任务的结果更新上下文,在后续任务中表现更好。

插图
图2:RL算法在CoD-Train中的优势计算可视化。

端到端RL训练实现:告别“头痛医头”,学会“放眼未来”

最大技术难点是信用分配。整个回合格外长,如何判断“Update-Context”动作的好坏?要看它是否帮助后续任务取得更好成绩。
阿里团队借鉴动态规划思想:
1. **回报设计**:每个“Solve-Task”有明确奖励,“Update-Context”给格式奖励鼓励写总结。
2. **优势计算**:每个回合的最终回报包括自身奖励和未来所有任务奖励。通过对比多个rollout轨迹,算出“更新上下文”动作让后续任务获利还是亏本。
3. **算法核心**:以GRPO为基础,将整个任务序列的奖励串联评估,并加入启发式技巧平衡梯度。
简单说,他们不只是让模型“做题”,而是让模型去“出题”并判断“题目”质量。

实验环境设计:三个“游戏”,考验LLM的真本事

FrozenLake-Obscure(冰湖迷踪):经典冰湖Hard模式。四个方向键被随机替换为A、B、C、D。模型必须试错后记下“A是往上走”,才能在后续任务通关。

Alchemy-Random(炼金随机):随机生成“炼金术”公式,模型需自己试出配方并记在上下文里,考验规划与利用信息的能力。

TerminalSimulator(模拟终端):模拟Linux/Mac/Windows终端,模型需分辨环境特质(如路径分隔符)并记录下来。

实验成功:跨域泛化能力显著提升

基座模型为Qwen3-8B-Instruct,两个训练场景:实验A仅在FrozenLake-Obscure上训练,实验B在FrozenLake-Obscure和Alchemy-Random混合数据上训练,任务序列长度均为4。
图3:实验A的结果,即在FrozenLake-Obscure域上进行CoD-Train。训练奖励曲线使用大小为17的运行平均窗口进行平滑处理。评估曲线中,检查点步骤0对应初始的Qwen3-8B-Instruct模型。
图3:实验A结果。
图3左半部分,任务序列第四个任务(Pos 3)成功率从28%飙升到76%,说明模型学会了利用积累的经验。右半部分,模型在没见过的更大地图和更长序列上依然表现出色,具备域内泛化能力
图4:实验B的结果,即在FrozenLake-Obscure和Alchemy-Random域的混合数据上进行CoD-Train。训练奖励曲线使用大小为17的运行平均窗口进行平滑处理。评估曲线中,检查点步骤0对应初始的Qwen3-8B-Instruct模型。
图4:实验B结果。
图4中,混合域训练的模型在完全没见过的TerminalSimulator环境也表现优异,实现了跨域泛化。模型学会了“在新环境里通过试错积累经验并指导后续行动”这一通用技能。
插图
图5:三种RL算法经验比较。
图5显示,细粒度信用分配方法明显优于把整个序列当作整体处理的方法。
表1:CoD训练和评估的超参数。
表1:CoD训练和评估的超参数。
表2:任务和环境的配置。跨两列的数值由简单和困难版本共享。TerminalSimulator仅用于跨域评估,采用单一配置。每个数据集包含50,000个训练实例和4,000个测试实例。
表2:任务和环境的配置。

实现与使用开放

整个CoD实现全部开源:
https://github.com/agentscope-ai/Trinity-RFT/tree/research/cod/examples/research_cod
框架Trinity-RFT通过“探索者”、“训练器”和“缓冲区”三个核心组件协同工作,可轻松复现实验并开发长期生命周期智能体。

龙迷三问

这篇论文解决什么问题?核心是让LLM具备长期部署中“自主学习”和“自我进化”的元能力。传统RL是任务驱动,模型无法串联经验。CoD通过全新RL训练流程,让模型学会“如何学习”,在新环境中不断解决任务、积累经验、更新上下文,未来表现更好。

GRPO和细粒度信用分配具体是什么意思?GRPO直接比较同一Prompt下多个回答的奖励来更新模型,无需额外“批评家”。细粒度信用分配指对“更新上下文”动作单独算KPI——看它是否帮助后续任务取得更好成绩,而非一刀切。

这个方法离产品化还有多远?目前处于概念验证阶段。产品化还需简化上下文管理机制(如引入记忆库),并弥合训练环境与现实世界的差距。但这是一个非常有希望的正确方向。

欢迎在评论区留言讨论~

龙哥点评

论文创新性分数:★★★★✰

提出“针对长期生命周期智能体的元能力训练”方向,思想前瞻。将动态规划引入多层级RL奖励分配是亮点。核心算法在GRPO上微调,无本质创新。

实验合理度:★★★★✰

环境设置精巧,评估体系全面。扣一星因仅停留在8B模型和游戏级环境。

学术研究价值:★★★★★

极高。为“智能体如何自主学习”提供了清晰可验证的研究范式,能“开宗立派”。

稳定性:★★✰✰✰

训练过程不稳定,存在性能波动,远未达到稳定训练。

适应性以及泛化能力:★★★★★

最大亮点。跨域泛化到TerminalSimulator表现优异,证明泛化能力极强。

硬件需求及成本:★★★✰✰

8B模型训练可控,但多任务序列Rollout成本远高于单任务RL,复现门槛不低。

复现难度:★★★★✰

论文和代码开源,环境设计有巧思。扣一星因训练不稳定,需调整超参数。

产品化成熟度:★★✰✰✰

目前不行,但技术路线为未来产品化指明了方向。

可能的问题:

核心算法存在启发式修补,训练稳定性待提高。上下文格式和利用方式有巨大优化空间。

主要参考文献

[1] Yanxi Chen, Weijie Shi, Yuexiang Xie, et al. “Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning”. arXiv preprint arXiv:2606.20002v1, 2026.
[2] Zhihong Shao, et al. “DeepSeekMath: Pushing the Limits of Mathematical Reasoning with Open Language Models”. 2024.
[3] Qwen-Team. “Qwen3 Technical Report”. arXiv preprint arXiv:2505.03701, 2025.
[4] Xuchen Pan, et al. “Trinity-RFT: A General, Flexible and User-Friendly Framework for Reinforcement Fine-tuning of Large Language Models”. 2025.
[5] Yan Duan, et al. “RL²: Fast Reinforcement Learning via Slow Reinforcement Learning”. arXiv preprint arXiv:1611.02779, 2016.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见。欢迎交流探讨~ 想了解更多原文细节,可点击"阅读原文"

end
想让你的LLM也学会“连点成线”超能力?快来龙哥读论文粉丝群交流!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或添加龙哥助手微信号加群:kangjinlonghelper。备注:研究方向+地点+学校/公司+昵称
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。