← 返回 PaperDaily
视觉与图像
清华SCALECUA把电脑智能体拉到68.7%,开源模型新纪录
这篇论文最值钱的不是单点技巧,而是把电脑智能体最卡脖子的三件事一次打通:题不够、采样不准、训练太慢。清华团队把可验证任务合成、前沿采样和视觉上下文分割拼成一条流水线,直接把开源模型推到 68.7%。
龙哥读论文
阅读 3
查看原文
🐉 龙哥读论文知识星球来了!公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由:
这篇论文最值钱的不是单点技巧,而是把电脑智能体最卡脖子的三件事一次打通:题不够、采样不准、训练太慢。清华团队把可验证任务合成、前沿采样和视觉上下文分割拼成一条流水线,直接把开源模型推到 68.7%。
原论文信息如下:
电脑自己学会用电脑?清华团队SCALECUA让AI成为多任务操作大师
电脑智能体这几年很热,但真正卡脖子的地方一直没变:题不够、练不动、还练得慢。会点鼠标键盘不算本事,能在真实桌面环境里跨应用、跨步骤、跨软件把任务做完,才算真上桌。
清华和 Z.AI 这篇 SCALECUA,干的事很直接:不是只改模型,而是把“数据怎么来、任务怎么挑、长任务怎么训”一口气打通。最后把一个 9B 参数 的开源模型,推到 OSWorld 68.7%、ScienceBoard 54.0%,还把不少更大的开源模型按在后面。这个结果最有意思的地方在于:不是单纯堆参数赢的,而是把训练流水线做顺了。
数据瓶颈怎么破?VERIGEN:让AI自己“出题”并“批改”
电脑智能体和数学、代码智能体不一样。后两类任务,答案对不对往往有现成判定器;而 GUI 任务往往只有一个环境和一句指令,做完没做完,得看界面状态。也就是说,“能不能自动打分” 是第一道坎。
SCALECUA 的第一个核心模块叫 VERIGEN,全称是 Verifiable Task Generation,中文可以理解为“可验证任务生成”。它不是简单让模型编一堆 GUI 题,而是把题目、判定器、环境执行三件事绑在一起,做成一条能闭环的流水线。
VERIGEN 里有三个角色:提案者、裁判、检查者。提案者先根据环境知识文档和实时 Docker 容器,生成一个任务和一个判定逻辑;裁判从语义上看这题是否清楚、判定逻辑是否自洽;检查者则直接在容器里“试跑”一遍,看看这题到底能不能做、判定器会不会乱判。
这个设计的妙处在于,它不是只追求“题目像真的”,而是追求题目真的能执行、真的能判分。对在线强化学习来说,这一点比花哨更重要。因为一旦奖励函数不稳定,训练就会变成“模型在幻觉里打工”。
更关键的是,VERIGEN 还会吃进模型 rollout 轨迹,做轨迹驱动的任务再合成。如果模型在某一步翻车,就把原任务拆成更细的子任务;如果模型已经做对了,就把相似任务串起来,生成更难的多目标任务。简单说就是:不会的拆小,会的加难。这就比随机出题靠谱多了。
论文里还专门做了大规模并行:通过共享 Docker 交互探针,100+ 个 agent worker 可以同时和 100+ 个容器交互。最后产出了 24K+ 可验证任务 和接近 3K 高质量 RL 任务。这才是在线强化学习能不能“规模化”的底座。
任务有了,不代表就能高效训练。在线强化学习最怕两种浪费:一种是太容易,模型一把过,没学习信号;另一种是太难,模型怎么试都错,还是没学习信号。真正值钱的,是那些“差一点就会”的任务。
这就是 Frontier Sampling,可以理解成“前沿采样”。它先用每个任务的成功率做一个指数滑动平均(EMA,Exponential Moving Average,指数滑动平均),再用一个高斯分布把采样权重压到当前能力边界附近。中文说白了就是:专挑那些模型半懂不懂、最容易长进的题。
论文里还加了一个很现实的约束:不是所有任务都能进训练池。先过滤掉成功率太低或太高的任务,避免模型在“完全做不来”和“已经闭眼会”之间打转。然后再保留一小部分均匀采样,防止训练过早钻进局部最优。这个思路很朴素,但很工程:既要吃到边界红利,也不能把探索性丢了。
从结果看,这个采样器不是“锦上添花”,而是直接影响在线 RL 的有效样本密度。因为在 GUI 任务里,rollout 很贵,错一次就是真金白银的算力损失。Frontier Sampling 的价值就在于:少浪费一次 rollout,就多赚一次学习机会。
训练太慢?视觉上下文分割:给AI“看”一个“动态摘要”
长任务训练还有一个老大难:截图太多。把整条轨迹都塞进训练样本,rollout 端会越来越慢;每一步都拆成单独样本,训练端又会被样本数量拖死。说白了就是,不是显存先炸,就是吞吐先跪。
SCALECUA 的解法叫 Visual Context Segmentation,中文可以理解成“视觉上下文分割”。它保留最近的 K 张截图作为滑动窗口,同时保留完整文本历史。这样一来,模型既不会忘掉前文的文字线索,也不会被无穷增长的视觉 token 拖垮。
这里最值得注意的是,它不是把历史一刀切掉,而是把“最近最有用的视觉信息”留下来,把更早的视觉内容压缩掉。这样做的好处很直白:训练项不会像步进式拆分那样线性膨胀,长序列推理也不会失忆。
图6(b) 里给出的速度结果也很实在:在相同算力预算下,滑动窗口训练把 actor-update 阶段和 reference-policy 阶段都明显压缩了,端到端训练速度提升 2.83 倍。这类提升不属于“论文里看着漂亮”,而是能不能把在线 RL 真正跑起来的分水岭。
更有意思的是,窗口变小并没有把任务成功率打崩。论文里对不同 K 做了验证,说明这个“动态摘要”不是粗暴删信息,而是把最贵的视觉上下文控制在一个合理范围内。对工程实现来说,这种平衡感非常值钱。
效果炸裂!SCALECUA在OSWorld和ScienceBoard上均创下开源模型新纪录
先看最直观的结果。SCALECUA 把三个不同骨干模型都拉上来了:GLM-4.6V-Flash、Qwen3-VL-8B-Thinking、Qwen3.5-9B。它不是只对某一个模型有效,而是比较明显地表现出方法可迁移的特征。
OSWorld 里最亮眼的是长程任务。Qwen3.5-9B 经 SCALECUA 训练后,整体从 41.8% 提到 68.7%,提升幅度非常大;在 Professional 和 Workflow 类任务上,效果尤其突出。这个现象和方法设计是对得上的:越长、越复杂、越依赖多步操作的任务,越吃 VERIGEN 的任务质量和 Visual Context Segmentation 的训练效率。
ScienceBoard 更难,因为它包含代数、分子可视化、地理信息、定理证明、天文模拟、科学文档写作等软件。SCALECUA 在这里还能维持优势,说明它合成出来的可验证任务不是“玩具题”,而是有一定复杂度和真实工作流味道的。尤其是 TeXstudio 和 Lean 相关任务上的表现,挺能说明问题:该方法不是只会点点点,是真的开始理解“多步骤工作流”了。
这个演示很适合拿来理解“电脑自己学会用电脑”到底是什么意思。它不是一句“去安装主题”就完事,而是要在多个应用之间来回切换:浏览器、终端、系统设置,每一步都可能出错。能把这种 47 步链路跑通,才算真的把 GUI 智能体往实用方向推了一大截。😏
总结与未来展望:SCALECUA为GUI智能体训练的通用配方奠定基础
SCALECUA 真正有价值的地方,不是某一个单点 trick,而是把电脑智能体训练最难的三件事串成了闭环:任务合成可验证、采样围绕前沿、训练控制视觉开销。这三件事任何一个短板没补上,在线 RL 都很难规模化。
但它也不是“万能钥匙”。首先,VERIGEN 依赖环境知识文档和容器接口,环境越封闭、状态越复杂,生成判定器的难度就越高。其次,Frontier Sampling 假设任务成功率能比较稳定地反映学习边界,遇到剧烈分布漂移时,采样策略可能还得再调。最后,Visual Context Segmentation 虽然提速明显,但窗口大小还是一个工程超参,窗口太小会丢信息,太大又会拖慢训练。
如果把视角放远一点,这篇工作给行业的启发很清楚:未来的 GUI 智能体,拼的不只是“谁的底座更大”,而是谁能把数据闭环、奖励闭环、训练闭环做得更稳。模型会越来越像“执行层”,而真正拉开差距的,可能是围绕环境构建出来的自动化训练系统。
龙迷三问
这篇论文到底解决了什么问题?它主要解决的是电脑智能体训练里的三大瓶颈:可验证任务太少、在线 RL 采样效率太低、长轨迹训练太慢。SCALECUA 不是只改模型,而是把任务生成、任务选择和训练切分一起优化了。
Frontier Sampling 里的“前沿”是什么意思?指的是模型当前刚好够得着、但还没完全掌握的任务区域。太简单的题没学习价值,太难的题又学不到东西,只有“半会不熟”的任务最值钱。
Visual Context Segmentation 为什么能提速?因为它不再把整条长轨迹的所有截图都硬塞进训练样本,而是只保留最近的视觉上下文,远处的历史通过文本连续性维持。这样既减少视觉 token 膨胀,也避免训练样本数量爆炸。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆。创新点不在单一算法花活,而在把可验证任务合成、任务采样和长轨迹训练做成系统方案,属于“工程型强创新”。
实验合理度:★★★★☆。对 OSWorld 和 ScienceBoard 都做了验证,还做了组件消融和训练效率分析,整体比较完整;不过部分收益来自系统级改造,复现时对环境要求不低。
学术研究价值:★★★★☆。它把 GUI 智能体最难规模化的环节拆开处理,对后续在线 RL 和任务合成研究很有参考价值。
稳定性:★★★☆☆。在标准桌面与科学软件基准上表现不错,但真实产品环境里,任务分布、权限和界面变化都会增加不确定性。
适应性以及泛化能力:★★★★☆。跨多个骨干模型都有效,跨桌面与科学软件也能跑通,泛化能力不错,但仍偏向可控环境。
硬件需求及成本:★★★☆☆。训练端和 rollout 端都需要较强并行资源,尤其是 100+ 容器并发这类设置,不是轻量玩家能随手复现的。
复现难度:★★★☆☆。代码开源是加分项,但 Docker 环境、评测基准、并行采样和长轨迹训练都比较吃工程细节。
产品化成熟度:★★★☆☆。在受控桌面工作流里已经很有希望,但要进真实企业环境,还得继续解决权限、异常恢复和任务安全边界问题。
可能的问题:系统设计很完整,但对环境依赖较强,真实场景里的任务漂移、判定器鲁棒性和安全约束,仍是后续必须补的课。
主要参考文献
Lv, B., Liu, X., Ren, Y., et al. SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL. arXiv, 2026.
SCALECUA 开源代码:https://github.com/THUDM/SCALE-CUA
项目演示与图片资源:https://github.com/THUDM/SCALE-CUA/raw/main/assets/overall.png
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!