← 返回 PaperDaily 视觉与图像

清华SCALECUA把电脑智能体拉到68.7%,开源模型新纪录

这篇论文最值钱的不是单点技巧,而是把电脑智能体最卡脖子的三件事一次打通:题不够、采样不准、训练太慢。清华团队把可验证任务合成、前沿采样和视觉上下文分割拼成一条流水线,直接把开源模型推到 68.7%。

清华SCALECUA把电脑智能体拉到68.7%,开源模型新纪录
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最值钱的不是单点技巧,而是把电脑智能体最卡脖子的三件事一次打通:题不够、采样不准、训练太慢。清华团队把可验证任务合成、前沿采样和视觉上下文分割拼成一条流水线,直接把开源模型推到 68.7%。


原论文信息如下:
论文标题:
SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL
发表日期:
2026年07月
发表单位:
Tsinghua University; Z.AI
原文链接:
https://arxiv.org/pdf/2607.11185v1.pdf
开源代码链接:
https://github.com/THUDM/SCALE-CUA
项目链接:
https://github.com/THUDM/SCALE-CUA/raw/main/assets/overall.png

电脑自己学会用电脑?清华团队SCALECUA让AI成为多任务操作大师

电脑智能体这几年很热,但真正卡脖子的地方一直没变:题不够、练不动、还练得慢。会点鼠标键盘不算本事,能在真实桌面环境里跨应用、跨步骤、跨软件把任务做完,才算真上桌。
清华和 Z.AI 这篇 SCALECUA,干的事很直接:不是只改模型,而是把“数据怎么来、任务怎么挑、长任务怎么训”一口气打通。最后把一个 9B 参数 的开源模型,推到 OSWorld 68.7%ScienceBoard 54.0%,还把不少更大的开源模型按在后面。这个结果最有意思的地方在于:不是单纯堆参数赢的,而是把训练流水线做顺了
封面
图1:SCALECUA在 OSWorld 和 ScienceBoard 上的整体表现概览,9B 骨干模型已经能压过不少更大的开源对手。

数据瓶颈怎么破?VERIGEN:让AI自己“出题”并“批改”

电脑智能体和数学、代码智能体不一样。后两类任务,答案对不对往往有现成判定器;而 GUI 任务往往只有一个环境和一句指令,做完没做完,得看界面状态。也就是说,“能不能自动打分” 是第一道坎。
SCALECUA 的第一个核心模块叫 VERIGEN,全称是 Verifiable Task Generation,中文可以理解为“可验证任务生成”。它不是简单让模型编一堆 GUI 题,而是把题目、判定器、环境执行三件事绑在一起,做成一条能闭环的流水线。
图3:SCALECUA框架总览
图3:SCALECUA整体框架。VERIGEN 负责在真实操作系统容器里合成可验证任务,Frontier Sampling 负责挑任务,Visual Context Segmentation 负责把长轨迹训得动。
VERIGEN 里有三个角色:提案者、裁判、检查者。提案者先根据环境知识文档和实时 Docker 容器,生成一个任务和一个判定逻辑;裁判从语义上看这题是否清楚、判定逻辑是否自洽;检查者则直接在容器里“试跑”一遍,看看这题到底能不能做、判定器会不会乱判。
这个设计的妙处在于,它不是只追求“题目像真的”,而是追求题目真的能执行、真的能判分。对在线强化学习来说,这一点比花哨更重要。因为一旦奖励函数不稳定,训练就会变成“模型在幻觉里打工”。
更关键的是,VERIGEN 还会吃进模型 rollout 轨迹,做轨迹驱动的任务再合成。如果模型在某一步翻车,就把原任务拆成更细的子任务;如果模型已经做对了,就把相似任务串起来,生成更难的多目标任务。简单说就是:不会的拆小,会的加难。这就比随机出题靠谱多了。
图10:任务分布
图10:VERIGEN生成任务的领域分布。OSWorld 覆盖 10 类应用,ScienceBoard 覆盖 6 类科学软件,说明它不是只会在单一场景里“刷题”。
论文里还专门做了大规模并行:通过共享 Docker 交互探针,100+ 个 agent worker 可以同时和 100+ 个容器交互。最后产出了 24K+ 可验证任务 和接近 3K 高质量 RL 任务。这才是在线强化学习能不能“规模化”的底座。
图8:VERIGEN分析
图8:VERIGEN生成的可验证任务池规模明显更大,且加入轨迹驱动任务后,训练奖励曲线更稳、更长。
图9:Python判定器示意
图9:匿名化的 Python 判定器示意。题目最终不是靠人拍脑袋打分,而是靠可执行的 judge 函数来判定。

学习效率低?前沿采样:只练“不会但快会”的任务

任务有了,不代表就能高效训练。在线强化学习最怕两种浪费:一种是太容易,模型一把过,没学习信号;另一种是太难,模型怎么试都错,还是没学习信号。真正值钱的,是那些“差一点就会”的任务。
这就是 Frontier Sampling,可以理解成“前沿采样”。它先用每个任务的成功率做一个指数滑动平均(EMA,Exponential Moving Average,指数滑动平均),再用一个高斯分布把采样权重压到当前能力边界附近。中文说白了就是:专挑那些模型半懂不懂、最容易长进的题
论文里还加了一个很现实的约束:不是所有任务都能进训练池。先过滤掉成功率太低或太高的任务,避免模型在“完全做不来”和“已经闭眼会”之间打转。然后再保留一小部分均匀采样,防止训练过早钻进局部最优。这个思路很朴素,但很工程:既要吃到边界红利,也不能把探索性丢了
图6:前沿采样与训练效率对比
图6(a):Frontier Sampling 相比均匀采样、DAPO 和课程学习,能更稳定地维持更高奖励,因为它一直跟着“学习边界”走。
从结果看,这个采样器不是“锦上添花”,而是直接影响在线 RL 的有效样本密度。因为在 GUI 任务里,rollout 很贵,错一次就是真金白银的算力损失。Frontier Sampling 的价值就在于:少浪费一次 rollout,就多赚一次学习机会

训练太慢?视觉上下文分割:给AI“看”一个“动态摘要”

长任务训练还有一个老大难:截图太多。把整条轨迹都塞进训练样本,rollout 端会越来越慢;每一步都拆成单独样本,训练端又会被样本数量拖死。说白了就是,不是显存先炸,就是吞吐先跪
SCALECUA 的解法叫 Visual Context Segmentation,中文可以理解成“视觉上下文分割”。它保留最近的 K 张截图作为滑动窗口,同时保留完整文本历史。这样一来,模型既不会忘掉前文的文字线索,也不会被无穷增长的视觉 token 拖垮。
图4:视觉上下文分割
图4:滑动窗口式轨迹处理。旧截图被逐步丢弃,文本历史保留,训练时只对助手回复计算损失,避免视觉上下文无限膨胀。
这里最值得注意的是,它不是把历史一刀切掉,而是把“最近最有用的视觉信息”留下来,把更早的视觉内容压缩掉。这样做的好处很直白:训练项不会像步进式拆分那样线性膨胀,长序列推理也不会失忆
图5:滑动窗口训练步时
图5:不同窗口大小 K 下的训练步时。中等窗口最合适,太小会损失上下文,太大又会拖慢训练。
图6(b) 里给出的速度结果也很实在:在相同算力预算下,滑动窗口训练把 actor-update 阶段和 reference-policy 阶段都明显压缩了,端到端训练速度提升 2.83 倍。这类提升不属于“论文里看着漂亮”,而是能不能把在线 RL 真正跑起来的分水岭。
更有意思的是,窗口变小并没有把任务成功率打崩。论文里对不同 K 做了验证,说明这个“动态摘要”不是粗暴删信息,而是把最贵的视觉上下文控制在一个合理范围内。对工程实现来说,这种平衡感非常值钱。

效果炸裂!SCALECUA在OSWorld和ScienceBoard上均创下开源模型新纪录

先看最直观的结果。SCALECUA 把三个不同骨干模型都拉上来了:GLM-4.6V-Flash、Qwen3-VL-8B-Thinking、Qwen3.5-9B。它不是只对某一个模型有效,而是比较明显地表现出方法可迁移的特征。
表2:OSWorld成功率
表2:OSWorld 成功率对比。SCALECUA-Qwen3.5-9B 达到 68.7%,超过了 Kimi K2.5、Claude Sonnet 4.5 等强基线,也明显高于同骨干的原始模型。
OSWorld 里最亮眼的是长程任务。Qwen3.5-9B 经 SCALECUA 训练后,整体从 41.8% 提到 68.7%,提升幅度非常大;在 Professional 和 Workflow 类任务上,效果尤其突出。这个现象和方法设计是对得上的:越长、越复杂、越依赖多步操作的任务,越吃 VERIGEN 的任务质量和 Visual Context Segmentation 的训练效率
表3:ScienceBoard成功率
表3:ScienceBoard 成功率对比。SCALECUA-Qwen3.5-9B 达到 54.0%,超过 Claude Opus 4.6,说明这套方法不只适合通用桌面任务,也能碰到专业科学软件场景。
ScienceBoard 更难,因为它包含代数、分子可视化、地理信息、定理证明、天文模拟、科学文档写作等软件。SCALECUA 在这里还能维持优势,说明它合成出来的可验证任务不是“玩具题”,而是有一定复杂度和真实工作流味道的。尤其是 TeXstudio 和 Lean 相关任务上的表现,挺能说明问题:该方法不是只会点点点,是真的开始理解“多步骤工作流”了
图2:47步任务演示
图2:一个 47 步的 OSWorld 任务演示。智能体从读取桌面状态开始,逐步浏览网页、下载主题、解压、应用配置,最后拿到 judge=1.0。
这个演示很适合拿来理解“电脑自己学会用电脑”到底是什么意思。它不是一句“去安装主题”就完事,而是要在多个应用之间来回切换:浏览器、终端、系统设置,每一步都可能出错。能把这种 47 步链路跑通,才算真的把 GUI 智能体往实用方向推了一大截。😏

总结与未来展望:SCALECUA为GUI智能体训练的通用配方奠定基础

SCALECUA 真正有价值的地方,不是某一个单点 trick,而是把电脑智能体训练最难的三件事串成了闭环:任务合成可验证、采样围绕前沿、训练控制视觉开销。这三件事任何一个短板没补上,在线 RL 都很难规模化。
但它也不是“万能钥匙”。首先,VERIGEN 依赖环境知识文档和容器接口,环境越封闭、状态越复杂,生成判定器的难度就越高。其次,Frontier Sampling 假设任务成功率能比较稳定地反映学习边界,遇到剧烈分布漂移时,采样策略可能还得再调。最后,Visual Context Segmentation 虽然提速明显,但窗口大小还是一个工程超参,窗口太小会丢信息,太大又会拖慢训练。
如果把视角放远一点,这篇工作给行业的启发很清楚:未来的 GUI 智能体,拼的不只是“谁的底座更大”,而是谁能把数据闭环、奖励闭环、训练闭环做得更稳。模型会越来越像“执行层”,而真正拉开差距的,可能是围绕环境构建出来的自动化训练系统。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它主要解决的是电脑智能体训练里的三大瓶颈:可验证任务太少、在线 RL 采样效率太低、长轨迹训练太慢。SCALECUA 不是只改模型,而是把任务生成、任务选择和训练切分一起优化了。

Frontier Sampling 里的“前沿”是什么意思?指的是模型当前刚好够得着、但还没完全掌握的任务区域。太简单的题没学习价值,太难的题又学不到东西,只有“半会不熟”的任务最值钱。

Visual Context Segmentation 为什么能提速?因为它不再把整条长轨迹的所有截图都硬塞进训练样本,而是只保留最近的视觉上下文,远处的历史通过文本连续性维持。这样既减少视觉 token 膨胀,也避免训练样本数量爆炸。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。创新点不在单一算法花活,而在把可验证任务合成、任务采样和长轨迹训练做成系统方案,属于“工程型强创新”。

实验合理度:★★★★☆。对 OSWorld 和 ScienceBoard 都做了验证,还做了组件消融和训练效率分析,整体比较完整;不过部分收益来自系统级改造,复现时对环境要求不低。

学术研究价值:★★★★☆。它把 GUI 智能体最难规模化的环节拆开处理,对后续在线 RL 和任务合成研究很有参考价值。

稳定性:★★★☆☆。在标准桌面与科学软件基准上表现不错,但真实产品环境里,任务分布、权限和界面变化都会增加不确定性。

适应性以及泛化能力:★★★★☆。跨多个骨干模型都有效,跨桌面与科学软件也能跑通,泛化能力不错,但仍偏向可控环境。

硬件需求及成本:★★★☆☆。训练端和 rollout 端都需要较强并行资源,尤其是 100+ 容器并发这类设置,不是轻量玩家能随手复现的。

复现难度:★★★☆☆。代码开源是加分项,但 Docker 环境、评测基准、并行采样和长轨迹训练都比较吃工程细节。

产品化成熟度:★★★☆☆。在受控桌面工作流里已经很有希望,但要进真实企业环境,还得继续解决权限、异常恢复和任务安全边界问题。

可能的问题:系统设计很完整,但对环境依赖较强,真实场景里的任务漂移、判定器鲁棒性和安全约束,仍是后续必须补的课。


主要参考文献

Lv, B., Liu, X., Ren, Y., et al. SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL. arXiv, 2026.
SCALECUA 开源代码:https://github.com/THUDM/SCALE-CUA
项目演示与图片资源:https://github.com/THUDM/SCALE-CUA/raw/main/assets/overall.png

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
电脑智能体、在线强化学习、可验证任务合成,这篇都踩在点上了。想少走弯路,就来群里一起拆。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。