← 返回 PaperDaily 大模型与智能体

EA联合大作:强化学习如何让游戏NPC告别“脚本味”?

玩过3A大作的朋友都知道,一个“蠢”NPC有多毁沉浸感。EA这次没有跟你聊概念,而是直接把强化学习塞进了EA SPORTS FC 25和Battlefield 6的AI系统里,并总结了一套极具价值的实战方法论,告诉你如何让NPC从“脚本”进化到“有灵魂”。这是游戏AI从学术走向工业的关键一步。

EA联合大作:强化学习如何让游戏NPC告别“脚本味”?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
玩过3A大作的朋友都知道,一个“蠢”NPC有多毁沉浸感。EA这次没有跟你聊概念,而是直接把强化学习塞进了EA SPORTS FC 25和Battlefield 6的AI系统里,并总结了一套极具价值的实战方法论,告诉你如何让NPC从“脚本”进化到“有灵魂”。这是游戏AI从学术走向工业的关键一步。


原论文信息如下:
论文标题:
Augmenting Game AI with Deep Reinforcement Learning
发表日期:
2026年06月
发表单位:
Electronic Arts (EA), Stockholm, Sweden
原文链接:
https://arxiv.org/pdf/2606.20210v1.pdf

强化学习如何让游戏AI更真实?

打游戏最怕什么?不是手残,而是队友NPC像个木头桩子——守门员永远慢半拍,士兵只会走固定路线。这种“脚本感”一出来,什么沉浸感都碎了。这就是传统手写AI的锅——靠有限状态机(FSM)或行为树(BT)堆出来的行为,永远少了点“人味儿”。
图5:Battlefield 6中移动系统的对比。上:RL增强的移动系统;下:基于NavMesh的游戏AI。RL增强的智能体展现出更平滑、更自然的轨迹,接近人类玩家的行为。而手写系统——主要由于NavMesh表示的离散性——产生更生硬、更不真实的运动模式。
图5:Battlefield 6中移动系统的对比。上:RL增强的移动系统;下:基于NavMesh的游戏AI。RL增强的智能体展现出更平滑、更自然的轨迹,接近人类玩家的行为。而手写系统——主要由于NavMesh表示的离散性——产生更生硬、更不真实的运动模式。
既然手写不行,那用强化学习(RL)行不行?AlphaStar、OpenAI Five证明AI在游戏里完全可以超越人类。但问题来了:那些是实验室玩法,训练环境简化、算力管够。而在真实的3A游戏开发中,游戏天天改、代码不断迭代、AI还得在老旧主机上跑得动。难度翻了好几倍。
最近,EA在ArXiv上发表了一篇重磅论文:Augmenting Game AI with Deep Reinforcement Learning。这篇论文没有空谈理论,而是直接把RL塞进了EA自家的两款3A大作——EA SPORTS FC 25和Battlefield 6——的AI系统里。论文总结了7个在真实游戏开发中必须解决的核心挑战,并展示了如何让NPC的行为从“剧本式”进化到“有灵魂”。龙哥看完只能说:这才是游戏AI从学术走向工业的正确姿势。
插图

我们面临的核心挑战:速度、控制与集成

在正式看案例之前,先摆出论文归纳的七大“魔鬼细节”。很多做RL研究的同学可能想:训练一个AI agent,扔游戏里跑呗,有什么难的?但放到真实的3A游戏生产环境中,跑通一个RL系统远比想象中复杂。论文明确提出了七个必须满足的要求:

短训练时间(Short Training Time)游戏在活跃开发阶段几乎每天都会变更,RL系统必须能在短时间内(比如一夜之间)重新训练好。

可控制性(Controllability)设计师希望对手下的AI行为有“质感”上的把控——想要它更激进还是更保守,通过调几个参数就能实现。

模块化(Modularity)游戏AI系统往往是模块化的,RL agent只改进其中一小块(比如守门员的定位),必须能无缝嵌入现有系统。

可维护性(Maintainability)手写代码随着规模变大越来越难管理,RL系统也必须容易维护和更新。

Bug检测与修复(Bug Detection and Fixing)RL agent训练完后,设计师需要系统的方法来确认行为是否正确,出了问题要能快速修正。

真实性(Authenticity)游戏AI不求超人类,只求看起来像真人。训练出超强的AI很容易,但训练出“真实”的AI反而更难。

运行推理约束(Runtime Inference Constraints)模型最终要在玩家的设备上运行,计算资源极其有限。推理延迟、内存占用都得严格控制。

这七个要求摆在那里,你才发现:学术论文里那些大模型、大算力、完美环境,拿到游戏工业界根本活不下去。论文的作者也直言:当前RL研究忽视了这些挑战,和真枪实弹的游戏开发有巨大鸿沟。

案例1:EA SPORTS FC 25守门员的模块化改造

图1:用作研究测试台的环境。本研究使用两款流行的3A游戏来展示将RL应用于游戏AI的挑战。上方是EA SPORTS FC 25的游戏内截图,一款基于物理的真实足球模拟游戏。在此环境中,目标是使用RL改进守门员AI的定位系统。下方是Battlefield 6的游戏内截图,一款团队型、大规模、多人在线第一人称射击3A游戏。在该测试台中,目标是用RL改进地面士兵的移动系统。
图1:用作研究测试台的环境。本研究使用两款流行的3A游戏来展示将RL应用于游戏AI的挑战。上方是EA SPORTS FC 25的游戏内截图,一款基于物理的真实足球模拟游戏。在此环境中,目标是使用RL改进守门员AI的定位系统。下方是Battlefield 6的游戏内截图,一款团队型、大规模、多人在线第一人称射击3A游戏。在该测试台中,目标是用RL改进地面士兵的移动系统。
守门员AI的痛点很经典。在EA SPORTS FC 25中,守门员的定位系统原本是一个有限状态机(FSM),包含“站位”、“扑救”等状态。问题是:不同状态切换太生硬,玩家一眼就能看出“这AI又蠢了”。论文的目标很明确:用RL替换掉那个负责“站位”的FSM模块,让守门员看起来更像真人。
训练RL agent时,面临的第一个大坑就是训练速度。游戏开发中的版本迭代以天为单位,RL agent必须能在一夜间训练完。但初始采用标准SAC算法训练一次需要2到4天。论文团队通过提高更新与数据比率、网络重置、利用预收集的离线数据以及基于场景的训练等技巧,硬是把训练时间从4天压缩到了约12小时,满足“一夜训练”的需求(见图2左)。另外,针对玩家发现的漏洞,还需要快速微调——目标是在约4小时内完成修正。他们通过结合场景学习与RaE技术,把微调时间控制在2到4小时内(见图2右)。
图2:在EA SPORTS FC 25中使用本文方法的训练性能。左图展示了使用标准SAC训练agent与为满足短训练时间要求而修改的变体之间的比较。虚线表示内置手写AI的性能,RL agent旨在增强其性能。通过定向修改,所提方法提高了样本效率,实现了有效的一夜训练。右图展示了一个场景中,设计师识别出不良行为后,标准SAC微调与本文提出的微调策略之间的比较。该方法提供了比传统SAC微调更有效的替代方案,能够在约2小时内实现定向行为纠正。
图2:在EA SPORTS FC 25中使用本文方法的训练性能。左图展示了使用标准SAC训练agent与为满足短训练时间要求而修改的变体之间的比较。虚线表示内置手写AI的性能,RL agent旨在增强其性能。通过定向修改,所提方法提高了样本效率,实现了有效的一夜训练。右图展示了一个场景中,设计师识别出不良行为后,标准SAC微调与本文提出的微调策略之间的比较。该方法提供了比传统SAC微调更有效的替代方案,能够在约2小时内实现定向行为纠正。
推理约束也是个硬骨头。游戏需要在低端主机上运行,留给AI推理的预算只有200微秒/次。EA团队选用了5层MLP,每层256个隐藏单元,SiLU激活函数+层归一化,总参数量约30万,推理耗时170微秒,刚好卡在预算内。最终训练出的守门员不仅行为被玩家评价为“更像真人”,扑救率还比手写系统提高了10%。这是一个模块化替换的完美范例——只改了定位模块,却带来了质的飞跃。
插图

案例2:Battlefield 6士兵的感知与移动革新

再来看看射击游戏。Battlefield 6里的士兵AI原本是行为树(BT)加GOAP的组合,但走路僵硬得像提线木偶——老爱沿着NavMesh给出的路径走,不会随机应变。论文的目标是用RL改进地面士兵的移动系统,让移动更自然。
这个场景的训练速度压力比足球小一些,因为可以在无头服务器上并行跑多个实例,最多同时240个agent并行,用PPO算法2小时就能搞定。但真正的难点在于观测表示。很多研究用射线投射或者第一人称视觉来做感知,但这些方式计算开销大。论文团队发现:游戏中其实已经有一张高度图,把它重构成一张以agent为中心的占据地图(Occupancy Map),50×50像素,每个像素标识agent、地形、障碍物或目标点。这样既利用了游戏引擎已有的数据结构,又避免了额外计算。
图3:Battlefield 6中探索的感知模式。左:24条射线的射线扇形,密度足够高,可以检测agent周围10米半径内的所有障碍物。右:50×50大小的占据地图。每个像素颜色代表:agent(黄色)、地形(紫色)、障碍物(蓝色)或目标航点(绿色)。当航点超出范围时,会映射到占据地图的边界作为方向指示器。
图3:Battlefield 6中探索的感知模式。左:24条射线的射线扇形,密度足够高,可以检测agent周围10米半径内的所有障碍物。右:50×50大小的占据地图。每个像素颜色代表:agent(黄色)、地形(紫色)、障碍物(蓝色)或目标航点(绿色)。当航点超出范围时,会映射到占据地图的边界作为方向指示器。
实验对比(图4)显示:占据地图与射线投射在训练性能上不相上下,但占据地图的构建时间仅需14微秒,比射线投射(27微秒)快了约2倍。这意味着在推理约束下,占据地图是更优的选择。不过论文也承认,目前占据地图不支持多层环境、垂直结构、动态障碍物和破坏效果,还需要进一步研究。
图4:Battlefield 6中使用射线(蓝色)和占据地图(橙色)进行agent训练的对比。左图:平均回合奖励。右图:agent在设定的500步限制内成功找到目标航点的平均成功率随时间的变化。从图中可以看出,两种方法达到了可比的性能。然而,占据地图的计算速度大约快了2.0倍,使得该方法在游戏生产环境中更具吸引力。
图4:Battlefield 6中使用射线(蓝色)和占据地图(橙色)进行agent训练的对比。左图:平均回合奖励。右图:agent在设定的500步限制内成功找到目标航点的平均成功率随时间的变化。从图中可以看出,两种方法达到了可比的性能。然而,占据地图的计算速度大约快了2.0倍,使得该方法在游戏生产环境中更具吸引力。
最终效果(参见之前放的图5)一目了然:RL增强的士兵移动轨迹更平滑、更自然,而手写系统由于路径点离散化,轨迹僵硬得像机器人。此外,论文还展示了一个关键验证:将RL移动agent嵌入到完整的BT中,与手写对手进行1v1对战,20局中RL agent赢了11局。这说明模块化替换并不会降低整体性能,反而因为行为更真实,看起来更有“人情味”。
插图

未来方向:设计师在环与高效微调

论文虽然展示了两个成功的案例,但也坦诚指出了目前RL在游戏AI中推广面临的瓶颈,并提出了几个值得投入的研究方向:

设计师在环(Designers-in-the-Loop)论文认为,RL系统应该把设计师(而非工程师)当作主要用户。设计师需要能够直观地控制agent的“性格”——比如让守门员更爱前压,或者让士兵更犹豫。一个能让设计师通过偏好、演示或简单反馈来引导训练的工具,将是游戏AI未来的关键。

高效网络与快速训练(Efficient Networks and Fast Training)虽然论文已经将SAC训练从4天压到12小时,但更理想的是能在一两个小时内完成重训。此外,推理侧也需要更小、更快的架构,比如非对称演员-评论家结构。

微调与行为纠正(Fine-Tuning and Correcting Behaviors)游戏生命周期中需要不断修复bug和漏洞,RL agent的微调很容易陷入灾难性遗忘。论文的RaE+场景训练方法虽然有效,但仍有改进空间。设计更鲁棒的持续学习算法,是实用化的必由之路。

全文看下来,龙哥最大的感受是:这篇论文没有高高在上的理论推导,而是踏踏实实踩在工程的泥地里,告诉你真实世界的RL落地有多难,又该如何一步步解决。它不是一篇“新算法”论文,而是一篇愿景与实战总结,对于所有想将RL引入产品的团队,都有极高的参考价值。
插图

总结与展望

EA这篇论文为RL在游戏AI中的工业级应用树立了一个标杆。核心贡献有三:第一,系统性地归纳了RL在3A游戏生产中必须满足的七大要求;第二,通过两个真实的商业游戏案例展示了满足这些要求的可行方案;第三,指明了未来需要攻关的方向。论文没有去标榜“超越SOTA”多少个百分点,而是用实战经验告诉我们:RL不是万能药,但用对了地方,能让游戏AI从“脚本”进化到“有灵魂”。
展望未来,随着RL训练效率进一步提升、网络架构更加轻量化、以及设计师工具的成熟,我们有理由相信,未来的3A大作中,NPC将不再是“背板机器人”,而是真正能给你带来惊喜和沉浸感的“虚拟同伴”。龙哥期待看到更多这样的实战论文,让AI离玩家更近一步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文解决了什么问题?论文主要解决了如何将深度强化学习(RL)实际部署到商业3A游戏AI中的问题。它指出了传统手写AI的局限性,并提出了一套满足短训练时间、可控制性、模块化、可维护性、Bug修复、真实性和推理约束等七大要求的RL框架。通过在EA SPORTS FC 25的守门员定位和Battlefield 6士兵移动两个真实案例中的成功实践,证明了RL可以增强而非替代传统AI,使NPC行为更真实、更沉浸。

SAC和PPO分别是什么?论文为什么选它们?SAC是一种基于最大熵的深度强化学习算法,擅长样本效率;PPO是一种稳定且实现简单的策略梯度算法。在EA SPORTS FC 25中,由于游戏模拟速度慢,样本效率是关键,所以选了SAC。在Battlefield 6中,可以并行跑240个agent,数据生成快,因此更看重稳定性和计算效率,所以选了PPO。

论文中提到的“模块化”是什么意思?为什么很重要?模块化是指RL agent只替换游戏AI系统中的一小部分功能,而不是替代整个AI。例如在EA SPORTS FC 25中,只替换了守门员的“定位”模块,而扑救等其他模块仍保持原样。这样做的优势是:开发风险低、便于设计师保留对手写模块的精细控制、训练更容易。论文认为端到端RL系统在游戏开发中不实用,因为游戏需要高度的可控性和可调试性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★✰✰论文并非提出全新的RL算法,而是将现有RL方法进行了面向工业的工程改良,提出了模块化替换的策略和一套面向生产的需求框架。创新主要体现在系统级和问题驱动的方法论上。

实验合理度:★★★★✰实验基于两款真实的商业3A游戏,场景真实可靠;对比了手写AI和标准RL baseline,且考虑了训练时间、推理速度、行为真实性等多维指标。不足在于缺少与其他RL工业应用的横向对比。

学术研究价值:★★★★✰本文系统性地总结了RL在游戏AI工业落地中的七大挑战,为后续研究者提供了清晰的“问题清单”;两个案例展示了如何针对工程约束调整RL方法,对推动RL走向实际应用有重要启发意义。

稳定性:★★★✰✰论文展示的RL agent在游戏环境中表现稳定,行为一致,且通过微调可以修复漏洞。但稳定性依赖于训练时的场景覆盖,遇到未训练过的极端情况可能表现不佳。

适应性以及泛化能力:★★★✰✰论文针对两款完全不同的游戏类型都成功应用了RL,说明方法有一定泛化性。但占据地图表示依赖游戏引擎已有的数据结构,对没有高度图的引擎可能不适用。

硬件需求及成本:★★★★★无论是训练还是推理,论文都高度重视硬件成本。训练效率优化到一晚可完成,推理模型仅30万参数、170微秒延迟,可以在低端主机上实时运行。

复现难度:★★✰✰✰论文没有公开代码和训练环境,使用的是EA内部未公开的商业游戏,外部研究者几乎无法复现。不过论文详细描述了方法论和关键技巧,有一定参考价值。

产品化成熟度:★★★★✰论文的两个案例都是直接在产品中使用的方法,说明已经过产品级验证。但RL系统仍依赖手工设计的奖励函数和训练场景,需要持续维护。

可能的问题:论文主要展示了成功案例,但对失败案例、调试过程的困难提及不多;另外,MLP+占据地图的感知方式还无法处理复杂环境,实际游戏中的场景远比测试复杂,论文的鲁棒性验证稍显不足。


主要参考文献

[1] Vinyals, O., et al. "Grandmaster level in StarCraft II using multi-agent reinforcement learning." Nature, 2019.
[2] Fuchs, F., et al. "GT Sophy: A Reinforcement Learning Agent for the Racing Game Gran Turismo." Nature, 2022.
[8] Bergdahl, J., et al. "Deep Reinforcement Learning for Game Testing." In IEEE Conference on Games, 2023.
[11] Sestini, A., et al. "Scenario-based Training for RL-Augmented Game AI." 2024.
[18] Haarnoja, T., et al. "Soft Actor-Critic: Off-Policy Maximum Entropy Deep RL with a Stochastic Actor." ICML, 2018.
[19] Fedus, W., et al. "Replay across Experiments: A Stateful Approach to Continual Reinforcement Learning." NeurIPS, 2020.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。