← 返回 PaperDaily 视觉与图像

FPV无人机竞速新方法:失误更少、学得更快

这篇论文挺有意思,核心不是让AI帮人飞得更稳,而是让AI知道什么时候该帮、什么时候该收手。宾大这套L2C把“教练”这事做成了强化学习问题,FPV无人机实验也给出了挺硬的结果。

FPV无人机竞速新方法:失误更少、学得更快
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文挺有意思,核心不是让AI帮人飞得更稳,而是让AI知道什么时候该帮、什么时候该收手。宾大这套L2C把“教练”这事做成了强化学习问题,FPV无人机实验也给出了挺硬的结果。


原论文信息如下:
论文标题:
AI Coaching for Accelerating Human Skill Development with Reinforcement Learning
发表日期:
2026年06月
发表单位:
University of Pennsylvania; Johns Hopkins University
原文链接:
https://arxiv.org/pdf/2606.27375v1.pdf

引言

AI 如果总替人把活干完,短期成绩可能很好,长期却容易把人养成“只会点确认”的选手。宾大这篇 L2C 反其道而行之:把 AI 训练成会判断时机的教练,目标不是帮人赢一把,而是帮人真正学会。

文章上半部分子标题


从“保姆”到“教练”:AI如何不越俎代庖?


“教练博弈”:让AI学会何时出手,何时闭嘴


L2C框架:量化技能、模拟学习、自适应干预


文章下半部分子标题


实战检验:FPV无人机竞速中的显著进步


总结与展望:AI赋能,而非替代


龙迷三问


龙哥点评


主要参考文献

[1] M. Kapur. Productive failure. Cognition and instruction, 26(3):379–424, 2008.
[2] J. Metcalfe. Learning from errors. Annual review of psychology, 68(1):465–489, 2017.
[3] P. R. Wurman, S. Barrett, K. Kawamoto, J. MacGlashan, K. Subramanian, T. J. Walsh, R. Capobianco, A. Devlic, F. Eckert, F. Fuchs, et al. Outracing champion Gran Turismo drivers with deep reinforcement learning. Nature, 602(7896):223–228, 2022. doi: 10.1038/s41586-021-04357-7.

从“保姆”到“教练”:AI如何不越俎代庖?

封面
图4:L2C 在 FPV 无人机竞速中的教练式干预示意。它不是一路“代打”,而是根据学员状态决定什么时候扶一把、什么时候放手让人自己摔一跤。
很多 AI 系统的默认姿势,都是“我来替你做完”。短期看,任务完成得确实漂亮;长期看,人却容易被养成“只会点确认”的熟练工具人。这个问题在驾驶、飞行、机器人操控这类高频训练任务里尤其明显:AI 一直兜底,人的错误少了,学习机会也跟着少了。
这篇论文的切入点很有意思:不是问“AI 能不能帮人飞得更稳”,而是问“AI 能不能帮人飞得更会”。作者把目标从当下表现换成了长期独立能力,这一下就把“保姆型 AI”和“教练型 AI”区分开了。
论文提出的核心思路叫 Learning to Coach,简称 L2C,可以理解成“教练也要学”。它不是简单把专家策略塞给人,而是训练一个 AI 去判断:此刻该不该介入、介入多少、以及介入后会不会让学员真的学会。
插图
这思路挺像真正厉害的教练:不是每次都冲上去替你打,而是知道什么时候该扶、什么时候该骂、什么时候该闭嘴。AI 如果只会“全包”,那叫代练;能精准放手,才叫教练。

“教练博弈”:让AI学会何时出手,何时闭嘴

论文先把问题讲得很直白:教练最难的地方,不是“会不会帮”,而是“帮到什么程度”。帮太多,学员会依赖;帮太少,学员会在无效失败里原地打转。于是作者把 AI 教练建模成一个 非合作动态博弈:学员追求眼前任务成绩,教练追求学员未来的独立能力。
这里有个关键缩写要先说清楚:POSGPartially Observable Stochastic Game,中文叫“部分可观测随机博弈”。意思是:双方都在和环境互动,但信息不完全,尤其教练看不到学员真实技能,只能通过行为去猜。
在这个设定里,学员的技能是一个隐藏变量 θ,教练只能维护一个对 θ 的信念分布。说人话就是:教练得一边看学员飞,一边在心里默念“这人到底是新手还是半熟练”,然后动态调整帮助力度。这个设定比“固定比例逐渐降辅助”聪明得多,因为真实学习从来不是匀速下坡,而是时快时慢、时进时退。
公式:自适应共享控制的动作融合
图中这个公式就是教练的“出手方式”:最终动作 a 由两部分混合而成,一部分是专家动作 π*,一部分是学员动作 aL。其中 λ 是每个控制维度上的融合系数,取值从 0 到 1。λ 越大,AI 接管越多;λ 越小,学员自己说了算。这个设计的妙处在于:它不是全局一刀切,而是可以按轴、按时刻、按场景细粒度调节。
但教练的目标不是“把这一圈飞好”,而是“让学员以后自己飞好”。所以论文定义了一个很有教练味的奖励:Value of Independence,VoI,中文可理解为“独立性价值”。它衡量的是:如果 AI 现在立刻撤手,学员接下来能飞成什么样。
公式:Value of Independence
这个公式里,rC 不是看“现在飞得多稳”,而是看“假如没了 AI,之后还能稳多久”。γ 是折扣因子,控制未来收益的重要性;πL 表示学员在当前技能水平下的行为策略;T 则描述系统状态如何随动作演化。简单讲,VoI 把 AI 的评分标准从“保你这局不翻车”改成了“让你以后少翻车”。

L2C框架:量化技能、模拟学习、自适应干预

L2C 的核心,不是把一个大模型硬塞进教练岗位,而是把“教练如何影响学习”拆成三个可训练的部分:先模拟学员,再模拟技能变化,最后学会何时介入。这样做的好处很现实:复杂问题被拆成了能在仿真器里训练的单智能体强化学习问题,难度一下子没那么吓人了。
图1
图1:L2C 的整体框架。左边是训练阶段:物理仿真器、学员动作模型、技能演化模型、专家策略一起组成训练环境;中间是共享控制:AI 把专家动作和学员动作按 λ 融合;右边是部署阶段:在真实教练过程中,系统根据对学员技能的信念 b(θ) 通过语音、视觉和共享控制多模态反馈进行指导。
先说“量化技能”。论文把学员技能 θ 离散成有限等级,并假设技能越高,学员越接近专家行为。为了在仿真中生成不同水平的学员,作者用一个基于 Boltzmann 的随机策略来模拟人类决策。Boltzmann 不是做热力学的那个梗,而是指“高价值动作更常被选中,但低技能学员会更随机”。
公式:学员动作的技能条件分布
这条公式表达的是:学员在技能 θ 下会按一个“软最大”分布选动作,Q* 越高的动作越容易被选中;而 β(θ) 会随着技能升高而增大,意味着高手更稳定、更接近最优,菜鸟则更像“动作随机游走”。这一步很关键,因为教练要先知道学员大概会怎么飞,后面才谈得上“该不该拉一把”。
接着是“模拟学习”。作者没有把“技能变化”当成黑箱,而是用一个 混合概率有限状态自动机 来近似人类在成功和失败后的学习变化。英文是 Probabilistic Finite-State Automaton, PFA,中文就是“概率有限状态自动机”。它的作用可以理解成:把“练习后技能涨没涨”这件事,变成可计算的状态转移。
图3
图3:用于模拟技能变化的混合概率有限状态自动机。系统会根据成功或失败事件,概率性地推动技能上升、下降或保持不变。它的思路很像真实训练:成功不一定立刻封神,失败也不一定全是坏事,关键看学员能不能从里面“长经验”。
论文里还有一个很重要的桥梁:训练时教练能看到技能 θ,部署时看不到,所以需要在线推断。换句话说,仿真里是“开卷考试”,现实里是“闭卷猜人”。作者用贝叶斯更新维护对技能的信念分布,依据学员在各个赛段的用时和表现,判断当前更像新手还是熟练者。
最后是“自适应干预”。训练时,作者用 PPO 来学教练策略。PPO 的全称是 Proximal Policy Optimization,中文叫“近端策略优化”。它是强化学习里比较稳的一类算法,适合在连续控制里学“什么时候该把 λ 调大,什么时候该把 λ 放小”。
表1
表1:专家策略和 L2C 教练策略的 PPO 超参数设置。论文还给出了训练流程 Algorithm 1。这里的重点不是参数多,而是训练对象分工明确:专家策略负责“会飞”,教练策略负责“会教”。
训练目标上,作者没有直接优化难估计的 VoI,而是用“技能提升”作为代理奖励。直白点说,就是先奖励“学员技能涨了多少”,再用理论结果说明这和最终的独立能力提升是对得上的。论文还给出了一个命题:如果某个教练策略更能推动学员上升到更高技能层级,那么它在评估意义上的 VoI 也会更优。这个桥搭得算比较漂亮,至少不是拍脑袋式的“感觉有效”。
公式:评估平均VoI
这里的 评估平均 VoI 是把不同初始状态下的独立表现取平均,避免某个教练策略只是“挑场景厉害”。这一步的意思很朴素:不能只看某个角落飞得好,要看整体是不是更能让人独立起飞。

实战检验:FPV无人机竞速中的显著进步

理论讲得再顺,最后还是得看真刀真枪。论文把 L2C 放进了 FPV 无人机竞速的用户研究里,场景来自高保真仿真器。这个任务挺适合检验教练能力:赛道窄、门框小、容错低,稍微一飘就撞墙,特别考验“何时该帮、何时该放”。
图2
图2:三种教练方法下的训练前后轨迹对比。旗帜表示起终点,叉号表示失败,门上方箭头表示飞行方向。训练 40 分钟后,L2C 的平均圈速下降 27.9%,明显优于两个基线方法。
实验设计上,作者找了 33 名不同飞行背景的参与者,做训练前测试、训练、训练后测试三段式流程。训练时长约 40 分钟,控制权只开放给 yaw 和 roll rate,pitch 和 thrust 则自动化处理。这个设置很现实:既保留了人类操作的学习空间,又避免把任务复杂到让新手直接原地自闭。
(此处原文未提供可用的额外结果图,以下直接使用论文主结果图。)
图4
图4:训练后,L2C 组在圈速和失败次数上都显著下降,同时主观问卷里的安全感、表现、控制感和满意度也高于两个基线。这个结果很关键,因为它说明 L2C 不只是“让系统看起来更聪明”,而是真的在帮人学会。
数值上,L2C 的平均圈速提升最明显:训练后相较训练前,圈速平均下降 27.9%,失败数平均减少 3.52 次/圈,且统计上显著。对比之下,规则式衰减辅助(RBF)虽然也有改善,但圈速提升不稳定;最小侵入式辅助(MIA)则更像“安全护栏”,对学习促进有限。换句话说,L2C 的优势不只是“更安全”,而是“更会教”。
图5
图5:L2C 根据估计技能和物理位置自适应调节辅助强度。左图是较低技能水平,右图是较高技能水平。可以看到,系统会在门口等关键位置明显加大介入,而在普通路段则更愿意放手。
这张图很能说明问题:L2C 不是平均用力,而是“该出手时出手”。对新手,它会给更多帮助;对更熟练的学员,它会减少干预;而在门框附近这类高风险区域,干预强度会突然上升。这个行为模式非常像一个懂行的教练——平时不吭声,关键点一嗓子能救命。
图8
图8:用户在 FPV 无人机教练研究中看到的交互界面。界面里除了共享控制,还会配合语音和视觉提示,把“为什么要帮、哪里在偏、下一步怎么改”尽量讲清楚。
论文还给出了一些训练过程图和初始组间平衡情况,说明不同组在训练前没有明显偏差,避免“某组本来就更强”这种老戏码。整体来看,这个实验设置比较扎实:同样的专家策略、相同的语音和视觉提示、相近的起点,最后还能拉开差距,说明差异主要来自教练策略本身。
图9
图9:训练前各组的初始圈速和失败数分布。这个图的作用很朴素:先证明大家起跑线差不多,再谈谁教得更好,不然结论容易变成“运气学”。

总结与展望:AI赋能,而非替代

这篇论文最值得记住的,不是“AI 又赢了”,而是它把 AI 的角色从“替人干活”改成了“帮人变强”。这个转变看起来只是目标函数换了一行,实际上会影响整个系统设计:奖励怎么定义、状态怎么估计、介入怎么调节、实验怎么验证,全都得跟着改。
从应用角度看,L2C 不只适用于无人机。只要任务满足“人类需要练习、AI 能提供共享控制、技能成长比单次表现更重要”这几个条件,它都可能有用。比如远程操控、驾驶训练、机械臂操作,甚至某些需要长期养成的专业技能训练,都可以考虑这种“扶一把但不包办”的思路。
当然,论文也不是没有坑。首先,技能模型还是仿真驱动的,现实人类学习远比自动机复杂;其次,当前系统的语音和视觉提示还是规则触发,真正的多模态教练还没完全打通;最后,部署时对技能信念的估计如果偏了,教练就可能“该帮时不帮、该闭嘴时乱指挥”。所以它更像一个有希望的框架,而不是已经能直接上岗的万能教练。
不过方向是对的。未来真正厉害的 AI,不一定是把人类工作全包了,而是能在恰当时刻把人往前推一小步,既不越俎代庖,也不袖手旁观。这个“推一小步”,可能比“替你做完”更难,但也更有价值。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“AI 该怎么帮助人学会,而不是只帮人完成”的问题。论文把教练目标从短期表现改成长期独立能力,并用强化学习学出一个会放手的 AI 教练。

VoI 和技能提升是什么关系?VoI 是 Value of Independence,意思是“如果现在没了 AI,学员还能表现多好”。训练时直接奖励技能提升,是为了用一个可计算的代理目标去逼近这个更难估计的教练目标。

PFA、PPO 这些缩写分别是什么?PFA 是 Probabilistic Finite-State Automaton,概率有限状态自动机,用来模拟技能在成功/失败后的变化;PPO 是 Proximal Policy Optimization,近端策略优化,是用来训练教练策略的强化学习算法。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆ 这篇工作的想法不在“模型更大”,而在“目标更对”。把 AI 从代练改造成教练,这个切口很新,也很有研究延展性。

实验合理度:★★★★☆ 33 人的用户研究、前后测、两类基线、统一专家策略,整体比较扎实。唯一的问题是样本还不算大,更多场景仍需验证。

学术研究价值:★★★★★ 这篇论文把“人机协作”往“人类成长”方向推进了一步,理论上很有意思,后续还能影响教育、训练、辅助驾驶等很多领域。

稳定性:★★★☆☆ 仿真里表现不错,但真实人类学习差异太大,技能推断一旦偏了,教练策略就可能失准。

适应性以及泛化能力:★★★☆☆ 对“需要长期训练的连续控制任务”很适合,但对完全离散、强语言交互的任务还得重新设计反馈机制。

硬件需求及成本:★★★☆☆ 训练阶段需要高保真仿真和强化学习算力,部署阶段成本倒不高,但前期建模和训练并不轻松。

复现难度:★★★☆☆ 论文给了方法框架和实验设置,但完整复现仍依赖仿真环境、用户实验与技能推断模块,门槛不算低。

产品化成熟度:★★★☆☆ 更像“可落地的原型框架”,在训练、陪练、辅助操控场景有希望,但要大规模上线还需要更稳的技能估计和更丰富的多模态反馈。

可能的问题:理论漂亮,现实难点在于技能估计误差和人类差异太大;如果反馈不够准,教练就可能从“因材施教”变成“瞎指挥”。


主要参考文献

[3] P. R. Wurman, S. Barrett, K. Kawamoto, J. MacGlashan, K. Subramanian, T. J. Walsh, R. Capobianco, A. Devlic, F. Eckert, F. Fuchs, et al. Outracing champion Gran Turismo drivers with deep reinforcement learning. Nature, 602(7896):223–228, 2022.
[4] E. Kaufmann, L. Bauersfeld, A. Loquercio, M. Muiller, V. Koltun, and D. Scaramuzza. Champion-level drone racing using deep reinforcement learning. Nature, 620(7976):982–987, 2023.
原文链接:https://arxiv.org/pdf/2606.27375v1.pdf

AI别总当“代打”,也可以当“教练”🤘。想看更多这种能落地、会做人、还会放手的论文解读,欢迎加入龙哥读论文粉丝群,和一群爱拆论文的朋友一起把前沿吃透~

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。