← 返回 PaperDaily 视觉与图像

ETH Zurich新作:纳米无人机部署提速1.6倍

这篇论文最值钱的不是“又做了一个能飞的无人机”,而是把纳米无人机上最烦人的事——模型训练、量化、部署、控制闭环——尽量自动化了。结果很实在:内存减半、推理提速,真机里还能避障、转弯、跑长廊。

ETH Zurich新作:纳米无人机部署提速1.6倍
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最值钱的不是“又做了一个能飞的无人机”,而是把纳米无人机上最烦人的事——模型训练、量化、部署、控制闭环——尽量自动化了。结果很实在:内存减半、推理提速,真机里还能避障、转弯、跑长廊。


原论文信息如下:
论文标题:
Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs
发表日期:
2026年07月
发表单位:
ETH Zurich, University of Bologna, USI-SUPSI
原文链接:
https://arxiv.org/pdf/2607.12593v1.pdf
开源代码链接:
https://github.com/pulp-platform/pulp-dronet
项目链接:
https://github.com/pulp-platform/pulp-dronet

纳米无人机自主飞行:从理念到现实

纳米无人机这类设备,最难的不是“飞起来”,而是“飞得像个正常人”。机身只有十厘米左右,电池、摄像头、算力、通信链路全都挤在一起,留给算法的空间小得可怜。传统的同时定位与建图(SLAM)方案,放在这种平台上基本属于“让小电驴拉货车”,想法很美,现实很骨感。
这篇工作抓住的核心问题很直接:如何把视觉神经网络真正“稳稳当当地”部署到纳米无人机上,并且让它在真实环境里跑得更快、更省电、更像回事。 论文没有停留在“模型精度不错”这种纸面成绩,而是把训练、量化、代码生成、板级集成、飞控联动一路打通,最后落到闭环飞行表现上。这个路线很朴素,但也很硬核:能飞,才算数。
封面
图1:PULP-Dronet 项目在纳米无人机上的演进示意。它不是单纯换了一个更大的网络,而是把“机载视觉导航”这件事从手工调参,推进到自动化部署与真实飞行验证。
先把背景说人话一点:这类系统通常由两部分组成。前端摄像头负责看路,后端神经网络负责判断“前面会不会撞”“该往哪边转”。在更大的无人机上,这些任务可以丢给强一点的板卡、甚至边缘 GPU;但在 Crazyflie 2.1 这种口袋级平台上,算力和功耗都很紧,必须依赖超低功耗多核 SoC。论文用的是 GreenWaves 的 GAP8,再配合 AI-deck,把视觉推理和飞控控制分开:AI-deck 负责看图和推理,主控 MCU 负责把结果变成飞行指令。
这里的关键不是“用了什么芯片”这么简单,而是把视觉感知、模型压缩、硬件映射和飞控闭环放进同一条工程链路里。很多论文只展示单独的网络推理速度,到了真机上却发现:UART 通信慢了、内存爆了、输出不稳定了、飞控跟不上了。本文显然非常清楚这些坑,所以后面的设计全部围绕“部署可行性”展开,而不是只盯着离线指标。

核心自动化部署流程:量化与硬件适配

这篇论文最值钱的地方,在于它没有把“部署”当成写脚本的体力活,而是把它拆成两个必须协同优化的阶段:量化硬件感知部署。前者解决“模型怎么变小、怎么适合整数计算”,后者解决“变小之后怎么在 GAP8 上跑得尽量快、尽量省内存”。
先说量化。这里的 量化(quantization),本质上就是把浮点数压缩成更低位宽的整数,比如从 32 位浮点压到 8 位整数。这样做的好处很现实:模型更小、访存更少、整数运算更适合这类 MCU/SoC。论文采用的是统一仿射量化(uniform affine quantization),简单说就是先把张量映射到一个整数区间,再用缩放因子还原。对纳米无人机这种平台来说,8 位量化几乎是“性价比最高的妥协”——再低会伤精度,再高又撑不住资源。
图2
图2:PULP-Dronet V1、GAPflow 版 V2、NEMO/DORY 版 V2 的残差块结构对比。可以看到,论文不是“换个名字继续跑”,而是围绕量化和部署工具对网络结构做了针对性微调。
这里还涉及两个工具链:GAPflow 里的 NNTool,以及开源路线 NEMO/DORY。前者是 GreenWaves 的工具,后者是社区开源方案。两者都能做 8 位量化,但细节不一样:NNTool 偏向把卷积、批归一化、激活等做融合处理;NEMO 则更强调量化感知训练和整数化表达。论文为了让两条链路都能顺利工作,对 PULP-Dronet 的残差块做了结构调整,比如把某些 ReLU 的位置往回挪,让量化后的张量流更容易被工具接受。听起来像“挪个激活函数”,实际上是在给部署工具让路,不然工程会卡死在奇怪的格式约束里。
再说硬件适配。GAP8 的 L1 内存只有 64KB,这意味着网络不能整块塞进去,只能切成很多 tile 分块来搬运和计算。论文把部署过程拆成“算子核 + 分块求解器”两层:底层是优化过的卷积核,上层是决定每个 tile 多大、怎么搬、怎么双缓冲。GAPflow 用 AutoTiler,NEMO/DORY 用 DORY。前者有时能把前几层大空间卷积做得更顺,后者在通道数较多的层上更占优。这个结论很工程:没有绝对最优工具,只有“谁更适合这一层”。
图3
图3:AI-deck 与 GAP8 SoC 架构,以及图像采集—推理—飞控的主循环。AI-deck 负责感知,主板 MCU 负责把感知结果变成飞行命令,整个闭环不依赖外部算力。
论文还把机载通信链路也处理得很细。CNN 的输出会通过 UART 传回主控,再由飞控任务读取。为了避免飞控被推理拖慢,系统用 DMA 收数据,收到固定字节后再触发中断。说白了,就是别让主控在那儿傻等网络结果,能并行就并行。对于这种实时系统,每一毫秒都不是虚的,因为无人机飞得越快,控制回路就越像在和时间赛跑。
这里顺手解释一个容易混的缩写:GAP8 是 GreenWaves Technologies 的 1+8 多核 RISC-V SoC;PULP 是 Parallel Ultra-Low-Power 的缩写,中文可理解为“并行超低功耗”计算平台;Dory 则是开源部署流程中的分块与代码生成工具。论文把这些东西拼起来,不是为了名词好看,而是为了让模型真能落地。

PULP-Dronet的进化:V2版本性能提升

PULP-Dronet 不是从零开始的新模型,而是在原始 DroNet 思路上的持续工程化改造。它本来就是一个很浅的残差网络,输出两个东西:一个是“前面撞不撞”的碰撞概率,另一个是“该往哪边转”的转向角。问题在于,原版虽然能跑,但部署成本不低,且在更严格的机载环境里还有进一步压缩和加速的空间。
V2 的改进可以概括成一句话:在不明显伤害预测能力的前提下,把网络变得更适合 8 位整数化和硬件映射。 这不是“加大模型容量”的老套路,而是反过来做减法:更少的内存占用、更快的推理、更少的搬运开销。对纳米无人机来说,这种减法比堆参数有用得多,因为电池不会因为你参数写得漂亮就多送一格电。
图4
图4:GAP8 在最节能配置下的功耗波形。论文说明了这套平台并不是“能跑就行”,而是能在明确功耗预算下工作,适合真正的机载场景。
从结果上看,V2 在自动化部署后实现了大约 2 倍内存占用下降1.6 倍推理加速,而精度保持在与原版相近的水平。这里最值得注意的不是某个单项指标“特别炸裂”,而是三件事同时成立:模型更小、速度更快、真机行为更稳。很多工作要么只快不准,要么只准不快;这篇论文至少在工程上把平衡做出来了。
更有意思的是,论文还补了一处飞控逻辑:当网络输出不够强时,不再直接“硬上”,而是通过积分项和速度衰减策略,让无人机更保守地处理不确定场景。这个设计很像老司机开车时的潜台词:看不清就别逞强,先把速度收住。对于真实机器人系统,这种“保守但不蠢”的策略往往比单纯追求高分更重要。🤨
图5
图5:图像采集与控制主循环示意。AI-deck 持续做感知,飞控主板读取结果并转换成速度与转向命令,形成闭环控制。

实体环境验证:避障、转向与长航飞行

真正能说明问题的,永远不是实验室里的离线曲线,而是真机在房间、走廊、狭窄通道和街道里会不会翻车。本文在 Vicon 动捕房间、办公空间、管道式狭窄通道以及城市街景中做了闭环测试,验证的重点也很清楚:避障、转向、长航飞行和环境泛化
图6
图6:避障实验设置与不同速度下的实飞测试。论文通过扫不同目标速度,观察无人机在动态障碍出现时的反应能力。
在避障任务中,论文展示了无人机面对突然出现的动态障碍时,能够在较短距离内刹停,并且刹停速度和刹车空间的比值优于基线。这个结果的意义不只是“停住了”,而是说明网络输出经过部署与飞控重构后,能形成更稳定的控制策略。换句话说,模型不再只是“看起来会预测”,而是真的能参与控制。
图7
图7:转向任务评估。论文在包含 45° 与 90° 左转的路径上测试无人机对真实航向的跟随能力,并扫不同前向速度,找出系统可稳定工作的边界。
转向任务更能体现系统是否“懂路”。论文让无人机在有明显拐弯的路径上飞行,观察它能否保持在通道中间并完成转角。结果显示,V2 在更高速度下仍能维持较稳的跟踪表现,而基线版本更早出现失稳。这说明自动化部署带来的不仅是速度提升,还有控制链路的整体响应改善。
最打动人的其实是长航飞行。 论文报告了在 110 米走廊里完成连续飞行,也在城市街景中记录到更长的飞行时间。对于纳米无人机来说,长航不是“飞久一点”这么简单,而是说明它的推理、控制和能耗分配已经进入一个可用区间。若系统每帧都要卡顿、每次转向都要犹豫,那飞得再久也只是漂着,不是真正自主。
图8
图8:训练样本与真实测试场景示意。论文覆盖了走廊、办公室、狭窄管道和街景等环境,用来观察模型在未见场景中的泛化能力。
表2
表2:回归与分类主结果。该表展示了不同部署流程下的预测表现,核心结论是:在更强量化和自动化部署之后,模型精度基本保持住了。
表3
表3:转向角误差与实际平均速度。这个结果说明,部署优化不只是让网络“跑得更快”,也让系统能在更高速度下维持可接受的转向误差。
表4
表4:110 米走廊飞行时间与平均速度。该表用于证明系统在长距离连续飞行中仍能保持稳定控制。
表5
表5:多场景闭环飞行评估。这里重点看的是平均飞行时间与成功率,能直观看出系统在不同环境中的稳定性。
如果结合项目介绍里的演示视频来看,这篇论文的价值就更直观了:它不是做一个“能在视频里飞”的 demo,而是把一套可复用的软件栈开源出来,让别人能在 Crazyflie 2.1 上复现、改造、继续往上叠任务。对于研究社区来说,这种“能跑的底座”往往比一堆漂亮曲线更有生命力。

结论与未来展望:走向更智能的纳米无人机

这篇论文最值得肯定的地方,是它把“纳米无人机上跑深度学习”这件事,从一个容易被演示视频包装的概念,变成了一条相对完整的工程路线:训练、量化、部署、通信、控制、真机验证,全部串起来了。尤其是自动化部署这一步,减少了大量手工调参和试错成本,这对任何要做机载智能的人都很现实。
不过,这类方法也有天然边界。首先,8 位量化和固定硬件平台的绑定较强,换芯片、换摄像头、换飞控,部署链路都可能要重新适配。其次,论文主要验证的是受控环境下的闭环飞行,面对光照剧烈变化、强风、遮挡和更复杂动态障碍时,系统鲁棒性还需要继续加强。最后,当前网络输出的功能仍然偏“导航基础款”,要进一步走向更复杂的自主任务,还得给系统留出更多算力和模块接口。
但从研究趋势看,这条路是对的。未来的纳米无人机不太可能靠单一模型解决所有问题,更可能是“轻量视觉感知 + 任务调度 + 低功耗多核加速 + 可靠飞控”的组合拳。本文给出的启发是:别只盯着模型分数,真正重要的是让模型在硬件上活下来、跑得稳、飞得久。 这句话听起来朴素,做起来一点都不朴素。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“纳米无人机上的视觉神经网络怎么自动化部署、怎么跑得快、怎么还能真机可用”这个老大难问题。不是只做离线推理,而是把模型、硬件和飞控一起打通。

文中的 PULP、GAP8、AI-deck 分别是什么?PULP 是并行超低功耗计算平台;GAP8 是 GreenWaves 的 1+8 多核 RISC-V SoC;AI-deck 是给 Crazyflie 用的可插拔计算板,集成了 GAP8、摄像头和存储,负责机载视觉推理。

为什么 8 位量化和分块部署这么重要?因为纳米无人机的内存和功耗都太紧了。8 位量化能显著减小模型和加速整数运算,分块部署则让模型能塞进只有 64KB 的 L1 内存里工作,否则网络根本跑不完整。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

创新点不在“发明了一个全新网络”,而在把自动化部署、量化与真机控制闭环整合得比较完整。思路不花哨,但工程价值很实。

实验合理度:★★★★☆

对比了不同工具链、不同任务和不同环境,还把速度、功耗和行为表现放在一起看,整体比较像一个能说服工程师的实验设计。

学术研究价值:★★★★☆

价值主要在方法论:自动化部署如何服务于机载智能系统。对做边缘 AI、机器人和超低功耗部署的人都有参考意义。

稳定性:★★★☆☆

在受控场景里表现不错,但对复杂自然环境、强扰动和更长时间飞行的鲁棒性仍需要更多验证。

适应性以及泛化能力:★★★☆☆

跨走廊、办公室、管道和街景的泛化已经展示出来了,但场景再复杂一点,模型和控制策略还得继续加固。

硬件需求及成本:★★★★☆

只用纳米级平台和超低功耗 SoC 就能完成闭环飞行,这点很强;但硬件栈仍然偏专用,不是随便一块板子就能复现。

复现难度:★★★☆☆

代码开源是加分项,但涉及特定硬件、工具链和飞控环境,复现门槛仍然不低。

产品化成熟度:★★★☆☆

在 Crazyflie 这类平台上已经很接近可用系统,但要进入更广泛产品形态,还需要更强鲁棒性和更通用的硬件适配。

可能的问题:自动化部署做得很扎实,但方法仍强依赖特定硬件与受控测试环境,离“拿来就能在任意纳米无人机上稳飞”还有距离。


主要参考文献

1. Vlad Niculescu, Lorenzo Lamberti, Francesco Conti, Luca Benini, Daniele Palossi. Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs. arXiv:2607.12593v1, 2026.
2. PULP-Dronet 开源项目与代码:https://github.com/pulp-platform/pulp-dronet
3. 演示视频:https://youtu.be/41IwjAXmFQ0;https://youtu.be/Cd9GyTl6tHI

纳米无人机最怕什么?不是飞不起来,是AI太重、板子太小。想继续看这种“把模型塞进硬件缝里”的论文拆解,欢迎加入龙哥读论文粉丝群,和一群同样爱抠部署细节的人一起聊模型、聊工程、聊落地。扫描二维码或加 kangjinlonghelper,备注研究方向+地点+学校/公司+昵称,进群别迷路。

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。