← 返回 PaperDaily
视觉与图像
ETH Zurich新作:纳米无人机部署提速1.6倍
这篇论文最值钱的不是“又做了一个能飞的无人机”,而是把纳米无人机上最烦人的事——模型训练、量化、部署、控制闭环——尽量自动化了。结果很实在:内存减半、推理提速,真机里还能避障、转弯、跑长廊。
龙哥读论文
发布于 2026-08-14 09:11:08
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最值钱的不是“又做了一个能飞的无人机”,而是把纳米无人机上最烦人的事——模型训练、量化、部署、控制闭环——尽量自动化了。结果很实在:内存减半、推理提速,真机里还能避障、转弯、跑长廊。
原论文信息如下:
纳米无人机自主飞行:从理念到现实
纳米无人机这类设备,最难的不是“飞起来”,而是“飞得像个正常人”。机身只有十厘米左右,电池、摄像头、算力、通信链路全都挤在一起,留给算法的空间小得可怜。传统的同时定位与建图(SLAM)方案,放在这种平台上基本属于“让小电驴拉货车”,想法很美,现实很骨感。
这篇工作抓住的核心问题很直接:如何把视觉神经网络真正“稳稳当当地”部署到纳米无人机上,并且让它在真实环境里跑得更快、更省电、更像回事。 论文没有停留在“模型精度不错”这种纸面成绩,而是把训练、量化、代码生成、板级集成、飞控联动一路打通,最后落到闭环飞行表现上。这个路线很朴素,但也很硬核:能飞,才算数。
先把背景说人话一点:这类系统通常由两部分组成。前端摄像头负责看路,后端神经网络负责判断“前面会不会撞”“该往哪边转”。在更大的无人机上,这些任务可以丢给强一点的板卡、甚至边缘 GPU;但在 Crazyflie 2.1 这种口袋级平台上,算力和功耗都很紧,必须依赖超低功耗多核 SoC。论文用的是 GreenWaves 的 GAP8,再配合 AI-deck,把视觉推理和飞控控制分开:AI-deck 负责看图和推理,主控 MCU 负责把结果变成飞行指令。
这里的关键不是“用了什么芯片”这么简单,而是把视觉感知、模型压缩、硬件映射和飞控闭环放进同一条工程链路里 。很多论文只展示单独的网络推理速度,到了真机上却发现:UART 通信慢了、内存爆了、输出不稳定了、飞控跟不上了。本文显然非常清楚这些坑,所以后面的设计全部围绕“部署可行性”展开,而不是只盯着离线指标。
核心自动化部署流程:量化与硬件适配
这篇论文最值钱的地方,在于它没有把“部署”当成写脚本的体力活,而是把它拆成两个必须协同优化的阶段:量化 和 硬件感知部署 。前者解决“模型怎么变小、怎么适合整数计算”,后者解决“变小之后怎么在 GAP8 上跑得尽量快、尽量省内存”。
先说量化。这里的 量化(quantization) ,本质上就是把浮点数压缩成更低位宽的整数,比如从 32 位浮点压到 8 位整数。这样做的好处很现实:模型更小、访存更少、整数运算更适合这类 MCU/SoC。论文采用的是统一仿射量化(uniform affine quantization),简单说就是先把张量映射到一个整数区间,再用缩放因子还原。对纳米无人机这种平台来说,8 位量化几乎是“性价比最高的妥协”——再低会伤精度,再高又撑不住资源。
这里还涉及两个工具链:GAPflow 里的 NNTool,以及开源路线 NEMO/DORY。前者是 GreenWaves 的工具,后者是社区开源方案。两者都能做 8 位量化,但细节不一样:NNTool 偏向把卷积、批归一化、激活等做融合处理;NEMO 则更强调量化感知训练和整数化表达。论文为了让两条链路都能顺利工作,对 PULP-Dronet 的残差块做了结构调整,比如把某些 ReLU 的位置往回挪,让量化后的张量流更容易被工具接受。听起来像“挪个激活函数”,实际上是在给部署工具让路,不然工程会卡死在奇怪的格式约束里。
再说硬件适配。GAP8 的 L1 内存只有 64KB,这意味着网络不能整块塞进去,只能切成很多 tile 分块来搬运和计算。论文把部署过程拆成“算子核 + 分块求解器”两层:底层是优化过的卷积核,上层是决定每个 tile 多大、怎么搬、怎么双缓冲。GAPflow 用 AutoTiler,NEMO/DORY 用 DORY。前者有时能把前几层大空间卷积做得更顺,后者在通道数较多的层上更占优。这个结论很工程:没有绝对最优工具,只有“谁更适合这一层”。
论文还把机载通信链路也处理得很细。CNN 的输出会通过 UART 传回主控,再由飞控任务读取。为了避免飞控被推理拖慢,系统用 DMA 收数据,收到固定字节后再触发中断。说白了,就是别让主控在那儿傻等网络结果,能并行就并行。对于这种实时系统,每一毫秒都不是虚的 ,因为无人机飞得越快,控制回路就越像在和时间赛跑。
这里顺手解释一个容易混的缩写:GAP8 是 GreenWaves Technologies 的 1+8 多核 RISC-V SoC;PULP 是 Parallel Ultra-Low-Power 的缩写,中文可理解为“并行超低功耗”计算平台;Dory 则是开源部署流程中的分块与代码生成工具。论文把这些东西拼起来,不是为了名词好看,而是为了让模型真能落地。
PULP-Dronet的进化:V2版本性能提升
PULP-Dronet 不是从零开始的新模型,而是在原始 DroNet 思路上的持续工程化改造。它本来就是一个很浅的残差网络,输出两个东西:一个是“前面撞不撞”的碰撞概率,另一个是“该往哪边转”的转向角。问题在于,原版虽然能跑,但部署成本不低,且在更严格的机载环境里还有进一步压缩和加速的空间。
V2 的改进可以概括成一句话:在不明显伤害预测能力的前提下,把网络变得更适合 8 位整数化和硬件映射。 这不是“加大模型容量”的老套路,而是反过来做减法:更少的内存占用、更快的推理、更少的搬运开销。对纳米无人机来说,这种减法比堆参数有用得多,因为电池不会因为你参数写得漂亮就多送一格电。
从结果上看,V2 在自动化部署后实现了大约 2 倍内存占用下降 和 1.6 倍推理加速 ,而精度保持在与原版相近的水平。这里最值得注意的不是某个单项指标“特别炸裂”,而是三件事同时成立:模型更小、速度更快、真机行为更稳。很多工作要么只快不准,要么只准不快;这篇论文至少在工程上把平衡做出来了。
更有意思的是,论文还补了一处飞控逻辑:当网络输出不够强时,不再直接“硬上”,而是通过积分项和速度衰减策略,让无人机更保守地处理不确定场景。这个设计很像老司机开车时的潜台词:看不清就别逞强,先把速度收住。对于真实机器人系统,这种“保守但不蠢”的策略往往比单纯追求高分更重要。🤨
实体环境验证:避障、转向与长航飞行
真正能说明问题的,永远不是实验室里的离线曲线,而是真机在房间、走廊、狭窄通道和街道里会不会翻车。本文在 Vicon 动捕房间、办公空间、管道式狭窄通道以及城市街景中做了闭环测试,验证的重点也很清楚:避障、转向、长航飞行和环境泛化 。
在避障任务中,论文展示了无人机面对突然出现的动态障碍时,能够在较短距离内刹停,并且刹停速度和刹车空间的比值优于基线。这个结果的意义不只是“停住了”,而是说明网络输出经过部署与飞控重构后,能形成更稳定的控制策略。换句话说,模型不再只是“看起来会预测”,而是真的能参与控制。
转向任务更能体现系统是否“懂路”。论文让无人机在有明显拐弯的路径上飞行,观察它能否保持在通道中间并完成转角。结果显示,V2 在更高速度下仍能维持较稳的跟踪表现,而基线版本更早出现失稳。这说明自动化部署带来的不仅是速度提升,还有控制链路的整体响应改善。
最打动人的其实是长航飞行。 论文报告了在 110 米走廊里完成连续飞行,也在城市街景中记录到更长的飞行时间。对于纳米无人机来说,长航不是“飞久一点”这么简单,而是说明它的推理、控制和能耗分配已经进入一个可用区间。若系统每帧都要卡顿、每次转向都要犹豫,那飞得再久也只是漂着,不是真正自主。
如果结合项目介绍里的演示视频来看,这篇论文的价值就更直观了:它不是做一个“能在视频里飞”的 demo,而是把一套可复用的软件栈开源出来,让别人能在 Crazyflie 2.1 上复现、改造、继续往上叠任务。对于研究社区来说,这种“能跑的底座”往往比一堆漂亮曲线更有生命力。
结论与未来展望:走向更智能的纳米无人机
这篇论文最值得肯定的地方,是它把“纳米无人机上跑深度学习”这件事,从一个容易被演示视频包装的概念,变成了一条相对完整的工程路线:训练、量化、部署、通信、控制、真机验证,全部串起来了。尤其是自动化部署这一步,减少了大量手工调参和试错成本,这对任何要做机载智能的人都很现实。
不过,这类方法也有天然边界。首先,8 位量化和固定硬件平台的绑定较强,换芯片、换摄像头、换飞控,部署链路都可能要重新适配。其次,论文主要验证的是受控环境下的闭环飞行,面对光照剧烈变化、强风、遮挡和更复杂动态障碍时,系统鲁棒性还需要继续加强。最后,当前网络输出的功能仍然偏“导航基础款”,要进一步走向更复杂的自主任务,还得给系统留出更多算力和模块接口。
但从研究趋势看,这条路是对的。未来的纳米无人机不太可能靠单一模型解决所有问题,更可能是“轻量视觉感知 + 任务调度 + 低功耗多核加速 + 可靠飞控”的组合拳。本文给出的启发是:别只盯着模型分数,真正重要的是让模型在硬件上活下来、跑得稳、飞得久。 这句话听起来朴素,做起来一点都不朴素。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是“纳米无人机上的视觉神经网络怎么自动化部署、怎么跑得快、怎么还能真机可用”这个老大难问题。不是只做离线推理,而是把模型、硬件和飞控一起打通。
文中的 PULP、GAP8、AI-deck 分别是什么? PULP 是并行超低功耗计算平台;GAP8 是 GreenWaves 的 1+8 多核 RISC-V SoC;AI-deck 是给 Crazyflie 用的可插拔计算板,集成了 GAP8、摄像头和存储,负责机载视觉推理。
为什么 8 位量化和分块部署这么重要? 因为纳米无人机的内存和功耗都太紧了。8 位量化能显著减小模型和加速整数运算,分块部署则让模型能塞进只有 64KB 的 L1 内存里工作,否则网络根本跑不完整。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
创新点不在“发明了一个全新网络”,而在把自动化部署、量化与真机控制闭环整合得比较完整。思路不花哨,但工程价值很实。
实验合理度: ★★★★☆
对比了不同工具链、不同任务和不同环境,还把速度、功耗和行为表现放在一起看,整体比较像一个能说服工程师的实验设计。
学术研究价值: ★★★★☆
价值主要在方法论:自动化部署如何服务于机载智能系统。对做边缘 AI、机器人和超低功耗部署的人都有参考意义。
稳定性: ★★★☆☆
在受控场景里表现不错,但对复杂自然环境、强扰动和更长时间飞行的鲁棒性仍需要更多验证。
适应性以及泛化能力: ★★★☆☆
跨走廊、办公室、管道和街景的泛化已经展示出来了,但场景再复杂一点,模型和控制策略还得继续加固。
硬件需求及成本: ★★★★☆
只用纳米级平台和超低功耗 SoC 就能完成闭环飞行,这点很强;但硬件栈仍然偏专用,不是随便一块板子就能复现。
复现难度: ★★★☆☆
代码开源是加分项,但涉及特定硬件、工具链和飞控环境,复现门槛仍然不低。
产品化成熟度: ★★★☆☆
在 Crazyflie 这类平台上已经很接近可用系统,但要进入更广泛产品形态,还需要更强鲁棒性和更通用的硬件适配。
可能的问题: 自动化部署做得很扎实,但方法仍强依赖特定硬件与受控测试环境,离“拿来就能在任意纳米无人机上稳飞”还有距离。
主要参考文献
1. Vlad Niculescu, Lorenzo Lamberti, Francesco Conti, Luca Benini, Daniele Palossi. Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs. arXiv:2607.12593v1, 2026.
2. PULP-Dronet 开源项目与代码:https://github.com/pulp-platform/pulp-dronet
3. 演示视频:https://youtu.be/41IwjAXmFQ0;https://youtu.be/Cd9GyTl6tHI
纳米无人机最怕什么?不是飞不起来,是AI太重、板子太小。想继续看这种“把模型塞进硬件缝里”的论文拆解,欢迎加入龙哥读论文粉丝群,和一群同样爱抠部署细节的人一起聊模型、聊工程、聊落地。扫描二维码或加 kangjinlonghelper,备注研究方向+地点+学校/公司+昵称 ,进群别迷路。