论文标题:
Lightweight Image Classification of Raptor Species for Edge Devices: Rare-Species Dataset Expansion via Video Frame Extraction, Knowledge Distillation, and TensorRT Deployment
发表日期:
2026年7月
发表单位:
Foundation for Computational Science (FOCUS), Japan
风力发电被看作清洁能源的标杆,但在日本北海道,每年冬天都会有白尾海雕被旋转的叶片击中。不仅是白尾海雕,虎头海雕(IUCN易危物种)、金雕等猛禽,只要飞进风力发电场的范围,就面临同样的风险。
为了解决这个问题,业界通用的做法是架设监控摄像头,实时识别飞过的鸟是不是受保护的猛禽。一旦确认,就立刻让风机停机,等鸟飞走再恢复运行。这个逻辑听起来很直接:摄像头拍摄→图像分类→控制风机,但在实际部署中却踩到一个硬坑。
这个坑就是:风力发电机旁边的边缘设备,比如一块NVIDIA Jetson Orin Nano开发板,功耗只有7–15W,算力跟一台普通笔记本电脑差不多。而目前最高精度的分类模型——DINOv2-L,参数量高达3.04亿,在这种设备上根本无法实时跑起来。如果换成轻量模型,精度又会掉下去,尤其是碰到极其相似、连鸟类专家都要仔细观察才能区分的物种类别时。
更棘手的一个场景是,白尾海雕和虎头海雕同属海雕属,形态极其相似。在实际监控中,模型很容易把白尾海雕误判成虎头海雕——这种单向误判可大可小:一旦把常见种错认成稀有物种,就会触发不必要的停机,影响发电效率;而如果反过来把易危物种漏掉,则违背了保护的初衷。
本文作者来自日本计算科学基金会(FOCUS),针对这6种受保护猛禽(金雕、白尾海雕、虎头海雕、鹰雕、苍鹰、白头鹞),部署了一套用于边缘计算的轻量化分类系统。全篇论文没有堆砌花哨的术语,而是围绕一个很务实的思路展开:数据不够就补数据,补完数据让大模型再学一遍,然后再把学到的知识蒸馏给小模型,最后真正放到Jetson Orin Nano上跑出性能。
数据扩充之后,下一步是让大模型(教师)先吃透这批新数据,再把自己的知识教会给轻量模型(学生)。
本文选用的教师模型是DINOv2-L(DeiT with NO labels v2 Large,一种自监督学习的视觉基础模型,参数量304M),在ImageNet预训练的基础上专门针对这6种猛禽再微调30个epoch。微调后的教师在扩充训练集上的新测试集精度达到了0.9777,相比旧教师在新测试集上的0.8985,直接提升了7.92个百分点。
图2:DINOv2-L教师模型在不同数据条件下的性能变化。旧教师在新测试集上准确率骤降7.21个百分点,反映了数据分布漂移(distribution shift);经过11分钟的再微调(30个epoch),准确率回升至0.9777,说明教师对数据变化的适应能力非常关键。
学生模型选了三个轻量级代表:
[1] Nishikawa, T. Lightweight Image Classification of Raptor Species for Edge Devices: Rare-Species Dataset Expansion via Video Frame Extraction, Knowledge Distillation, and TensorRT Deployment. arXiv:2607.26238, 2026.[2] Oquab, M. et al. DINOv2: Learning Robust Visual Features without Supervision. arXiv:2304.07193, 2023.[3] Hinton, G. et al. Distilling the Knowledge in a Neural Network. arXiv:1503.02531, 2015.[4] NVIDIA. TensorRT: A High-Performance Deep Learning Inference Library. https://developer.nvidia.com/tensorrt