代尔夫特理工新作:MoMQ让实时视频多路径传输延迟直降70.3%
多路径传输一直在“盲人摸象”——调度器只看字节,不懂视频帧的关键程度。代尔夫特理工这篇MoMQ,首次把MoQT的元数据变成路径调度规则,在Starlink+WiFi真实测试床上把P99.9延迟从384.7ms砍到114.1ms,实时视频终于能跑进150ms交互预算。想法巧妙,实验扎实,值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
多路径传输一直在“盲人摸象”——调度器只看字节,不懂视频帧的关键程度。代尔夫特理工这篇MoMQ,首次把MoQT的元数据变成路径调度规则,在Starlink+WiFi真实测试床上把P99.9延迟从384.7ms砍到114.1ms,实时视频终于能跑进150ms交互预算。想法巧妙,实验扎实,值得一读。
想象一下你在云VR里看演唱会,网络突然卡顿,画面立刻变成马赛克甚至崩溃——SplatStream就是来终结这种尴尬的。它让动态3D高斯泼溅像视频一样支持自适应流传输,带宽不够就降质量但不中断,从粗糙到精细丝滑过渡。是不是很香?
继7月聊过北大用0.005bpp还原视频细节之后,微软亚洲研究院带着GenVC来了——这是**首个面向视频压缩、从头训练的像素域视频扩散模型**。它不自欺欺人地继承百亿参数预训练骨架,而是用5.78亿参数干到码率省六成、解码15fps。更关键的是,它发现直接暴力蒸馏会让运动卡死,于是提出了**自适应分数蒸馏**来精准纠偏。想搞懂视频压缩+扩散模型的最强实战,
继2026年6月推过一篇强化学习搞定视频压缩之后,这回ABR领域又来了一个狠角色。电通大团队不仅一针见血地指出:多年来用来测试强化学习ABR策略泛化性的工具(只看平均带宽等统计量)是错的!还顺手把“规则”和“学习”的边界给消融了。 方法是真硬核:把经典码率选择的规则,直接以几何锚点的形式嵌进神经网络的潜在空间里,让网络“想跑偏都难”。训练只用3G数据,零微调
视频压缩最难的,不是把码率压低,而是把画面压低以后还不让人想砸键盘。北大这篇直接把“结构锚点”和“运动细节”拆开处理,用生成模型补细节,思路很硬,码率也压得够狠。
自回归图像压缩最烦人的不是“压得不够好”,而是“明明模型很强,推理却慢得像在排队买奶茶”。这篇论文直接不改模型,靠波前并行把串行瓶颈拆开,属于很实用的系统型加速。
视频理解模型往往要把每一帧都当成独立图片来处理,这又慢又浪费算力。微软和斯坦福的研究人员直接从视频压缩算法中取经,用轻量级的运动向量和残差代替大部分图像的密集编码,让首帧生成时间快了86%,令牌用量暴减93%,同时性能还不降反升!这个方法与之前的Quickviewer等非均匀采样思路不同,它是在编解码层面做“减法”,从根源上避免了冗余。
这篇工作不玩花活,专盯RAW无损压缩里最容易被忽略的“对齐”问题。看似只是把亮度样本挪一挪,实际却能让CfL预测更稳,JPEG XS里也更能省码率。
这篇论文很实在:不追求大模型堆参数,而是盯着视频通话最真实的痛点——带宽不够、画面糊、还得实时。它用少量人脸帧就能快速训练一个CPU可跑的增强模型,属于“能落地”的那种小聪明。
视频流媒体最怕的不是“码率不够”,而是“同样的码率,给不同视频的效果完全不一样”。这篇论文直接抓住这个痛点,用压缩回波给视频做自监督预训练,思路很工程,也很聪明。
NVRC++最值钱的地方,不是“又做了一个视频压缩模型”,而是把INR视频编码最头疼的两件事——复杂度随码率乱飘、长序列高分辨率网格难训练——一起按住了。四档复杂度、宽码率范围、实时解码,这套组合拳很适合想看“论文怎么往工程落地靠”的读者。
MoQ 终于开始认真处理“人不想总盯着直播边缘”的现实需求了。本文不搞花活,直接拿时间偏移客户端做 ABR 实验,结果很实在:多给几秒缓冲,吞吐量能明显起飞。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球