LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12787 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:视频编码

共 12 篇
代尔夫特理工新作:MoMQ让实时视频多路径传输延迟直降70.3%
视觉与图像

代尔夫特理工新作:MoMQ让实时视频多路径传输延迟直降70.3%

多路径传输一直在“盲人摸象”——调度器只看字节,不懂视频帧的关键程度。代尔夫特理工这篇MoMQ,首次把MoQT的元数据变成路径调度规则,在Starlink+WiFi真实测试床上把P99.9延迟从384.7ms砍到114.1ms,实时视频终于能跑进150ms交互预算。想法巧妙,实验扎实,值得一读。

AI · PAPER
视觉与图像

GenVC:首个压缩导向视频扩散模型,码率省62%秒变15fps

继7月聊过北大用0.005bpp还原视频细节之后,微软亚洲研究院带着GenVC来了——这是**首个面向视频压缩、从头训练的像素域视频扩散模型**。它不自欺欺人地继承百亿参数预训练骨架,而是用5.78亿参数干到码率省六成、解码15fps。更关键的是,它发现直接暴力蒸馏会让运动卡死,于是提出了**自适应分数蒸馏**来精准纠偏。想搞懂视频压缩+扩散模型的最强实战,

新方法NSMA:把规则“钉”进神经网络,零样本称霸8大网络!
视觉与图像

新方法NSMA:把规则“钉”进神经网络,零样本称霸8大网络!

继2026年6月推过一篇强化学习搞定视频压缩之后,这回ABR领域又来了一个狠角色。电通大团队不仅一针见血地指出:多年来用来测试强化学习ABR策略泛化性的工具(只看平均带宽等统计量)是错的!还顺手把“规则”和“学习”的边界给消融了。 方法是真硬核:把经典码率选择的规则,直接以几何锚点的形式嵌进神经网络的潜在空间里,让网络“想跑偏都难”。训练只用3G数据,零微调

把视频“偷摸”压缩的事告诉大模型:微软新方法令牌省93%
视觉与图像

把视频“偷摸”压缩的事告诉大模型:微软新方法令牌省93%

视频理解模型往往要把每一帧都当成独立图片来处理,这又慢又浪费算力。微软和斯坦福的研究人员直接从视频压缩算法中取经,用轻量级的运动向量和残差代替大部分图像的密集编码,让首帧生成时间快了86%,令牌用量暴减93%,同时性能还不降反升!这个方法与之前的Quickviewer等非均匀采样思路不同,它是在编解码层面做“减法”,从根源上避免了冗余。

NVRC++来了:7.6倍提速,还把视频压缩复杂度钉死了
视觉与图像

NVRC++来了:7.6倍提速,还把视频压缩复杂度钉死了

NVRC++最值钱的地方,不是“又做了一个视频压缩模型”,而是把INR视频编码最头疼的两件事——复杂度随码率乱飘、长序列高分辨率网格难训练——一起按住了。四档复杂度、宽码率范围、实时解码,这套组合拳很适合想看“论文怎么往工程落地靠”的读者。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球