最新研究:从84秒到0.05秒,独立研究者让VBGS实时重建提速1680倍
3D高斯泼溅做持续重建,最大痛点就是慢。这篇论文用空间截断变分推断加改进重分配,把每帧训练延迟从84秒干到0.05秒,1680倍提速还不掉质量,直接在RTX 3070 Ti上跑通。做机器人实时建图的读者,这篇相当值得看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
3D高斯泼溅做持续重建,最大痛点就是慢。这篇论文用空间截断变分推断加改进重分配,把每帧训练延迟从84秒干到0.05秒,1680倍提速还不掉质量,直接在RTX 3070 Ti上跑通。做机器人实时建图的读者,这篇相当值得看。
Google DeepMind把动态4D重建做成了"点单式"服务:一段视频编码一次,任何时间、任何空间位置的3D坐标随查随到。200+FPS位姿估计、18-300倍跟踪提速,CVPR 2026最佳论文的含金量,龙哥带大家一探究竟。
24K沉浸感,听起来有没有很刺激?这篇论文巧妙借助静态场景的稳定性,用“8K全景相机+4K云台相机”的搭配,把静态360度远程呈现的有效分辨率提升到了24K水平,还顺手做了一个用户实验来验证体验提升。VR远程协作、远程巡检、沉浸式教学都可能被这波操作刷新上限。
当视觉圈的3D高斯泼溅还在忙着做新视角合成时,港科大的研究者已经把它搬进了毫米波通信的波束赋形里。GSBF让基站不再依赖繁琐的在线CSI估计,用激光雷达点云初始化环境表征,24毫秒内直接合成高质量波束——连逐波束扫描都省了。
想象一下,AI 不仅能模仿任何人的笔迹生成手写图片,还能把笔画轨迹直接发给机器人,让它拿着笔在纸上写出来——在线轨迹和离线图像向来是两条平行线,这篇来自 GIST、CMU、延世大学等机构的论文用一个六参数的可微分物理笔刷模型,硬是把它们捏成了同一件事。
实时移动光源,画面即刻响应——LiveLight 让视频重光照从『渲染后等待』变为『边播边调』。香港科技大学联合多家机构提出首个基于扩散模型的实时流式视频重光照框架,仅用4步采样跑出15.78FPS还把质量做到SOTA,视频编辑领域值得重点关注的方向性工作。
继2025年PoissonNet霸榜网格学习之后,蒙特利尔大学团队终于把注意力机制按网格几何的“本性”改造了一番——内在且三角化无关。结果直接拉满:高频信号预测PSNR暴增6dB,手指变形细节从未如此清晰,而且代码和实验都开源可复现,看完就想动手试试。
继6月聊过Mila的Gigapixel自博弈训练之后,Valeo这篇Pictura直接更进一步:把强化学习的观察空间从特权矢量换成了摄像头第一视角的渲染图,彻底消除了部署时的表征鸿沟。500亿步训练后,效果居然还能跟特权基线掰手腕,零样本迁移到Waymo场景甚至反超——这才是自博弈该有的样子。
想象一下你在云VR里看演唱会,网络突然卡顿,画面立刻变成马赛克甚至崩溃——SplatStream就是来终结这种尴尬的。它让动态3D高斯泼溅像视频一样支持自适应流传输,带宽不够就降质量但不中断,从粗糙到精细丝滑过渡。是不是很香?
3D高斯泼溅这个计算机图形学的网红,被Temple大学和阿贡国家实验室的团队跨界用到科学数据压缩上,结果直接碾压传统有损压缩器SZ3好几个身位。不仅压缩比高,还能实时交互渲染,宇宙学家们可以欢呼了。看完直呼:还能这么玩?
在视频生成领域,肖像动画一直是个既要保身份又要跟表情的棘手活。传统3DMM渲染生硬,纯扩散模型控制不准。本篇来自TUM和丰田的ViDS巧妙地把3DMM法线图作为视频扩散的条件,实现了精细、稳定的肖像动画生成,FID低至21.29,用户评分领先对手一大截。
打游戏时你有没有想过——这个场景里哪个参数让画面这么亮?哪个材质导致眩光?传统方法得反复调参数试错,而这篇来自Simon Fraser大学的最新论文,把可微渲染的梯度当作“显著性图”,一次反向传播就能告诉你答案。就像Grad-CAM解释神经网络一样,现在轮到渲染器了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球