← 返回 PaperDaily 视觉与图像

高通联合高校新方案:3DGS也能像视频一样自适应流播放

想象一下你在云VR里看演唱会,网络突然卡顿,画面立刻变成马赛克甚至崩溃——SplatStream就是来终结这种尴尬的。它让动态3D高斯泼溅像视频一样支持自适应流传输,带宽不够就降质量但不中断,从粗糙到精细丝滑过渡。是不是很香?

原论文信息如下:
论文标题:
SplatStream: Fine Granular Scalable Gaussian Splatting for Adaptive 3D Scene Streaming
发表日期:
2026年07月
发表单位:
密苏里大学堪萨斯分校、高通公司等
原文链接:
https://arxiv.org/pdf/2607.25971v1.pdf
3D 高斯泼溅(3D Gaussian Splatting,3DGS)近几年火得一塌糊涂,无论是 VR/AR 沉浸式体验还是自由视角视频,它都能用一堆高斯椭球体把场景渲染得又快又真。但问题来了:一个动态 3D 场景可能有几十万甚至上百万颗高斯,每帧还要带一堆属性(位置、缩放、旋转、不透明度、球谐系数),你想通过网络实时传给用户——稍微一卡顿,画面不是糊成一片就是直接崩溃。传统的 3DGS 压缩方法基本只管存得小,压根没考虑“网络不好先看个大概、网好了再慢慢刷细节”这种自适应场景。
今天介绍的这篇 SplatStream,就是要把动态 3DGS 从“死数据包”变成“活流媒体”——像视频的 DASH(Dynamic Adaptive Streaming over HTTP)自适应流一样,让你在带宽抖动时也能平滑切换画质,而且从粗糙到精细还能渐进式渲染。是不是有点意思?

SplatStream:空间/时间/质量三重可扩展框架揭秘

先看整体框架:SplatStream 把动态 3DGS 序列按 GOP(Group of Pictures,图像组)组织,每个 GOP 的第一帧作为 内锚定帧(Intra Anchor),采用多分辨率渲染损失来训练——同一个高斯表示,在 540p、720p、1080p 三个分辨率下同时计算渲染损失,这样解码端从低分辨率开始接收就能直接渲染,随后再补充高分辨率增强层来提升画质。这就是 空间-质量可扩展
时间方向上,每个 GOP 又分为基础时间层(例如帧 0,2,4... 只传关键帧)和B 层增强帧(例如中间帧 1,3... 用前向预测编码),实现帧率可扩展。最后,每帧内的所有高斯还要按重要性排序,形成 10%、20%...100% 的精细度层级,让用户按需接收最核心的那部分高斯。三重可扩展加起来,就是一套完整的自适应流方案。
(由于缺少原图链接,此处示意方法整体框架:内锚定帧经多分辨率损失训练,生成空间层;随后通过层间 Transformer 预测和帧间 InterGS-Lite 预测,产生时间层和精细度层,最后打包为 DASH 子表示。)
让我们更深入地剖析这个框架的运作流程。首先,输入是一个动态 3D 高斯序列,即随时间变化的高斯集合。SplatStream 将其划分为固定长度的 GOP,每个 GOP 包含若干连续帧。在每个 GOP 内部,第一帧被指定为内锚定帧(I 帧),它独立编码,不依赖其他帧。后续帧则分为 P 帧(基础时间层)和 B 层增强帧。P 帧从前一个已解码帧(可能是 I 帧或其他 P 帧)进行前向预测编码,而 B 层增强帧则进一步细化时间分辨率。这种分层结构类似于视频编码中的分层 B 帧(Hierarchical B-frames),但这里 B 层帧实际上只使用前向预测,其命名更多是出于其在时间层级中的角色定位。
对于内锚定帧,SplatStream 采用了一种创新的多分辨率训练策略。在训练阶段,对于同一组高斯参数,渲染器会生成三个不同分辨率的图像:540p(标清)、720p(高清)和 1080p(全高清)。然后,分别计算这三个分辨率下的渲染损失(例如 L1 损失和结构相似性损失),并将它们加权求和作为最终的优化目标。这个设计的关键在于,它迫使同一组高斯参数能够同时适应不同分辨率的渲染需求。当解码端只接收到低分辨率层的数据时,它可以直接使用这些高斯参数渲染出 540p 的图像,而无需等待高分辨率数据。当高分辨率增强层到达后,解码端利用层间预测器更新高斯属性,从而提升渲染质量至 720p 或 1080p。这就实现了空间-质量的可扩展性。
在时间维度上,基础时间层(P 帧)提供了较低的帧率,例如 15fps。B 层增强帧则插在 P 帧之间,将帧率提升至 30fps 或更高。这些 B 层帧通过帧间预测编码,利用已解码的 P 帧或 I 帧作为参考,只传输预测残差,从而大幅降低码率。最后,精细度层是在每一帧内部进行的。无论帧的类型(I、P 或 B 层帧),其包含的所有高斯都会被计算一个重要性得分,并按得分降序排列。客户端可以根据当前带宽和计算能力,选择接收前 10%、20% 或 50% 的高斯。这种渐进式渲染机制确保了即使在带宽极低的情况下,用户也能立即看到一个粗糙但完整的场景轮廓,而不是等待整个帧下载完毕。

Transformer增强预测:如何降低层间与帧间冗余

多分辨率空间层中间有大量信息重复——低分辨率层的高斯属性不能直接复用,但可以通过预测来缩减。SplatStream 引入了一个轻量级的 跨层 Transformer 预测器:给定已解码的低质量层高斯,它能预测出高质量层中对应位置的高斯属性(主要是球谐系数 SH)。同时,帧间预测模块基于 InterGS-Lite(一种轻量级高斯泼溅帧间预测编码方法,Inter-predictive Gaussian Splatting Lite),在原有的 KNN(K 近邻)和双边预测器之外,又增加了一个 Transformer 预测器,形成三个候选预测器。编码器对每颗高斯选择误差最小的那个,并传输预测器索引,解码端照做即可。
具体而言,对于目标高斯,先在其参考帧中搜索 K 个最近邻(KNN),每个邻居形成一个 token,包含 PCA 域(主成分分析)压缩后的 SH 信息和相对几何位置。然后这些 token 经过一个单头注意力层(带有相对位置偏置)后,由预测头输出 SH 系数。这个 Transformer 非常轻(单头、少量 token),增加的算力有限,但能捕捉到手写预测器难以建模的局部几何关联。
对于层间预测同样使用类似的 Transformer 结构,但输入来自低质量层(例如 540p 层),输出预测高质量层(720p)的高斯属性。这样一来,质量增强层只需要传输残差而非完整属性,大大降低码率。
(由于缺少公式截图,此处简要说明层间预测损失:对每颗高斯计算预测值与真值的 L1 损失,训练 Transformer。)
我们来详细拆解一下这个 Transformer 预测器的工作原理。在帧间预测场景中,假设我们要编码当前帧(例如 B 层帧)中的一颗高斯 G_current。首先,我们在参考帧(通常是前一个已解码的 P 帧或 I 帧)中找到与 G_current 在三维空间中最接近的 K 个高斯,记为 {G_ref_1, G_ref_2, ..., G_ref_K}。对于每个参考高斯 G_ref_i,我们构建一个特征 token。这个 token 包含两部分信息:一是 G_ref_i 的球谐系数(SH),为了降低维度,这些 SH 系数首先经过 PCA 降维;二是 G_ref_i 与 G_current 之间的相对位置偏移(Δx, Δy, Δz)。这 K 个 token 被送入一个单头 Transformer 编码器。该编码器使用一个可学习的相对位置偏置(Relative Position Bias),让模型能够感知不同邻居在空间上的远近关系。编码器的输出经过一个轻量级的预测头(例如一个 MLP),最终输出 G_current 的预测 SH 系数。编码器会比较这个预测值与真实 SH 系数之间的误差,并与 InterGS-Lite 中已有的 KNN 预测器和双边预测器产生的误差进行对比,选择误差最小的预测器,并将其索引(例如 0 表示 KNN,1 表示双边,2 表示 Transformer)编码进码流。
层间预测的逻辑与此类似,但输入和输出的对象不同。在层间预测中,输入是来自低质量层(例如 540p 层)的已解码高斯,输出是高质量层(例如 720p 层)对应位置的高斯属性。由于低质量层和高质量层的高斯数量可能不同(高质量层通常包含更多高斯),SplatStream 首先通过最近邻匹配将低质量层的高斯与高质量层的高斯关联起来。然后,对于每个高质量层的高斯,其对应的低质量层高斯及其邻居构成 token,通过 Transformer 预测其 SH 系数。这样,高质量层只需要传输预测残差,而不是完整的 SH 系数,从而显著降低了码率。论文中的实验表明,引入 Transformer 预测器后,在相同的 PSNR 下,码率可以降低约 5-10%。

不透明度-体积排序:从粗糙到精细的渐进渲染

即使有了空间和时间层,每一帧内部的高斯贡献也高度不均——有些高斯很大很亮,对视觉影响极大;有些非常细小或隐藏在场景内部,几乎看不见。SplatStream 定义了一个简单的 重要性度量:体积-不透明度得分。对每颗高斯,先计算其三维体积 V_i = exp(s_x + s_y + s_z)(这里 s 是缩放因子的对数),再与经过 sigmoid 函数后的不透明度 α_i 相乘:ρ_i = sigmoid(α_i) * V_i。这个值越大表示该高斯占据的空间大且比较实心,对最终渲染贡献大。
将一帧内所有高斯按 ρ_i 降序排列,然后取前 x% 的子集用于渲染。由于排序是嵌套的,10% 的高斯是 20% 的子集,20% 是 30% 的子集……这样从粗糙到精细形成渐进式表示。客户端可以先收 10% 快速看到主体,再逐步接收更多细节,体验远超“等全部下载完再看”。
这个重要性度量的设计非常巧妙。它综合考虑了高斯的“大小”和“实体程度”。一个体积很大但透明度也很高的高斯(例如一片薄雾),其体积-不透明度得分可能并不高,因为它对最终像素颜色的贡献有限。相反,一个体积中等但完全不透明的高斯(例如一个实心球体),其得分会很高,因为它会显著遮挡背景并贡献颜色。这种度量方式确保了最重要的结构性和视觉显著性元素被优先传输。例如,在一个人物场景中,人物的身体和头部通常由体积较大、不透明度较高的高斯构成,因此会被排在前面。而背景中一些细小的、半透明的装饰物或光线效果,则会被排在后面。当客户端只接收了前 10% 的高斯时,渲染出的图像已经能够清晰地看到人物的轮廓和主要结构,虽然细节模糊,但场景的语义信息已经完整。随着接收比例的增加,背景细节、纹理和精细的光影效果会逐步显现,最终达到全质量渲染。
值得注意的是,这种排序是在编码端离线完成的。对于每一帧,编码器都会计算所有高斯的 ρ_i 值,并生成一个排序索引列表。这个列表本身也需要被编码并传输给解码端,以便解码端知道应该按照什么顺序来接收和渲染高斯。不过,由于排序索引的熵很小,其带来的额外码率开销几乎可以忽略不计。此外,SplatStream 还支持在精细度层内部进一步分层。例如,可以将 10%-20% 的高斯作为一个子层,20%-30% 作为另一个子层,以此类推。这样,客户端可以以更细的粒度来调整渲染质量,实现更平滑的自适应切换。

DASH适配:将GS位流映射为可选择的子表示

最后一步是把分层编码后的位流组织成标准化的 DASH(Dynamic Adaptive Streaming over HTTP,基于 HTTP 的动态自适应流)兼容结构。每个 GOP 视为一个 segment,segment 内包含多个 子表示(Sub-representation):基础层子表示、B 层增强子表示、精细度增强子表示等。DASH 清单中记录每个子表示的字节大小、依赖帧、精细度百分比等信息,客户端根据当前带宽和渲染能力选择最合适的组合播放。
例如带宽极低时,客户端只要求 540p 内锚定帧(约 13.80 MB),实现快速启动;带宽稍好一点再加 720p 增强层;带宽充裕则进入全帧率全质量模式(1080p + 100% 精细度)。这种灵活性与视频流的 ABR(自适应码率)异曲同工,但针对的是 3DGS 场景。
SplatStream 与 DASH 的集成是其工程实现上的一个亮点。DASH 是一种广泛部署的视频流媒体标准,其核心思想是将视频内容切分成一系列小的、可独立访问的 segment,并提供一个描述这些 segment 的 MPD(Media Presentation Description)清单文件。SplatStream 借鉴了这一思想,将每个 GOP 的 3DGS 数据打包成一个 DASH segment。在这个 segment 内部,不同的可扩展层被映射为不同的“子表示”(Sub-representation)。MPD 文件中会详细描述每个子表示的属性,例如:
- 空间层:标识该子表示对应的渲染分辨率(540p, 720p, 1080p)。 - 时间层:标识该子表示对应的时间层级(基础层或增强层),以及其依赖的帧。 - 精细度层:标识该子表示包含的高斯百分比(10%, 20%, ..., 100%)。 - 码率信息:该子表示的字节大小,用于客户端进行带宽估算。 - URL:该子表示数据的下载地址。
客户端(例如一个 Web 浏览器或 VR 头显应用)在播放开始时,首先下载 MPD 文件,解析出所有可用的子表示组合。然后,客户端内置的自适应码率(ABR)算法会周期性地监测当前网络带宽和缓冲区状态。根据这些信息,ABR 算法会动态地决定下一个 segment 应该下载哪些子表示。例如,当网络状况良好时,客户端会选择下载 1080p、全帧率、100% 精细度的子表示组合,以获得最佳视觉体验。当网络出现波动时,客户端可以平滑地降级,例如只下载 720p、基础帧率、50% 精细度的组合,从而避免播放中断。这种基于 DASH 的架构使得 SplatStream 能够无缝地融入现有的流媒体生态系统中,并利用成熟的 ABR 算法和 CDN 分发网络。

实验验证:带宽波动下的质量权衡与渐进式提升

实验使用 MPEG 标准测试序列中的三个动态 3DGS 场景:bartender、cinema、breakfast(均为半跟踪类型)。每个序列采用 4 帧 GOP 结构:I0(内锚定帧)、B1(B 层增强)、P2(基时间层 P 帧)、B3(B 层增强)。所有帧内预测和重采样均在 1080p 高斯域中进行。主要评测指标为 RGB-PSNR、SSIM、LPIPS。
先看精细度渐进效果。表 I 给出了 bartender 序列上不同精细度等级的操作点。从 10% 到 100%,PSNR 从 22.86 dB 提升到 32.34 dB,SSIM 从 0.617 增至 0.892,LPIPS 从 0.365 降至 0.164。而每帧传输的高斯数从约 47.5 万增加到 161 万,总大小从 23.46 MB 增加到 38.82 MB。这种渐进式细化非常有效:前 10% 的高斯已经能还原出粗结构,后 90% 逐步提升细节。
*表格超出部分左右可以滑动
Ref. levelCoding levelP2 sizeB1 sizeB3 sizeAdded temp. sizeTotal sizeTotal #GCum. BPGAvg. PSNR / SSIM / LPIPS
10%Very-low-rate ref.0.59 MB0.53 MB0.59 MB1.71 MB23.46 MB474560395.4822.86 / 0.617 / 0.365
20%Low-rate ref.1.17 MB1.06 MB1.18 MB3.41 MB25.17 MB601059334.9724.51 / 0.672 / 0.316
30%Progressive ref.1.76 MB1.60 MB1.76 MB5.12 MB26.87 MB727557295.4925.92 / 0.730 / 0.280
50%Medium-rate ref.2.93 MB2.66 MB2.94 MB8.53 MB30.29 MB980553247.1027.82 / 0.793 / 0.233
100%Full-quality ref.5.86 MB5.32 MB5.88 MB17.07 MB38.82 MB1613044192.5332.34 / 0.892 / 0.164
表 I:不同精细度等级的操作点:随着传输百分比增加,总大小、高斯数、PSNR/SSIM/LPIPS 均稳步改善。
再看带宽自适应能力。表 II 列出了 bartender 序列在不同带宽模式下的操作点。最低仅需 828 Mbps(仅 540p 内锚定帧)就能显示画面,PSNR 达 30.45 dB;正常全帧率高质量模式需要 2329 Mbps,PSNR 达 32.34 dB。中间还有多种组合(低帧率、低精细度等),让客户端在带宽不足时不是直接崩溃,而是优雅降级。
*表格超出部分左右可以滑动
Bandwidth modeSelected stream unitsAvailable framesPlayback modeRefinementTotal size/GOPReq. BWTotal #GAvg. PSNR / SSIM / LPIPS
StartupI_540_00Intra only13.80 MB828 Mbps27812730.45 / 0.886 / 0.161
Low spatial qualityI_540_0+I_720_00Intra only17.56 MB1054 Mbps29258033.15 / 0.904 / 0.155
Full spatial anchorI_540_0+I_720_0+I_1080_00Intra only21.75 MB1305 Mbps34806034.12 / 0.911 / 0.150
Low-frame-rate temporalS3+P_1080_20,2Base temporal layer100%27.62 MB1657 Mbps77220132.84 / 0.898 / 0.160
Very-low BW full FPSS3+P_10_2+B_10_1+B_10_30,1,2,3Full temporal layer10%23.46 MB1408 Mbps47456022.86 / 0.617 / 0.365
Low BW full FPSS3+P_20_2+B_20_1+B_20_30,1,2,3Full temporal layer20%25.17 MB1510 Mbps60105924.51 / 0.672 / 0.316
Moderate BW full FPSS3+P_30_2+B_30_1+B_30_30,1,2,3Full temporal layer30%26.87 MB1612 Mbps72755725.92 / 0.730 / 0.280
Medium BW full FPSS3+P_50_2+B_50_1+B_50_30,1,2,3Full temporal layer50%30.29 MB1817 Mbps98055327.82 / 0.793 / 0.233
High BW full FPSS3+P_100_2+B_100_1+B_100_30,1,2,3Full temporal layer100%38.82 MB2329 Mbps161304432.34 / 0.892 / 0.164
表 II:带宽自适应操作点:不同启动、空间增强、时间增强、精细度增强模式下的尺寸、带宽和质量。
图 1-3 展示了三个序列上精细度从 10% 到 100% 的 RD(率失真)曲线:横轴为 bpp,纵轴分别为 PSNR、SSIM、LPIPS。曲线在三个序列上都呈现单调平滑上升,说明重要性排序对场景内容稳定鲁棒。
整体实验表明:SplatStream 在动态 3DGS 自适应流传输这一任务上达到了预期目标。但也要注意,当前实验仅包含 3 个序列、4 帧 GOP,规模偏小;所需带宽在 828-2329 Mbps 之间仍然很高,实际部署可能需要进一步压缩或切片优化。
我们来深入解读一下这些实验结果。表 I 清晰地展示了精细度渐进式的有效性。从 10% 到 100%,PSNR 提升了近 10 dB,这是一个非常显著的增益。值得注意的是,从 10% 到 50%,PSNR 提升了约 5 dB,而从 50% 到 100%,PSNR 又提升了约 4.5 dB。这说明前 50% 的高斯贡献了大部分的结构信息,而后 50% 的高斯则主要负责精细纹理和细节的还原。SSIM 和 LPIPS 的变化趋势也印证了这一点。SSIM 从 0.617 提升到 0.892,表明图像的结构相似性在逐步增强;LPIPS 从 0.365 下降到 0.164,表明感知质量在持续改善。这些数据强有力地支持了 SplatStream 渐进式渲染策略的有效性。
表 II 则展示了 SplatStream 在应对不同带宽条件时的灵活性。从“Startup”模式(仅 540p 内锚定帧)到“High BW full FPS”模式(1080p + 全帧率 + 100% 精细度),所需带宽跨度从 828 Mbps 到 2329 Mbps。这为客户端提供了丰富的选择空间。例如,在“Low spatial quality”模式下,通过增加 720p 增强层,PSNR 从 30.45 dB 提升到了 33.15 dB,而带宽仅增加了约 226 Mbps。在“Low-frame-rate temporal”模式下,通过牺牲帧率(只播放基础时间层),可以在保持较高空间质量(1080p)和精细度(100%)的同时,将带宽需求降低到 1657 Mbps。这些组合使得客户端可以根据实时网络状况,动态地选择最合适的“带宽-质量”折中点,从而实现流畅的播放体验。
然而,我们也必须指出实验的局限性。首先,实验只使用了三个 MPEG 标准测试序列,这些序列的场景复杂度和动态范围有限。对于包含快速运动、大量遮挡或复杂光照变化的场景,SplatStream 的性能还有待验证。其次,GOP 大小仅为 4 帧,这在实际流媒体应用中可能不够典型。更长的 GOP(例如 16 帧或 32 帧)可能会带来更高的编码效率,但也可能引入更大的延迟和误差累积。最后,论文没有提供与现有 3DGS 压缩方法(如 HAC、ContextGS)的直接率失真对比。虽然作者声称 SplatStream 的目标是流媒体而非单纯压缩,但提供一个对比基线(例如,将 HAC 压缩后的数据打包成 DASH segment 进行流传输)将有助于更全面地评估 SplatStream 的优势。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

SplatStream 和现有的 3DGS 压缩方法(如 CompGS、HAC)最大的区别是什么?现有压缩方法主要目标是减小存储大小,通常一次性编码整帧或整个场景,没有考虑流传输场景。SplatStream 则把问题定位为自适应流传输,因此引入了空间层、时间层和精细度层三重可扩展性,并映射为 DASH 兼容结构。换句话说,别人做的是“压缩”,SplatStream 做的是“可扩展流媒体包装”。

什么是“体积-不透明度”重要性度量?它基于什么原理?每颗高斯都定义了一个三维缩放(s_x, s_y, s_z)和不透明度 α。体积 V = exp(s_x+s_y+s_z) 代表高斯所占三维空间的大小,不透明度 sigmoid(α) 代表该高斯的“实体”程度。两者相乘得到一个分数:大而实的高斯对渲染结果影响大,小而透明的高斯影响小。排序后确保最重要的高斯先传,实现渐进式渲染。

文中的 B 层(B-layer)是双向预测吗?为什么这么叫?不是真正的双向预测。论文简化了实现,B 层帧(如 B2、B4、B6)仅使用前向预测(P 模式)从最近的前一个已解码帧编码。之所以叫 B 层,是因为它们在时域中起到增强帧率的作用——类似于 H.264 视频编码中真正的 B 帧角色,但编码方式为 P 型。所以读者不用纠结“B”的字面意思。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将视频流中的 DASH 概念引入 3DGS,并结合多分辨率监督、Transformer 预测和重要性排序,是系统性创新。单看每个部件不算全新,但组合成完整流媒体方案是首次。

实验合理度:★★★★✰

实验在三个 MPC 标准序列上进行,详细列出了不同带宽/精细度下的指标,数据量充分。但缺少与现有压缩方法(如 HAC、ContextGS)的率失真对比,只说自己是流媒体方案不与压缩方法直接比较——这其实也合理,但若能展示相对普通压缩方法的流传输效率差异会更有说服力。

学术研究价值:★★★★✰

为 3DGS 流传输提供了第一个完整的可扩展框架,对后续标准化(如 MPEG 沉浸式视频)有参考价值。四星合理。

稳定性:★★★✰✰

渐进式渲染和帧率切换本身机制稳定,但高斯重要性排序在场景结构剧烈变化时(如快速旋转、大量新物体出现)可能失效,论文没有测试复杂动态场景。此外,当前实验帧数少,稳定性未能充分展现。

适应性以及泛化能力:★★★✰✰

方法面向 forward-facing(前向)场景设计,对 360° 大场景或自由视点泛化能力未知。重要性度量依赖几何大小,对长细物体(如电线)可能不太准确。

硬件需求及成本:★★✰✰✰

最高档需要 2.3 Gbps 带宽和强悍的解码端(实时渲染百万级高斯),普通家用网络/移动设备难以承受。虽然可以降级到 800 Mbps 左右,但依然很高。这可能是限制早期应用的最大短板。

复现难度:★★★✰✰

论文依赖 InterGS-Lite(未开源完整代码)且未公开 SplatStream 源码,复现需根据描述自行实现多分辨率训练、Transformer 预测等模块,有一定难度。但算法描述清晰,有经验的团队 2-3 个月可重复。

产品化成熟度:★★✰✰✰

框架完整且基于成熟标准(MPEG-DASH),但高带宽需求、缺乏端侧优化、未支持 360° 场景等因素使得直接产品落地还很远。需要与编码器硬件团队协作,进一步降低 bitrate。

可能的问题:论文在比特率方面仍有很大的压缩空间(当前最低 828 Mbps 对于大多数网络仍然过高);实验仅在 3 个短序列上进行,缺少大规模泛化验证;未与现有流媒体导向方法(如 LTS、Fine granular scalable GS coding)做定量对比,说服力有待提升。


主要参考文献

[1] Kerbl B, Kopanas G, Leimkühler T, et al. 3D Gaussian Splatting for Real-Time Radiance Field Rendering. ACM Transactions on Graphics, 2023.
[2] Talha M, et al. InterGS-Lite: Light Weight Dynamic GS Coding with Vector Quantization of Prediction Residuals. DCC, 2026.
[3] Zou J, Shi L, Xu S, et al. Fine Granular Scalable Gaussian Splatting Coding for Real-Time Immersive Education. ICNC, 2026.
[4] Sodagar I. The MPEG-DASH Standard for Multimedia Streaming Over the Internet. IEEE Multimedia, 2011.
[5] Yang K, Yang Q, Xu Y, et al. RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing. arXiv:2602.19753, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
SplatStream 让3DGS也能像视频一样“自适应变速”,空间时间质量全可调,再也不用担心云VR卡顿、画质崩了!想跟龙哥一起钻研3DGS流传输前沿?扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。我们在群里等你探讨动态3DGS、MPEG-DASH、点云压缩~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。