ReSplat Research Roadmap

Renderer Score Tokens for Recurrent Gaussian Splatting

Top 1 精炼方案:从 renderer residual 到 parameter-typed primitive token

Published: 2026-07-16 Review: same-family provisional 9.12/10 Status: READY for experiment planning;未运行实验

Research Proposal: Renderer Score Tokens for Recurrent Gaussian Splatting

Problem Anchor

Method Thesis

使用一个解析的 post-render score-replay kernel,把当前 renderer 中 mean、opacity 和 SH 的 support-normalized partial score 聚合成 fixed-dimensional primitive tokens。该 interface 直接按当前渲染 primitive ID 绑定 residual 与 action,不调用通用 renderer autograd 或逐场景 optimizer。

Contribution Focus

Why ReSplat Needs This Interface

ReSplat 当前把 RGB 与 frozen ResNet residual 变成二维 tokens,经 global attention 后按 source latent-grid 顺序与 Gaussian state 拼接。Gaussian 在循环中已经移动,但 residual binding 没有随当前 renderer responsibility 改变。该设计无法显式表达:

PRIMU 和 GaussianPOP 提供 scalar attribution,分别服务 uncertainty 与 pruning;它们无法表达 parameter-typed local response。Diff3R、G3R 和 Learn2Splat 能使用 renderer gradient 或完整 optimization,但改变了 ReSplat 的 fixed-cost recurrent inference 形态。

Two-Stage Algorithm

Stage 1:Standard Render

  1. 使用原 gsplat tile binning 与 contributor sorting。
  2. 正常 front-to-back compositing,得到 rendered color \(\hat C_{pv}\)、final transmittance 与 contributor count。
  3. 与 observation 计算 RGB residual:

\[ r_{pv}=\hat C_{pv}-C_{pv}. \]

  1. tile bins 与 sorted contributor indices 保留在 renderer workspace;不向 PyTorch 暴露完整 per-pixel contributor tensor。

Stage 2:Analytic Score Replay

score-replay kernel 复用相同 tile bins 与 contributor order。对每个 pixel 再做一次 front-to-back traversal,并维护:

当前 Gaussian 后方的 suffix composite 可解析恢复为:

\[ C^+_{pgv} = \frac{ \hat C_{pv}-P_{pgv}-T_{pgv}\alpha_{pgv}c_{gv} }{ T_{pgv}(1-\alpha_{pgv})+\epsilon }. \]

当 denominator 太小、alpha/color clamp 饱和或数值不稳定时,由明确 mask 排除该 contribution。kernel 随后直接做 per-Gaussian segmented/atomic accumulation,只输出 fixed-dimensional score token。

因此推理需要一次标准 render 和一次专用 score replay,但:

Exact Score Operators

标准 3DGS 中:

\[ o_g=\sigma(a_g),\qquad \alpha_{pgv}=o_gG_{pgv},\qquad w_{pgv}=T_{pgv}\alpha_{pgv}. \]

定义 residual-suffix contrast 与 visibility support:

\[ \rho_{pgv} = \langle r_{pv},c_{gv}-C^+_{pgv}\rangle, \qquad q_{gv}=\epsilon+\sum_p w_{pgv}. \]

令 \(M^\alpha_{pgv}\) 为 alpha、suffix denominator 和相关 clamp 均有效的 mask,\(M^{color}_{pgv}\) 为 renderer color clamp 未饱和的 mask。

Opacity-Logit Score

\[ \frac{\partial\alpha_{pgv}}{\partial a_g} = G_{pgv}o_g(1-o_g) = \alpha_{pgv}(1-o_g). \]

\[ s^\alpha_{gv} = \frac{1}{q_{gv}} \sum_p M^\alpha_{pgv} T_{pgv}\alpha_{pgv}(1-o_g)\rho_{pgv}. \]

在 fixed contributor order/visibility、RGB squared loss 与明确 clamp mask 下,该 block 是 opacity logit 的 support-normalized local VJP。

SH Score

令 \(B(d_{gv})\in\mathbb{R}^{d_{SH}}\) 为 view direction 的 SH basis:

\[ s^{SH}_{gv} = \frac{1}{q_{gv}} \sum_p M^{color}_{pgv} w_{pgv}[B(d_{gv})\otimes r_{pv}] \in\mathbb{R}^{3d_{SH}}. \]

在 stop-gradient viewing direction 与 fixed order/visibility 下,该 block 是 SH coefficients 的 support-normalized local VJP。

Projected-Center Mean Partial Score

二维 Gaussian kernel:

\[ G_{pgv} = \exp\left[ -\frac{1}{2} (p-\mu^{2D}_{gv})^\top (\Sigma^{2D}_{gv})^{-1} (p-\mu^{2D}_{gv}) \right]. \]

\[ \nabla_{\mu^{2D}_{gv}}G_{pgv} = G_{pgv}(\Sigma^{2D}_{gv})^{-1} (p-\mu^{2D}_{gv}). \]

\[ s^{\mu,2D}_{gv} = \frac{1}{q_{gv}} \sum_p M^\alpha_{pgv} T_{pgv}o_g \nabla_{\mu^{2D}_{gv}}G_{pgv} \rho_{pgv}. \]

此 block 明确对以下路径 stop-gradient:

因此它是 projected-center partial VJP,不是完整 3D mean VJP。

令:

\[ J_{gv} = \frac{\partial\pi_v(\mu_g)} {\partial\mu_g} \in\mathbb{R}^{2\times3}. \]

固定跨视图权重:

\[ \gamma_{gv} = \frac{q_{gv}} {\epsilon+\sum_{v'}q_{gv'}}. \]

三维 covector pullback:

\[ b^\mu_g = \sum_v \gamma_{gv} J_{gv}^{\top} s^{\mu,2D}_{gv}. \]

conditioning matrix:

\[ A_g = \lambda I+ \sum_v \gamma_{gv} J_{gv}^{\top}J_{gv}. \]

\(\lambda\) 在 scene scale normalization 后固定,并在所有训练/评测中保持同一约定。只输出 conditioning statistics,不计算 \(A_g^{-1}b_g\):

\[ \tilde e_g = \frac{\mathrm{eig}(A_g)} {\mathrm{tr}(A_g)+\epsilon}, \qquad \ell_g = \log(\mathrm{tr}(A_g)+\epsilon). \]

appearance 跨视图聚合为:

\[ s^\alpha_g = \sum_v\gamma_{gv}s^\alpha_{gv}, \qquad s^{SH}_g = \sum_v\gamma_{gv}s^{SH}_{gv}. \]

Final Token and Updater

\[ z_g=[ b^\mu_g(3),\, s^\alpha_g(1),\, s^{SH}_g(3d_{SH}),\, \log q_g(1),\, \tilde e_g(3),\, \ell_g(1) ]. \]

总维度为 \(9+3d_{SH}\)。一个共享 linear–GELU–linear projection 将 \(z_g\) 映射到 ReSplat 的 \(D_{error}\),输出 \([B,G,D_{error}]\)。

主方法默认删除原 source-index ResNet residual。Point Transformer 输入只有:

updater 仍可输出 mean、scale、rotation、opacity 和 SH;但 direct typed-score claim 只覆盖:

scale/rotation 由 Gaussian state、neighborhood 和 score context 间接更新,不构成本文贡献。

Relation to Gradient

完整 gradient 原则上包含更多一阶信息。本文 token 是选择性、support-normalized、parameter-typed local VJP/partial VJP 的 score-replay 表达。

必须比较:

  1. raw gradient;
  2. detached gradient;
  3. support-normalized gradient;
  4. parameter-scale-normalized gradient;
  5. proposed score replay token。

Kill criterion:若 normalized gradient 在 matched wall time 与 peak VRAM 下持续支配 proposed token,则该 interface 的论文主张失败。

Novelty Boundary

本文贡献是 post-render analytic score replay、structured primitive token 与 amortized recurrent updater 的组合 interface;不是单纯把 attribution 用途改成 update。

Training and Inference

Claim-Driven Validation

Block A:Score-Replay Correctness

Block B:Held-Out One-Step Utility

Block C:Quality–Cost Pareto

Go / No-Go Gates

  1. suffix recovery 或 score reference error 不可靠:STOP。
  2. alphaT/PRIMU/GaussianPOP scalar token 的 one-step utility 等价:STOP。
  3. normalized gradient 在 matched cost 下支配:STOP。
  4. 四步没有约 0.25 dB global 增益,且困难区域也无稳定显著收益:STOP。
  5. score replay overhead 超过 20% 且质量收益不足:STOP。
  6. 删除 ResNet residual 后质量损失无法由 score 恢复:STOP。

Compute and Timeline