GaussianGPT 研究路线图

坐标图一致列事件:首选精炼方案

固定物理证据,只消除滑动窗口局部坐标图引入的条件分布差异;零新增参数、推理不变

来源: artifacts/FINAL_PROPOSAL.md SHA256: fc3d2f87e624 渲染时间: 2026-07-19 16:31 UTC

研究方案:面向 GaussianGPT 的坐标图一致列事件(Chart-Consistent Column Events)

问题锚点(Problem Anchor)

核心论点(Executive Thesis)

GaussianGPT 的生产级外扩解析器(production outpainting parser)真正消费的空间事件,并不是完整的 8000 类局部位置 ID,而是“目标全局列(column)中的下一个 z 行(row)”或“离开该列”。本方案将每个坐标图的完整词元(token)概率无损推送到共同物理事件空间 {z0,...,z19, EXIT},随后在固定物理提示/目标(prompt/target)、只改变合法窗口原点(window origin)的反事实配对(counterfactual pairs)上对齐条件分布。

方法不增加参数,不修改分词器/解码器/词表/解析器,也不改变推理。核心贡献不是通用 KL 散度,而是一个与生产语法(production grammar)一致的“同状态、同动作空间”坐标图反事实接口(same-state/same-action-space chart counterfactual interface)。

基线为何可能失败(Why the Baseline Can Fail)

同一全局上下文行(context row)在不同窗口原点下,会得到不同的局部位置词元与三维旋转位置编码坐标(3D RoPE coordinate)。RoPE 的相对结构无法消除类别词元嵌入(categorical token embedding)、输出头(output head)和非线性隐藏状态对局部坐标图的依赖。当前全序列教师强制交叉熵(full-sequence teacher-forced CE)让每种编码独立拟合独热目标(one-hot target),却不要求完整的解析器消费条件分布(parser-consumed conditional)保持一致。

简单替代方案并不足够:

方法(Method)

将一个状态写为 (H,T)

枚举两个不同原点 o_a,o_b,要求 H 的全部行以及所有 (T,z) 均可映射进 20×20×20 画布(canvas)。两条分支只重写局部坐标,不添加、删除或截断任何证据。

配对编译器(pair compiler)对每个样本执行机械断言:

2. 完整词元到事件的推送(Complete Token-to-Event Pushforward)

首篇论文的范围限定为仓库默认大场景配置:单列逐词元路径(single-column tokenwise path),no_empty_columns=falseresample_empty_columns=true

施加现有槽位/单调约束(slot/monotonic constraints)后,令 r_o(v|h) 表示位置/EOS 词元分布。定义确定性映射 A_o

事件概率为:

p_o(e|h)=sum_{v:A_o(v)=e} r_o(v|h),其中 e in {z0,...,z19,EXIT}

实现采用 logsumexp。8000 个位置结果与 EOS 全部计入,不使用支撑集交集、不截断,也不重新归一化。该事件精确对应 _accept_sparse_rows_for_target 的状态转移:接受目标 xy 行,其他位置/结束事件则终止本次列尝试(column attempt)。

3. 反事实一致性(Counterfactual Consistency)

在教师强制目标列上抽样 K=32 个匹配位置槽位(matched position slots),使用交替单向停止梯度 KL 散度(stop-gradient KL):

L_event(a->b)=KL(sg(p_a)||p_b)

小批次(minibatch)交替使用 a->bb->a,因此在期望意义上对称,但每次只保留一个梯度图。

对于已占用目标,强制输入坐标图特定的位置词元,再读取 LFQ 特征分布。仅当冻结审计表明特征 JS 散度至少为重放噪声的 2 倍,且与接缝/事件失效存在实质关联时,才启用 L_feat;否则最终方法采用仅事件版本(event-only)。

4. 训练目标(Training Objective)

保留标准全序列交叉熵,并增加配对列辅助批次(paired column auxiliary batch):

L_pair = 0.5(L_colCE_a+L_colCE_b) + lambda_e L_event + I_feat lambda_f L_feat

L = L_fullCE + beta L_pair

L_colCE 同时监督解析器事件(下一 z 或 EXIT)与普通特征交叉熵。对照方法包括:

5. 高效接口(Efficient Interface)

6. 形式化范围(Formal Scope)

理论对象是解析器诱导的目标列标记过程(parser-induced target-column marked process)。如果每个可达配对历史上的事件/标记条件分布相同,则由概率链式法则可得诱导列分布相同;两种坐标图诱导列分布之间的 KL,可分解为匹配历史上逐步条件 KL 的期望。

训练目标只是基于真值/滚动采样历史(GT/rollout sampled histories)的蒙特卡洛替代量(Monte Carlo surrogate)。本文不声称:

7. 推理(Inference)

推理完全不变。只运行一次原始 GaussianGPT 采样器;不使用第二坐标图、重排序、共识或额外解码器。

已有静态证据(Static Evidence Already Available)

确定性的 CPU/代码审计已验证:

这些结果只证明定义自洽且非平凡。由于没有检查点/数据,尚未证明真实配对覆盖率、冻结模型不一致或质量提升。

预注册门槛(Preregistered Gates)

门槛(Gate) 测试(Test) 通过标准(Pass criterion) 失败动作(Failure action)
G0 解析器等价性(Parser equivalence) 针对精确默认解析器的穷举属性测试 每个合法词元/EOS 都产生相同的 A_o 事件和解析器转移;概率和为 1 修复定义,或在使用模型前终止
G1 真实配对覆盖率(Real pair coverage) 只使用逐字保留的验证集滚动状态 至少 20% 的非自举原点切换目标状态具有非零配对;状态数至少 10k;计划重加权后,已覆盖/未覆盖状态的上下文长度和占用率标准化差异不超过 0.25 终止;绝不截断提示
G2 冻结坐标图效应(Frozen chart effect) 重放/丢弃/坐标图干预 事件 JS 中位数至少为重放噪声的 5 倍;原点切换状态相对稳定状态的匹配 JS 至少高 25%;耦合采样分歧不可忽略 微调前终止
G3 特征实质性(Feature materiality) 同目标特征审计 特征 JS 至少为重放噪声的 2 倍,并与失效具有实质关联 否则删除特征损失

论断驱动的证据计划(Claim-Driven Evidence Plan)

论断 1:真实原点切换暴露纯坐标图事件跳变

若 G1/G2 失败,立即终止。

论断 2:语义坐标图配对优于通用正则化

等算力实验分支:

  1. 标准微调;
  2. 原点增强;
  3. 同坐标图 R-Drop;
  4. 坐标图—事件一致性;
  5. 仅在 G3 通过时加入事件+特征。

指标包括留出事件 JS/NLL、分块 FID/KID/COV/MMD、熵和两两多样性。预注册的不退化边界为:FID/KID 相对退化不超过 3%,COV 下降不超过 2 个百分点,多样性下降不超过 5%。

论断 3:消除坐标图跳变可改善长场景生成

失效模式(Failure Modes)

新颖性边界(Novelty Boundary)

不得宣称首个等变模型、首个分块一致性方法、首个随机顺序三维自回归(3D AR)或首个长场景生成器。暂定的增量贡献为:

固定物理证据和解析器消费的动作语义,只改变局部坐标图;将完整稀疏词元分布推送到共同物理列事件空间,并通过训练消除被隔离出的窗口原点依赖。

深度查新状态仍为“部分成立/暂定(PARTIAL / provisional)”;没有检索到 2024–2026 年的完全相同工作并不能构成证明。

实现与算力(Implementation and Compute)

首先运行的三项实验(First Three Runs)

  1. G1 真实提示配对覆盖扫描(real-prompt pair coverage scan)——仅使用 CPU;若覆盖率或偏差不合格则终止。
  2. G2 冻结反事实审计(frozen counterfactual audit)——固定 H/T/随机性,只做坐标图干预;若效应处于噪声水平或无法定位则终止。
  3. 选定槽位微基准 + 最小等算力试验(selected-slot microbenchmark + minimal matched-compute pilot)——仅在 G1/G2 通过后执行;比较增强、R-Drop 和事件一致性。

当前状态(Current Status)