设计 · 结构 · 实验报告(独立完整版)
一句话:DeepSeek-V4.1-Flash 的 CED 骨架(编码器压缩前缀 → 解码器 KV 从编码器末态投影)
× 我们的 Rubik-GLA 低秩非交换门控(50/50 混合配比),
在 minimind 上以 7.5% 更少的参数、3.4× 更少的训练显存达到 CED 家族最优
val NLL 3.585(vs 全秩 CED-Hybrid2 3.590,纯平铺对照 3.513)。
定位:部署优先形态——prefill 计算减半(CED)、推理状态 O(1)+窗口 KV、
门控低秩化(O(4r·dh²))、无 MoE、单卡 1.7GB 可训。
1. 设计来源(三个血统)
| CED 编码器/解码器切分 + 投影 KV | DeepSeek-V4.1-Flash (arXiv:2609.19969, YOCO 血统) | 无 MoE;解码器全局 KV = 编码器末态投影 C_l = H_3 W_l,Z_l = H_3 W_l^Z |
| 非交换旋转门控 + λ 衰减 | Rubik-GLA(本仓库 §2/§3) | 门控改为低秩参数化(§2.3) |
| 50/50 混合配比 | 配比曲线闭合实验(§13/§14) | 编码器/解码器各 [Rubik, Rubik, SWA] |
设计原则:不做内容选择、不做 MoE、不做查表记忆——只保留三件被各自验证过的机制。
2. 结构
2.1 总览
输入 x ∈ R^{B×128} (词表 23005, minimind token)
└─ 拆分: 前缀 P=96 (编码器) | 后缀 Q=32 (解码器生成, 损失区)
编码器 (3 层, 因果, 全 96 token):
[RubikLR] → [RubikLR] → [SWA win=48] ⇒ H_3 ∈ R^{B×96×128}
桥 (CED 核心, 每解码层独立投影):
C_l = H_3 @ W_l^KV (K, 96 entries)
Z_l = H_3 @ W_l^Z (V)
— W_l ∈ R^{128×2×128}, 每层独立 —
解码器 (3 层, 因果, 32 token):
每层: [SWA win=32 自注意力] → [Cross-Attn(Q=解码态, K=C_l, V=Z_l)]
⇒ logits (B×32×V), 损失只算 32 个后缀位置 (next-token)
参数: 6.61M (全秩 CED-Hybrid2: 7.53M, −12%)
2.2 RubikLR 门控层(低秩非交换旋转,fp32 岛)
逐 token 计算(与训练并行的批量实现语义一致):
u, w = split(W_uv·x_t) # 各 ∈ R^{dh×r}, r=2
A_t = u w^T − w u^T # 反对称, 秩 ≤ 2r (=P Q^T, P=[u,−w], Q=[w,u])
S_t = λ ⊙ ( exp(A_t) · S_{t-1} ) + k_t v_t^T
o_t = q_t · S_t
- 低秩恒等式(免 dh×dh 大矩阵与逐 token 大 matrix_exp):
exp(A_t)·S = S + P·g(X)·(Q^T·S),其中 X = Q^T P ∈ R^{2r×2r},
g(X) = X^{-1}(e^X − I)。 - g(X) 的实现是稳定性关键:4×4 上用精确 matrix_exp + 正则 solve
(solve(X + 1e-4·I, e^X − I))。禁止 12 项截断 Taylor——‖X‖>2 时
截断级数发散,即首跑 NaN 的根因(§5 工程记录)。 - λ:逐头逐通道 sigmoid 标量(初始 0.27),与矩阵乘可交换,非交换性完整保留。
- fp32 岛:整层在 autocast(enabled=False) 内计算(bf16 下指数/级数类
反向会产生 inf 梯度),输出转回 bf16。
2.3 SWA 层
标准因果滑窗注意力(pre-norm,无位置编码):编码器内 win=48,解码器内 win=32。
窗口即该层的全部上下文——精确、有限。
2.4 配比(hybrid2)
6 层中 4 层 RubikLR + 2 层 SWA(50/50 按 token 计算占比近似)。
配比依据:7 点全采样曲线(§13/§14)显示 50/50 为峰值
(0/6: 4.170 → 3/6: 3.957 → 6/6: 4.021,全序列 LM 任务)。
3. 与全秩 CED-Hybrid2 的结构差
| 门控参数化 | skew 全矩阵 16×16(每层每 token 1024 参数) | P,Q 低秩 16×4(256 参数)+ 4×4 精确 exp |
| 逐 token 门控 FLOPs | O(dh³) = 4096 | O(4r·dh²) = 2048 |
| G 张量存储 | (B,L,H,16,16) 需保存 | 不构造 G |
| 参数量 | 7.53M | 6.61M(−12%) |
| 训练峰值显存 | 5.7GB | 1.7GB(−3.4×) |
| 2500 步墙钟 | 742s | 690s(−7%) |
4. 实验报告
4.1 设置
- 数据:minimind token 序列(OpenASHVoc 23005),train 1.265M / val 5000 × 128
- 目标:prefix-LM(编码器见前 96,解码器生成后 32,损失只在后 32 位置)
- 训练:2500 步,B=64,lr 6e-4,AdamW(wd 0.01),clip 1.0,bf16 + fp32 岛
- 对照(同目标同预算):CED-Rubik(纯低秩→不对,纯全秩 rubik CED)、
flat_hybrid2(无 CED 拆分平铺)、flat_rubik
4.2 主结果(val NLL, 越低越好)
| flat_hybrid2(对照上界) | 3.513 | 8.36M | 9.4GB | 3139s |
| CEDLR-Hybrid2(本模型) | 3.585 | 6.61M | 1.7GB | 690s |
| CED-Hybrid2(全秩) | 3.590 | 7.53M | 5.7GB | 742s |
| CED-Rubik | 3.610 | 8.05M | 5.7GB | 1101s |
| flat_rubik(对照下界) | 3.667 | 9.38M | 9.4GB | 4424s |
4.3 六条判读
CEDLR-Rubik 3.607 vs 3.610(−0.003)。r=2 足够。
在 CED 框架内再次胜出,与 §13 配比实验方向一致。
hybrid2 从 flat 3.513 → CED 3.590(−0.077 恶化)。CED 拆分是弱检索组件的
补偿器(跨注意力直通前缀信息),对强组件则拆分本身有损。
CEDLR-Hybrid2 以 0.072 nats 换 5.5× 训练显存比、4.5× 墙钟比——
与 DeepSeek 论文"以压缩换服务经济学"的同形权衡。
状态投影 KV 尺寸小 + 门控参数 −12%。
窗口封顶、增量路径与并行前向逐位一致(0.00e+00)、512→4096 token
生成显存恒定(2.1→10.3MB,噪声级)。
4.4 证据链(本模型的组件级历史验证)
| 非交换门控需 λ 衰减 | §2 阶段一 | 纯形式四任务随机 → 加 λ 满分 |
| λ 后的门控有效性 | §2 阶段二 fsm | 0.97~0.99 跨 2 种子,超 gla/tf |
| 长度外推 | §2 阶段二 | 4× 仅 −0.7pp(TF −38pp) |
| 50/50 配比 | §13/§14 扫参 | 7 点曲线峰值,超纯注意力 |
| 混合 LM | §九 | hybrid 系全部 > tf/gla |
| 低秩精度 | §十 H4 | r=2 差 0.007 |
| 批量 g(X) 速度 | §十一 | 修复后低秩反超全秩 |
| CED 投影 KV | §十五 本模型 | 家族内最优部署形态 |
5. 工程记录(复现者必读)
会增长)→ NaN。必须用 4×4 精确 matrix_exp + solve(X+1e-4I, e^X−I)。
autocast(enabled=False),入口 .float(),出口转回。
会静默产生错误依赖(scan 层曾中招)。
CUDA illegal access)。
6. 边界(诚实声明)
- 单种子、2500 步、d128/L128 小规模;CEDLR vs 全秩差 0.005 未做显著性检验
- CED 的 NLL 口径(32 位置)与全序列 LM(127 位置)不可横向比;
flat 对照已用同口径重训 - 质量上界仍是 flat_hybrid2(3.513)——本模型的卖点是部署经济学
(显存/参数/墙钟),不是裸质量 - Engram(查表记忆)、CSA2 三模式、MoE 未纳入简化
- loop 臂墙钟、enwik8 原版复测:外部条件待除
7. 复现
cd rubikgla
python lowrank.py # 低秩恒等式自检 (1.78e-04)
python run_ced.py # 6 模型全矩阵 (增量落盘 ced_results.json)
代码:lowrank.py(RubikLowRankFast)、run_ced.py(CEDModel/FlatModel)、
models.py(RubikLayer/SWA)、scan.py(训练并行化可选)。
数据:minimind pretrain_cached_1270238_256.pt。
8. 时间戳
设计+实验+报告:2026-09-24 前完成,GitHub dfytensor/OpenAshAnyWhere
rubikgla/ 目录(服务端时间戳可 git log 核验)。
https://github.com/dfytensor/OpenAshAnyWhere/blob/master/rubikgla

