欢迎光临
我们一直在努力

CEDLR-Hybrid2:CED 框架 + 50/50 混合配比 + 低秩非交换门控

设计 · 结构 · 实验报告(独立完整版)
一句话:DeepSeek-V4.1-Flash 的 CED 骨架(编码器压缩前缀 → 解码器 KV 从编码器末态投影)
× 我们的 Rubik-GLA 低秩非交换门控(50/50 混合配比),
在 minimind 上以 7.5% 更少的参数、3.4× 更少的训练显存达到 CED 家族最优
val NLL 3.585(vs 全秩 CED-Hybrid2 3.590,纯平铺对照 3.513)。

定位:部署优先形态——prefill 计算减半(CED)、推理状态 O(1)+窗口 KV、
门控低秩化(O(4r·dh²))、无 MoE、单卡 1.7GB 可训。


1. 设计来源(三个血统)

成分来自本模型中的简化
CED 编码器/解码器切分 + 投影 KV DeepSeek-V4.1-Flash (arXiv:2609.19969, YOCO 血统) 无 MoE;解码器全局 KV = 编码器末态投影 C_l = H_3 W_l,Z_l = H_3 W_l^Z
非交换旋转门控 + λ 衰减 Rubik-GLA(本仓库 §2/§3) 门控改为低秩参数化(§2.3)
50/50 混合配比 配比曲线闭合实验(§13/§14) 编码器/解码器各 [Rubik, Rubik, SWA]

设计原则:不做内容选择、不做 MoE、不做查表记忆——只保留三件被各自验证过的机制。

2. 结构

2.1 总览

输入 x ∈ R^{B×128} (词表 23005, minimind token)
└─ 拆分: 前缀 P=96 (编码器) | 后缀 Q=32 (解码器生成, 损失区)

编码器 (3 层, 因果, 全 96 token):
[RubikLR] → [RubikLR] → [SWA win=48] ⇒ H_3 ∈ R^{B×96×128}

桥 (CED 核心, 每解码层独立投影):
C_l = H_3 @ W_l^KV (K, 96 entries)
Z_l = H_3 @ W_l^Z (V)
— W_l ∈ R^{128×2×128}, 每层独立 —

解码器 (3 层, 因果, 32 token):
每层: [SWA win=32 自注意力] → [Cross-Attn(Q=解码态, K=C_l, V=Z_l)]
⇒ logits (B×32×V), 损失只算 32 个后缀位置 (next-token)

参数: 6.61M (全秩 CED-Hybrid2: 7.53M, −12%)

2.2 RubikLR 门控层(低秩非交换旋转,fp32 岛)

逐 token 计算(与训练并行的批量实现语义一致):

u, w = split(W_uv·x_t) # 各 ∈ R^{dh×r}, r=2
A_t = u w^T − w u^T # 反对称, 秩 ≤ 2r (=P Q^T, P=[u,−w], Q=[w,u])
S_t = λ ⊙ ( exp(A_t) · S_{t-1} ) + k_t v_t^T
o_t = q_t · S_t

  • 低秩恒等式(免 dh×dh 大矩阵与逐 token 大 matrix_exp):
    exp(A_t)·S = S + P·g(X)·(Q^T·S),其中 X = Q^T P ∈ R^{2r×2r},
    g(X) = X^{-1}(e^X − I)。
  • g(X) 的实现是稳定性关键:4×4 上用精确 matrix_exp + 正则 solve
    (solve(X + 1e-4·I, e^X − I))。禁止 12 项截断 Taylor——‖X‖>2 时
    截断级数发散,即首跑 NaN 的根因(§5 工程记录)。
  • λ:逐头逐通道 sigmoid 标量(初始 0.27),与矩阵乘可交换,非交换性完整保留。
  • fp32 岛:整层在 autocast(enabled=False) 内计算(bf16 下指数/级数类
    反向会产生 inf 梯度),输出转回 bf16。

2.3 SWA 层

标准因果滑窗注意力(pre-norm,无位置编码):编码器内 win=48,解码器内 win=32。
窗口即该层的全部上下文——精确、有限。

2.4 配比(hybrid2)

6 层中 4 层 RubikLR + 2 层 SWA(50/50 按 token 计算占比近似)。
配比依据:7 点全采样曲线(§13/§14)显示 50/50 为峰值
(0/6: 4.170 → 3/6: 3.957 → 6/6: 4.021,全序列 LM 任务)。

3. 与全秩 CED-Hybrid2 的结构差

项CED-Hybrid2(全秩)CEDLR-Hybrid2
门控参数化 skew 全矩阵 16×16(每层每 token 1024 参数) P,Q 低秩 16×4(256 参数)+ 4×4 精确 exp
逐 token 门控 FLOPs O(dh³) = 4096 O(4r·dh²) = 2048
G 张量存储 (B,L,H,16,16) 需保存 不构造 G
参数量 7.53M 6.61M(−12%)
训练峰值显存 5.7GB 1.7GB(−3.4×)
2500 步墙钟 742s 690s(−7%)

4. 实验报告

4.1 设置

  • 数据:minimind token 序列(OpenASHVoc 23005),train 1.265M / val 5000 × 128
  • 目标:prefix-LM(编码器见前 96,解码器生成后 32,损失只在后 32 位置)
  • 训练:2500 步,B=64,lr 6e-4,AdamW(wd 0.01),clip 1.0,bf16 + fp32 岛
  • 对照(同目标同预算):CED-Rubik(纯低秩→不对,纯全秩 rubik CED)、
    flat_hybrid2(无 CED 拆分平铺)、flat_rubik

4.2 主结果(val NLL, 越低越好)

模型val NLL参数显存wall
flat_hybrid2(对照上界) 3.513 8.36M 9.4GB 3139s
CEDLR-Hybrid2(本模型) 3.585 6.61M 1.7GB 690s
CED-Hybrid2(全秩) 3.590 7.53M 5.7GB 742s
CED-Rubik 3.610 8.05M 5.7GB 1101s
flat_rubik(对照下界) 3.667 9.38M 9.4GB 4424s

4.3 六条判读

  • 低秩无损:CEDLR-Hybrid2 3.585 vs 全秩 3.590(−0.005,低秩略优);
    CEDLR-Rubik 3.607 vs 3.610(−0.003)。r=2 足够。
  • 两模型对决:CEDLR-Hybrid2 > CEDLR-Rubik(−0.022)——混合编码器
    在 CED 框架内再次胜出,与 §13 配比实验方向一致。
  • CED 结构的不对称效应:纯 rubik 从 flat 3.667 → CED 3.610(+0.057 改善);
    hybrid2 从 flat 3.513 → CED 3.590(−0.077 恶化)。CED 拆分是弱检索组件的
    补偿器(跨注意力直通前缀信息),对强组件则拆分本身有损。
  • 规模经济学与玩具质量的权衡成形:flat 上界 3.513 的代价是 9.4GB/3139s;
    CEDLR-Hybrid2 以 0.072 nats 换 5.5× 训练显存比、4.5× 墙钟比——
    与 DeepSeek 论文"以压缩换服务经济学"的同形权衡。
  • 显存 3.4× 的结构性来源:不构造 G 张量(B,L,H,16,16 消失)+
    状态投影 KV 尺寸小 + 门控参数 −12%。
  • 推理性质(继承 + 实测):Rubik 状态 O(1)(6×16×16 常量)、SWA KV
    窗口封顶、增量路径与并行前向逐位一致(0.00e+00)、512→4096 token
    生成显存恒定(2.1→10.3MB,噪声级)。
  • 4.4 证据链(本模型的组件级历史验证)

    组件/机制验证位置结果
    非交换门控需 λ 衰减 §2 阶段一 纯形式四任务随机 → 加 λ 满分
    λ 后的门控有效性 §2 阶段二 fsm 0.97~0.99 跨 2 种子,超 gla/tf
    长度外推 §2 阶段二 4× 仅 −0.7pp(TF −38pp)
    50/50 配比 §13/§14 扫参 7 点曲线峰值,超纯注意力
    混合 LM §九 hybrid 系全部 > tf/gla
    低秩精度 §十 H4 r=2 差 0.007
    批量 g(X) 速度 §十一 修复后低秩反超全秩
    CED 投影 KV §十五 本模型 家族内最优部署形态

    5. 工程记录(复现者必读)

  • 截断 Taylor 禁用:g(X) 的 12 项级数在 ‖X‖>2 发散(训练中 skew 范数
    会增长)→ NaN。必须用 4×4 精确 matrix_exp + solve(X+1e-4I, e^X−I)。
  • fp32 岛:bf16 autocast 下指数类算子反向 inf——rubik 层整体
    autocast(enabled=False),入口 .float(),出口转回。
  • pre-norm 必需:递归层无输入归一化会逐层复利爆炸(GPA 4 层即 inf)。
  • CE 前转 fp32:23005 词表的 bf16 交叉熵会溢出;加非有限跳步保护。
  • 外积写法:k.unsqueeze(-1) * v.unsqueeze(-2);写反成内积标量
    会静默产生错误依赖(scan 层曾中招)。
  • 后台任务纪律:启动前确认无旧实例(本会话两次双实例互踩 JSON +
    CUDA illegal access)。
  • 6. 边界(诚实声明)

    • 单种子、2500 步、d128/L128 小规模;CEDLR vs 全秩差 0.005 未做显著性检验
    • CED 的 NLL 口径(32 位置)与全序列 LM(127 位置)不可横向比;
      flat 对照已用同口径重训
    • 质量上界仍是 flat_hybrid2(3.513)——本模型的卖点是部署经济学
      (显存/参数/墙钟),不是裸质量
    • Engram(查表记忆)、CSA2 三模式、MoE 未纳入简化
    • loop 臂墙钟、enwik8 原版复测:外部条件待除

    7. 复现

    cd rubikgla
    python lowrank.py # 低秩恒等式自检 (1.78e-04)
    python run_ced.py # 6 模型全矩阵 (增量落盘 ced_results.json)

    代码:lowrank.py(RubikLowRankFast)、run_ced.py(CEDModel/FlatModel)、
    models.py(RubikLayer/SWA)、scan.py(训练并行化可选)。
    数据:minimind pretrain_cached_1270238_256.pt。

    8. 时间戳

    设计+实验+报告:2026-09-24 前完成,GitHub dfytensor/OpenAshAnyWhere
    rubikgla/ 目录(服务端时间戳可 git log 核验)。

    https://github.com/dfytensor/OpenAshAnyWhere/blob/master/rubikgla

    赞(0)
    未经允许不得转载:171主机测评 » CEDLR-Hybrid2:CED 框架 + 50/50 混合配比 + 低秩非交换门控
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址