欢迎光临
我们一直在努力

Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation通过改进的无偏梯度估计实现

《Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation》主要研究如何在NVIDIA Blackwell GPU支持的NVFP4 4位低精度格式下,实现对大语言模型(LLM)的高精度、高效率预训练。核心目标是解决现有FP4量化训练方法因梯度估计偏差或方差过大而导致模型精度下降的问题。

以下是论文主要研究内容的全面概括:

1. 核心问题与动机

  • 背景:LLM预训练计算成本极高,降低矩阵乘法精度是提升效率的关键。NVFP4格式相比FP8/BF16可提供2-4倍吞吐量提升。

  • 挑战:现有FP4训练方案(如NVIDIA官方方案、TetraJet-v2)虽采用随机舍入(SR)保证梯度估计无偏,但SR引入的方差过大,导致模型精度显著低于FP16/FP8训练。

2. 主要创新点

(1)提出新的无偏量化原语 MS-EDEN
  • 核心思想:将随机性从高方差的逐元素FP4舍入,转移到低方差的微尺度(Micro-scaling)分组缩放因子上。

  • 实现方式:

    • 对输入向量分块(如128维)应用随机Hadamard变换(RHT)平滑离群值。

    • 使用确定性的“舍入到最近”(RTN)量化得到FP4值,降低MSE。

    • 用随机舍入将EDEN校正因子(缩放系数)融入FP8组缩放因子,保持整体无偏性。

  • 优势:相比SR,MS-EDEN的量化MSE降低超过2倍(表1:SR的MSE为23.5×10⁻³,MS-EDEN为9.4×10⁻³),同时保持无偏性。

(2)构建全NVFP4线性层计算方案 Quartet II
  • 前向传播:

    • 使用原生NVFP4缩放(每16个元素一个FP8缩放因子),保留更高表示能力。

    • 采用“Four-Over-Six”(4/6)启发式,为每个块从4.0和6.0两个缩放因子中选择MSE更优者,进一步降低前向量化误差。

  • 后向传播:

    • 使用MS-EDEN进行重量化,同时量化两个GEMM(E·W 和 Eᵀ·X)所需的张量。

    • 要求权重和激活在后向传播中被重新量化(与之前方案不同),但MS-EDEN的低误差足以抵消重量化带来的额外开销。

  • 整体优势:在改善后向梯度估计质量的同时,保留前向传播的高表示能力,解决了以往方案中“方形分块量化”带来的表示精度损失问题。

(3)提供高效的GPU内核实现
  • 优化技术:设计了“事后范围对齐”(Post Hoc Range Alignment)内核,避免双重加载和旋转,降低内存带宽和计算开销。

  • 性能表现:

    • 在RTX 5090上,线性层训练速度相比BF16提升超过4倍;在B200上,大模型规模下可达2.5倍加速。

    • 在1.1B参数模型端到端训练中,实际吞吐量达到BF16的1.85倍(52 tok/s vs 28 tok/s)。

3. 实验验证

(1)消融实验(Llama-2类模型,30M~200M参数,C4数据集)
  • 后向量化:在所有GEMM量化组合下,MS-EDEN均优于SR,且带重量化的全MS-EDEN方案(方案e)甚至优于不带重量化的全SR方案(方案d)。

  • 前向量化:原生NVFP4缩放 + 4/6启发式显著优于方形分块量化,验证了其与原生格式的良好协同性。

  • 全量化对比:Quartet II相比NVIDIA方案、4/6方案、TetraJet-v2,验证损失差距(与BF16相比)至少降低20%。

(2)更大规模验证(Nanochat,560M~1.9B参数,FineWeb-Edu数据集)
  • 在380亿token上训练1.9B模型,Quartet II的预训练损失差距比现有NVFP4方法缩小15-25%。

  • 下游零样本评测(ARC、PIQA、HellaSwag等)虽因微调数据有限导致差异不显著,但验证损失稳定改善。

(3)无偏性验证
  • 通过多次随机重复后向传播,证明MS-EDEN的梯度估计误差随采样次数增加按1/B速度衰减,符合无偏估计性质;而将4/6用于后向传播则引入偏差。

4. 核心贡献总结

贡献描述
MS-EDEN原语 首个针对微尺度FP4格式的无偏量化方法,误差比SR降低2倍以上。
Quartet II方案 完整的前后向量化计算图,兼顾前向表示能力和后向梯度无偏性。
实证验证 在多种模型规模和训练数据量下,证明Quartet II稳定优于现有FP4方案。
高效内核 提供可实际运行的CUDA实现,在Blackwell GPU上获得明显加速,具备现实可用性。

5. 局限性与未来方向

  • 实验主要聚焦于NVFP4格式和LLM预训练,虽理论上可推广,但需针对其他架构或问题调整旋转粒度等超参数。

  • 当前仅支持NVIDIA Blackwell一代硬件,泛化性有待进一步验证。

文章通过将分布式优化中的EDEN去偏技术适配到NVFP4微尺度格式,提出了MS-EDEN量化原语和Quartet II训练方案,在保证梯度估计无偏且低方差的同时,提升了前向表示能力,实现了比现有FP4方案更高精度和更高效率的LLM预训练。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

摘要

NVFP4 低精度格式,由 NVIDIA Blackwell GPU 提供硬件支持,有望首次实现大规模模型(如 LLM)的端到端全量化预训练。然而,现有的量化训练方法为了通过随机舍入(SR)实现更精确的无偏量化梯度估计,仍然牺牲了该格式的部分表示能力,导致相对于标准 FP16 和 FP8 训练出现明显的精度损失。在本文中,我们通过一种新颖的、针对微尺度格式的无偏量化例程(称为 MS-EDEN)来改进 NVFP4 量化训练的最新水平,该例程的量化误差比 SR 降低了 2 倍以上。我们将其集成到一个新颖的全 NVFP4 线性层量化方案中,称为 Quartet II。我们通过分析表明,Quartet II 在所有主要的矩阵乘法运算(包括前向和后向传播)中都能实现持续更好的梯度估计。此外,我们的方案与近期专门针对 NVFP4 的训练改进措施具有良好的协同效应。我们通过在多达 380 亿个 token 上预训练多达 19 亿参数的 LLM 来进一步验证 Quartet II。我们提供了可在 NVIDIA Blackwell GPU 上执行的内核,相较于 BF16 可实现高达 4.2 倍的加速。

1. 引言

训练最先进的基础模型的计算成本正以大约指数级的速度增长,这使得该领域的可持续性受到质疑,例如 (Amodei & Hernandez, 2018; Sevilla et al., 2022)。预训练基于 Transformer 的现代基础模型主要由密集矩阵乘法(GEMM)主导,例如注意力机制和 MLP 中的线性投影。因此,降低这些 GEMM 的精度是降低端到端训练成本最直接的手段之一。

这一动机推动了混合精度训练方法的稳步发展,从 FP16/BF16 到 FP8 (Micikevicius et al., 2022),现在正朝着 4 位微尺度浮点格式(如 MXFP 和 NVFP)迈进。在这些格式中,值以 4 位浮点编码存储,但每个小块都配有一个更高精度的(例如 FP8)缩放因子,从而在保留动态范围的同时实现张量核心加速。最新的 GPU 加速器为这些格式提供了原生支持,单个矩阵乘法的吞吐量比 FP8 提高了 2-4 倍 (NVIDIA, 2024)。

关键的挑战在于,在以 4 位精度执行大部分操作的同时,保持 FP16/FP8 质量级的优化效果 (Xi et al., 2023; Chmiel et al., 2024)。在这种规模下,朴素的量化会导致长时间预训练过程中的发散。关于稳定 FP4 原生训练的新兴工作 (Tseng et al., 2025; Castro et al., 2025; Chmiel et al., 2025) 已汇聚于两个指导原则。首先,前向传播应通过最小化激活和权重的量化误差(通常通过均方误差 MSE 衡量)来最大化表示能力。其次,后向传播对偏差尤其敏感:因此,有偏的梯度估计器会在许多步骤中累积系统性误差,使得无偏(或仔细控制的)梯度量化对于稳定收敛至关重要。这些见解支撑了 NVIDIA 首个端到端 NVFP4 预训练方案 (NVIDIA et al., 2025) 及其后续改进,包括前向传播的缩放因子选择启发式算法 (Cook et al., 2025) 和改进的 NVFP4 稳定性机制 (Chen et al., 2025b)。然而,当前最先进的 FP4 方案相较于 FP8 和 FP16 仍然有显著的精度下降。

贡献。 在本文中,我们通过重新审视 NVFP4 微尺度格式的无偏梯度估计问题,改进了 NVFP4 原生训练的当前技术水平。令人惊讶的是,我们发现现有的主流解决方案,即元素级 FP4 随机舍入(SR),可以得到显著改进。为此,我们引入了一种新的、适用于微尺度格式的无偏量化例程,称为 MicroScaling EDEN (MS-EDEN),它通过将随机性从单个 FP4 值转移到微尺度缩放因子上来降低量化误差,同时保留可证明的期望无偏性。基于 MS-EDEN,我们构建了 Quartet II,一个全 NVFP4 线性层计算图,它结合了 (i) 使用原生 NVFP4 缩放并辅以“Four-over-Six”缩放因子选择启发式算法 (Cook et al., 2025) 的高容量前向传播,以及 (ii) 基于 MS-EDEN 和高效的内维度随机分块旋转的无偏后向传播。我们通过分析比较表明,Quartet II 在 Transformer 训练中的主要矩阵乘法运算上能持续提供改进的梯度估计,并在端到端 LLM 预训练中验证了这些改进。最后,我们提供了可在 NVIDIA Blackwell GPU 上高效执行的内核,使所提出的方案在实际规模下具有实用性。总之,我们的贡献如下:

一种新的、专为微尺度 FP4 格式设计的无偏量化原语,称为 MS-EDEN,它在保持硬件兼容性和高效性的同时,显著降低了相对于 FP4 随机舍入的量化误差。一个称为 Quartet II 的全 NVFP4 线性层训练图,它结合了改进的前向传播量化和改进的(基于 MS-EDEN)无偏后向传播量化,从而产生更好的梯度估计。实证验证: 我们通过大量消融实验和端到端精度验证(训练运行)展示了相对于先前 NVFP4 方案的一致精度提升。高效内核: 我们展示了我们的方案可以在 NVIDIA Blackwell 代 GPU 上高效实现,相较于 BF16 可实现高达 4.2 倍的加速。

2. 相关工作

低精度训练。 低精度训练是深度学习中的一个长期方向,例如 (Courbariaux et al., 2015; Esser et al., 2019; Panferov et al., 2025a; Micikevicius et al., 2022; Hernandez-Cano et al., 2025)。早期对 4 位训练和 4 位矩阵乘法的演示主要集中在 INT4 上,并确立了在受限条件下,仔细处理缩放因子和离群值可以保持准确度 (Xi et al., 2023; Chmiel et al., 2024)。

微尺度 FP4 训练。 最近推出的 NVFP4 和 MXFP4 微尺度浮点格式 (NVIDIA, 2024) 引发了对此方向的新兴趣。Tseng 等人 (2025) 研究了仅在后向传播中使用 MXFP4,强调了微尺度选择和张量核心行为如何与优化稳定性相互作用。Castro 等人 (2025) 和 Chmiel 等人 (2025) 同时提出了首个稳定的全量化训练方案。前者专注于 MXFP4,并结合使用了 Hadamard 旋转和 MSE 最优裁剪,提供了 GPU 内核结果;而后者专注于

NVFP4,采用了谨慎的 RTN 量化和选择性随机舍入,并提供了更大规模(1T token)的模拟训练结果。NVIDIA 等人 (2025) 推出了首个大规模 NVFP4 方案,利用了方形分块量化、后向传播中的 Hadamard 旋转,并将某些层设置为更高精度。TetraJetV2 (Chen et al., 2025b) 通过改进的离群值控制和振荡减少技术增强了 NVIDIA 的方法。FourOverSix 技术 (Cook et al., 2025) 通过一种减少 MSE 的专用网格选择算法提供了正交改进。

TetraJet-v2 由 Chen 等人 (2025b) 提出,作为对 NVIDIA 等人 (2025) 方案的升级。它引入了对该方案的一些修正以及一些进一步稳定化的启发式方法:i) 修正了后向传播中的激活重量化,以更好地符合链式法则,并添加了类似于 Castro 等人 (2025) 的权重重量化;ii) 引入了中间层 FP32 缩放因子和选择性离群值通道。这些格式变化的实用性难以验证,因为它们需要作者未提供的、复杂得多的内核支持。有鉴于此,当我们在后文引用 TetraJet-v2 时,我们将指代以下 GPU 可行的方案:前向传播中使用不带方形分块缩放因子的 RTN NVFP4 量化,后向传播中对两个 GEMM 的内维度使用带 RHT 的 SR 量化。但是,我们不会重新实现他们的中间层 FP32 缩放因子或离群值通道。这将逻辑方案与实践中难以实现的设计决策区分开来。

上述所有技术都采用某种形式的随机舍入(SR)来保持后向传播的无偏性。我们重新审视了这一选择,并提出了一种新的无偏梯度估计器(MS-EDEN),它提供了显著更好的 MSE 和验证损失。

无偏量化与旋转。 无偏随机量化是分布式优化中的一项关键技术 (Alistarh et al., 2017; Suresh et al., 2017; Davies et al., 2020),因为它能为通信减少的 SGD 带来收敛性保证。随机舍入是低精度训练中的标准无偏原语,但在较低位宽下会显著增加方差。EDEN (Vargaftik et al., 2022) 将随机旋转与校正性重新缩放相结合,在分布式优化中获得了(近乎)无偏的估计器。然而,这项技术不能直接应用于我们的场景,我们将在第 3.2 节讨论这一点。我们的 MS-EDEN 例程通过实现无偏性同时相对于 SR 减少误差来解决此问题。更广泛地说,旋转也被用于权重和激活量化情况下的分布平滑 (Tseng et al., 2024; Ashkboos et al., 2024)。

图 1. 选择性 NVFP4 后向传播量化对 C4 验证损失的影响(相对于 BF16 预训练),针对 N 参数量的 Llama-2 类 LLM,令牌-参数比为 D/N。坐标轴标题指示了两个后向传播 GEMM 中的哪些张量被量化。

3. 后向传播量化

我们将重点放在 LLM 预训练的后向传播量化中的无偏性上,已有研究表明这对于稳定的长期收敛至关重要 (Chmiel et al., 2024; Tseng et al., 2025; Castro et al., 2025; NVIDIA et al., 2025)。直观地说,这是因为梯度估计中的持续偏差可能导致持续不正确的下降方向。

3.1. NVFP4 与随机舍入

量化训练的最终目标是通过使用专门的低精度 GEMM 来实现更高的吞吐量;特别是,NVIDIA 和 AMD 的最新 GPU 支持称为 MXFP4 和 NVFP4 的微尺度格式。研究表明,NVFP4 格式比 MXFP4 具有更高的精度 (NVIDIA et al., 2025; Egiazarian et al., 2025; Chen et al., 2025a)。它将张量值映射到 E2M1 浮点格式,并具有两级缩放因子:每 16 个值一个 E4M3 缩放因子,以及每个张量一个用于范围扩展的 FP32 缩放因子。形式上,x 的量化表示 QSR​ 变为

3.2. EDEN 重新缩放:一个理论上有依据的解决方案

在 LLM 量化背景下,一个流行的工具是随机旋转,例如随机 Hadamard 变换(RHT)(Xi et al., 2023; Tseng et al., 2024; Ashkboos et al., 2024; Tseng et al., 2025)。RHT 的另一种用途来自分布式优化 (Suresh et al., 2017; Davies et al., 2020; Vargaftik et al., 2021)。其中一种方法是 EDEN (Vargaftik et al., 2022),它使用 RHT(由随机变量 ω 播种)来确保高精度旋转向量 RHT(x,ω) 与量化向量的期望 Q(RHT(x,ω)) 之间的共线性。其基于此构造,EDEN 的作者表明,如果 d 是基础维度,那么:

3.3. 我们的解决方案:微尺度 EDEN

概述。 我们现在展示如何将方程 1 中给出的 EDEN 偏差校正扩展到 NVFP4 微尺度量化格式。我们过程的伪代码在算法 1 中给出。我们首先提供概述,然后讨论一些关键实现细节。

该过程以例如 128 个连续条目(只要是量化组大小 16 的任意倍数即可)的块来处理输入向量 x,给定旋转和舍入种子,

4. 前向传播量化

4.1. 表示与重量化之间的权衡

4.2. 使用“4/6”的前向传播

Cook 等人 (2025) 提出了 Four Over Six(“4/6”),这是对 NVFP4 量化算法的修改,它为每个值块评估两个潜在的缩放因子(4.0 和 6.0),并选择产生较低 MSE 的那个。他们将“4/6”与后向传播中的随机舍入相结合。

然而,这种组合存在一个显著的正确性问题。在所提出的形式中,它不构成无偏估计,因为选择较低 MSE 缩放因子分支的行为引入了偏差,即使两个缩放因子分支通过 SR 各自都是无偏的。我们在附录 A 中通过实验验证了这一说法。因此,他们的方案不会产生无偏的梯度估计,因此,我们将其从后向传播比较中排除。

然而,它对前向传播的用处是明确的。在他们最初的方案中,由于对权重张量使用了方形分块量化,这个想法没有被利用。我们通过测量“4/6”在 N(0,1) 张量上的二次误差改进来验证这一点,并将结果报告在表 1 中。

5. Quartet II 计算图

现在我们将所有内容整合在一起,提出 Quartet II,一个用于 LLM 预训练的全 NVFP4 线性层计算方案,具有无偏梯度估计保证。

6. 实验验证与扩展

6.1. Llama 系列模型预训练

我们现在通过消融 Quartet II 的各个组成部分,在 LLM 预训练中提供实验验证。具体来说,我们按照 Llama 2 (Touvron 等人,2023) 架构训练 Transformer 模型 (Vaswani 等人,2023),在 C4 数据集 (Dodge 等人,2021) 的样本上进行语言建模损失训练,使用 Adam (Kingma & Ba, 2017) 和余弦学习率调度 (Loshchilov & Hutter, 2017)。我们训练了 30M、50M、100M 和 200M 参数的模型,数据与参数之比分别为 25、50、100、200、400 和 800,范围从接近计算最优 (Hoffmann 等人,2022) 到严重过度训练。我们通常遵循 Panferov 等人 (2025b) 的超参数设置,但将较大模型的学习率与模型宽度成反比缩放。我们在 BF16 基线和 QAT 运行之间重用所有超参数(包括 LR 和权重衰减)。我们在附录 B 中描述了所有超参数。

图 3. Quartet II 全 NVFP4 线性层计算方案。

图 4. 全 NVFP4(前向和后向传播)C4 验证损失差距(相对于 BF16 预训练),针对 (N) 参数量的 Llama-2 类 LLM,令牌-参数比为 (D / N),比较 Quartet II 与基线方法。

自然,MS-EDEN 与方案 (b) 和 (d) 不兼容,因为它需要权重重量化。然而,我们观察到,在每种两者都适用的方案中,MS-EDEN 的性能始终优于 SR,更值得注意的是,带有权重重量化的全量化 MS-EDEN(图 1 (e))优于不带权重重量化的全量化 SR(图 1 (d))。

6.2. Nanochat 预训练

为了在更大规模和质量更高的数据上验证 Quartet II,我们提供了 Nanochat (Karpathy, 2025) 训练流程的结果。它与第 6.1 节的消融实验设置在多个方面有所不同:1) 它使用 Muon 优化器 (Jordan 等人,2024) 和 WSD LR 调度 (Hu 等人,2024),2) QK-归一化 (Henry 等人,2020; Dehghani 等人,2023) 和 3) ReLU 22 MLP 激活函数 (So 等人,2022)。在数据方面,Nanochat 模型在 FineWeb-Edu (Lozhkov 等人,2024) 上以每参数 20 个 token 的比例进行预训练,然后在 ARC (Clark 等人,2018)、GSM8K (Cobbe 等人,2021)、Smol-SmolTalk (Allal 等人,2025) 及其他较小数据集的训练集上进行微调。我们在附录 C 中指定了所有细节。

与第 6.1 节类似,我们用选定的 QAT 方案替换所有线性层,保留所有训练超参数。我们发现 Quartet II 是稳定的,并且在预训练阶段,相对于现有的 NVFP4 方法,将预训练损失与 BF16 的差距缩小了 15−25%,如图 5 中验证每字节位数(bits-per-byte)相对于 BF16 的增加所示。零样本基准测试结果,报告在额外的中期训练和 SFT(附录 C)之后,显示 QAT 方法之间的差异不显著,可能是由于短暂的指令微调和较小的测试数据集。

7. 内核支持

融合重量化内核。 图 3 中的阴影区域大致标明了哪些操作可以在 GPU 上合并执行以提高效率。然而,在实践中,这些操作无法在单个内核传递中执行,因为 NVFP4 量化所需的全局最大值规约充当了一个全局屏障。它必须在一个单独的内核中执行,如图 7 所示的重量化 MS-EDEN 操作示例。这使内存带宽和矩阵乘法成本加倍,因为整个张量必须被加载和旋转两次。

text[[87, 864, 472, 894], [499, 616, 884, 646]] 事后范围对齐。 为避免双重加载和旋转,我们针对 NVFP4 量化提出以下格式特定且硬件感知的实现启发式方法:事后范围对齐。

在第一个内核中,我们不是用预先计算好的 AbsMax 来对齐缩放因子的范围,而是跳过对齐,将缩放因子舍入到 E8M3——一个用 BF16 表示的扩展范围 FP8 代理。然后我们将张量值除以缩放因子,舍入到 FP4。我们将 E8M3 缩放因子和 FP4 值的这种组合称为扩展范围 NVFP4(ER-NVFP4)。我们在同一内核中计算旋转后的全局绝对最大值和 EDEN 校正因子,从而无需加载和旋转原始张量两次。

在第二个内核中,我们加载 E8M3 伪缩放因子以及归约后的 FP32 全局最大值,将伪缩放因子移位到 FP8 可表示区域,应用 EDEN 校正,并通过随机舍入将它们量化为 FP8,从而产生无偏梯度估计。以重量化 MS-EDEN 操作为例,得到的方案如图 8 所示。由于第二个内核仅对缩放因子进行操作,它所需的内存移动量远少于初始量化,导致理论带宽节省约 20%,如表 2 所示,并且第二个内核的实际延迟比第一个内核低 10 倍以上。我们在附录 D 中讨论了具体实现。

加速效果。 我们为 NVIDIA RTX 5090 GPU 和 B200 提供并基准测试了定制的 CUDA 内核,这些内核针对后向传播中的三种独特 Quartet II 量化操作以及前向传播中的 Four Over Six 量化。对于矩阵乘法本身,我们使用 cuBLAS。

首先,为减少外部因素(例如,分布式环境、注意力实现、词汇量大小)的影响,我们报告线性层操作的孤立加速比。图 6 显示了在 RTX 5090(1676 TFLOP/s;理论加速 8×8×)和 B200(9000 TFLOP/s;理论加速 4×)上的这些结果。由于功耗或热限制,以及矩阵形状的原因,纯矩阵乘法实际达到的 FLOP/s 低于理论速度,并在图中以空心框显示。实心框表示实际速度,两者之间的差距对应于我们的量化内核的成本。

在 RTX 5090 上,Quartet II 在大型矩阵上实现了超过 4× 的线性层加速,即使在小型矩阵上也超过 4×,并且始终优于 Quartet (Castro 等人,2025) 的实现。在 B200 上,较小的矩阵大小完全由量化开销主导,我们仅在 3B 规模开始看到实际加速,并在 22B 时达到 2.5×。此外,我们展示了在 1B LLM 预训练中,相对于 BF16,实际训练吞吐量提高了 1.8 倍以上(详情见附录 D)。

8. 结论与局限性

我们利用分布式优化的见解,为微尺度格式提出了一种新颖的无偏量化方案,称为 MS-EDEN。基于此,我们提出了 Quartet II——一种用于 NVFP4 LLM 预训练的计算方案。

表 2. 朴素和事后范围对齐 MS-EDEN 重量化内核的全局内存(GMEM)带宽和 GEMM 指令复杂度。

我们验证了 MS-EDEN 更好的保证意味着更好的模型质量,并且所提出的方案受益于额外的 QAT 启发式方法。我们以 CUDA 内核形式提供的硬件支持进一步展示了其实际潜力。

尽管我们认为本文的主要贡献在于将先进的去偏技术应用于深度学习模型训练的后向传播,但实验验证集中在相对较窄的 NVFP4 格式 LLM 预训练问题上,该格式目前仅支持单代 NVIDIA 加速器。从基本统计特性(即在高斯源上可测量的更低 MSE)来看,我们预计该方法也能推广到其他问题和模型架构,但这可能需要额外的超参数调整,例如随机旋转的时间粒度和空间粒度。

赞(0)
未经允许不得转载:171主机测评 » Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation通过改进的无偏梯度估计实现
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址