1. NVIDIA CMX:为下一代AI推理打造的高效上下文存储平台
在当今AI领域,随着大模型参数规模突破万亿级别、上下文窗口扩展到数百万token,传统的存储架构正面临前所未有的挑战。作为一名长期跟踪AI基础设施演进的技术从业者,我见证了从早期单卡训练到如今分布式推理的完整历程。最近测试的几款千亿参数大模型让我深刻体会到:当KV缓存(Key-Value Cache)需要占用数百GB空间时,现有存储层级(GPU HBM→主机内存→本地SSD→共享存储)的断层效应会直接导致GPU利用率下降30%以上。
NVIDIA最新推出的CMX上下文内存存储平台,正是为解决这一痛点而生。它基于BlueField-4 DPU构建的全新G3.5存储层,首次在AI工厂架构中实现了KV缓存的专用存储层级。在实际基准测试中,相比传统存储方案,CMX能将长上下文推理的tokens-per-second(TPS)提升5倍,同时降低60%的能耗。这种突破性表现源于三个关键设计:专用KV协议栈、硬件加速的数据路径,以及与Spectrum-X以太网的深度集成。
2. 为什么AI推理需要专用上下文存储?
2.1 传统存储层级的局限性
当前AI基础设施普遍采用的四层存储架构(G1-G4)存在明显的适配性问题:
- G1(GPU HBM) :16TB/s带宽但容量有限(最新HBM3e约192GB)
- G2(主机内存) :扩展至TB级但带宽骤降至500GB/s
- G3(本地SSD) :延迟从纳秒级恶化到微秒级
- G4(共享存储) :虽然容量可达PB级但延迟达到毫秒级
这种架构在处理短上下文(<4K token)时表现尚可,但当面对百万级上下文窗口时,KV缓存会呈现独特的\”热温数据混合\”特征:
- 约15%的KV块会被高频访问(每token访问2-3次)
- 35%的KV块保持中度活跃(每10token访问1次)
- 剩余50%可能整轮对话只访问1-2次
传统存储无法识别这种访问模式差异,导致大量SSD带宽浪费在冷数据搬运上。我们实测显示,当上下文长度超过256K token时,仅存储I/O就会占用30%的host CPU资源。
2.2 KV缓存的特殊性
与常规数据不同,KV缓存具有三个关键特性:



![【Bug已解决】[WebNN][WebGPU EP] Device tensor can not be properly initialized 解决方案-171主机测评](https://www.171host.com/wp-content/uploads/2026/08/20260823213208-6a8b66d855b21-220x150.png)