行业洞察

推理集群里的三层盘:X9 承接 KV Cache、Q9 装检查点与超大阵列、TITAN 9 做在线库

2026-07-14AI推理 / KV Cache / 低延迟SSD

AI 推理规模化改变了存储层的负载形态:KV Cache 溢出带来小块随机读与高频覆写,检查点则是低频大块顺序写。本文解释这两端为何分别对应 X9 超低延迟高耐久型号与 Q9 大容量 QLC,以及同一集群内分层的工程逻辑。

推理规模化把读延迟推到前台

训练阶段的存储压力集中在数据加载带宽与检查点写入,负载形态相对可预测。推理规模化之后形态变了:大量并发会话各自持有上下文,KV Cache 从显存溢出到主机内存、再溢出到 SSD,命中与否直接反映在首 token 时延上。这类访问是小块、随机、读多写少,但对延迟分布的敏感度远高于平均值——平均值好看而 P99.9 掉到毫秒级的盘,在会话层面就是可感知的停顿。

X9 为什么按超低延迟叠加高耐久来定义

型号带 X 的产品针对的正是这一层。X9 的 J990X 与 J995X 走 PCIe 5.0,定位超低延迟高耐久,面向 AI KV Cache 与实时数据库。全产品线规划的写入耐久上限是 120 DWPD,这是产品线层面的包络值,不是某个系列的标称规格;但缓存层确实是最需要往这个方向靠的负载——会话进出会持续覆写同一批区域,日均写入量远高于常规数据盘,用 1 DWPD 定位的通用盘去承接,先撞上的是寿命而不是性能。代价同样明确:低延迟高耐久要求更保守的介质工作点,容量密度必然让位。这些型号名已于 2026-07-22 固定,性能与耐久数值仍是产品定义/EVT 阶段的目标值。

检查点与归档不是同一层

另一端的负载几乎相反,但它内部也要再分。Q9 的 J960Q 与 J960QD 走 Gen5 QLC,定位 AI 检查点与超大容量阵列:检查点落盘是低频、大块、顺序的,写完之后长期只读,容量与顺序带宽比随机延迟重要得多;带 QD 的双端口型号面向需要双路径访问的阵列。Q7 的 J760Q 与 J760QD 是 Gen4 QLC,方向不同,面向对象存储、备份与归档这类真正的冷数据留存。产品线规划的单盘最大容量 122.88TB 说明的是容量层能做到的量级,属于全线边界数字,具体落点由各型号的容量 SKU 组合决定。QLC 每单元四比特带来更窄的读窗口、更长的编程时间与更低的耐久,在大块低频改写下这些代价可控,同一颗盘放到 KV Cache 层则会立刻暴露短板。

中间层与形态约束

在线数据库、向量索引与元数据要吞吐与延迟兼顾,对应 TITAN 9(J960、J980、J961、J981,PCIe 5.0 U.2/U.3),其中 J960C 提供透明压缩,对可压缩数据可以换取有效容量。产品线规划的最高顺序读 14,500 MB/s 同样标注在产品线层面,而不是挂在某一个系列名下。高密度节点受机架散热与背板约束,用 FLEX 9 的 E3.S(J100E、J130E)与 E1.S(J100S、J130S)形态适配 OCP 机型;日志、元数据与缓存层若仍在 Gen4 平台上,则由 X7(J790X、J795X)承接。

分层的成本逻辑

把不同型号混在一个集群里的理由不是型号多,而是每层的付费口径不同:延迟敏感层按微秒与 DWPD 付费,容量层按 TB 付费,中间层按吞吐与 QoS 稳定性付费。真正的工程量在跨层隔离——多命名空间划分、QoS 权重分配、双端口路径切换,都属于集群级而非单盘级的设计,分层收益也只能在平台级测试里确认,不能靠单盘指标外推。

キーワード
AI推理KV Cache低延迟SSDJ990XQLC大容量J960Q检查点存储存储分层TITAN 9