一、前言:专为AI而生的企业级SSD

2个月前,我们收到了长江存储PE501 61.44TB,这是目前为止测试过的容量最大的企业级SSD。

与大部分企业级SSD不同,它是一款采用了QLC闪存的企业级SSD产品,也是长江存储自有品牌企业级产品线中,首款采用QLC闪存的SSD产品。

PE501采用的是采用了基于长江存储晶栈Xtacking 4.0技术打造的X4-6080三维闪存芯片,原生接口速率3600MT/s,单Die容量2Tb(256GB),通过高密度堆叠HDP封装技术能将单封装做到4TB,因而可以轻易在2.5寸盘体内实现61.44TB甚至122.88TB的容量。

传统QLC NAND的P/E测试一般在150~300之间,而X4-6080具备5,000次编程/擦写次数(P/E Cycle),再配合超大容量,完全不用为寿命担心。

我们测试的这款PE501 61.44TB,拥有14.2GB/s的顺序读取速度和4000MB/s的顺序写入速度,4K随机读取性能为3350K IOPS、4K随机写入性能为50K IOPS。

与消费级使用场景不同,AI超算对于存储设备的读取需求要远高于写入。

根据各大互联网巨头(如 Meta、微软、百度、阿里等)在顶会(如 FAST、USENIX ATC)以及行业白皮书上披露的实际运行统计数据,AI 超算集群中本地存储的读取(Read)与写入(Write)的流量比例通常在7:3到 9:1之间。

例如对于万亿参数的大模型训练,AI超算对于存储设备的长期平均读写带宽比约为 7:1 ~ 9:1,AI 推理场景的读写比例通常在19:1;KV Cache交换场景下,读写比例是7:3。

只有在数据预处理(ETL)阶段,读写比例才会短暂地达到1:1。

大模型参数2年暴涨240倍(GPT-1到GPT-5、DeepSeek、OpenClaw 等),而英伟达 H100/H200/B200的HBM 显存容量仅缓慢线性增长,两者形成巨大存储鸿沟。大模型在长上下文推理时,会持续生成海量KV 缓存(KV Cache)显存彻底不够用,因此需要超大容量高速SSD来处理KV Cache。

与主流数据中心普遍采用的15.36TB容量规格SSD相比,PE501单盘做到 122.88TB,容量提升8倍。一台标准的2U 24盘位服务器就可以部署3PB存储,机房机架占用减少85%,大幅降低数据中心的基础建设以及空间成本。

同时盘位减少后,服务器整机功耗、发热、机房冷却负载同步下降,整体电力成本能降低 60% 以上。

长江存储PE501 61.44TB SSD依赖3350K IOPS随机读取性能、14GB/s的顺序读取能力、百微秒级低延迟,同时超大容量可承接海量 KV 交换,是长江存储专为AI超算设计的大容量企业级SSD。

长江存储PE501系列SSD参数如下:

二、图赏

背面具备密集的沟槽和凸起设计,配合SSD两端的开孔,进一步强化散热效率。

U.2接口,又名SFF-8639,由SATA、SAS衍变而来,在企业级市场上很常见,消费级主板支持的不多,但可以转接为传统的PCIe接口或M.2接口。

三、FIO测试与AI模拟测试

为了发挥SSD的全部性能,我们使用企业级SSD厂商相同的基准性能测试方法,即基于Linux测试环境,使用FIO进行测试,看看这款PBlaze7 7A40 7.68TB SSD性能是否达标。

FIO是企业级SSD最为常用的基准性能测试工具,通过配置不同的任务数量、队列深度、不同的测试数据大小,测试范围,以及不同的读写方式、读写占比、测试时长等,可模拟出多种多样的SSD测试方法,而严谨的预处理,也更有助于反映出SSD的真实性能水平。

本次将进行128K顺序读写、4K随机读写、4K随机混合读写测试。每个项目又分别进行QD1、QD8、QD64、QD512的测试。每一项测试开始前会进行两遍的顺序全盘填充,在随机测试开始前,还需要进行相应的随机全盘填充,以4K随机性能测试为例,分为SSD格式化、128K顺序写全盘2遍、4K随机写全盘2遍。预处理、测试无缝衔接,以降低GC等因素带来的影响。

总计51个测试项目,每个项目测试时长1000秒,测试前预热10分钟。

1、4K顺序读取

4K随机读使用QD64,任务数量8,模拟大压力下的并发访问,测试时长1000秒,预热10分钟。

结果显示,PE501 61.44TB最高4K随机读性能达到3004K IOPS,最低为2914K IOPS,平均为2971K IOPS。

继续加大测试压力,将队列深度提升到128,线程数32,总QD 4096,PE501 61.44TB性能得到进一步提高,最终突破3300K IOPS。

2、4K随机写入

4K随机写入测试环节,PE501 61.44TB在稳态下最高随机写速度为51K IOPS。

3、4K随机70:30混合读写测试

4K随机混合测试,选择队列深度64,任务数量8。

可以看到4K随机读取性能达到了123K IOPS,4K随机写也有53K IOPS,综合起来为 176K IOPS。

4、128K顺序读取

128K顺序读取测试,选择队列深度512,任务数量1。

PE501 61.44TB的最高顺序读取速度为13581MiB/s,最低顺序读取速度为13556MiB/s,平均顺序读取速度为13569MiB/s。

5、128K顺序写入

PE501 61.44TB的最高顺序写入速度为3852MiB/s,最低顺序写入速度为3828MiB/s,平均顺序写入速度为3852MiB/s。SSD达到稳态后,写速度始终保持在非常平稳的水平。

测试数据汇总如下:

四、AI模拟测试

我们通过调整FIO特定参数,还原3个AI存储使用场景,来测试PE501 61.44TB SSD的性能。

每次测试前,我们都进行2次全盘顺序写入,让SSD进入稳态。

1、模拟 AI 训练的“数据喂料”(Data Ingestion)

多路 GPU 异步从 SSD 读取训练集,属于高并发、高队列深度的纯随机读/混合读。

我们将FIO参数设置为64队列深度、8线程、128KiB 块大小,纯随机读,测试时长1小时,测前预热半小时。

实测在128KiB相对较大的块大小下,PE501 61.44TB依然跑出了 10.8 万的随机读 IOPS。这意味着固态硬盘内部的闪存通道并发管理和主控性能极强,完全能够撑起多路 GPU 并行训练时的数据索取。

数据稳定性方面,除了2次全盘写入,我们还设置了1800秒(30分钟)的预热时间和 60 分钟的正式测试时间。在SSD进入稳态后,标准差(stdev)仅为 302.53 MiB/s,相对于13471 MiB/s的均值来说,波动率仅在2.2%左右。

对于 AI 训练,除了吞吐量,延迟的控制也至关重要。

观察clat percentiles,99.00%的请求延迟都在 8.98 ms 以内,而代表最极端卡顿的99.99%的请求延迟也仅仅只有11.08 ms。

最大延迟(12.63 ms)与平均延迟(4.75 ms)相差不到3倍,且没有出现企业级测试中常见的“秒级”掉速或长尾延迟卡顿。

2、模拟大模型“断点续训”(LLM Checkpointing)

在 LLM 训练中,Checkpointing 表现为大块(Large Block Size)、高并发、纯顺序写入。当训练运行到特定Step时,系统需要将数百亿甚至数万亿参数的权重(Weights)和优化器状态(Optimizer States)以最快速度从 GPU 显存刷写到 SSD 中,以防由于节点故障导致训练中断。

实测稳态下,平均写入速度3853MiB/s、标准差为363.71MiB/s(波动率约9.4%)。

需要注意的是,我们测试时已经进行了2次全盘写入,并预热30分钟,确保SSD在进入稳态后才开始时长1小时的测试。

在这种极端测试环境下,PE501 61.44TB平均写入速度依然稳定在3853MiB/s,标准差为363.71MiB/s(波动率约9.4%)。

本次测试在稳态下共计写入了13.2TB数据,平均延迟33.19ms。99.99%的写入请求都在79.17ms以内完成,最大延迟卡死在96.56ms,完全没有突破100毫秒。

在分布式训练中,最忌讳某个节点因为磁盘卡死(例如延迟突高到几秒)导致整个集群停下来等待。PE501将最大延迟控制在0.1秒以内,能完美保证大模型集群训练的整体步调一致。

3、模拟大模型推理的KV Cache(键值缓存交换)

在LLM推理或训练中,GPU显存往往装不下所有历史对话的KV缓存。此时系统需要将暂时用不到的KV缓存交换(Swap)到SSD中,需要时再读回。这类场景的典型特点是:小数据块(通常为4KiB)、高并发、读写混合(以读为主)。

我们使用4KiB(4k)块大小、70%读/30%写,8线程、每线程128队列深度的极端高并发随机读写配置来模拟KV Cache。

测试前依旧全盘写入2次并预热30分钟,测试时长则是1小时。

实测读取带宽1707MB/s、IOPS=437K,写入带宽767MB/s、IOPS=187K,总IOPS=624K。

这也就意味着每秒钟有超过62万个KV缓存切片在SSD和主机之间高频交换,这个吞吐量可以同时支撑数千个并发用户的Token生成,极大缓解了显存溢出(OOM)问题。