如果你曾经重温过一部流媒体剧集中最喜欢的一集,你可能很喜欢“前情提要”的剧情回顾功能。如果没有它,你可能不得不浪费时间重看之前的剧集来了解剧情。
许多 AI 推理系统却无法享受这种便利。当用户返回文档或重新查看之前的上下文时,模型通常会从头开始重新计算所有内容,这不仅会消耗 GPU 资源,还会迫使用户等待数十秒才能获得他们已经了解过的答案。
在大规模应用中,这个问题不仅存在于存储在键值 (KV) 缓存中的上下文内存中,还延伸到支持检索增强生成 (RAG) 的向量数据库,在这些数据库中,仅仅为了保持知识的可搜索性,内存成本就会急剧上升。
结果是,AI 系统很容易遗忘,而且记忆成本过高。在 Solidigm 和 Metrum AI 联合发布的一份最新白皮书(链接在此)中,他们展示了 SSD 如何为 AI 系统提供持久的记忆,而无需为每次记忆恢复支付额外费用。FarmGPU——一家深耕存储领域的数据中心基础设施服务商——也为我们的这项研究提供了支持。
AI 推理流水线正朝着两个方向同时发展。一方面,RAG 应用依赖于庞大的向量数据库,其嵌入数量可达数亿。另一方面,大型语言模型正在处理越来越长的上下文,生成庞大的 KV 缓存,这些缓存必须保持可访问状态才能实现快速响应。
传统上,这两个问题都是通过增加 DRAM 和 GPU 内存来解决的。但这种方法正面临严峻的经济和物理限制。
在我们的研究中,我们观察到,内存中存储 1 亿个向量的索引需要超过 300GB 的 DRAM。同时,一个包含约 18 万个令牌的长上下文文档会消耗超过 90% 的 GPU 显存,几乎没有空间进行并发或重用。
结果是,系统的成本增长速度远超其价值增长速度。
该研究最清晰的发现之一是,SSD 卸载的向量检索如何从根本上改变了 RAG 的成本效益曲线。
通过使用 DiskANN 索引并将向量数据存储在 Solidigm™ D7-PS1010 SSD 上,测试系统在 1 亿个向量的情况下,将 DRAM 需求从 331GB 降低到 116GB,减少了 65%,且未牺牲准确性。事实上,即使在大规模数据下,数据召回率也保持在 99% 或以上。
性能也有所提高。在具有生产环境代表性的并发场景(1024 个线程)下,采用 SSD 卸载的 DiskANN 的查询吞吐量比受限于 DRAM 的 HNSW 索引的高出 14%,同时平均延迟和长尾延迟也更低。这一结果挑战了一个长期存在的假设:将数据迁移至存储层必然会导致结果响应变慢。
对于 RAG 流水线而言,这一发现意义重大。企业只需增加 SSD 容量,即可将知识库从数百万个向量扩展到数亿个向量,而无需围绕不断增大的内存占用重新设计服务器。
向量搜索只是故事的一半。AI 推理的另一个主要瓶颈是大型语言模型在注意力计算过程中生成的 KV 缓存。
如果没有卸载,切换回先前分析过的文档将迫使系统重新计算整个 KV 缓存,在处理大型提示词的场景下,这一过程可能需要 30~40 秒才能返回首个输出令牌。这种延迟会中断调查和分析工作流程,尤其是在用户需要在文档之间来回切换时。
该白皮书展示了如何通过扩展内存层次结构——将活跃的 KV 数据保存在 GPU 内存中,并将其他上下文信息保存在 Solidigm SSD 上——来显著改善这种体验。
当从 SSD 中检索缓存的 KV 张量而不是重新计算时,首次获取令牌的时间从约 39 秒降至仅 1.43 秒,提升了 27 倍。模型不再重复处理相同的上下文信息,GPU 可以将时间用于生成洞察,而不是重复执行已完成的工作。
同样重要的是,这种方法避免了为内存密集型工作负载扩展 GPU VRAM 的需要。SSD 为数据持久化与复用提供了成本效益更为优异的存储层级。
无论是向量检索还是 KV 缓存卸载,数据都指向一个一致的结论:SSD 不再仅仅是容量层级。借助合适的软件架构,它们可以成为 AI 推理中的积极性能层。
在合成基准测试和生产基准测试中,SSD 卸载设计均表现出色:
对于构建旨在长期运行的 AI 系统的企业而言,这一点至关重要。到 2026 年,内存价格只会一路走高。GPU 资源弥足珍贵。假设所有数据都必须存储在 DRAM 或 VRAM 中的架构,其经济可扩展性根本无法满足需求。
结论显而易见:大规模 AI 推理系统不再仅仅受益于高性能 SSD,而是必须依赖它们。
通过将 RAG 数据结构和 KV 缓存卸载到高性能 NVMe SSD,企业可以突破限制规模、响应速度和投资回报率的内存瓶颈。最终打造出的 AI 基础设施能够随着需求增长而扩展,提供持续稳定的性能,并更好地利用每一分计算资源。
通过让 AI 记住信息而非重新学习,SSD 将推理过程转化为真正的“前情提要”体验:上下文信息可在数秒内恢复,GPU 保持高效运行,洞察无需从零开始。
点击此处阅读 Metrum AI 白皮书:《突破视频分析中的内存壁垒》
Ace Stryker 是 Solidigm 的 AI 生态系统营销总监,专注于公司数据中心存储解决方案组合的新兴应用。