KVCache 正在经历一次身份上的转变:从"计算内的优化技巧"走向"独立的基础设施层"。
 
早期,KVCache 更多被视为推理引擎内部的一项性能优化方案——通过 PagedAttention、Block Manager 等技术手段,在单机、单卡的范围内尽可能提高显存利用率、减少碎片浪费。这一阶段的优化目标是"把 HBM 用得更好"。
 
而随着上下文窗口从 4K 迅速扩展至百万级 Token、多轮对话、Agent 工作流等应用场景的普及,KVCache 的管理诉求已经超出了单机、单卡的范畴,开始向集群级、跨节点的方向演进。企业需要的不再只是"在一台机器上少浪费一点显存",而是"让整个推理集群里已经算过的东西,能够被尽可能多的请求复用"。
 

图1: AI 推理时代存储分层演进:G3.5 共享 KV Cache 层

 
KVCache 需要一个新的存储层级——它既要有足够大的容量来承载长上下文与高并发带来的缓存膨胀,又要具备跨节点、跨实例的共享能力,同时还要在性能上尽可能逼近本地显存的访问体验。
 
在 KVCache 的分级缓存体系中,本地 NVMe SSD 通常被称为 G3(第三级缓存)——容量大、单位成本低,但数据只能留在产生它的那台机器上,无法被集群中的其他节点访问。而G4 更远端的分布式存储系统虽然可以实现跨节点共享,却往往要付出更高的建设成本与组网复杂度作为代价。
 
在 G3(本地 SSD)与G4 远端共享存储之间,事实上存在一个尚未被充分定义的"断层地带":企业需要一种存储层级,既要具备接近本地 SSD 的访问性能,又要具备跨节点共享的能力——这正是 G3.5 命名的由来。它并非对某一层的简单替代,而是在 G3 与G4 存储之间新增的一个独立层级,专门用于承接那些"本地放不下、又希望以更低成本更高效率实现跨节点共享"的 KVCache 数据。
 
 

YRCache ContextBox AI 推理专属缓存层

 

 

面对这一行业性挑战,焱融科技借鉴了 NVIDIA CMX 参考架构设计,正式推出 YRCache ContextBox ——AI 推理场景专属的缓存分层,定位于本地 SSD(G3)与远端网络存储(G4)之间,专为 KVCache 的访问特征设计,旨在填补传统分级存储体系中"单机容量有限、跨节点无法共享"的关键断层。
 

YRCache ContextBox 解决的核心问题

 
跨节点/跨实例的 KVCache 共享
 
G3.5 的首要使命,是让 KVCache 摆脱"困在单机里"的宿命。无论请求被负载均衡分发到哪个推理节点,只要曾经计算过的上下文被写入过 G3.5,集群中的任意实例都可以直接读取并复用这份缓存,无需重新计算 Prefill。这一能力直接对应前述的行业普遍痛点——"会话无法迁移、跨节点复用率低"。
 
突破单机内存SSD 容量上限
 
对于超长上下文场景(如百万级 Token 的长文档理解、复杂 Agent 任务),单台服务器的主机内存与本地 SSD 容量终究是有限的。G3.5 作为一个可独立扩展的共享层,能够将 KVCache 的可用容量从单机的 GB~TB 级别,扩展到跨节点池化后的 TB~PB 级别,从根本上打开容量天花板。
 
计算与缓存解耦,支持弹性扩缩容
 
将 KVCache 独立于计算节点之外存放,还带来了一个重要的架构收益:计算与缓存实现了解耦。当推理集群因业务波峰波谷需要弹性扩缩容时,新加入的计算节点可以直接访问 G3.5 中已有的缓存数据,而不必"从零开始";节点下线时,其产生的缓存数据也不会随之丢失。这使得推理集群的弹性伸缩不再以"牺牲缓存命中率"为代价。
 

YRCache ContextBox 的架构设计

 
YRCache ContextBox 是基于“计算-网络-存储-软件”深度协同设计 (Co-design) 理念打造的系统级解决方案。它向下打破硬件孤岛,向上无缝衔接主流 AI 生态,通过重构长上下文记忆的存取链路,为大模型推理提供兼具极致性能与极致弹性的底层支撑。
 
图2: YRCache ContextBox:端到端深度集成的 AI 原生存储基础设施
 

 

YRCache ContextBox 核心优势

 

释放能耗红利,重塑绿色 AI
 
YRCache ContextBox 基于 DPU,实现了 NVIDIA CMX 分层缓存架构的实际落地,构建专为 KV 缓存深度定制的高效存储层,有效避免了传统存储方案带来的无效功耗。我们帮助企业“回收”数据中心宝贵的能源,将其重新聚焦于核心的 GPU 算力上,助力 AI 服务在同等能耗预算下实现计算规模的绿色倍增。
 
算力引擎倍增器:极致的 GPU 吞吐量与极速响应
 
通过在 YRCache ContextBox 缓存层中高效复用预计算的 KV 数据,完美消除重复计算导致的算力浪费,优化数据链路并大幅降低 I/O 停滞。这不仅使多轮对话与 Agent(智能体)推理的吞吐量(Tokens/sec)飙升,更极大地缩短了首字生成时间(TTFT)和端到端完成时间。无论面对怎样激增的模型参数、上下文窗口还是超高并发请求,都能保障丝滑流畅的极速响应体验。
 
集群级协同:AI Pod 内的全局智能 KV 共享
 
打破节点孤岛,YRCache ContextBox 为 AI 算力集群提供高速的、Pod 级别的原生上下文访问能力。这使得多 Agent 工作流能够实时协调与共享状态,从架构底层彻底消除跨节点的 KV 缓存数据冗余。伴随业务量的激增,YRCache 可实现弹性的无缝扩展,确保集群整体的存储与计算效率始终维持在巅峰状态。
 
突破显存枷锁,解锁无限长上下文推理
 
YRCache ContextBox 打造了海量、高密度的 KV 缓存池,通过智能调度突破单卡/单机 GPU 显存的物理限制。完美支撑极高并发下的超长文本解析、复杂的智能体协同(Multi-Agent)业务、万亿参数巨型模型,让企业无需承担昂贵的显存扩容成本,即可从容驾驭未来的长上下文应用浪潮。
 
开放生态:快速融入现有 AI 集群
 
YRCache ContextBox 采用软硬件解耦架构,广泛兼容 NVIDIA 及国产 GPU、 vLLM、SGLang 等主流推理框架及模型。
 
 

实测验证:将推理性能优势转化为 Token 生产能力

 

 

YRCache ContextBox 的价值不仅体现在架构创新,更体现在真实推理业务中的性能提升。
 
在某头部 AI 企业实际测试中:
 
测试环境:
 
  • GPU:8 × NVIDIA H20-3e(141GB HBM/GPU)
  • 推理框架:SGLang
  • 测试模型:GLM-5.1
 
在相同 GPU 配置下,对比原生 SGLang 与 SGLang + YRCache ContextBox 在 31K~129K 输入上下文长度下的推理表现。
测试结果显示:
 
  • TTFT(首 Token 时延)降低 89%~94%
  • Token Throughput 提升 3~6 倍

 
以 64K 输入上下文场景为例,假设 GPU 持续满负载运行且缓存命中率为 50%:按照当前主流大模型 Token 定价换算,单台 8 卡 H20 服务器部署 YRCache ContextBox 后,其月度 Token 等效产值可从 5.2 万元跃升至 11.9 万元!
 
 
YRCache ContextBox 将存储架构创新转化为推理效率提升和商业价值增长,在无需增加 GPU 投入的情况下,帮助企业提升 AI 基础设施投资回报率,加速大模型应用规模化落地。

 

 

从存储加速,到 AI 推理基础设施升级

 

 

YRCache ContextBox 的发布,标志着 KVCache 缓存体系从"单机分级卸载"迈向"跨节点软硬一体共享"的新阶段,为大模型推理集群提供了一套可扩展、可复用、成本可控的底层缓存基础设施,助力企业以更低成本释放长上下文与 Agentic AI 的推理潜能。