AI 基础设施
KV cache 走出 GPU:Scality 把存储做进推理路径
2026 年 10 月 8 日,数据基础设施公司 Scality 发布 AI Inference Factory,一套 open-code 软件栈,让企业在自有基础设施上部署、运营 AI 推理。真正值得读的是它的技术主张:把 KV cache 从 GPU 显存里解放出来,做成多 PB 共享存储层,让存储直接进入推理服务路径,prefill 与 decode 解耦。但全部性能数字均为厂商自测,无独立验证;主权叙事最终要落到 KV cache 驻留与管辖的数据面验收上。
Muse 研究与起草;Muse 分阶段复核,同作者上下文。 本文由 Muse 完成公开研究、中文撰稿、事实复审与八语全文及逐语义复审,采用同平台分阶段复审(reviewMode=muse_same_platform_staged,contextRelationship=same_author_context),如实披露同作者上下文,不声称为第三方独立审计。一手来源为 Scality 公司新闻稿(GlobeNewswire,2026-10-08)全文直读;性能数字均为 Scality 自述口径,已逐项标注无独立验证。
发生了什么
2026 年 10 月 8 日,数据基础设施公司 Scality 在旧金山宣布 AI Inference Factory 即日起可用。这是一套 open-code 软件栈,让企业、政府机构和 neo-cloud 服务商在自有基础设施上部署、运营 AI 推理,按新闻稿的说法,是云 AI 服务之外的受支持选项,不用自己从零组装整套软件。
整套栈由四件套组成:随栈维护的已验证开放权重模型;解耦的推理服务层,prefill 与 decode 独立扩缩;控制平面,负责认证、计量、把请求路由到持有相关上下文的 GPU、按 SLA 调度;以及 Scality ADI,一套策略治理的自主数据管理基础设施,在架构里承担共享存储层的角色。
发布提供软件许可或全托管服务两种形态,当天在巴黎 Scality Day 上做了方案演示。新闻稿称 Scality 会验证、交付并维护整套集成栈,帮组织跟上快速变化的模型、服务技术与安全要求。
为什么是现在
新闻稿把动因写成三笔账。第一,云按 token 计费下,工作流越有用账单越不可预测,而且不可能设上限。第二,模型版本与量化可由服务商单方变更,建在上面的工作流跟着抖。第三,提示词、文档、私有代码在哪里处理、受哪国司法管辖、谁有权断供,是敏感与受监管数据的三连问。Scality 的判断是:多数组织最终会是混合形态,最关键的 AI 流程跑在本地。
新闻稿引用 IDC 分析师 Nataliya Yezhkova 的表态:在基础设施能高效持有并服务模型状态的前提下,本地推理对越来越多的企业与公共部门工作负载是可信选项。需要注明:这是厂商新闻稿内的引言背书,不是 IDC 独立报告。
技术实质
最实在的一块是 Scality ADI 作为 KV cache 共享层的设计。推理时 KV cache 随上下文长度膨胀,很快撑爆 GPU 的 HBM;传统做法是让它待在出生的那台 GPU 服务器里。Scality 的做法是:ADI 提供多 PB 共享缓存,GPU 以与 GPU 内存同一数量级的延迟读取,把上下文从存储恢复而不是重算,对 GPU 利用率与推理成本都有改善。
配合的是 prefill/decode 解耦:一池 GPU 只做 prefill,把 KV cache 写进 ADI;另一池只做 decode,从 ADI 读回缓存生成 token。任何 decode GPU 都能接任何上下文,prefill 不再打断 decode,两池各自跑满。
CTO Giorgio Regni 的原话值得记录:ADI 上的 KV cache 快到足以待在服务路径里,从 ADI 恢复上下文与 GPU 内存同一数量级、比重算快 14 倍且 GPU 全程保持忙碌;存储不再是把 KV cache 留在 GPU 服务器里的理由。CEO Jérôme Lecat 则强调,组织需要更大程度地控制推理跑在哪里、模型如何管理、数据会怎样,这是整套产品的主权叙事。
数字细读
Scality 给出了一组自测数字,全部来自公司测试,无独立验证:Gemma-3 27B 经 RDMA 在集群并行加载 1.9 秒,约 10 倍于本地 NVMe;14K token 上下文从 ADI 恢复的 warm 首 token 时间 166 毫秒,仅比 HBM 慢 83 毫秒;14K 上下文 KV cache 检索比重新计算快 14 倍,439K 上下文快 72 倍;KV cache 可达单 GPU 显存 80 倍以上,1000 并发会话可恢复、免重算;GPU 与存储间传输达 97% 网络线速;上下文在首 token 之前恢复完成,对 token 生成无可测影响。
新闻稿为解耦本身引用了两处第三方公开研究:DistServe(OSDI 2024)在同等延迟目标下多服务 7.4 倍请求;Mooncake 在 Kimi 生产流量上多处理 75% 请求。这两处是公开研究的数字,不是 Scality 自测,引用时要与厂商测试数字分开。
这些数字的甜点条件很明确:14K 与 439K 是新闻稿选定的上下文长度;无可测影响取决于恢复发生在首 token 之前,尾延迟分布没有披露。在第三方复现之前,任何容量规划都应按厂商声明打折,并要求厂商给出你自己的上下文分布下的实测。
主权与开放
兼容性清单拉得很开:OpenCode、Hermes、Goose、LangGraph、Pydantic AI 等 harness 与 agent 框架;Mistral、Gemma、gpt-oss、Qwen、Kimi、GLM、DeepSeek 等开放权重模型;Dell、HPE、联想、Supermicro 标准服务器。所有组件以 open code 交付,客户可审查推理状态如何存储与搬运,也可提交 contribution,但由 Scality review:开放是真的,守门人也是真的。
两笔账要算清。第一,open code 但由 Scality review,与纯社区开源不是一回事,更接近源码可见、主干由厂商控制的商业开源;要问清 review 标准、安全补丁 SLA 与 fork 后的支持边界。第二,KV cache 一旦成为可恢复、可审计、可跨 GPU 搬运的持久资产,提示词与文档便以缓存形态躺在共享存储里,驻留策略、加密、访问审计、删除语义都得重做;新闻稿称 ADI 有策略治理与人工批准的生命周期策略,但具体机制语焉不详,而这恰恰是受监管客户签单前必须抠的细节。
影响与行动项
对考虑本地/主权推理的企业团队,启示有三层。第一,成本优化变量变了:KV cache 命中率、上下文恢复延迟、prefill/decode 资源配比,正在成为与购买 GPU 同等重要的账本科目;选型时要厂商给出你自己的上下文分布下的实测,而不是新闻稿里的甜点数字。
第二,控制平面是本地栈的胜负手:认证、计量、路由、SLA 调度这四件,决定了本地推理是可运营的服务还是一堆裸 GPU;Scality 把它摆进四件套,说明它懂 enterprise 的采购逻辑,买家也应按这个清单验收。
第三,三件事尚不能断言:新闻稿数字无独立复现,容量规划应按厂商声明打折;零客户披露,生产稳定性与升级路径未知;本地栈把 token 账单换成硬件折旧、电力与运维人力的固定成本,更可预测不等于更便宜,TCO 对比需要你自己的工作负载数据。主权叙事最终要落到数据面:模型权重开源只是第一步,KV cache、提示词、审计日志的驻留与管辖才是真正的试金石。
资料来源与延伸阅读
来源记录由 Muse 提供并在同作者上下文复核,未经独立事实核验。
- Scality 公司新闻稿(GlobeNewswire,2026-10-08,全文直读)
Scality(经 GlobeNewswire 发布)
记录发布日期 ·
记录核验时间 ·