天极大咖秀

登录 | 申请注册

AI推理越跑越复杂,新时代存储应当如何求变?

大数据在线 2026-09-22 阅读: 4,015 次

沿着旧地图,永远找不到新大陆。

当DeepSeek V4上下文窗口达到百万Token,当智能体推理请求从单轮对话变成多轮长程交互,当AI工作负载演变为多步骤链式复杂工作流,KV Cache数据量也迎来爆炸性增长。如今,业界愈发形成共识:即KV Cache已不再是AI推理过程中的“边角料”,而是决定单位Token成本、推理效率和运营成本的核心数据资产。

因此,随着人工智能重心从“训练”转向“推理”,存储需求也随之出现结构性的改变。那么,在智能体新时代全面到来之际,存储产品又应当如何求变?

近日,中科曙光率先出招,正式发布全新迭代升级的AI推理原生存储FN NEO,以“共享 KV Cache 池”为核心理念,通过极致融合能力实现一站式的AI推理全场景支持,同时以灵活的扩展性为将来后续智能体持续爆发后做好准备,真正为 AI推理场景带来“快、稳、开放、焕新”四大维度的全新改变。

智能体时代的推理“焦虑”

信通院最新数据显示,截至今年6月份,我国日均Token调用量激增至近175万亿。

Token调用量爆发性增长的背后,是AI推理时代的全面到来。Gartner相关研究显示,智能体的爆发,使得AI推理成为算力、存储消耗的主要模式,预计2026年推理导向AI基础设施支出预计增长55%,AI推理工作负载占比的持续增长将彻底重塑基础设施。

事实上,业界普遍认为,随着智能体开始深入融入到千行百业的各种业务场景之中,其自主运行、高频访问的背后是底层数百上千轮的上下文交互、数十万计Token的输入以及步骤链式复杂工作流,而KV Cache 已不仅仅是AI推理过程中的临时缓存,而具备了成本高昂、复用价值巨大、急需生命周期管理以及跨节点共享等特征的“核心数据资产”。更加关键的是,这种“越跑越复杂”的AI推理模式已让现有基础设施达到其极限,不少用户因此陷入AI推理“焦虑”。那么,如何妥善管理并高效复用如此庞大规模的“核心数据资产”?业界一度认为,采用本地存算一体节点来堆叠 KV Cache缓存层的方案是极佳解决方案。

但现实有些“反常识”,各种实践表明,存算一体的本地节点方案存在着两大不可忽视的痛点:

其一、存算一体节点各自保存KV Cache,使得资源跨节点共享困难,智能体推理调度到其他节点时候容易陷入重复计算,造成资源浪费、延迟飙升和效率低下。

其二、存算一体方案无法提供“又低又稳”的尾延迟保障,在AI推理链路中,决定系统体验和SLA的不是“平均延迟”,而是 P99、P99.9 这类最慢请求的“尾延迟”,而存算一体方案极易引发性能断崖式下跌,拖垮整个集群的吞吐。

中科曙光集中式存储产品部总经理郭照斌直言:“存储已能直接影响AI推理的效能。在提升存储能力和降低存储成本的同时,来提高同等算力配置下的Token输出效率,是当前存储的关键方向。”

因此,集中式存储开始备受重视,其存算分离和资源池化的特性,在金融、电信等核心交易场景多年锤炼出来的稳定性与可靠性,以及数据统一管理等特性,使之智能体时代存储主动求变的关键突破口。

FN NEO:一站式支撑AI推理全场景

面向KV Cache带来的变革性存储需求,中科曙光的解法是推出专为AI推理设计的集中式全闪存储--FN NEO,首次将集中式全闪存储纳入KV Cache分层体系中,让多个计算节点之间共享一套存储,推动集中式存储从“共享数据”演进为 “共享 KV Cache”。

过去,存储在整个AI推理链路体系更多属于被动型的配套资源;如今,以“共享 KV Cache 池”为核心理念的FN NEO出现,标志着存储成为主动参与算力效率、Token产出的核心基础设施,为 AI 推理场景带来“快、稳、开放、焕新”四大维度的主动改变。

具体来看,首先是“快”:FN NEO延续曙光高端集中式存储的性能基因,单阵列带宽高达 160GB/s,NAS 协议带宽达到 70GB/s,能提供稳定的亚毫秒级物理延时;同时,FN NEO深度融入 KV Cache 卸载与加载链路,能让TTFT(首字延迟) 缩减73%,Token吞吐能力提升150%。

“FN NEO采用了SAN+NAS+KV一体化架构,实现原生三协议的直出和极短路径,并且实现统一数据池,资源调度灵活。同时,利用超级隧道技术实现软件、硬件资源的高效规划,并通过全链路的负载均衡、KV原生语意卸载实现整个存储的极致性能。”郭照斌介绍道。

其次是“稳”,在智能体长程任务的推理中,稳定性即生产力,一旦SSD或者控制器发生故障,集群就容易发生长尾抖动,甚至导致推理过程中断。而FN NEO拥有 99.999% 的金融级高可靠性,并具备四重技术保障长程推理过程中 TTFT、TPOT 和端到端延迟的稳定性。

郭照斌介绍,“FN NEO 的应用全局镜像缓存技术、RAID-QC 硬盘冗余技术、自动缩列修复技术和亚健康盘与慢盘自动隔离等四重技术带来了极高的可靠性,确保AI 推理对‘尾延迟’的敏感需求。”

第三是“开放”,目前AI推理的技术生态正在快速演进,整个技术栈不仅涉及到众多厂商的多种技术,且推理链路中各类技术频繁切换已是常态,因此破除“生态锁定”就成为大势所趋。

FN NEO的测试了提供推理框架层兼容、组网部署层适配和操作系统层兼容的三重开放体系,不仅通过标准接口透明接入 vLLM、SGLang、TensorRT-LLM等框架,实现 KV Cache 的透明卸载与共享;而且适配 RoCE、IB、FC等多种组网模式;还兼容多种主流操作系统,可无缝适配不同计算节点的部署需求。

最后是“焕新”,FN NEO凸显了智能体时代存算紧密协同的趋势,彻底改变过去存储的被动角色,以“共享 KV Cache”来实现AI 推理场景的“存得下、存得快、存得稳、存得省”。

综合来看,FN NEO代表着集中式存储在智能体时代的一次重要演进,它就像一位六边形战士,从硬件架构、性能、可靠性、软件协议等多个层面全面适配AI推理需求,通过极致融合能力和极致性价比,一站式满足智能体、模型权重、RAG等推理全场景的支持;同时,兼具横向与纵向扩展的能力让其具备极高的灵活性,可以灵活满足算力集群规模增大后的需求。

重塑智能体时代的存力锚点

过去十年,存储行业的主旋律是“分布式”,软件定义、弹性扩展、去中心化赋予了存储行业多重想象力;进入到智能体时代,面对动态产生、高频复用、对延迟极度敏感的 KV Cache 数据资产,集中式存储正以一种全新形态演进,与分布式在整个存储产业中继续并驾齐。

在AI推理越跑越复杂的今天,新时代存储的“求变”方向已经清晰:即智能体时代的存力锚点是让KV Cache从算力的附庸变成算力效应释放的杠杆。

就像中科曙光FN NEO,以池化共享能力、关键行业锤炼出的可靠性、极致性能体验和灵活可扩展等 能力,让每一份KV Cache“物尽其用”,为AI商业化的大航海带来最为可靠的“锚点”。

大数据在线
洞悉技术趋势,聚焦产业发展

特别声明:文章版权归原作者所有,文章内容为作者个人观点,不代表大咖秀专栏的立场,转载请联系原作者获取授权。(有任何疑问都请联系wemedia@yesky.com)