2026年5月,全球最大SSD主控芯片厂商之一——慧荣科技的总经理苟嘉章,在公开场合做出了一个令业界震动的预判:到2030年,长江存储有望成长为全球最大的NAND Flash制造商。
这句话的分量,不在于它是否会精确实现,而在于说这话的人是谁。慧荣科技长期深耕NAND产业链最核心的位置,它比任何分析机构都更清楚颗粒的真实品质、技术路线的可持续性,以及市场需求的走向。这个判断,本质上是一个产业链内部人士对整个NAND生态未来走势的高度浓缩。
而驱动这一切的底层逻辑,只有两个字:AI。
本文将从AI推理需求的爆发出发,逐层拆解存储需求的传导链路,最终聚焦到NAND接口标准——ONFI(Open NAND Flash Interface),——在这场存储革命中所扮演的关键角色与市场机遇。
过去几年,AI算力的讨论几乎被"训练"所垄断:更大的GPU集群、更高带宽的HBM、更快的互连网络。但随着大模型进入大规模商业化落地阶段,推理才是真正的主战场。
推理与训练在存储需求上有本质区别:
上下文窗口的指数级膨胀:KV Cache的存储压力
现代大语言模型(LLM)推理的核心机制之一是KV Cache(Key-Value缓存)。每一次推理,模型需要将历史上下文的Key和Value矩阵缓存起来,以避免重复计算。
问题在于:上下文窗口正在以指数级速度扩张。
以一个128K上下文窗口、70B参数模型为例,单次推理的KV Cache占用可达数十GB。当并发请求量达到数千乃至数万时,HBM和DRAM根本无法承载全部KV Cache。
因此,KV Cache必须向下溢出到更大容量的存储层——而这个存储层,就是NAND Flash。
AI推理对存储体系提出了前所未有的要求,迫使整个存储层级重新洗牌:

这意味着NAND Flash不再只是"存数据的地方",而是AI推理关键路径上的实时存储介质。对NAND的性能要求,尤其是随机读取延迟和IOPS,被提升到了前所未有的高度。
苟嘉章将AI服务器的核心需求拆解为三大块:运算、连接、内存与存储。三者缺一不可。
在存储侧,AI推理的落地正在催生几个全新的NAND消费场景:
AI推理服务器本地存储:每台AI推理服务器配备数十TB NVMe SSD,用于KV Cache卸载(KV Cache Offloading)
向量数据库存储:RAG(检索增强生成)架构下,向量数据库规模随知识库扩张而爆炸式增长
AI PC与AI手机端侧推理:本地模型需要高速NAND支撑实时推理,对随机读取性能要求极高
自动驾驶与边缘AI:实时感知数据的高速写入与模型参数的快速加载
慧荣科技的数据印证了这一趋势:2026年NAND位元增长率约20%,SSD和HDD全面缺货,抢货成常态。
资本壁垒:新建一座NAND晶圆厂需要数百亿美元投入
设备交期:半导体设备交期长达1~1.5年,调校还需半年,产能落地至少三年
土地与环保:建厂条件苛刻,各地区面临不同成都的环境审批与基建周期挑战
大厂战略取舍:三星、SK海力士等大厂优先将产能倾斜至利润更高的HBM,NAND扩产意愿受限
苟嘉章明确表示:缺货将持续到2028年。 这不是短期波动,而是结构性供需失衡。
ONFI(Open NAND Flash Interface) 是由英特尔、美光、意法半导体等主要厂商联合制定的NAND Flash标准接口规范,旨在统一NAND颗粒与主控之间的通信协议,降低互操作性门槛,推动整个生态的技术演进。
ONFI标准的核心价值在于:定义了NAND颗粒与主控芯片之间的电气接口、时序规范、命令集和特性参数,使得不同厂商的NAND颗粒可以被同一主控驱动,极大降低了系统集成复杂度。
ONFI标准的每一次迭代,都是对存储性能需求的直接响应:
从50 MT/s到4800+ MT/s,接口速率提升了近100倍。这背后,是NAND应用场景从消费级存储向AI推理关键路径的根本性跃迁。
“值得关注的是,部分新兴NAND厂商如长江存储,通过创新的Xtacking®架构实现了更高的I/O速率和更灵活的工艺迭代,这也对ONFI接口IP的适配能力提出了新的要求——而这一点正是奎芯科技ONFI IP的核心优势所在。”
回到KV Cache卸载的场景:当AI推理引擎需要从NVMe SSD中实时读取KV Cache数据时,整个链路的延迟由多个环节决定:
ONFI接口的带宽和延迟,直接决定了主控能以多快的速度从NAND颗粒中取出数据。在高并发推理场景下,ONFI接口的性能上限,就是整个存储子系统的性能上限。
具体而言:
随机读取IOPS:AI推理的KV Cache访问模式高度随机,ONFI的命令响应延迟(tR)直接影响IOPS上限
接口带宽:更高的MT/s意味着单次数据传输时间更短,对延迟敏感的推理任务至关重要
多平面操作(Multi-Plane):ONFI支持的多平面并发操作,可成倍提升有效带宽
数据完整性:AI推理对数据准确性要求极高,ONFI的ECC协同机制和On-Die ECC特性不可或缺
作为提供ONFI IP的芯片接口IP供应商,奎芯科技的ONFI IP提供了以下几个维度的价值:
协议合规性与互操作性 ONFI规范细节繁复,时序参数极为严苛。一个经过充分验证的ONFI IP,可以帮助主控芯片设计团队规避大量协议层风险,缩短从设计到量产的周期。
高速信号完整性在3600 MT/s以上的速率下,信号完整性(SI)成为设计的核心挑战。差分信号、阻抗匹配、眼图裕量——每一个细节都可能成为性能瓶颈。成熟的ONFI PHY IP,内置了针对高速信号的优化设计。
多颗粒管理与并发调度 企业级SSD通常需要同时管理数十乃至数百颗NAND颗粒。ONFI IP中的多通道并发管理逻辑,直接决定了系统级IOPS的天花板。
功耗优化 AI推理服务器的功耗预算极为紧张。ONFI IP中的低功耗模式(如ONFI Power States)和动态电压频率调整,对数据中心TCO(总拥有成本)有直接影响。
-4-
市场机遇:ONFI IP的需求爆发点在哪里?
AI数据中心对企业级NVMe SSD的需求正在以前所未有的速度增长。每一颗企业级SSD主控芯片,都需要高性能的ONFI接口IP。随着NAND颗粒技术迭代加速以及本土供应链的成熟,国产SSD主控芯片的需求同步爆发,对ONFI IP的本土化供应提出了迫切需求。
CXL(Compute Express Link)协议正在重新定义服务器内存扩展架构。基于CXL的NAND存储扩展器,可以将大容量NAND以接近DRAM的访问语义暴露给CPU,完美契合KV Cache卸载的需求。这类产品同样需要高性能ONFI接口IP作为底层支撑。
AI PC的普及,要求本地NAND存储具备更高的随机读取性能,以支撑端侧模型的实时推理。这一市场的规模以亿计,对ONFI IP的需求将形成长尾效应。
EV和智能座舱的普及,使车用NAND需求激增。车规级ONFI IP需要满足AEC-Q100等可靠性标准,技术门槛更高,竞争格局相对宽松,是差异化竞争的重要方向。
AI推理对存储带宽的需求没有上限。ONFI标准委员会已在推进下一代规范,目标速率将突破4800 MT/s。这对PHY设计、ESD保护、封装寄生参数控制都提出了全新挑战。
未来的存储控制器将不再是简单的"NVMe控制器 + ONFI控制器"的叠加,而是需要在协议层面实现深度融合优化,以最小化端到端延迟。ONFI IP需要提供更丰富的可编程接口,以适配上层协议栈的多样化需求。
在高速ONFI接口中,时序参数(如tDQSCK、tRPRE等)对温度、电压、工艺角高度敏感。引入AI辅助的自适应校准机制,可以在运行时动态优化时序参数,在保证可靠性的前提下最大化性能。
随着NAND存储进入AI推理关键路径,存储安全的重要性急剧上升。ONFI IP中集成硬件加密引擎(如AES-256)、安全启动支持和防篡改机制,将成为企业级和车规级产品的标配需求。
AI的发展,正在将存储从"配角"推向"主角"。从HBM到DRAM,从DRAM到NAND,整个存储层级都在被AI推理的需求重新塑造。
NAND Flash站在了这场变革的中心。而ONFI,作为NAND颗粒与外部世界沟通的"语言",其重要性从未如此凸显。
苟嘉章对长江存储的预判,折射出的是整个NAND产业正在进入一个新的超级周期。在这个周期中,谁能提供更快、更可靠、更低功耗的ONFI接口解决方案,谁就能在这场存储革命中占据不可替代的位置。
对于奎芯科技这样专注于高速NAND接口IP的公司而言,不仅是面临广阔的市场机遇,更是迎来技术价值被重新定价的历史时刻。