2026年8月18日 · 观天下
超节点正在从"各家定义"走向"一个标准",KV Cache则从"技术问题"变成了"定价问题"。本周值得关注:鹏城实验室联合全球计算联盟发布《超节点定义与实践白皮书》,首次给国产超节点立下32卡/400GB/s/500ns/统一内存编址四条硬杠杠;DeepSeek缓存命中价与未命中价相差30倍,缓存命中率正式成为API定价的分水岭;NVIDIA CMX继续吞食NAND,512Gb TLC现货价重返21美元。论文方面,北大联合阶跃星辰提出TensorCast,把模型权重与KV Cache做成"张量即服务",Agent场景首字延迟最高降93.2%;清华等发布记忆机制综述,给"记忆"在LLM架构里正名。
一、行业动态
1. 《超节点定义与实践白皮书》:国产超节点首次立下"产业标准"
8月17日,蓝鲸新闻对WAIC 2026发布的《超节点定义与实践白皮书》进行深度解读。这份由鹏城实验室(主任高文)与全球计算联盟(GCC)联合牵头编制的文件,首次完整厘清了超节点的核心定义与架构特征:①规模标准——整合32卡及以上AI芯片;②带宽标准——域内AI芯片到交换芯片带宽不低于400GB/s;③时延标准——交换设备时延小于500ns;④内存标准——支持跨物理节点统一内存编址。白皮书同时披露实践数据:DeepSeek V3训练中,超节点把未掩盖通信比例降低80%,在单NPU裸算力提升2倍的条件下实现系统训练性能3倍以上提升。
值得关注:超节点竞争进入"系统级较量",而标准就是第一道入场券。国海证券测算,2026至2028年国产超节点市场规模将分别达到889亿元、4151亿元和11089亿元,在国产AI芯片出货中渗透率从约15%快速提升至55%;华泰证券测算剔除单卡代差后,超节点推理环节效率增益达1.23至1.50倍。四条硬标准(32卡/400GB/s/500ns/统一内存编址)落地后,谁是"真超节点"、谁是"营销超节点",从此有尺可量——统一内存编址这条,正是内存池化的架构级背书。
2. 缓存定价战:KV Cache命中率成为API价格分水岭
8月17日报道,"看标价不如看缓存机制"已成业界共识,国产大模型在缓存命中率上明显分梯队:第一梯队月之暗面、深度求索、阶跃星辰——Kimi K3缓存命中价仅2元/百万token(未命中20元,相当于1折);DeepSeek-V4-Pro自研前缀缓存命中率逼近90%-98%,8月17日起价格上浮后缓存命中价0.3元、未命中9元,价差高达30倍;阶跃星辰客观命中率86%-92%,命中缓存约原价2折。第二梯队智谱AI、MiniMax、火山引擎命中率约70%-85%;第三梯队零一万物、腾讯云、百川智能约50%-80%。阿里、百度未公开数据。
值得关注:KV Cache命中率第一次被"明码标价",这是缓存基础设施商业价值的直接显性化。模型厂商敢给"命中价打1折、价差30倍",前提是前缀缓存、KV池化与共享缓存系统真的扛得住高命中率——缓存经济模型的胜负手,已经从"模型参数"转向"KV命中率"。这对内存池化、KV Cache共享类基础设施(CXL池、SSD卸载层)是明确的商业化利好信号。
3. NVIDIA CMX继续锁NAND:TLC现货价重返21美元,美银否认HBM降配
8月17日消息,NVIDIA Vera Rubin平台量产爬坡正在挤压TLC NAND供应:512Gb TLC NAND现货价格在6月回落后重新升至21美元。CMX(上下文存储扩展)作为HBM与后端网络存储之间的中间存储层,底层是大量TLC闪存,经BlueField-4 DPU连接Rubin GPU集群、通过Spectrum-X以太网实时处理KV缓存——单台2U CMX服务器容纳600TB TLC闪存、四颗DPU各管理150TB,pod级容量达9.6PB,一个Rubin集群要消耗近10PB TLC。同时,美国银行近日否认了NVIDIA可能削减每颗GPU HBM4E容量的传闻,认为任何潜在降规格都只是应对短期供应紧张的临时措施,而非永久性低容量SKU。
值得关注:一边是KV Cache卸载架构(CMX)锁定TLC产能、现货价重新走强,一边是市场对HBM降配的担忧被权威机构辟谣——"HBM不够、NAND来凑"的分层内存路线正被NVIDIA全栈绑定。KV Cache卸载不是纸面概念,它已经在改写NAND现货定价,这对eSSD、主控与存储机架产业链是持续性的需求锚。
二、论文分析
论文1:TensorCast——把模型权重与KV Cache做成"张量即服务"
事件:北京大学、阶跃星辰与北京邮电大学联合提出TensorCast(arXiv:2608.06007,8月6日提交,8月17日机器之心深度解读),瞄准LLM基础设施的"缺失抽象层":当前模型加载、KV Cache管理、Checkpoint同步各自为政,深度绑定具体框架、网络与存储后端,开发者无法跨组件复用优化策略。TensorCast提出Tensor-as-a-Service(TaaS):把张量(模型权重、KV Cache等)提升为"一等系统对象",提供可组合的生命周期原语(识别/放置/移动/转换/物化),控制面Global Store只维护元信息不参与数据传输,数据面Worker节点通过RDMA、零拷贝实现P2P传输。实测:集成vLLM与SGLang后,弹性扩容实例启动时间最高降低228.6倍(Qwen3-235B-A22B);KV Cache管理性能对标Mooncake相当;用TensorCast API写一个面向多轮Agent的调度器,中位数TTFT最高降低93.2%。
值得关注:这篇论文把"内存池化"从存储层提升到了系统抽象层——KV Cache不再属于某个推理引擎,而是可跨节点、跨组件、跨阶段流动的一等资源。对超节点而言,"256TB统一内存"是硬件池化,TensorCast则是软件池化的通用底座;两者叠加,Agent多轮会话的KV迁移、负载均衡与弹性扩容才能组合出真正可编程的策略空间。这是KV Cache基础设施化从"专用系统"走向"通用抽象"的标志性一步。
论文2:Memory for LLMs综述——给"记忆"在LLM架构中正式正名
事件:清华大学、新加坡国立大学与博世人工智能研究院联合发布综述《Memory for Large Language Models》(arXiv:2607.25380,7月28日提交,8月17日学术头条解读),首次从架构视角系统性梳理LLM的记忆系统:传统Transformer中记忆只是前向计算的瞬态副产物(KV Cache),而Mamba/RWKV-7/Gated DeltaNet等循环状态模型、Titans/TTT测试期动态更新、Engram显式哈希存储、MoE条件激活等新范式,让记忆演化为可控的显式机制。论文提出三个正交维度分类:表示形式(隐式vs显式)、更新动力学(离线vs在线)、持久性(短期vs长期),并形式化记忆写入、路由、状态转移与巩固的细粒度机制,剖析混合记忆架构的设计权衡与系统级效率优化。
值得关注:当"记忆"成为LLM的第一架构公民,KV Cache的定位将被重新审视——它只是"隐式、瞬态、短期"记忆的一种形态,而显式/持久化记忆(外部存储、可寻址KV库)正在获得架构级地位。这与行业方向完全同频:Kimi Linear削KV 75%、DeepSeek DSA稀疏注意力、CMX把KV卸载到NAND,本质都是把"记忆"从隐式缓存推向显式资源管理。这张分类学地图,是理解未来内存池化、KV卸载、长期记忆基础设施走向的坐标系。
三、结语
超节点有了标准,KV Cache有了价格,张量有了服务化抽象,记忆有了分类学——内存的故事正在从"怎么装得下"升级为"怎么定义、怎么定价、怎么被系统编排"。硬件池化(统一内存编址)、软件池化(TensorCast)、商业价值(缓存定价)三者首次在同一周内共振,内存池化与KV Cache基础设施化的下半场,正式开场。
免责声明:本文基于公开信息整理,仅供参考,不构成投资建议。


