位置:首页 > 技术资讯 > HBF/SSD替代HBM显存方案:九天睿芯实现单卡运行万亿参数模型

HBF/SSD替代HBM显存方案:九天睿芯实现单卡运行万亿参数模型

时间:2026-08-12  |  作者:318050  |  阅读:0

芯东西

作者 | 陈骏达

编辑 | 心缘

芯东西8月5日报道,近日,深圳存算一体AI芯片创企九天睿芯发布了一套面向超大MoE模型的推理部署方案。该方案在“单卡+4 SSD”的配置下,让DeepSeek-V4在decode阶段的速度跑到了约20 TPS,具备了真正可用的吞吐量。更重要地,九天睿芯已于去年开始,作为国内首家与关键存储合作伙伴研发基于HBF和sram存算一体堆叠的万亿参数AI推理芯片。

HBF/SSD替代HBM显存方案:九天睿芯实现单卡运行万亿参数模型_wishdown.com

一、显存装不下万亿模型?把部署变成数据放置和调度问题

如今,大模型的参数规模正迅速膨胀,Kimi K3、DeepSeek V4 Pro这类新一代超大MoE模型,总参数量已经冲到万亿量级,对绝大多数想在本地用上大模型的企业来说,如何低门槛、高效率地用上这些超大模型,成为横在落地面前的一道现实难题。

行业对上述问题的默认解法是增加计算卡数量,并辅以张量并行、专家并行、高速互联等技术,打造计算集群。这类方案的性能优异,但也带来新的问题。

算力集群是一个复杂的系统工程,涉及拓扑、通信、负载均衡、故障域等多个层面,任何一张卡或一条链路的异常,都可能放大成整套服务的抖动。对需要自行部署的企业来说,其中的工程挑战不言而喻。

当前主流的MoE模型架构给业界提供了一个突破口。MoE模型的特征是总参数量较大,但每个token所激活的始终是少数专家。

于是,业界开始思考,既然计算只需要少数专家,就不一定需要让全部专家都长期存储在价格昂贵、容量有限的显存里。

九天睿芯的思路,是把部署问题重新定义为一个数据放置和调度问题。

这套系统对存储架构进行了精细的分层设计:显存专供当前计算任务及高概率即将调用的专家使用;DRAM与近端缓存则承担预取、短期驻留以及回退缓冲的重任;SSD作为海量专家池,存放那些暂时闲置但随时可能被激活的权重;此外,还有一套预测调度系统,确保下一批可能需要的专家能提前抵达计算节点附近。

九天睿芯强调,这套方案不是“拿SSD替代显存”,显存仍然承担着关键计算窗口。同时,专家也不会被永久贴上“热”或“冷”的标签。调度系统可以按专家粒度持续跟踪访问热度,动态调整数据位置,跟着路由分布走,而不是一次性静态切分。

要实现这样的切分,难点在于对MoE推理时序约束的把控。MoE模型推理时,下一层要哪些专家,通常需要得等上一层算完、路由结果出来才知道。如果每次都等确定了再去读取,就难免会产生算力空转的现象。

九天睿芯为此打造了一套专家级预测式调度系统。根据当前状态和历史路由信息,系统可以提前生成候选专家集合并发起预取,如果预测落空,系统就就同步取数兜底,保证计算结果正确。

系统中多块SSD被组织成并行资源池,尽量让读取与计算重叠推进。理想状态下,当前层还在算,下一层的候选专家已经并行读出,SSD的延迟被计算时间遮蔽。

候选集的选定同样有取舍。候选集过小,容易漏掉真正需要的专家;候选集过大,又会占用带宽和缓存,把无效数据提前搬进来。调度器要在命中率、覆盖率、搬运代价和缓存空间之间动态取舍,面向最终能兑现的token吞吐进行优化。

九天睿芯也与RWKV社区开展了技术交流与协同,在专家预测、推理基础设施优化等方向共同探索更高效的大模型运行机制。正推动超大参数模型从软件架构到硬件系统的协同进展。

二、万亿参数模型单卡跑出约20 TPS,算力交付单位变了

在这条路径上,九天睿芯已经把DeepSeek-V4推进到单卡+4 SSD、decode速度约20 TPS。这套方案的价值在于,它证明了单卡、多盘和专家预测能够组成一条持续供数的工程路径,支撑大型MoE实现真正可用的部署。

九天睿芯称,他们强调decode环节,是因为生成阶段具有逐token依赖特点:前一个token产生后,后一个才能推进,任何一次专家缺失或I/O等待都会直接形成气泡。相比可以并行吞吐的prefill环节,decode最能暴露内存访问与调度是否稳定。

约20 TPS的速度,说明这套系统能让专家供给持续跟上生成节奏,具备一定的可用性。

这套方案还改变了算力的交付单位。原本要先筹备一个小集群的模型,现在可以从一台机器起步。工厂、园区、政务、本地一体机这些看重数据不出域、机房条件有限的场景,开始具备直接部署超大模型的可能,如果需求进一步增加,只需通过增加实例或扩展资源池就可以提高服务能力。

九天睿芯在研HBF与SRAM存算一体堆叠,更可几十倍速度支持单卡跑万亿级别模型

更长远看,九天睿芯方案中的单卡+多SSD配置,只是当前可交付的工程验证平台。行业正在为这条路线准备更好的介质,即HBF(高带宽闪存)。

今年2月,闪迪与SK海力士在OCP(开放计算项目)下启动HBF联合标准化,闪迪公布的规划显示,其第一代HBF路线目标为单个16层堆叠512GB、读取带宽1.6TB/s;第二代和第三代的规划分别超过2TB/s和3.2TB/s,容量提升至1TB和1.5TB。

与此同时,铠侠和英伟达也在把闪存一步步推向“更靠近计算”的位置。铠侠这边,已经完成了高带宽Flash模块原型验证,参数包括5TB容量、64GB/s带宽,以及低于40W的功耗;英伟达的BlueField-4/CMX,则把通过以太网连接的Flash做成了Pod级的上下文存储层,专门用于承接并复用KV Cache。 在刚刚结束的FMS 2026峰会上,SK海力士与闪迪共同推出了全球首个HBF规范标准谷歌(Google)与Tenstorrent已作为成员加入HBF联盟。 据悉,九天睿芯正在研发的芯片,也将高带宽闪存作为主要的模型权重和KV cache存放介质,是国内首家走这一路径的AI芯片公司。

这个跨层级推理方案并不等同于HBF,却共同说明一件事:闪存正在从“存放文件的后端”,进入模型权重、专家数据和上下文数据的推理路径。

结语:分层存储成超大模型落地现实路径

大模型推理的需求正在迅速增长,但HBM价格高企、产能紧张,超大模型的部署成本中,相当一部分实际上是在为“显存”买单。分层存储,有望成为超大模型落地的一条现实路径。

而九天睿芯在多SSD上验证的专家切分、热度统计、候选生成、预取回退等调度能力,并不绑定特定介质。未来即便存储介质升级换代,这套系统积累下的调度能力,依然可以复用。

九天睿芯在研基于HBF和SRAM存算一体AI 计算die 3D堆叠的芯片在这个基于SSD替代HBM做显存的方案基础上,把带宽和TPS提高10倍以上,单卡显存容量可达4TB,带宽达数TB/s。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多