云天励飞公布未来算力蓝图,三款AI推理芯片与超节点异构集群
时间:2026-07-19 | 作者:318050 | 阅读:07月18日,2026 WAIC上,云天励飞公布了未来两年多的AI推理芯片路线图。这次他们拿出了三款芯片:DeepVerse100P、DeepVerse100D和DeepVerse100L。
这三款芯片分别针对AI推理中Prefill、Decode以及Decode FFN这三个环节的负载特征做了专用优化。说白了,就是把推理过程拆开,让最合适的芯片干最擅长的活。
这三款芯片不是各自为战,而是面向万卡异构集群进行协同设计与部署。通过对不同推理阶段的解耦,为每种负载匹配更精准的算力资源。最终目标是提升系统整体效率,把Token生成成本持续压下去。
推理负载持续分化,算力优化走向精细化
仔细观察当前大模型推理的负载特征,不难发现一个明显趋势:应用场景正在快速分化。通用AI助手(对话、知识问答)、深度推理应用(复杂推理、编程)、以及实时智能体系统(Agentic Coding、多Agent协同),它们的负载特征完全不同。
随着AI应用不断深入,单次任务的上下文长度、推理链路复杂度以及实时交互要求都在持续攀升。这对推理系统的吞吐、延迟和成本提出了更高要求。对于大规模推理部署来说,峰值算力已经很难单独反映系统效率。计算、访存、互联和系统调度等因素,共同决定了Token生成的效率和成本。
大模型推理不同阶段的计算特征差异也很明显。Prefill阶段需要集中处理输入上下文,对计算能力要求高。Decode阶段是逐Token生成,对内存带宽和数据访问效率更敏感。随着MoE等模型架构的发展,Decode阶段内部的Attention与FFN在计算、访存等方面也呈现出不同的资源需求。
针对这些变化,云天励飞计划推出三款云端大算力推理芯片,思路很清晰:
- DeepVerse100P瞄准百万级上下文Prefill场景。在传统混部架构中,长上下文Prefill与Decode共享算力与带宽资源,容易造成资源抢占,影响Decode生成吞吐。专用芯片可以避免这种干扰。
- DeepVerse100D面向Decode环节打造专用推理引擎,内存带宽达到主流芯片的数倍,支持1024卡Scale-up及光互联系统架构。通过按需建立光路直连,并根据任务动态重构光路,减少传统多跳电交换和静态组网中的排队、拥塞及中间转发开销,降低多节点通信阻塞和尾延迟,提高逐Token输出的稳定性。
- DeepVerse100L则针对Decode阶段计算密集型的FFN环节,采用3D Memory架构,相比主流HBM大幅提升内存带宽。通过低延迟芯片互联和激活数据快速传输,提高计算与通信的并行效率。
三款芯片协同面向万卡异构集群
AI推理进入规模化部署阶段后,芯片优化已经从单颗性能提升,走向多芯协同和集群级效率优化。
在万卡规模的推理集群中,系统效率不是单卡性能的简单叠加。不同推理负载对计算、内存和通信资源的需求差异很大。当Prefill与Decode、Attention与FFN共享同一套通用算力资源时,资源竞争几乎不可避免。集群规模越大,通信阻塞、资源等待和尾延迟等问题就越突出,最终影响整体推理效率。
因此,提升Token生成效率,除了优化单颗芯片性能,更需要围绕芯片在集群中的协同,对推理过程中的计算、访存、互联和资源配置进行系统级设计。
基于DeepVerse100P、DeepVerse100D和DeepVerse100L,云天励飞计划推动三款芯片在万卡异构集群中实现分离式部署与协同运行。按照Prefill、Decode和Decode FFN的不同负载特征,分别配置相应芯片和资源池,通过高速互联形成协同运行的异构算力系统。
这套方案围绕Token生成全过程进行系统优化。通过对不同推理阶段进行分离,降低不同负载之间的资源干扰,并根据实际需求配置计算、访存和通信资源,从而提升集群资源利用率和整体推理效率。
从面向特定推理负载进行芯片优化,到不同芯片之间的协同,再到万卡级集群应用,云天励飞正在将AI推理芯片的优化范围由单颗性能延伸至集群级效率。面向“百亿Token一分钱”的长期目标,他们希望以三款芯片为核心,形成一套服务于大规模Token生成的“推理工厂”。通过芯片、互联、软件和系统的协同优化,提高算力产出效率,持续降低单位Token成本。
IFWA软件栈:降低国产算力应用门槛
硬件异构程度和集群规模不断提升,对软件栈的要求也水涨船高。模型能否快速完成适配、算子性能能否充分释放、不同硬件资源能否高效协同,这些直接影响DeepVerse芯片在大规模集群中的实际运行效率。
围绕DeepVerse芯片及其集群应用,云天励飞持续建设IFWA软件栈。该软件栈覆盖AI模型开发、编程及系统等不同层级,为模型适配、算子优化、编译部署和软硬件协同提供软件支撑。
兼容性方面,IFWA围绕Transformer主流架构,持续完善PyTorch ATen算子的适配和性能优化,并加强对vLLM、SGLang等主流推理框架的支持。通过兼容主流软件接口、复用成熟开源组件,降低模型向DeepVerse平台迁移和部署的成本。
在模型适配和开发效率方面,IFWA构建了覆盖模型量化、压缩、编译和部署的一站式自动化工具链,并引入AI Agent参与推理芯片适配和性能优化。此前,云天励飞已开源Houmao多Agent异构编程框架。该框架由不同Agent协同完成模型开发、算子开发、性能优化和测试验证等任务,将部分依赖人工经验的芯片软件开发流程转化为自动执行、自动验证和持续优化,缩短新模型和新算子的适配周期。
同时,云天励飞还将成熟的Triton算子能力融入FlagOS,通过代码贡献、联合验证和社区复用,推动相关能力在国产AI软件生态中进一步共享,减少不同硬件平台在算子适配上的重复投入。
在云天励飞的规划中,IFWA并非一套封闭的软件体系。它通过对主流模型、框架和开发工具的兼容,降低开发者的迁移和使用成本,缩短模型在DeepVerse平台上的部署周期,让国产算力更加便捷地进入实际应用。
“1001计划”,推动Token成本协同优化
降低Token生成成本,说到底是一项系统工程。
从芯片架构、IP与EDA,到封装测试、系统互联、软件栈和算力平台,再到模型及应用,产业链每个环节的效率都会影响最终的Token生成成本。要实现极致性价比的Token,需要产业链上下游共同参与。
今年5月,云天励飞联合30余家单位,共同签署了“1001计划”倡议。该计划围绕Token生成效率和成本,推动产业链上下游加强协同。通过更紧密的产业合作,使模型和应用需求更早反馈至芯片及系统设计环节,推动成熟软件能力加快复用,同时加速芯片在集群和实际场景中的验证和应用。
随着AI走向规模化应用,算力竞争正在进一步转向对系统效率和单位Token成本的持续优化。芯片、软件、系统和应用之间的协同程度,也将越来越直接地影响AI算力的实际价值。以“百亿Token一分钱”为长期目标,云天励飞将持续推进芯片、系统、软件和产业生态协同创新,与更多生态伙伴共同提高Token性价比,推动国产AI算力从“能用”迈向“好用、易用、用得起”,为人工智能规模化应用提供更加高效、普惠的算力基础。
来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 云天励飞公布算力路线图:涵盖AI推理芯片和超节点异构集群
- 时间:2026-07-19
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- iOS 13.5.1电池续航差是电池耗电问题吗
- 时间:2026-07-25
-
- 苹果教育优惠开启 附购买攻略
- 时间:2026-07-25
-
- 苹果iOS 14 beta 2 测试版主要更新内容:除细节变化外修复多项Bug
- 时间:2026-07-25
-
- iOS 14 beta 2 是否解决内存占用过多问题?
- 时间:2026-07-25
-
- 受欢迎的奥特曼游戏有哪些
- 时间:2026-07-25
-
- iOS 14信息应用5大更新变化
- 时间:2026-07-25
-
- iOS 14正式版上线时间公布 官方全新介绍
- 时间:2026-07-25
-
- 最新苹果iOS 14 Beta 2版本更新内容全解析与升级教程
- 时间:2026-07-25




