位置:首页 > 热点资讯 > 蚂蚁集团发布百灵原生混合推理模型Ling-3.0-flash 124B参数对标旗舰

蚂蚁集团发布百灵原生混合推理模型Ling-3.0-flash 124B参数对标旗舰

时间:2026-07-25  |  作者:318050  |  阅读:0

7月24日,蚂蚁集团旗下百灵大模型正式发布了新一代原生混合推理模型——Ling-3.0-flash。

值得关注的是,这款模型在参数规模上做了大幅精简,但能力表现反而对标甚至超越了上一代旗舰。

蚂蚁集团发布百灵原生混合推理模型 Ling-3.0-flash:124B 总参数量,能力对标上一代旗舰 Ring-2.6-1T

参数规模大幅精简,性能越级对标

官方数据很直观:上一代旗舰思考模型 Ring-2.6-1T 的参数量达到 1T

而 Ling-3.0-flash 的总参数量只有 124B,大约是前者的 12.4%

激活参数量更是压缩到了 5.1B,仅相当于 Ring-2.6-1T 的 8.1%

在如此悬殊的规模差距下,Ling-3.0-flash 却在多个维度上实现了能力对标甚至超越——这才是真正的“以小博大”。

核心改进三大方向

  • 混合线性架构,原生进化。从预训练阶段就引入了自研的混合线性注意力架构。

    采用 5:1 交替堆叠 KDA 与 MLA 的设计,同时升级了全新的 KDA 细粒度对角门控,以及 1/64 稀疏 MoE

    在 124B 总参数、5.1B 激活参数的规模下,长上下文处理效率、状态记忆能力和计算成本之间取得了协同跃升。这个平衡点选得相当精准。

  • 极致智能密度,越级挑战。追求“快、省、可落地”的智能密度和智效比极限,是这代模型的核心思路。

    仅仅 5.1B 的激活参数,就能提供出色的传统推理、指令遵循和长文本处理能力。

    这意味着在复杂 Agent 场景中,它可以用更低的成本实现更高效的应用落地。

  • Agent 全面进化,长程闭环。围绕真实生产力场景,模型的训练环境扩展到了 10,000+ 个可交互场景。

    Coding、General 与 Deep Research Agent 任务都能实现全程闭环。官方总结为“能力强、响应快、协同稳”。

    更值得一提的是,创新接入了 SGLang HiCacheMooncake 分级缓存架构,采用物理双池、集群共享 L3 的设计。

    这使得长程交互不需要重复计算,长输入下的 TTFT(首 token 生成时间) 降低了 60% 到 80% 以上。

开放API与开源计划

目前,Ling-3.0-flash 已经在 OpenRouter 和百灵官方平台同步开放了限时免费 API 调用。

免费期截止到北京时间 8 月 3 日 23:00

更值得期待的是,模型权重将在免费期结束后正式开源。

这意味着开发者很快就能拿到这个“小而强”的模型,在实际场景中验证它的真实能力。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多