位置:首页 > 技术资讯 > Kimi发布史上最大2.8T参数开源模型 距GPT-5.6和Fable 5仅半步

Kimi发布史上最大2.8T参数开源模型 距GPT-5.6和Fable 5仅半步

时间:2026-07-18  |  作者:极客少年  |  阅读:0

Kimi K3正式上线

就在7月16日晚,月之暗面放出了一支很艺术的预告片之后,正式上线了Kimi K3。

这款混合专家模型拥有2.8万亿参数100万token上下文窗口和原生视觉理解能力。

它是Kimi迄今规模最大、能力最强的模型。

不过,在官方发布前,K3已经以另一种方式出了名。

一款名为“Kivine”的匿名模型这几天出现在Arena,连续几天产出高完成度的网页、3D场景和小游戏。

许多测试者直接把它称为“Fable级”。

Kimi发布史上最大2.8T参数开源模型 距GPT-5.6和Fable 5仅半步_wishdown.com图丨KIMI K3正式上线(来源:KIMI)

匿名测试揭秘

当时Kivine并未公开身份。

外界根据模型特点、表现和月之暗面此前的匿名测试习惯,推测它是K3的预览版本。

7月15日,一名用户用相同提示词让它和Claude Fable 5制作宇宙模拟器。

Fable 5完成得更快,界面控件也更稳定。

而Kivine搭建的场景则更加复杂,加入了丰富的天体细节和第一人称视角,视觉冲击力更强。

这段对比很快在X上传播开来,也形成了外界对K3的第一印象:速度未必占优,但经常主动把任务做得更充分。

用户测试亮点

此后的测试大多延续了这一特点。

  • 在一项与GPT-5.6 Sol对照的“体素版死星战壕”测试中,原提示词只要求制作静态世界,Kivine最终交付的却是一个可以实时运行的动画场景。
  • 在樱花盆景测试中,它生成了扭曲的树干和层次分明的树冠,提示词遵循和细节完成度获得测试者好评。
  • 还有用户让它用Three.js一次生成战争场景,模型直接搭出了带有镜头运动和交互元素的网页。

视频丨相关测试视频(来源:X)

更多测试案例

另一名用户要求Kivine制作一款《我的世界》风格的游戏,场景中需要包含中世纪城堡、森林和花丛。

模型最终做成了一款限时寻宝游戏,还加入了环境音效、光影和手机端虚拟摇杆。

作为对照的Claude Opus 4.7,则生成了一款完成度相对简单的上帝视角方块游戏。

另一次前端测试中,Kivine的输出被用户评价为同一提示词下见过的最好结果之一,但生成过程耗时约35分钟,甚至慢于Fable 5。

横向测试:跷跷板台球

K3正式上线后,我们也做了一轮简单的横向测试,要求不同模型制作一款“跷跷板台球”游戏。

  • GPT-5.6 Sol(极高)用时不到10分钟,便实现了要求中的全部效果。
  • Fable 5 Extra在约15分钟时已经生成可用预览,但后续修改破坏了原有交互,台球变得无法拖动。
  • Opus 4.8(Ultracode)用约20分钟完成任务,整体功能齐全(相比其他模型没有做出台球编号),但存在明显bug:白球会卡在球桌边缘,无法再次点击。

Kimi发布史上最大2.8T参数开源模型 距GPT-5.6和Fable 5仅半步_wishdown.com图丨跷跷板台球案例实测结果:Opus 4.8(左上)、GPT-5.6 Sol(右上)、Fable-5(左下)、KIMI K3(右下)(来源:DeepTech)

Kimi K3 Max同样用时约20分钟。

它不是这次测试中速度最快的模型,但最终版本的完成度却最高:主要功能正常,未出现上述交互故障,还额外加入了球体碰撞音效甚至动效。

测试局限与总结

不过,这些案例仍属于零散的用户测试。

提示词数量有限,任务主要集中在前端和游戏生成。

Arena的随机配对也让横向比较很难严格控制变量。

漂亮的单次输出可以展示能力上限,却无法回答稳定性、成本和多轮任务成功率。

K3经常主动扩大任务范围,这也会拉长生成时间,并可能增加后续修改和收敛的难度。

官方评测成绩

从月之暗面公布的评测结果来看,K3的整体表现已经接近当前最强的一批模型。

它“仅次于Claude Fable 5和GPT-5.6 Sol”。

在面向真实职业任务的GDPval-AA v2中,K3获得1687分,排在Claude Fable 5 Max和GPT-5.6 Sol Max之后,高于Claude Opus 4.8 Max的1600分。

在长周期智能体知识工作测试AA-Briefcase中,K3得分为1527,位列第二,超过GPT-5.6 Sol Max的1495分。

K3还在BrowseComp信息检索测试中获得91.2分

按照月之暗面的说法,这项成绩由单个智能体完成,没有使用上下文压缩或额外的上下文管理技术。

Kimi发布史上最大2.8T参数开源模型 距GPT-5.6和Fable 5仅半步_wishdown.com图丨Kimi K3架构图(来源:Moonshot AI)

架构与能力

K3的能力方向也与它在Arena上走红的案例基本吻合。

模型的架构也很有意思:它共有896个专家,每次推理只激活其中16个

它采用Kimi Delta Attention混合线性注意力机制和Attention Residuals。

月之暗面称,这些设计让K3的整体扩展效率达到K2的约2.5倍

它能够读取大型代码库、操作终端和调用工具,再根据截图、日志、测试结果及运行状态继续修改代码。

主要面向前端、游戏、计算机辅助设计和长周期知识工作。

K3目前已经通过API开放。

完整模型权重将在未来几天发布,技术报告也即将公布。

参考资料:1. https://platform.kimi.ai/docs/guide/kimi-k3-quickstart 2. https://www.testingcatalog.com/early-look-at-kimi-k3-generations-from-moonshot-ai-on-arena/

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多