国产第一!阿里千问旗舰模型Qwen3.7-Max发布:全自主完成35小时任务
时间:2026-05-20 | 作者: | 阅读:05月20日消息,阿里巴巴在2026阿里云峰会上,正式发布了全新一代千问旗舰模型Qwen3.7-Max。
在三方机构Arena全球大模型盲测总榜中,Qwen3.7-Max超过Kimi-K2.6、DeepSeek-v4-pro、GLM-5.1,与GPT、Claude、Gemini最强模型接近,位列国产模型第一。
这是千问旗舰模型近三个月内的第三次重大迭代,从3.5到3.6再到3.7,阿里大模型研发节奏明显加速。
Qwen3.7-Max面向智能体(Agent)场景全新设计,在多个核心维度实现突破。
编程方面,在SWE-Pro、SWE-Multilingual等编程智能体测评中均取得领先,Terminal Bench 2.0-Terminus得分69.7,超过DeepSeek-v4-pro-Max和Claude-Opus4.6等。
通用智能体方面,Qwen3.7-Max在MCP-Atlas、MCP-Mark、Skillbench等现实能力测试中表现优异,超越GLM5.1、Kimi-K2.6等模型,创下国产新高。
推理方面,在GPQA Diamond、HLE、HMMT 2026 Feb等推理核心测评中超越Claude-Opus4.6及所有国产模型。
通用能力上,Qwen3.7-Max在指令遵循IFBench评测中得分79.1分创下新高,多语言评测WMT24++、MAXIFE中同样领先。
实战任务测试中,在一个模型训练时从未接触过的全新硬件平台平头哥真武M890芯片上,Qwen3.7-Max在没有任何性能分析数据、硬件文档或新架构的示例内核情况下,从空白工作空间出发,自主完成了推理内核优化任务。
整个过程持续35小时,模型独立进行了432次内核评估和1158次工具调用,完全自主地完成了编写、编译、性能分析与迭代改进的全流程。
最终优化后的推理内核较SGLang Triton官方参考实现取得了10倍加速。
测试轨迹显示,模型在独立运行超过30小时后仍能发现有效优化点,甚至主动发起了一次关键的架构重设计。
在Agent能力方面,Qwen3.7-Max展现出跨框架泛化能力,在Claude Code、OpenClaw、Qwen Code等框架下均能稳定发挥。
通过MCP集成和多智能体协作,该模型在办公自动化基准SpreadSheetBench-v1上斩获87分,处于顶尖水平。
阿里云表示,Qwen3.7-Max API即将上线百炼平台,后续还将推出Qwen3.7-Plus等版本,覆盖从编程智能体到视觉智能体的全场景需求。
来源:https://news.mydrivers.com/1/1123/1123554.htm
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 谷歌正式推出Gemma 4 12B多模态人工智能模型新版本
- 时间:2026-07-23
-
- 英伟达与Abridge正式合作开发人工智能医疗保健模型
- 时间:2026-07-22
-
- 谷歌发布DiffusionGemma开源文本生成图像模型
- 时间:2026-07-22
-
- 沐曦股份曦云C系列GPU发布即适配智谱GLM-5.2旗舰模型
- 时间:2026-07-21
-
- 蚂蚁灵波开源LingBot-Video 全球首个具身智能MoE视频基模落地
- 时间:2026-07-19
-
- 商汤科技发布日日新U1 Pro图片创作模型 8K原生分辨率 告别AI味
- 时间:2026-07-19
-
- 沐曦曦云C系列GPU适配腾讯混元Hy3模型
- 时间:2026-07-18
-
- 大晓机器人开源统一具身基模型ACE-Brain-0.5
- 时间:2026-07-18
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- iOS 13.5.1电池续航差是电池耗电问题吗
- 时间:2026-07-25
-
- 苹果教育优惠开启 附购买攻略
- 时间:2026-07-25
-
- 苹果iOS 14 beta 2 测试版主要更新内容:除细节变化外修复多项Bug
- 时间:2026-07-25
-
- iOS 14 beta 2 是否解决内存占用过多问题?
- 时间:2026-07-25
-
- 受欢迎的奥特曼游戏有哪些
- 时间:2026-07-25
-
- iOS 14信息应用5大更新变化
- 时间:2026-07-25
-
- iOS 14正式版上线时间公布 官方全新介绍
- 时间:2026-07-25
-
- 最新苹果iOS 14 Beta 2版本更新内容全解析与升级教程
- 时间:2026-07-25

