腾讯与人大高瓴联合开源规划评测框架PlanningBench
时间:2026-08-20 | 作者:云端旅人 | 阅读:0最近,腾讯混元团队和人大高瓴人工智能学院等机构联手,推出并开源了一个新框架——PlanningBench。它的定位,就是用来评测和训练大语言模型在规划这件事上的能力。
而且,这个框架是可扩展、可验证的,数据生成和检查都能跟上。
PlanningBench的核心定位
PlanningBench的切入点很务实。它从真实规划场景出发,把任务、约束、难度这些因素系统地抽象出来。
在此基础上,它搭建起一个覆盖超过30种规划任务类型的数据生成与验证体系。
这套体系不仅能看一个模型到底有没有规划能力,还能为模型训练提供稳定的、可迁移的奖励信号。这才是关键所在。
覆盖六大实际应用场景
任务设计上,PlanningBench覆盖了六大类实际应用。范围足够广,目的是避免模型只在某一个领域里“刷题”刷得漂亮,换个场景就露怯。
- 日程排布
- 资源分配
- 人力排班
- 路径调度
- 生产运营
- 应急服务
让模型真正去应对多样化的真实世界,这才是初衷。
难度控制与评估方式更细致
值得一提的还有它的难度控制体系。它通过拆解任务结构、约束层级、资源紧张度这些因素来调整难度。
它并不是简单地把提示词变长、变复杂。
每条数据实例还附带一个checklist,用来评估模型的输出是否满足输入条件、是否受资源限制、以及目标是否达到最优。
这就把评估扎扎实实地落到了细节上。
同时关注局部合规与全局成功
有意思的是,PlanningBench同时关注“局部合规”和“全局成功”。
这意味着,它能识别出那种“看起来大部分都对,但实际上整体根本无法执行”的计划。
这种能力,对于诊断大语言模型在复杂约束下的真实规划水平,价值非常大。
训练效果与研究价值
从实际效果看,用PlanningBench的可验证数据去训练模型,模型在没见过的规划基准和通用任务上的表现也明显提升了。
这说明它的学习信号确实具有通用性。
整体来看,PlanningBench走通了一个真实的闭环:
- 从场景出发生成数据
- 数据驱动训练
- 训练成果还能迁移到更多任务上
对于未来的人工智能规划研究来说,这无疑提供了一个新的方向和工具箱。
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 爱芯元智开源Magnetar一站式模型部署工具发布
- 时间:2026-08-21
-
- 沐曦股份完成阿里千问Qwen3.8-2.4T-A95B大模型Day 0适配
- 时间:2026-08-21
-
- 北大开源美学照片重构模型:废片一键变大片
- 时间:2026-08-21
-
- 苏州GEO系统开源部署实战:制造企业30天快速落地指南
- 时间:2026-08-18
-
- JimuChatBI v1.0发布:开源对话式Chat2BI智能问数产品
- 时间:2026-08-18
-
- 阿里云秒悟Meoo CLI开源工具一键部署上线指南
- 时间:2026-08-18
-
- 小米MiMo Code开源后Bug频发,5人2周做出5.1k星项目引热议
- 时间:2026-08-18
-
- 智谱GLM-5.2全量开源推动前沿人工智能全民化
- 时间:2026-08-17
精选合集
更多大家都在玩
大家都在看
更多-
- 以下哪种食材被称为“地下苹果” 蚂蚁庄园今日答案9.18
- 时间:2026-09-17
-
- 蚂蚁庄园今天答题答案2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园答题今日答案2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园小课堂2026年9月18日最新题目答案
- 时间:2026-09-17
-
- 小鸡答题今天的答案是什么2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园每日答题答案2026年9月18日
- 时间:2026-09-17
-
- 蔬菜洗完掉色,说明是被染色了,是真的吗 蚂蚁庄园今日答案9月18日
- 时间:2026-09-17
-
- 满襟蜡绘花纹巧染就花纹当绣裳说的是哪种传统技艺 蚂蚁新村今日答案2026.9.17
- 时间:2026-09-17
