E-Bench:腾讯混元等推出的智能体评测基准
时间:2026-08-13 | 作者:实验室老王 | 阅读:0E-Bench:给AI智能体的一次“实地演练”
大模型智能体的能力评测,一直是行业里挺头疼的事儿。
光靠几个简单的问答测试,很难真正看出一个Agent在复杂场景下的真实表现。
最近,腾讯混元团队联合清华大学AIR和东南大学,搞了一个叫E-Bench的评测基准,专门用来“拷打”那些需要多步工具调用才能完成任务的AI智能体。
说白了,它不再只是问你“这是什么”,而是让你去“做完这件事”。
E-Bench的基础,是基于王者荣耀、QQ音乐、腾讯会议这三个真实产品,构建了一套完全合成的虚拟环境。
这套环境里包含323个状态变更任务、41张数据库表,以及超过7.6万条数据。
它的核心设计思路,是通过“信息鸿沟”和“工具鸿沟”的双重不对称,逼迫智能体必须主动去搜集隐藏信息,再编排出一连串的工具调用,才能拿到最后的分数。
而最终评分,靠的是确定性数据库状态diff,数据对上了才算通过,杜绝了任何模糊空间。
E-Bench凭什么能测出“真本事”?
- 全合成产品环境:基于图引导的数据库填充技术,保证生成的虚拟世界里,没有孤立的数据,跨表记录也完全一致。
- 双鸿沟任务设计:出题模型拥有完整数据库访问权限,而被测模型只能通过有限的业务工具去交互,这就在信息和工具上形成了双重不对称。
- 确定性状态评测:只认数据库操作前后的状态diff,精确匹配才算通过,完全杜绝了评分上的主观偏差。
- 成本与性能的联合分析:同步记录每个任务的API开销,然后画出准确率与成本的帕累托前沿图,帮你一眼看出哪款模型性价比最高。
- 代码执行扩展:E-Bench-Code版本开放了
exec_code工具,可以单独剥离出任务编排和信息获取这两个维度的难度,方便做更精细的分析。
技术原理:如何让AI智能体“跑”起来
- 图引导数据库填充:从关系型schema出发,构建表级依赖图,按顺序填充根表和下游表。用强LLM做约束合成器,只通过插入工具写数据,下游表必须从当前库查询候选实体。最后用确定性脚本修复时间顺序、聚合计数等语义错误,确保整个环境自洽。
- 生成器-求解器不对称:出题Agent拥有
query_sql和exec_code特权,能看清全局数据库;而被测Agent只能调用业务级工具。这种设计,本质上是把全局状态隐藏起来,并把内部计算工具移走,迫使模型必须通过多步并行工具调用,像侦探一样去探索环境。 - 意图改写与规则替换:把数据库里那些具体的值,替换成产生它们的规则。比如,不是直接给出一首歌的ID,而是说“把收藏里所有已下架的歌加进来”。这样一来,任务就无法脱离环境交互独立完成。
- 交叉验证任务生成:每个任务都要经过“查看数据→确定目标→修改状态→总结意图”的严格循环,然后由三个不同的强Agent模型交叉验证,至少两个能复现一致,任务才被采纳,保证了可解性和标注准确性。
怎么用E-Bench评测你的模型?
流程很清晰,基本就是六步走:
- 环境准备:从论文配套资源里获取E-Bench全合成虚拟环境,加载覆盖三大产品域的数据库模板和323个评测任务。
- 版本选择:根据研究目标,选基础版E-Bench或E-Bench-Code。
- 模型接入:把被测LLM Agent接入评测框架,确保它只能通过受限的领域工具(如搜索歌曲、创建会议、添加好友等)间接与环境交互,禁止直接查询底层数据库。
- 任务配置:设定每个任务独立运行的次数和全新数据库副本的起始条件,开启API调用成本追踪,保证结果可复现。
- 执行评测:启动自动化评测,Agent接收自然语言指令后,通过多步工具调用与虚拟环境交互并修改状态,系统自动记录完整操作轨迹和Token消耗。
- 结果分析:评测结束后,系统基于确定性数据库状态diff,输出Pass@1与Pass准确率,生成成本-性能联合分析报告,辅助评估模型性价比。
核心优势:为什么它比SWE-bench更“刁钻”
- 真实规模干扰充分:每个库填充到7.6万+行、60万+数据单元,目标实体被大量近似记录环绕,模型没法靠环境稀疏蒙对。
- 环境任务解耦复用:一套自洽的产品环境,可以支撑上百个任务的生成,边际成本极低,环境层可控,任务层可扩展。
- 评测稳定可复现:全合成环境不受线上服务演进的影响,确定性diff评分消除了语义裁判的主观偏差。
- 难度分层清晰:基础版考验多步编排与信息搜集,Code版则额外测试计算密集型任务的代码卸载能力。
项目地址
- arXiv技术论文:https://arxiv.org/pdf/2607.23722
和SWE-bench怎么比?
| 维度 | E-Bench | SWE-bench |
|---|---|---|
| 评测对象 | 多步骤工具使用Agent(状态变更、信息搜集、工具编排) | 代码修复Agent(GitHub Issue对应代码补丁) |
| 环境构建 | 全合成虚拟产品环境,图引导数据库填充 | 真实开源代码库快照,基于GitHub历史Issue |
| 任务类型 | 323个状态变更任务,涉及社交、音乐、办公协作 | 真实软件工程任务,涉及代码理解与修改 |
| 评分机制 | 确定性数据库状态diff,精确匹配通过 | 单元测试通过率,补丁应用后测试是否通过 |
| 可扩展性 | 环境任务解耦,一套环境支撑上百任务,边际成本低 | 依赖真实代码库与Issue,扩展受限于开源项目可用性 |
| 去污染难度 | 全合成环境,天然无污染,模型无法靠训练记忆抄近道 | 需严格时间切分防止数据泄漏,去污染成本高 |
| 成本维度 | 同步测量API开销,支持成本-性能联合分析 | 主要关注功能正确性,成本分析非核心设计目标 |
哪些场景用得上E-Bench?
- AI智能体能力评测:为LLM Agent提供标准化、可量化的多步工具使用能力评估,覆盖信息检索、状态变更、跨实体编排等核心维度。
- 模型选型与产品化决策:通过成本-性能帕累托图,帮助企业在准确率与API开销之间做出权衡,识别高性价比模型。
- 智能体训练数据合成:作为可控、可扩展的训练数据来源,用于持续提升Agent在多步工具调用与可靠性方面的能力。
- 代码增强Agent研究:E-Bench-Code支持研究代码执行对不同类型任务(计算密集 vs 推理决策)的收益边界。
- 跨领域基准扩展:这套方法论可以迁移到更多产品后端与CLI场景,推动通用智能体评测标准的建立。
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- PlanningBench:开源大模型规划能力评测框架介绍
- 时间:2026-08-21
-
- 腾讯混元发布MMAE音频编辑基准:AI精准编辑能力不足5%
- 时间:2026-08-18
-
- MMAE音频编辑评测基准:腾讯混元联合高校推出新标准
- 时间:2026-08-17
-
- AngelSpec端到端推测解码训练框架解析与腾讯混元开源介绍
- 时间:2026-08-13
-
- 腾讯混元Hy ASR 3.0预览版发布,语音识别能力全面升级
- 时间:2026-08-12
-
- 腾讯混元团队发布E-Bench多步骤智能体评测基准平台
- 时间:2026-08-05
-
- 腾讯混元推出Hy ASR 3.0预览版新一代语音识别模型
- 时间:2026-08-05
-
- 腾讯混元Hy ASR 3.0预览新一代语音识别模型
- 时间:2026-08-05
精选合集
更多大家都在玩
大家都在看
更多-
- 糖尿病完全不能吃糖吗
- 时间:2026-09-15
-
- 蚂蚁庄园小课堂2026年9月16日最新题目答案
- 时间:2026-09-15
-
- 小鸡答题今天的答案是什么2026年9月16日
- 时间:2026-09-15
-
- 蚂蚁庄园每日答题答案2026年9月16日
- 时间:2026-09-15
-
- 以下哪种粮食是酿造绍兴黄酒的主要原料 蚂蚁庄园今日答案9月16日
- 时间:2026-09-15
-
- 劝学名句“及时当勉励,岁月不待人”出自哪位诗人 蚂蚁庄园今日答案9.16
- 时间:2026-09-15
-
- 蚂蚁庄园今天答题答案2026年9月16日
- 时间:2026-09-15
-
- 蚂蚁庄园答题今日答案2026年9月16日
- 时间:2026-09-15