E-Bench – 腾讯混元等推出的智能体评测基准
E-Bench:腾讯混元携手清华、东南大学,重塑多步骤工具使用评测新标杆
E-Bench,这一由腾讯混元团队与清华大学 AIR、东南大合推出的创新性评测基准,正以前所未有的深度和广度,重新定义着人工智能智能体在真实产品场景下的能力边界。它以深受用户喜爱的《王者荣耀》、《QQ 音乐》以及《腾讯会议》三大真实产品为蓝本,精心构建了一个全合成的虚拟环境。在这个高度仿真的世界里,E-Bench 包含了多达 323 个需要状态变更的任务,并辅以 41 张数据库表和超过 7.6 万条丰富的数据,为评测提供了坚实的基础。
E-Bench 的核心价值
E-Bench 的设计巧妙之处在于其“信息鸿沟”与“工具鸿沟”的双不对称性。这种设计迫使接受评测的智能体必须主动地去搜集那些隐藏在表面之下的关键信息,并能够巧妙地编排一系列工具调用来完成复杂任务。最终,评测结果的公正性通过确定性的数据库状态差异(diff)来衡量,精确的匹配才算得分,从而有效避免了模糊评分和评判主观性的问题,全面揭示了当前 AI 智能体在模拟真实产品交互时的能力极限。
E-Bench 的关键功能亮点
- 全方位虚拟产品环境的打造:借助先进的图引导数据库填充技术,E-Bench 能够生成一个无孤立记录、跨表数据一致的虚拟世界,完美复刻了三大产品的核心功能和数据关联。
- 精巧的双鸿沟任务生成机制:负责出题的智能体拥有完整的数据库访问权限,而接受评测的智能体则只能通过受限的业务工具进行交互。这种信息与工具上的双重不对称,极大地增加了任务的挑战性。
- 严谨的确定性状态评测体系:评测的核心标准是数据库在操作前后的状态差异。只有当智能体的操作能够精确地达到目标状态时,任务才被视为通过,这杜绝了任何形式的“猜测得分”或“裁判不一致”的情况。
- 成本与性能的双重考量:E-Bench 在评测过程中会同步记录每一次 API 调用所产生的开销,并在此基础上绘制出准确率与成本的帕累托前沿图,为评估模型的性价比提供了直观的依据。
- 代码执行能力的拓展(E-Bench-Code):E-Bench-Code 版本引入了
exec_code工具,能够将任务分解为纯粹的编排机制难度和信息获取难度,进一步细化了对智能体能力的评估。
E-Bench 的技术内核解析
- 图引导数据库填充的精妙之处:该技术从关系型数据库的 schema 入手,构建了表与表之间的依赖图。数据按照拓扑序填充,从根表开始,逐步向下游表延伸。强大的大型语言模型(LLM)被用作受约束的合成器,数据只能通过插入工具写入。下游表在生成时必须从当前数据库查询候选实体,最后通过确定性脚本来校验和修复时间顺序、聚合计数等语义错误,确保整个环境的完整性和自洽性。
- 生成器-求解器不对称设计的核心:出题的 Agent 拥有
query_sql和exec_code等特权,能够洞察整个数据库并执行复杂的计算。而被测 Agent 则仅能调用业务级的工具。这种信息鸿沟(全局状态的隐藏)和工具鸿沟(内部计算工具的移除)的设计,迫使模型必须通过多步并行工具调用来主动探索和理解环境。 - 意图改写与规则替换的智慧:E-Bench 将数据库中具体的数值替换为生成这些数值的规则。例如,任务不会直接给出歌曲 ID,而是表述为“把收藏里所有已下架的歌加进来”,这样就确保了任务的完成无法脱离与环境的交互而进行。
- 交叉验证的任务生成流程:每个任务的生成都经过一个严谨的“查看数据→确定目标→修改状态→总结意图”的产品化循环。并且,任务的有效性会由三个不同强度的 Agent 模型进行交叉验证,只有当至少两个模型复现一致时,该任务才会被采纳,从而保证了任务的可解性与标注的准确性。
如何驾驭 E-Bench
- 环境的准备工作:首先,需要从论文配套资源中获取 E-Bench 的全合成虚拟环境。随后,加载覆盖《王者荣耀》、《QQ 音乐》和《腾讯会议》三大产品域的数据库模板以及 323 个精心设计的评测任务。
- 版本选择的考量:根据您的具体研究目标,选择基础版 E-Bench 或功能更全面的 E-Bench-Code 版本。
- 模型接入的策略:将待评测的 LLM Agent 接入评测框架。关键在于配置其只能通过受限的领域工具(例如搜索歌曲、创建会议、添加好友等)与环境进行间接交互,严禁直接访问底层数据库。
- 任务配置的精细化:设定每个任务的运行次数,并确保每个任务都从全新的数据库副本开始。同时,开启 API 调用成本追踪功能,以保障评测结果的可复现性。
- 评测执行的流程:启动自动化评测。Agent 在接收到自然语言指令后,将通过多步工具调用与虚拟环境进行交互,并修改其状态。系统会自动记录完整的操作轨迹和 Token 消耗。
- 结果分析的深度:评测完成后,系统将基于确定性的数据库状态差异,输出 Pass@1 和 Pass³ 的准确率。同时,还会生成一份详细的成本-性能联合分析报告,为评估模型的性价比提供有力支持。
E-Bench 的核心优势概览
- 真实规模下的充分干扰:每个数据库都被填充至超过 7.6 万行、60 万个数据单元,目标实体被大量近似记录所包围,这使得模型难以仅仅依靠环境的稀疏性来“蒙对”答案。
- 环境与任务的解耦和复用:一套自洽的产品环境可以支撑生成上百个任务,边际成本极低。环境层面的可控性与任务层面的可扩展性得到了极大的提升。
- 评测的稳定性和可复现性:全合成环境不受线上服务迭代的影响,而确定性的状态差异评分则消除了评判过程中可能出现的主观偏差。
- 清晰的难度分层设计:基础版主要考验智能体的多步编排和信息搜集能力,而 Code 版本则额外评估了代码执行在计算密集型任务中的卸载能力。
E-Bench 的项目入口
- arXiv 技术论文链接:https://arxiv.org/pdf/2607.23722
E-Bench 与同类竞品的深度对比
| 维度 | E-Bench | SWE-bench |
|---|---|---|
| 评测对象 | 多步骤工具使用 Agent(状态变更、信息搜集、工具编排) | 代码修复 Agent(GitHub Issue 对应代码补丁) |
| 环境构建 | 全合成虚拟产品环境,图引导数据库填充 | 真实开源代码库快照,基于 GitHub 历史 Issue |
| 任务类型 | 323 个状态变更任务,涵盖社交、音乐、办公协作等领域 | 真实软件工程任务,涉及代码理解与修改 |
| 评分机制 | 确定性数据库状态 diff,要求精确匹配才能通过 | 单元测试通过率,以补丁应用后测试是否通过为标准 |
| 可扩展性 | 环境与任务解耦,一套环境可支持上百任务,边际成本低 | 扩展性受限于真实代码库和 Issue 的可用性 |
| 去污染难度 | 全合成环境,天然无污染,避免了模型通过训练记忆作弊的可能性 | 需要严格的时间切分以防止数据泄露,去污染成本较高 |
| 成本维度 | 同步测量 API 开销,支持成本-性能联合分析 | 主要关注功能正确性,成本分析并非核心设计目标 |
E-Bench 的广泛应用前景
- AI 智能体能力评估的量化标准:E-Bench 为 LLM Agent 提供了一个标准化、可量化的评估平台,能够全面衡量其在信息检索、状态变更、跨实体编排等核心能力上的表现。
- 模型选型与产品化决策的辅助工具:通过成本-性能帕累托图,E-Bench 能够帮助企业在准确率和 API 开销之间做出明智的权衡,从而识别出最具性价比的模型。
- 智能体训练数据的高效合成:作为一个可控且易于扩展的数据源,E-Bench 能为提升 Agent 在多步工具调用和可靠性方面的能力提供持续的训练数据。
- 代码增强 Agent 研究的新维度:E-Bench-Code 版本为研究代码执行在不同类型任务(计算密集型 vs 推理决策型)中的收益边界提供了有力支持。
- 跨领域基准的扩展潜力:E-Bench 的方具有极强的迁移性,可应用于更多产品后端和命令行接口(CLI)场景,有望推动通用智能体评测标准的建立。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


