WorkBuddy Bench – 腾讯开源的编码智能体评测套件
在日新月异的人工智能浪潮中,对编码智能体的评测已成为推动技术进步的关键环节。腾讯开源的 WorkBuddy Bench 应运而生,它不仅是一个评测工具,更是一个集真实性、全面性与可审计性于一体的创新平台,旨在为开发各类智能体提供一套严谨而可靠的评估体系。
WorkBuddy Bench 深度解析
WorkBuddy Bench 是腾讯推出的一套旨在全面评估编码智能体性能的开源评测套件。它巧妙地将评测场景拓展至代码开发、网页构建、办公自动化以及网络安全四大核心领域,力求模拟真实的工作环境。其任务设计独具匠心,源自真实的软件开发提交(commit)、拉取请求(PR)及实际业务场景,经过逆向工程手法转化为更贴近人类日常沟通的口语化指令,有效规避了因数据污染而可能产生的偏差。
该套件在260个精心设计的任务上,通过在隔离的沙箱环境中执行,并结合隐藏测试、规则校验以及大型语言模型(LLM)的多元化评判,最终在双重评测框架下进行交叉验证,确保了评测结果的开放性、可复现性和可审计性,实现端到端的严谨评估。
WorkBuddy Bench 的核心能力
- 代码(Code):包含80个面向整个软件工程生命周期的任务,覆盖了bug修复、新功能开发、接口调整、算法实现等18个细分类别。这些任务的提出者模拟了开发者、算法工程师、产品经理、QA以及运维工程师等五种不同的工作角色,反映了真实项目中的多样化需求。
- 网页(Web):提供70个前端开发相关的任务,涉及页面布局实现、交互逻辑设计、数据可视化展示、视觉效果呈现、代码质量测试以及文档格式转换等7个类别。其独特之处在于,要求智能体交付可直接运行的前端制品,而非仅仅是对话文本。
- 办公(Office):聚焦于50个涉及多文件处理的业务流程任务。智能体需要处理电子表格、文档、PDF、JSON等混合格式的文件,完成数据核对、报告生成、状态信息更新等一系列交接性工作,模拟了日常办公中的复杂协作场景。
- 安全(Security):包含60个模拟红蓝对抗的安全任务,涵盖漏洞的发现与利用、恶意软件行为分析、安全运营策略制定以及AI智能体自身的安全评估。这部分任务的评分机制采用严格的确定性评分脚本,不依赖LLM进行评判,确保了评估的客观性。
WorkBuddy Bench 的技术基石
- 逆向工程构建:每个评测任务都源于真实世界的代码提交、PR、CVE漏洞报告或业务场景,通过逆向工程手法精心改写为简短、口语化的角色扮演式请求。这种设计方式使得原始的提示词难以通过简单的搜索引擎找到,从而有效防止了数据污染。
- 刻意信息不充分:任务请求在设计时,仅陈述核心意图与必要约束,故意省略了目标文件、精确接口定义、边界条件处理等细节。这迫使智能体必须主动在工作区内进行上下文恢复和信息探索,以此来测试其需求消歧和实际落地能力。
- 回合后评估隔离:在智能体执行任务的过程中,它只能看到任务指令和可访问的工作区。而用于评分的关键资产,如隐藏测试用例、详细的评分细则等,则被严格保存在沙箱中,直到任务完成后才被引入,确保了评估过程的公正性,避免了评分信息提前泄露。
- 双框架交叉验证:为了消除单一评测框架可能带来的系统性偏差,WorkBuddy Bench 会将所有任务分别在CodeBuddy Code和Claude Code这两种不同的智能体框架下运行,通过交叉验证来提升评估结果的稳健性。
- 抗污染机制:该套件通过在任务构建层面即封闭可搜索的提示路径,并辅以数据集版本管理机制进行定期刷新,构建了一种主动的抗污染解决方案,有效替代了传统的保密式防污染策略。
如需深入了解,请关注微信公众号并回复“开源”,加入AI开源项目交流群,获取更多信息。
WorkBuddy Bench 的使用指南
- 获取任务集:用户可以通过访问GitHub仓库,下载标准化的任务目录。该目录包含了
instruction.md(任务说明)、task.toml(任务配置)、environment/(环境镜像)以及tests/(评分资产)等核心组件。 - 运行评测:将待评测的智能体接入Harbor风格的任务目录后,即可在隔离的Docker沙箱环境中执行评测。智能体将读取自然语言请求,并在工作区内进行自主探索和制品生成。
- 查看结果:任务结束后,评分器将自动启动。代码类任务通过隐藏的单元测试进行评分;网页类任务则采用规则检查、LLM/VLM及智能体评判器的组合方式;办公类任务结合了规则检查和证据驱动的LLM评判;而安全类任务则依赖于
scoring.py这一确定性脚本进行评分。 - 审计:WorkBuddy Bench 的设计允许任何第三方离线运行单个任务,并直接检查其内容,从而实现了端到端的完全可复现性和可审计性。
WorkBuddy Bench 的突出亮点
- 真实工作分布:其任务的设计和难度分布,均严格遵循了内部真实工作场景的分类标准,而非简单地从公开题库或教程中拼凑,确保了评估的贴合度。
- 完全开源可审计:与CursorBench等封闭厂商的基准测试不同,WorkBuddy Bench 的任务目录、环境镜像、评估代码、评分测试以及参全部公开,为用户提供了高度透明和可信赖的评估环境。
- 多维度评分体系:针对不同子集,WorkBuddy Bench 采用了量身定制的评分工具:代码使用隐藏测试;网页结合规则、语义和交互三重评判;办公依赖规则和证据驱动的LLM评判;安全则采用确定性的脚本。
- 角色与场景多样性:代码子集引入了五种不同的请求者角色,安全子集则覆盖了红蓝对抗的全光谱,有效避免了因单一任务类型导致的评估偏差。
- 效率与能力解耦:排行榜不仅展示了模型的得分,还同时报告了token消耗量和轮次效率。例如,GPT-5.5 以极低的输出预算取得了顶级分数,证明了高分并非一定伴随着高消耗,实现了对智能体实际效能的精细评估。
WorkBuddy Bench 的项目入口
- 项目官网:https://workbuddybench.com/
- GitHub仓库:https://github.com/Tencent/workbuddy-bench
- HuggingFace模型库:https://huggingface.co/datasets/tencent/workbuddy-bench
- 技术论文:https://workbuddybench.com/report/main.pdf
WorkBuddy Bench 与同类竞品对比
| 维度 | WorkBuddy Bench | SWE-bench |
|---|---|---|
| 任务来源 | 真实 commit/PR/业务场景逆向工程 | 公开 GitHub issue |
| 抗污染方式 | 构建层面封闭搜索路径+版本管理 | 依赖发布时的新颖性 |
| 覆盖领域 | Code / Web / Office / Security 四领域 | 仅代码缺陷修复 |
| 开源程度 | 任务/镜像/评分/答案全部公开 | 公开任务集与测试 |
| 请求风格 | 口语化、角色扮演、信息不充分 | 详细技术 issue 描述 |
| 评测框架 | 双框架(CodeBuddy + Claude Code) | 单一框架 |
WorkBuddy Bench 的应用场景
- 智能体研发基准:为编码智能体、前端AI工具、办公自动化Agent以及安全AI等提供了一套标准化的能力衡量标尺,促进了相关领域的研究与开发。
- 模型选型参考:其跨模型排行榜汇集了Claude Opus 4.8、GPT-5.5、GLM-5.2、DeepSeek-V4等主流模型,为企业在选择AI模型时提供了宝贵的参考依据。
- 学术研究与对比:完全开源的任务集和评分协议,使得第三方研究者可以轻松复现、审计和改进评测方法,有力地推动了领域内基准的持续迭代和发展。
- 产品迭代优化:通过对细分任务子集的得分和token效率数据的深入分析,可以精准定位智能体在代码导航、前端状态管理、跨文件一致性等具体环节的短板,为产品优化提供方向。
- 安全能力评估:的、专门设计的安全子集,为AI红队和蓝队的实战对抗能力提供了量化的测试环境,有助于提升AI在安全领域的攻防水平。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


