位置:首页 > 产业资讯 > 腾讯发布WorkBuddy Bench编码智能体考场集成代码网页办公安全

腾讯发布WorkBuddy Bench编码智能体考场集成代码网页办公安全

时间:2026-07-25  |  作者:冻月看渠  |  阅读:0

一、多领域评测套件:WorkBuddy Bench

说起评测编码智能体这事儿,过去大家的思路基本是各管一摊:

  • 修bug的盯着SWE-bench
  • 做前端的看Design2Code
  • 生产环境的基准又多半关着门不让外人审计

腾讯这次倒好,直接把四块拼到一张桌上,端出一个叫WorkBuddy Bench的多领域评测套件。论文已经挂在arXiv上了。

这个套件最较劲的地方,不在于题量多,而在于这些题从根上就防着“背答案”这一手。

二、四个工作领域与任务设计

整套基准横跨四个工作领域:

  • 代码(仓库级软件工程)
  • 网页(前端制品)
  • 办公(多文件业务流程)
  • 安全(红蓝队)

规模分别是80、70、50、60个任务,合计260道。

关键点:每个任务都不是从某份公开题库里改来的。而是从真实的代码提交、拉取请求或业务场景里“逆向工程”出来,再改写成简短、口语化、带角色扮演味道的请求。

这么做的道理很简单:任务的提示词没法靠上网搜到对应的PR或提交线索——你搜不到,自然就背不了。

由于数据集是公开发布的(任务目录、环境镜像、评估工具、测试用例、参考方案全给),它的抗污染靠的是这种构造方式加版本管理,而不是把题捂着。

image.png

三、验证方式与反作弊机制

四个子集共享同一套任务目录格式,但各自有独立的验证方式。分数因此不能在子集之间直接比,所以腾讯干脆不报套件平均分。

  • 代码类:按隐藏测试通过率打分
  • 网页类:用规则检查加LLM/VLM评判再加智能体评判,且必须交付一条声明路径上的制品、不连实时互联网
  • 办公类:走确定性规则检查加基于证据的LLM评判,权重0.70到0.95之间偏向规则
  • 安全类:干脆用确定性的scoring.py跑三次取平均,不用大模型当裁判

安全子集还布了五层反作弊:

  • 禁字面量扫描
  • 重命名输入
  • 覆盖篡改测试
  • 编码依赖
  • 低权重诱饵

红队38题、蓝队22题,白盒审计锚定binutils、curl、nginx等真实CVE。

四、任务构建流程

任务构建走的是统一流水线:来源收集、改写成真实请求、组装工作空间、回合后隔离评估资产、独立目录打包,全程不碰用户数据。

代码任务给五种角色(开发者、算法工程师、产品经理、QA、运维),安全任务赋专业角色。而且刻意把信息写得不充分——不告诉你目标文件、模式或边界,智能体得自己把上下文找回来。

评分资产在智能体跑完之后才引入,它全程看不见。

五、评测环境与框架

评测在隔离容器里跑,模型和沙箱分离。框架用CodeBuddy Code(默认)和Claude Code两种。推理努力调高、上下文给到200k,并禁用WebSearch与AskUserQuestion。

这点很重要:关掉联网搜索,本就为了验证抗污染是不是真管用。

六、排行榜结果分析

排行榜把多家模型族摆上了台面(分数0–100,思考模式,三次平均)。

  • Claude Opus4.8在代码、网页、办公、安全多数榜首通吃,拿下五个第一
  • GLM-5.2在security两榜登顶
  • GPT-5.5则摘下office cc第一

框架的敏感性也不小——安全子集重排最狠,平均绝对变动达8.6个点。Claude Opus4.8在cc框架下拒答了13次,GPT-5.5在cbc下只拒2次。

效率上,GPT-5.5输出token最少却分数不低。而DeepSeek-V4-Pro在代码上跑了44轮、出入token都高,显得更“费劲”。

七、团队与未来展望

这篇论文由腾讯多家实验室合力完成,署名的包括:

  • 优图实验室(Youtu Lab)
  • 科恩安全实验室(Keen Security Lab)
  • Workbuddy团队
  • 云鼎安全实验室(Yunding Security Lab)

团队也坦承局限:代码子集以Python为主、跨语言偏少;开源发布本身带来被爬取污染的风险,得靠版本管理缓解;评判器偏差尚未量化;办公类偏文本,暂无OCR与GUI。

近期计划是校准网页评分、扩充公开榜单。对一个想把“真实工作分布”搬进考场的评测来说,WorkBuddy Bench已经把门敞得很开了

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多