跳转到主要内容

腾讯WorkBuddy Bench:无法作弊的编程AI新测试

一段时间以来,评估编程AI有点像以爬树能力来评判鱼——每个基准测试只关注一个狭窄的技能。SWE-bench测试bug修复,Design2Code检查前端工作,而生产基准测试通常被关在闭门之后。腾讯正试图通过WorkBuddy Bench改变这一现状,这是一个新的多领域评估套件,将代码、网页、办公和安全任务整合在一起。论文已上传至arXiv,其突出之处不仅在于多样性,还在于任务构建方式——通过防止AI记忆答案来阻止作弊。

四个领域,260个任务

该基准测试涵盖四个工作领域:代码(仓库级软件工程)、网页(前端工件)、办公(多文件业务流程)和安全(红蓝队练习)。其中有80个代码任务、70个网页任务、50个办公任务和60个安全任务——总共260个。它们都不来自任何公共题库。相反,它们是从真实的代码提交、拉取请求或业务场景中逆向工程而来,然后重写为简短、口语化、角色扮演式的请求。这意味着你不能通过搜索任务提示来找到答案。数据集是公开发布的(包括任务目录、环境镜像、评估工具、测试用例和参考解决方案),因此抗污染能力来自这种构建方法加上版本控制,而不是通过保密问题。

Image

有意义的评分

每个子集都有自己的验证方法,因此分数不能跨领域直接比较。腾讯甚至不报告总体分数。代码任务基于隐藏测试通过率评分。网页任务使用规则检查结合LLM/VLM评估和代理评估,要求沿声明路径交付工件,而不连接实时互联网。办公任务使用确定性规则检查结合基于证据的LLM评估,权重范围从0.70到0.95,偏向规则。安全任务使用确定性scoring.py运行三次并取平均值,不使用大模型作为评判者。安全子集还包括五层反作弊措施——禁用字面扫描、重命名输入、覆盖篡改测试、编码依赖项和低权重诱饵——包含38个红队任务和22个蓝队任务。白盒审计基于真实世界的CVE,如binutils、curl和nginx。

任务构建方式

任务构建遵循统一流程:源收集、重写为真实请求、组装工作空间、轮次后隔离评估资产、打包成独立目录。从不接触用户数据。代码任务分配五个角色(开发人员、算法工程师、产品经理、QA、运维),而安全任务分配专业角色。任务故意提供不完整信息——它们不告诉你目标文件、模式或边界——因此代理必须自行检索上下文。评分资产仅在代理完成运行后引入,因此代理在过程中从未看到它们。

评估设置

评估在隔离容器中运行,模型和沙箱分离。框架使用CodeBuddy Code(默认)和Claude Code,增加推理努力,上下文窗口为200k。WebSearch和AskUserQuestion被禁用。这一点很重要:关闭在线搜索正是为了验证抗污染是否真正有效。

排行榜亮点

排行榜展示了多个模型系列(分数0-100,思考模式,三次平均)。Claude Opus4.8在代码、网页、办公和安全领域占据大部分顶级位置,获得五个第一名。GLM-5.2在两个安全排名中位居榜首,GPT-5.5在办公cc排名中位列第一。框架的敏感性也很显著——安全子集显示出最剧烈的重新排名,平均绝对变化为8.6分。Claude Opus4.8在cc框架下拒绝了13个答案,而GPT-5.5在cbc下仅拒绝了2个。在效率方面,GPT-5.5输出的token最少,但保持了不错的分数,而DeepSeek-V4-Pro在代码上运行了44轮,token输入和输出都很高,显得更“苛刻”。

关键点

  • WorkBuddy Bench涵盖代码、网页、办公和安全领域的260个任务。
  • 任务基于真实场景构建,旨在防止答案记忆。
  • 每个领域有自己的评分方法,因此无法进行跨领域比较。
  • Claude Opus4.8在大多数类别中领先,但GPT-5.5显示出强大的效率。
  • 该基准测试公开发布,促进透明度和可重复性。