腾讯WorkBuddy Bench:一个无法被作弊的新AI测试场
腾讯WorkBuddy Bench:一个无法被作弊的新AI测试场
一段时间以来,评估编码AI智能体感觉有点像给一个已经看过答案的学生打分。基准测试是孤立的——在SWE-bench上修复bug,在Design2Code上做前端工作——许多生产环境基准测试被关在门后。腾讯正试图通过WorkBuddy Bench改变这一现状,这是一个多领域评估套件,将代码、网页、办公和安全任务整合在一起。论文已上传至arXiv。
真正有趣的不仅仅是任务数量(总共260个),而是它们的构建方式。腾讯团队不遗余力地确保这些任务无法通过记忆来作弊。他们没有从公共数据集中提取问题,而是从真实的代码提交、拉取请求和业务场景中逆向工程。然后,他们将其重写为简短、口语化、角色扮演式的请求。其理念是,你不能仅仅通过在线搜索找到相应的PR或提交——没有捷径。数据集是公开的(包括任务目录、环境镜像、评估工具、测试用例和参考解决方案),因此对污染的抵抗力来自构建方法和版本控制,而非保密。

四个子集——代码(80个任务)、网页(70个)、办公(50个)和安全(60个)——共享相同的任务目录格式,但每个子集都有自己的验证方法。这意味着子集之间的分数不能直接比较,因此腾讯不报告总体分数。代码任务根据隐藏测试通过率评分;网页任务使用规则检查结合LLM/VLM评估和智能体评估,要求沿着声明路径交付工件,而不连接实时互联网;办公任务使用确定性规则检查结合基于证据的LLM评估,权重从0.70到0.95不等,偏向规则;安全任务使用确定性的scoring.py运行三次并取平均值,不使用大模型作为评判者。安全子集还包括五层反作弊措施——禁用字面扫描、重命名输入、覆盖篡改测试、编码依赖和低权重诱饵——包含38个红队任务和22个蓝队任务。白盒审计锚定在真实世界的CVE上,如binutils、curl和nginx。
任务构建遵循统一流程:源收集、重写为真实请求、组装工作空间、在轮次后隔离评估资产、打包成独立目录。用户数据从未被触及。代码任务分配五个角色(开发者、算法工程师、产品经理、QA、运维),而安全任务分配专业角色,并故意提供不完整信息——它们不告知目标文件、模式或边界,因此智能体必须自行检索上下文。评分资产仅在智能体完成运行后引入,过程中智能体从未看到它们。
评估在隔离容器中运行,模型和沙箱分离。框架使用CodeBuddy Code(默认)和Claude Code,增加推理努力,上下文窗口为200k,并禁用WebSearch和AskUserQuestion。关闭在线搜索是一个刻意的选择——这是验证抗污染是否真正有效的一种方式。
排行榜包含多个模型系列(分数0-100,思考模式,三次平均)。Claude Opus4.8在代码、网页、办公和安全领域占据大多数顶级位置,获得五个第一;GLM-5.2在安全排名中占据两个第一,GPT-5.5在办公cc中占据第一。框架的敏感性也很显著——安全子集显示出最剧烈的重新排名,平均绝对变化为8.6分;Claude Opus4.8在cc框架下拒绝了13个答案,而GPT-5.5在cbc下仅拒绝了2个。在效率方面,GPT-5.5输出的token最少,但保持了不错的分数,而DeepSeek-V4-Pro在代码上运行了44轮,token输入和输出都很高,显得更“苛刻”。
关键点:
- WorkBuddy Bench涵盖四个领域:代码、网页、办公和安全,共260个任务。
- 任务从真实场景逆向工程,以防止记忆。
- 每个子集有自己的验证方法,因此分数不能直接比较。
- Claude Opus4.8在大多数类别中领先,但安全子集显示出显著重新排名。
- 该基准测试通过构建方法而非保密来抵抗污染。