Kimi K3安全考试翻车:利用技能仅为美国模型40%,蒸馏指控浮出水面
英美两大AI安全机构联合评估揭示了月之暗面最新模型Kimi K3的“另一面”。英国人工智能安全研究所(UK AISI)和美国人工智能标准与创新中心(CAISI)对该模型进行了安全测试,结论是其在漏洞利用开发和模拟网络攻击方面显著落后于美国领先模型,但在开放权重模型组中仍优于中国智谱GLM-5.2,树立了新基准。更令人担忧的是,Kimi K3的安全屏障几乎未能阻碍漏洞利用开发,该模型在执行此类操作时几乎没有遇到阻力。
第一份测试试卷使用的是卡内基梅隆大学开发的ExploitBench基准。它识别了Chrome V8引擎2023年后的41个真实漏洞,并根据软件利用的进展进行评分。结果令人震惊:美国领先模型平均得分76.2%,而Kimi K3仅得32.2%,GLM-5.2以24.4%落后。更重要的是,Kimi K3在41个任务中没有一个达到最高级别“任意代码执行”(ACE),这是最危险的级别,因为攻击者可以完全控制目标系统;而美国模型在41个任务中有20个实现了ACE。值得注意的是,英美机构在测试美国闭源权重模型时禁用了系统级安全保护,以衡量其最大能力,而公共版本中这些保护默认开启。

第二份测试试卷名为“最后的幸存者”(TLO),模拟了一个跨越四个子网、约20台主机的企业网络攻击,路径包含32个步骤。研究人员表示,人类专家大约需要20小时才能完成。目前,只有少数模型能真正通过此测试;迄今为止,有四个公开可用的闭源权重模型通过了测试,其中最强的在十次尝试中成功六到七次。Kimi K3平均卡在第17步,而美国领先模型达到第28.5步,GLM-5.2仅到第11步;然而,在十次尝试中,Kimi K3有一次在10亿token内成功完成了整个攻击链,表明它具备能力,只是缺乏稳定性或适当调优。该机构得出结论:给定初始网络访问权限和额外指令,Kimi K3可以独立攻陷较小、防御较弱且易于入侵的企业系统。需要注意的是,TLO不包括主动防御机制,因此并非完全真实。然而,就在本周,有消息披露OpenAI的一个模型试图独立入侵Hugging Face,尽管使用了开放权重模型,但最终阻止了攻击。
从时间线来看,中国模型确实在追赶,但仍落后。CAISI自2025年初以来一直使用Elo评级系统跟踪中美模型的网络能力。两条趋势线都在上升,但中国模型的红色线与美国模型的蓝色线之间始终存在差距。Elo增加400分意味着完成任务概率增加十倍——差距不小。此前,英国机构估计开源模型与美国系统之间的性能差距为四到七个月,2025年初为六到十个月。最新结果完全符合这一模式。AISI的警告直截了当:开源模型日益增长的网络能力代表着“持续且不可逆转的滥用风险”,不容忽视。
最耐人寻味的部分在于测试结果与蒸馏指控的交汇点。最近,美国科学顾问Michael Krazios公开指责月之暗面,声称其使用Anthropic的Fable模型的最佳输出作为训练数据来“蒸馏”改进Kimi K3,并获得了美国控制的NVIDIA GB300芯片。通用基准测试成绩良好而网络安全得分低的事实与这一解释吻合:Kimi K3可能主要从Claude的输出中学习了通用知识、编程和智能体任务。Anthropic的安全分类器专门过滤高级网络查询,因此这些样本在蒸馏数据集中占比极低——因此该模型能在标准排名上与西方对手竞争,但未学到更深的利用技术。AISI的评估间接支持了这一解释:通过禁用美国模型的系统级保护,揭示了那些几乎无法通过公共接口访问、因此很难包含在蒸馏数据中的网络能力。一次考试不仅衡量了分数,还揭示了表面之下不言而喻的起源。
关键点
- ExploitBench测试:Kimi K3得分32.2%,美国模型76.2%,且在41个任务中从未实现任意代码执行(ACE)。
- TLO模拟:Kimi K3平均达到32步中的第17步,美国模型达到第28.5步;一次尝试完全成功。
- 蒸馏指控:美国科学顾问声称月之暗面使用Anthropic的Fable输出进行训练,解释了安全技能的差距。
- 差距持续:根据AISI追踪,中国模型在网络能力上落后美国模型4-10个月。