跳转到主要内容

Kimi K3 网络安全考试不及格:仅达美国模型40%水平,蒸馏指控浮出水面

两大主要AI安全机构——英国人工智能安全研究所(AISI)和美国人工智能标准与创新中心(CAISI)——对月之暗面的最新模型Kimi K3进行了严格的安全考试。结果如何?不太乐观。

ExploitBench:两种分数的故事

第一项测试是卡内基梅隆大学的ExploitBench,提供了2023年后发现的Chrome V8引擎中的41个真实漏洞。模型根据其在利用每个漏洞方面的进展程度进行评分。美国领先模型平均得分为76.2%。Kimi K3呢?只有32.2%。中国的智谱GLM-5.2以24.4%紧随其后。

更说明问题的是:美国模型在41个任务中的20个中实现了“任意代码执行”(ACE)——最危险的级别,使攻击者获得完全控制。Kimi K3没有一次达到ACE。值得注意的是,测试人员禁用了美国闭源模型的系统级保护以测量其上限,而公共版本中这些保护默认开启。

Image

最后的幸存者:卡在第17步

第二项测试名为“最后的幸存者”(TLO),模拟了一个真实的企业网络攻击,跨越四个子网和大约20台主机,共32步。人类专家需要大约20小时完成。只有少数模型通过;最强的美国模型在10次尝试中成功6-7次。

Kimi K3通常在第17步停滞。美国模型平均达到第28.5步。GLM-5.2只到了第11步。但有一个转折:在十次尝试中的一次,Kimi K3在10亿个token内完成了整个攻击链。所以能力是存在的——只是不稳定。评估人员得出结论,给定初始访问权限和额外指令,Kimi K3可以独立攻破较小、防御较弱的企业系统。(TLO缺乏主动防御,因此不完全真实。)

更大的图景:追赶中,但仍落后

CAISI自2025年初以来使用Elo评级系统追踪中美模型的网络能力。两条趋势线都在上升,但差距持续存在。Elo增加400分意味着任务完成概率提升十倍——因此差距显著。早些时候,AISI估计开源模型落后美国系统4-7个月;2025年初为6-10个月。最新结果符合这一模式。

AISI的警告直截了当:开源模型日益增长的网络能力构成了“持续且不可逆转的滥用风险”。

蒸馏关联

最有趣的部分是这些测试结果如何与近期指控相交。美国科学顾问Michael Krazios公开声称,月之暗面使用Anthropic的Fable模型(Claude)的输出“蒸馏”并改进Kimi K3,并且获得了美国控制的NVIDIA GB300芯片。

模式吻合:Kimi K3在通用基准测试中得分高,但在网络安全上表现糟糕。如果它主要从Claude的输出中学习通用知识、编程和代理任务,那就能解释差距。Anthropic的安全分类器过滤了高级网络查询,因此这些样本在蒸馏数据集中稀缺。该模型可以在标准排名中竞争,但没有学到更深的利用技术。

AISI的评估间接支持了这一点:禁用美国模型的系统级保护揭示了几乎不可能通过公共接口访问的网络能力——因此不太可能出现在蒸馏数据中。一次考试,两个启示:一个分数,以及其下未言明的起源。

关键点:

  • Kimi K3在ExploitBench上得分32.2%,而美国模型为76.2%;从未实现任意代码执行。
  • 在模拟企业攻击(TLO)中,Kimi K3平均达到32步中的第17步;美国模型达到第28.5步。
  • 中国模型正在改进,但仍落后美国同行4-10个月。
  • 糟糕的网络表现与蒸馏指控相符:Kimi K3很可能在缺乏高级利用数据的Claude输出上训练。
  • AISI警告开源网络能力构成持续滥用风险。