跳转到主要内容

研究发现:AI检测器被风格模仿欺骗

AI文本检测器在识别普通机器撰写的内容方面表现相当不错——但加入一点风格模仿,它们就开始出错。这是Epoch AI一项新研究的结论,该研究测试了三款流行检测器,发现当模型被要求模仿特定作者的语气时,近30%的AI生成文本得以蒙混过关。

研究团队对Pangram(3.3.2版)、GPTZero(2026-05-11-base)和Originality.ai(Turbo3.0.2)进行了测试。他们构建了一个包含495篇原创人类作品的测试集,涵盖博客、小说和科学写作——所有作品均在2022年11月ChatGPT发布前创作,以避免训练数据污染。

对标准AI文本近乎完美

当检测器面对普通AI生成内容时,它们表现优异。平均假阴性率(AI文本被误标为人类)仅为0.7%。Pangram和GPTZero对人类文本的假阳性率为零,而Originality.ai将19篇人类作品标记为AI生成,假阳性率为3.8%。

Image

风格模仿改变游戏规则

然后情况变得有趣起来。研究人员让三个大型语言模型——Claude Opus4.8、GPT-5.5和Gemini3.1Pro——研究一位作者的五部真实作品,并生成相同风格的新内容。在297篇风格模仿文本中,平均约13%逃脱了检测。Pangram漏掉了10%,GPTZero漏掉了11%,Originality.ai漏掉了18%。

科学写作:薄弱环节

最大的盲点?学术写作。对于科学风格的AI文本,假阴性率跃升至Pangram的25%、GPTZero的24%和Originality.ai的29%。某些模型组合表现更差:Pangram漏掉了48%的Gemini生成的学术文本,Originality.ai漏掉了39%的GPT-5.5的学术输出。

尽管使用了不同的技术方法——神经网络、文本可预测性分析、统计模式识别——所有三款检测器都表现出相似的脆弱性。研究表明,随着大型语言模型在模仿人类写作方面越来越好,当前的检测技术仍有很长的路要走,尤其是在教育、研究等真实性至关重要的领域。

关键要点

  • 标准AI文本检测高度准确:普通AI内容的假阴性率仅为0.7%。
  • 风格模仿降低准确性:约13%的模仿文本逃避检测,某些检测器漏掉高达18%。
  • 科学写作最难检测:学术风格AI文本的假阴性率高达29%,某些模型-检测器组合甚至达到48%。
  • 所有检测器存在相似弱点:尽管技术不同,它们都在风格模仿上表现不佳,尤其是在科学语境中。