GPT-6 Astra数据风波:OpenAI频繁改分引发信任危机
OpenAI在9月3日高调发布了新一代模型GPT-6 Astra,但这场发布却像坐过山车一样跌宕起伏。起初,公告上线后不久就被紧急撤下,页面长时间无法访问。官方先是解释为内容管理系统故障和网络中断,并坚决否认与测试成绩有关。然而,当博客重新上线并更新后,人们发现模型的评估数据经历了多次调整,其中最引人注目的是Astra的幻觉率——先是大幅下降至2%,随后又戏剧性地回升至4.2%。此外,GPT-5.6 Sol的幻觉率和内部网络安全测试等关键指标也出现了波动。更令人玩味的是,不仅OpenAI自家产品受影响,连Anthropic等竞争对手的某些性能分数也出现了类似的先降后升,部分数据调整甚至发生在博客首次发布之前。
面对外界的种种猜测,OpenAI官方解释称,这些调整只是为了确保数据能真实反映模型性能,并强调测试条件等客观因素会影响最终结果。然而,频繁的数据变动还是让不少AI专家怀疑,这背后是否有“刷分”的嫌疑。事实上,这并非个例,Meta等大公司也曾因类似问题陷入信任危机。
行业观察人士指出,基准测试的准确性一直是AI领域的痛点。随着大模型竞争白热化,测试成绩直接关系到市场定位和商业拓展,但数据频繁变动让企业客户和投资者难以判断模型的真实水平。有声音呼吁,应尽快建立统一的测试标准,任何分数修改都必须公开透明,并详细说明测试条件的变化。否则,不仅会损害OpenAI的长期信誉,也会让整个行业陷入“数字游戏”的泥潭。
关键要点
- OpenAI发布GPT-6 Astra时,测试数据多次调整,引发“刷分”质疑。
- 幻觉率从4.2%降至2%又回升,其他指标也出现波动。
- 官方解释为测试条件影响,但专家仍存疑虑。
- 事件暴露AI基准测试的信任危机,行业呼吁统一标准。