Skip to main content

OpenAI前CTO新模型翻车:抄中国作业,性能不如还更贵

OpenAI前CTO穆拉蒂(Mira Murati)离开老东家后的首秀,意外上演了一场中美大模型角色互换的戏码。

7月15日,她创办的Thinking Machines Lab发布了首个模型Inkling。这款混合专家架构模型,主要参考了DeepSeek-V3的设计,后训练冷启动阶段还用了月之暗面Kimi K2.5等开源模型生成的合成数据。结果有点尴尬:多项基准评测中,Inkling落后于Kimi和智谱GLM,调用价格反而更高。一家融资20亿美元、估值120亿美元的明星公司,首秀表现低于预期。

但穆拉蒂可能从一开始就没打算争第一。

硬件豪华,性能平平

单看硬件配置,Inkling确实配得上明星实验室的身份。它采用混合专家架构,总参数量9750亿,处理每个token激活410亿参数;预训练用了45万亿token,覆盖文本、图像、音频和视频,支持最多100万token上下文;能理解文本、图像和音频,以文本形式输出,还支持调整思考强度来平衡性能、速度和成本。模型开放权重,采用相对宽松的Apache 2.0许可证,允许开发者下载权重自行部署或通过Thinking Machines的Tinker平台微调。公司定位很明确:与其跟ChatGPT抢普通用户,不如让Inkling成为企业开发AI应用的基础。

真正让人注意的是技术报告后半部分。Thinking Machines在架构介绍中明确写道,Inkling的混合专家设计主要参考了DeepSeek-V3,大量专家模块中每个token只激活一小部分,还采用了DeepSeek-V3的无辅助损失负载均衡设计。中国模型的影响延伸到训练阶段:为了启动后训练,公司先用开源模型生成的合成数据做了一轮监督微调,明确提到了Kimi K2.5。

一条完整的路线图浮现出来——OpenAI前CTO创办的美国实验室,首款模型借鉴DeepSeek架构,再用Kimi的数据启动后训练。借鉴开源模型本身没问题,DeepSeek和Kimi公开权重允许使用,这是站在公开成果上。更尴尬的是,吸收了中文模型的技术后,Inkling依然没能超越这些老师。Thinking Machines也坦言:Inkling目前不是最强的模型,无论开源还是闭源。

数据不会骗人

把数字摆出来就更清楚了。在最终人类考试纯文本评测中,Inkling得分29.7%,Kimi K2.6和GLM 5.2分别达到35.9%和40.1%;加入工具后Inkling升至46%,仍低于Kimi K2.6的54%和GLM 5.2的54.7%;测试真实软件工程能力的SWE-Bench Pro中,Inkling得分54.3%,Kimi K2.6为58.6%,GLM 5.2达到62.1%;差距最明显的是Terminal Bench 2.1,Inkling得分63.8%,Kimi K2.6和GLM 5.2分别为71.3%和82.7%。

当然,Inkling在网页应用设计、音频理解和安全评估方面有长处,某些数学任务甚至能超过Kimi和DeepSeek。但综合推理、编程和智能体能力,还没挤进开源模型第一梯队。

价格也没带来惊喜。Tinker平台上,64K版本每100万Prefill Tokens收费1.87美元,每100万Sample Tokens收费4.68美元,这还是五天折扣价。256K版本涨到3.74美元和9.36美元;对比Kimi K2.6官方API输入0.95美元、输出4美元,GLM 5.2的1.4美元和4.4美元,Inkling的Prefill价格几乎是Kimi K2.6的两倍,生成价格也更高,毫无价格优势。于是局面变得微妙:架构参考DeepSeek,后训练依赖Kimi,整体性能没超过中国领先开源模型,调用价格还更贵。

为什么这么做?

这件事之所以有意思,在于Thinking Machines的特殊背景。这家公司几乎是OpenAI校友会——2025年2月成立时团队约30人,三分之二来自OpenAI,其余主要来自Meta和Mistral。创始团队曾包括John Schulman、Barret Zoph、翁丽莲、Andrew Tulloch和Luke Metz,路透社报道穆拉蒂从老东家挖了至少20名研究员。

穆拉蒂2018年加入OpenAI,参与DALL-E、Codex、ChatGPT和Sora,2022年升任CTO,2023年11月董事会解雇奥特曼后短暂担任临时CEO,完整了解OpenAI的模型开发和产品化路径。这样一群最了解OpenAI的人离开后从头搭建技术体系,外界期待一条带有OpenAI印记的路线。结果最明显的技术来源指向了中国模型,这很容易被解读为一个戏剧性信号:最了解OpenAI的人,最终选择了中国模型的技术蓝图。

但这个结论需要仔细分析。OpenAI近期的前沿模型全部闭源,外界无法获取权重或了解完整架构和训练方案。即使穆拉蒂熟悉内部技术,也不能把OpenAI的商业机密带到新公司;而DeepSeek和Kimi公开了权重或技术报告,架构、训练方法和工具链可以合法研究复用。

Inkling本身也是开源权重模型,对于想构建开源生态的公司,采用DeepSeek和Kimi等开源模型的成熟方案是合理的工程选择。今天开发开源模型要完全避开中国团队公开的成果,试错成本会高得多。因此,借鉴中国模型不能证明穆拉蒂认为DeepSeek优于OpenAI,两者在开放程度和参考条件上完全不同,但这传递了一个明确信号:至少在开源权重领域,中国模型已成为美国AI团队的重要参考。

真正的问题是,Thinking Machines吸收了现有架构和训练经验后,为什么做出一个性能更弱、价格更高的Inkling?穆拉蒂有顶级团队、充足资金和最新NVIDIA训练系统,她没有理由忽视这些差距,所以高成本替代可能是一个经过计算的选择。

合规才是真卖点

考虑到Thinking Machines受到的待遇,Inkling不应该只是一款还不错的模型。2025年7月,公司在未发布任何产品前完成20亿美元种子轮融资,估值120亿美元,投资者包括a16z、NVIDIA、AMD和红杉。四个月后下一轮谈判目标估值高达500亿美元,虽未正式公布,但公司已被视为OpenAI和Anthropic的潜在竞争对手。当它推出一款性能不如中国模型、价格还更贵的产品时,难免低于预期。但从商业角度看,穆拉蒂可能从一开始就没打算在基准测试中获胜。

公司强调开源权重、多模态和可定制性,希望企业用Tinker微调Inkling,变成客服、编程助手、行业智能体等专用模型。穆拉蒂押注的是一个不看重基准排名的市场。企业更关心模型能否私有化部署、能否控制数据、能否根据自身业务继续训练。这部分需求很大程度已被中国开源模型满足:OpenAI和Anthropic长期闭源,Meta的Llama4表现不及预期后逐渐减少开源,而DeepSeek、Kimi、Qwen和GLM持续发布权重,性能越来越接近美国闭源模型,价格却低得多。

美国企业迅速用脚投票——OpenRouter提供给CNBC的数据显示,2026年2月以来,美国企业通过该平台调用的中国模型token每周占比超过30%,最高达46%,而2025年上半年平均只有4.5%。Cursor在开发Composer2时测试多个基座模型,最终选择了评测最强的Kimi K2.5。桥水基金也通过Tinker微调阿里Qwen,效果超过某些顶级闭源模型。中国开源模型成了美国企业省钱的捷径,但这条路现在面临压力。

与此同时,美国对中国AI模型的监管氛围正在收紧。相关部门就数据安全、模型来源和供应链风险发出警告,一些使用中国模型的企业受到调查。即使没有统一限制,政策不确定性已足以影响企业选择,尤其涉及政府业务和敏感数据的公司。

这正是Inkling的市场空间:它是由美国公司开发的开源权重模型,采用Apache 2.0许可证,支持私有化部署和定制。美国企业选择它,不用担心使用中国模型引发的政治争议,更容易通过政府客户和大公司的合规审查。Inkling的真正价值来自这种合规确定性——穆拉蒂把DeepSeek和Kimi的公开成果转化为美国公司提供的模型。它不需要在基准测试中击败中国模型,只需要成为不敢继续使用中国模型的美国企业可接受的选择。这也解释了为什么它敢定更高价格:政策缩小了竞争范围,性能和价格差距不再致命。对一些美国企业来说,一个稍弱但更贵的模型已经够用了。

关键要点

  • 技术借鉴:Inkling架构主要参考DeepSeek-V3,后训练冷启动使用了Kimi K2.5等开源模型生成的合成数据。
  • 性能差距:在多项基准评测中,Inkling落后于Kimi和GLM等中国开源模型,综合推理、编程和智能体能力未进入第一梯队。
  • 价格劣势:Inkling的调用价格高于Kimi和GLM,Prefill价格接近Kimi K2.6的两倍,毫无价格优势。
  • 合规卖点:Inkling的真正价值在于由美国公司开发、开源权重、支持私有化部署,能满足美国企业因监管收紧而不敢使用中国模型的合规需求。
  • 商业逻辑:穆拉蒂可能从一开始就没打算在基准测试中获胜,而是瞄准了政策驱动的合规替代市场,性能稍弱但价格更高仍可接受。