跳转到主要内容

B站AI竞技场首轮榜单:GPT-6登顶,国产模型紧咬不放

B站AI无限竞技场:一场没有标准答案的模型大乱斗

你见过上百个AI模型同台PK吗?B站最近就干了这么一件事——推出 “AI无限竞技场” 评测榜单,首轮排名已经揭晓。

和那些正襟危坐的跑分榜不同,这个竞技场更像一个热闹的广场。10位来自不同领域的UP主,把各自对上百款大模型的真实测试搬了上来。没有固定的评测维度,也没有标准答案——写代码的、搞推理的、玩协作的、拼知识的,各路人马根据自己的工作流、专业场景甚至脑洞来出题,让模型在同样的挑战里露出真本事。

Image

谁站在了山顶?

首轮真机实测的结果有点意思。GPT-6Astra 一路爬到了最高处,拿下榜首,还顺带赢了个“最会登顶”的称号。紧随其后的是 GLM-5.3,咬得很紧。

更值得一说的是,前五名里有三款是国产大模型。面对海外巨头,它们没在怕的,差距正在肉眼可见地缩小。

这场竞技场里,DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、混元、MiniMax……你能叫得上名字的主流模型,基本都下场了。榜单实时更新,而且全平台持续开放报名——今天你排前面,明天可能就被挤下去。

为什么这个榜单不太一样?

传统的Benchmark像标准化考试,题目固定,分数说话。但AI无限竞技场更像一场实战演练:UP主们从真实需求出发,有人让模型现场改bug,有人让它模拟客服吵架,还有人拿它当编剧写反转短剧。

这样一来,模型之间的差异就不再是小数点后的数字,而是“谁更懂人话”“谁更会来事儿”的直观感受。对普通用户来说,这比看跑分表有意思多了——毕竟,你关心的不是它在实验室里多强,而是它能不能帮你把活儿干漂亮。

重点速览

  • GPT-6Astra 登顶首轮榜单,获“最会登顶”称号;GLM-5.3 紧随其后。
  • 前五名中三款为国产大模型,与海外巨头竞争激烈。
  • 评测由10位B站UP主真机实测,覆盖上百款模型,无固定维度。
  • 主流模型DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、混元、MiniMax 等悉数参战。
  • 榜单实时更新,全平台持续开放报名。