Skip to main content

B站AI竞技场开打:GPT-6 Astra暂居榜首,国产模型冲进前五

B站搭了个“AI无限竞技场”,让模型真刀真枪干一场

9月20日,B站正式发布“AI无限竞技场”大模型评测榜单,首轮排名同步公开。在10位UP主的实测中,GPT-6 Astra拿下第一,击败GLM-5.3,成为“夺冠次数最多”的模型。更让人眼前一亮的是,前五名里有三个是国产大模型。

据B站介绍,这个竞技场不是传统跑分,而是收集UP主们对AI大模型的真实评测。来自不同领域的UP主,用上百个大模型在真实场景里做任务,题目覆盖代码、推理、协作、知识等方向。

Image

不设题目限制,让真实工作流说话

和传统基准测试不同,B站“AI无限竞技场”不限制主题,也不限制评测维度。各分区UP主拿真实工作流、专业应用,甚至脑洞大开的想法来出题,同一个题目下,各个模型的实际表现差异一目了然。

榜单里既有DeepSeek、Kimi、ChatGPT、Claude、Gemini这些熟面孔,也有豆包、通义千问、混元、MiniMax等国产选手。排名实时更新,并且继续向全平台UP主开放报名。

公开信息显示,过去一年B站AI知识内容的消费时长增长了72%,每月有超过1.9亿用户在看AI内容。大量覆盖不同领域、维度和主题的评测内容冒出来,从发布到讨论、评测、使用、求助、共建,一个内容生态已经成形。

这场“竞技”到底特别在哪?

你可能会想:评测榜单那么多,B站这个有什么不一样?

关键在于,它把出题权交给了真正用模型干活的人。UP主们不按套路出牌,有人让模型改代码,有人让它做推理题,还有人拿它协作写方案。同一道题,谁行谁不行,观众看得明明白白。这种“实战式”评测,比实验室里的标准答案更接近普通人的使用体验。

另一个看点是实时更新。模型迭代快,榜单也跟着动,今天的第一名,明天可能就被反超。这种动态竞争,让排名更有看头,也更能反映模型当下的真实水平。

重点速览

  • B站上线“AI无限竞技场”,首轮榜单GPT-6 Astra登顶,GLM-5.3紧随其后。
  • 前五名中三个是国产大模型,国产力量表现抢眼。
  • 评测不设主题和维度限制,UP主用真实工作流出题,覆盖代码、推理、协作、知识等方向。
  • 榜单实时更新,继续向全平台UP主开放报名。
  • B站AI内容消费时长年增72%,月活观看用户超1.9亿,评测生态正在形成。