Skip to main content

国产黑马27B模型硬刚DeepSeek,边缘AI新纪元开启

最近,一份来自中国信通院人工智能研究所的测试报告,在AI圈里掀起了不小的波澜。报告显示,一家名为上海原点星光科技的公司,其研发的本地大模型StartLux-V1.0-27B-Preview,在可信AI大模型基准测试(MCP专项)中表现抢眼——仅凭27B的参数规模,综合性能就冲到了第二名,直接把拥有284B参数的DeepSeek-V4-Flash甩在了身后,甚至在某些单项任务上,和1.6T参数的DeepSeek-V4-Pro打了个平手。

这不禁让人好奇:一个27B的“小模型”,凭什么能跟那些庞然大物叫板?

小参数,大能量:MCP测试中的黑马

这次MCP专项测试,可不是简单的“问答比赛”。它涵盖了位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计等六大专项任务,外加一个综合评估,重点考察的是大模型在真实世界中的“动手能力”——比如多工具协作、复杂任务执行这些硬核指标。

测试结果一出,StartLux-V1.0-27B-Preview以综合得分39.25的成绩,不仅超过了DeepSeek-V4-Flash-0731(284B参数)和Step-3.7-Flash(198B参数),还在同参数规模的较量中,比Qwen-3.6-27B高出了5.34个百分点。更让人意外的是,在位置导航任务上它拿了第一,在浏览器自动化和金融分析上,跟1.6T参数的DeepSeek-V4-Pro并列甚至领先。

Image

技术突围:用“AI训练AI”的新玩法

这么亮眼的成绩,背后靠的是什么?答案不是堆参数,而是技术创新。StartLux团队在Qwen3.6-27B的基础上,做了后训练定向增强,还独立设计了一套多维度、可验证、可扩展的模型优化升级技术。最特别的是,他们用了“AI训练AI”(Auto Research)的方法——让AI自己去做训练实验,然后根据反馈不断调整策略。据说,这是国内首个用这种方法做后训练的本地Agent模型。

Image

行业风向:从“拼参数”到“拼实用”

这件事背后,其实折射出AI行业的一个深层转变。过去两年,大家拼的是参数规模,千亿、万亿参数的大模型一个接一个。但现在,当基础模型的能力已经跨过实用门槛,这种“军备竞赛”似乎进入了同质化阶段。企业和用户更关心的,是模型到底能不能解决实际问题、数据安不安全、成本划不划算。这些需求,正在加速本地大模型的崛起。

你看,谷歌、Meta、英伟达这些全球科技巨头,也都在加紧布局30B级别的本地模型。业内普遍预测,未来几年,本地大模型会占据不小的市场份额。

未来可期:消费级PC也能跑

目前,StartLux-V1.0-27B-Preview已经能在消费级个人电脑上运行了。据透露,公司计划在今年内推出首款本地智能解决方案,同时团队还在推进后续训练,并对扩散语言模型等新架构做深入研究。

关键要点

  • 性能超群:StartLux-V1.0-27B-Preview在MCP专项测试中综合排名第二,超越DeepSeek-V4-Flash,部分任务比肩DeepSeek-V4-Pro。
  • 技术创新:采用“AI训练AI”的后训练方法,实现小参数高性能。
  • 行业趋势:AI竞赛从参数规模转向实际应用,本地大模型成为新焦点。
  • 落地在即:模型已可在消费级PC运行,年内将推出本地智能解决方案。