跳转到主要内容

蚂蚁灵-3.0-Flash:小模型,大智慧

蚂蚁集团正式推出灵-3.0-Flash,这是一款新一代原生混合推理模型,颠覆了“越大越好”的传统观念。该模型于7月24日发布,总参数达1240亿,但关键在于:每次计算仅激活51亿参数。这就像拥有一个庞大的图书馆,但只取出你需要的书——节省了能源和时间。

尽管设计精简,灵-3.0-Flash在与参数规模大两到三倍的行业巨头较量中毫不逊色。在推理、指令遵循和长文本处理等基准测试中,它不仅跟上了节奏,还常常超越对手。结果就是:更高的“智能效率比”,使其既更智能又运行成本更低。

Image

为实际智能体应用而生

灵-3.0-Flash的独特之处在于其对实际智能体应用的关注。团队在超过10,000个真实交互场景上进行了训练,微调了其自我纠正和长期任务规划能力。无论是编写代码、分解复杂项目还是跨多个来源进行研究,该模型都比传统模型更可靠,后者在处理大型任务时容易偏离轨道。

秘诀:混合注意力机制

那么,他们是如何将如此多的智能塞进一个小巧的封装中的呢?他们摒弃了“只需增加参数”的方法。相反,灵-3.0-Flash从一开始就采用了混合注意力架构。它以5:1的比例交替使用KDA线性注意力层和MLA层,在长上下文效率和原始能力之间找到了最佳平衡点。

他们还升级了之前的闪电注意力,采用了名为KDA(Kimi Delta注意力)的新机制。这种新机制在Delta规则状态更新中引入了细粒度对角门控,帮助模型在处理长文档或代码库时记住关键细节。此外,他们将每个令牌的专家激活比例从1/32压缩到1/64,从而在每次计算中获得更高的效益。

Image

实际应用的速度与稳定性

为了让AI智能体运行更快、更可靠,蚂蚁集团构建了一套支撑工程架构。集群级别的分层缓存系统减少了长对话中的重复计算,将长输入的首字符响应延迟降低了60%到80%。升级后的多智能体协作设置让不同智能体协同工作并相互校验,降低了高频在线服务中出错的风险。

灵-3.0-Flash现已在OpenRouter上免费提供一周。之后,它将完全开源——这一举措可能颠覆AI格局,证明有时少即是多。

关键点

  • 模型:灵-3.0-Flash,总参数1240亿,每次计算激活51亿参数。
  • 性能:在推理、指令遵循和长文本任务中,与规模大2-3倍的模型持平或超越。
  • 架构:混合注意力,包含KDA和MLA层(5:1比例),以及带对角门控的KDA注意力。
  • 效率:每个令牌的专家激活比例降至1/64。
  • 可用性:在OpenRouter上免费提供一周,随后开源。
  • 实际应用重点:在10,000多个智能体场景上训练,采用缓存和多智能体协作以实现速度和稳定性。