蚂蚁灵·Ling-3.0-Flash:小模型,大智慧
蚂蚁灵正式发布了Ling-3.0-Flash,一款超越其规模的下一代原生混合推理模型。该模型于7月24日发布,总参数达1240亿,但每次计算仅激活51亿参数——这一设计选择大幅降低了计算成本,同时不牺牲性能。
在涵盖基础推理、指令遵循和长文本处理的基准测试中,Ling-3.0-Flash与参数规模为其两到三倍的行业领导者不相上下,甚至有时超越它们。这就是团队所称的更高“智能效率比”。对企业而言,这意味着更高的性价比。

但有趣之处在于:Ling-3.0-Flash是为真实世界的智能体而构建的。团队在超过10,000个真实交互场景上对其进行了训练,优化了其自我纠错和长期任务规划能力。无论是编写代码、分解复杂项目,还是通过多个来源进行深入研究,该模型都能端到端地完成任务,而不会偏离轨道——这是传统模型常见的痛点。
那么,蚂蚁灵是如何实现“小尺寸,高智能”的呢?他们摒弃了单纯增加参数的蛮力方法,而是从根本上重新思考了底层计算架构。Ling-3.0-Flash采用混合注意力设计,以5:1的比例交替使用KDA线性注意力层和MLA层。这种组合平衡了长上下文效率与原始能力。

另一项升级:之前的Lightning Attention已被KDA(Kimi Delta Attention)取代。这种新机制在Delta规则状态更新中引入了细粒度对角门控,帮助模型在处理长文档或代码库时记住关键细节。此外,他们将每个token的专家激活比例从1/32压缩到1/64,进一步提升了效率。
为了让AI智能体运行更快、更可靠,蚂蚁灵还构建了配套的工程架构。集群级别的分层缓存系统减少了长对话中的重复计算,将长输入的首字符响应延迟降低了60%到80%。升级后的多智能体协作设置让不同智能体协同工作并相互检查,降低了高频在线服务中的错误风险。
关键点:
- Ling-3.0-Flash:总参数1240亿,每任务激活51亿。
- 在推理、指令遵循和长文本方面与更大模型相当或更优。
- 在10,000多个真实智能体场景上训练,任务完成更佳。
- 混合注意力架构(KDA + MLA)提升效率。
- 在OpenRouter上免费使用一周,随后开源。