产品简介
蚂蚁百灵 Ling-3.0-flash 是蚂蚁百灵发布的新一代原生混合推理模型,总参数量 124B,激活参数量仅 5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰 Ring-2.6-1T。模型采用原生混合线性注意力架构与 1/64 稀疏 MoE,长输入下 TTFT 降低 60% 至 80% 以上。
核心功能
- 原生混合推理:总参数 124B 激活仅 5.1B,对标上代旗舰 Ring-2.6-1T
- 稀疏 MoE 架构:1/64 稀疏 MoE 加原生混合线性注意力
- 长文本低延迟:长输入下 TTFT 降低 60% 至 80% 以上
- 多环境训练:扩展至 10000+ 可交互训练环境
适合谁用
以下类型的用户会特别受益于 蚂蚁百灵 Ling-3.0-flash:
- 需要高效推理的企业应用
- 长文本处理场景
- 对延迟敏感的实时应用
优点亮点
- 激活参数极低,推理效率高
- 长文本延迟显著降低
- 性能对标上代旗舰
价格与方案
API 定价以蚂蚁百灵官网为准。
总结与建议
Ling-3.0-flash 用 5.1B 激活参数对标上代 1T 旗舰,是稀疏 MoE 与混合推理的代表作,适合对推理效率和长文本延迟有要求的企业场景。
版本演进
- Ling-3.0-flash 发布 (2026-07-24):124B 参数激活 5.1B,原生混合线性注意力加 1/64 稀疏 MoE,长输入 TTFT 降低 60-80%