产品简介
蚂蚁百灵发布的新一代原生混合推理模型Ling-3.0-flash,总参数124B、激活参数5.1B,以极致智能密度对标并超越1T级旗舰思考模型。该模型通过底层架构升级与Agent定向优化,实现了参数向实际能力的高效转化,在极低体量下展现出越级挑战的可能。
核心功能
- 混合线性架构,原生进化:从预训练伊始即采用原生混合线性注意力架构(5:1交替堆叠KDA与MLA),并升级全新KDA细粒度对角门控与1/64稀疏MoE。在124B总参数、5.1B激活参数规模下,实现了长上下文效率、状态记忆与计算成本的协同跃升。
- 极致智能密度,越级挑战:追求快、省、可落地的智能密度与智效比极限,在直面更大尺寸竞对SOTA及上一代旗舰时实现性能越级。仅需5.1B激活参数即可提供卓越的传统推理、指令遵循与长文本能力,全面赋能复杂Agent场景的高效落地。
- Agent全面进化,长程闭环:围绕真实生产力场景深度打磨,扩展10,000+可交互训练环境,实现Coding、General与Deep Research Agent任务的全程闭环。同时创新接入SGLang HiCache + Mooncake分级缓存架构,使长程交互无需重算,长输入下TTFT降低60%至80%+。
适合谁用
以下类型的用户会特别受益于 Ling-3.0-flash:
- 复杂规划与多轮工具调用
- 长程任务交付与Deep Research
- 代码生成与通用Agent场景
优点亮点
- 以12.4%总参数和8.1%激活参数对标1T级旗舰模型,性价比极高
- 原生混合线性注意力与稀疏MoE提升参数转化效率
- Agent优化覆盖10,000+训练环境,长程任务稳定闭环
- 分级缓存架构大幅降低长输入延迟
价格与方案
未公开具体定价,但强调高性能与高性价比兼得,适合企业级Agent部署
总结与建议
Ling-3.0-flash是蚂蚁百灵推出的原生混合推理模型,以124B总参数和5.1B激活参数实现智能密度突破,在推理、指令遵循和长文本能力上对标甚至超越1T级模型。其混合线性架构和Agent定向优化使其在复杂规划、工具调用和长程任务中表现卓越,同时通过分级缓存降低延迟,是兼顾性能与成本的生产力级模型。