7月24日,蚂蚁百灵正式发布了新一代原生混合推理模型 Ling-3.0-Flash。该模型总参数量为 124B,但单次计算仅需激活 5.1B。在大幅精简体积、降低算力开销的同时,Ling-3.0-Flash 在基础推理、指令遵循以及长文本处理等核心指标上,对标并超越了规模达其 2 至 3 倍的行业领先模型,展现出极高的“智效比”与商用落地性价比。据悉,该模型已在 OpenRouter 平台上线,限时免费一周,后续将正式向全球开源。
作为该版本的核心,Ling-3.0-Flash 针对 AI Agent 的实际落地场景进行了深度打磨。模型在训练中扩展了超过 10,000 个真实交互环境,并对复杂任务的自我纠错与长程规划机制进行了专项优化。无论是在代码编写、复杂任务拆解,还是多源信息深度调研等场景下,Ling-3.0-Flash 均展现出强劲的自主闭环交付能力,解决了传统大模型在执行长链路任务时极易发生“跑偏”或断档的痛点。
实现“小体量、高智能”的秘诀在于其底层计算架构的革新。Ling-3.0-Flash 摒弃了单纯堆砌参数的路线,在预训练阶段便采用了创新的混合注意力架构,以 5:1 的比例交替堆叠 #KDA 线性注意力层与 MLA 潜变量注意力层,在保持长文本效率的同时最大化了模型的能力上限。
此外,Ling-3.0-Flash 将上一代的 Lightning Attention 升级为了全新的 KDA (Kimi Delta Attention)。通过在 Delta Rule 状态更新中引入细粒度对角门控,使模型在处理超长文档与旁大代码库时,能更精准地检索和记忆关键信息。同时,模型进一步压缩了单次计算的专家激活比例,将每个 Token 的 MoE 专家激活率由上一代的 1/32 进一步压缩至极低的 1/64,释放出更高的运行效率。
为了确保 AI Agent 能够运行得更快、更稳,百灵团队还为其配套了领先的工程与协作架构。在响应速度方面,通过引入集群级分级缓存技术,避免了长对话和多轮交互中的重复计算,将长输入下的首字响应延迟(TTFT)大幅降低了 60% 至 80% 以上。而在任务稳定性上,升级后的多智能体协同架构支持不同 Agent 分工协作与相互校验,有效抑制了单模型的误判风险,为高频线上服务与真实业务落地提供了强力支撑。
Ling-3.0-Flash 的发布标志着 AI Agent 底层大模型正从“大而全”向“高智效”演进。相比传统 Transformer 模型在高并发、长链路 Agent 任务中因 KV Cache 暴涨而导致的算力崩溃,Ling-3.0-Flash 巧妙地融合了 KDA 线性注意力 与 MLA 架构,并配合 1/64 极稀疏 #MoE 激活,在工程层面上为 Agent 的规模化落地扫清了成本障碍。更为重要的是,其 10,000+ 交互环境的专项训练与集群级缓存设计,直击 Agent 运行中“首字延迟高”与“长任务易中断”的两大痛点。这种“模型架构+系统工程”双轮驱动的范式,将加速推动 AI Agent 从简单的聊天助手,真正转变为具备自主闭环交付能力的行业级“数字员工”,对未来多智能体协同生态的演进具有极其重要的风向标意义。