蚂蚁开源团队正式发布并开源了百灵系列的首个原生多模态大模型 Ling-3.0-flash-VL。该模型基于 Ling-3.0-flash 的 MoE 架构拓展而来,总参数量达到 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,且上下文窗口达到了 256K Token。

在研发过程中,团队重点探索了如何让大模型更可靠、更高效地完成真实任务。针对业界普遍担心“给大模型加上视觉能力会拉低文本智能”的顾虑,其实际训练实践给出了相反的结论:原生多模态联合训练不仅拓展了应用边界,反而进一步拉升了文本智能。

为了实现更精准的执行效果,Ling-3.0-flash-VL 引入了创新的视觉反馈机制。通过“观察执行结果、对比目标、发现偏差、持续修正”的完整闭环,模型将传统的一次性“生成”转变为具备自我纠错能力的动态过程,从而大幅提升了最终结果的可靠性。

此外,该模型继承了 Ling-3.0-flash 在 Agent 工作流中作为高效执行节点的核心优势。在视觉反馈的闭环运行中,它能够完美兼顾输出质量与执行效率,以更低的成本和更短的时间推进并完成完整复杂的任务。