智东西
作者 李水青
编辑 心缘
智东西8月11日报道,今日,蚂蚁百灵大模型开源了一款轻量级混合推理MoE模型——Ling-3.0-tiny。
该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署而设计。其同步提供BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,兼顾性能、效率与可部署性。
在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分,仅比Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。
该模型的关键要点总结如下:
1、高效的混合线性架构:Ling-3.0-tiny采用月之暗面自研的KDA(Kimi增量注意力)与DeepSeek自研的MLA(多头潜在注意力)的3:1 交替堆叠结构,并配备由128个路由专家组成的稀疏MoE前馈网络,构建起高效的混合线性架构。
每个Token仅激活8个路由专家和1个共享专家,使该模型能够在长上下文建模能力、参数效率与计算成本之间实现平衡。
2、原生混合推理与智能体能力:Ling-3.0-tiny兼顾快速响应与多步推理能力,可通过enable_thinking参数在单次请求中灵活开启或关闭思考模式。该模型在通用智能体任务、代码生成、数理科学推理以及指令遵循场景下均具备均衡表现。
3、本地与边缘部署:在FP8精度下,Ling-3.0-tiny在DGX Spark上的推理吞吐量可达100–105tokens/s,而在M4 Pro MacBook上则为86–90tokens/s,且在8K上下文长度时,峰值内存占用仅为8.34GiB。
如下面视频所示,百灵在36GB内存MacBook Pro复刻Infinite Wiki(无限百科)核心体验。用户阅读时点击词语即可生成上下文解释卡片,支持多层知识下钻。
该Demo全程本地推理,无需云端调用,实测首Token响应低于100毫秒;所有数据留存设备端,不会产生云端API计费,接近一个原生速度的本地知识引擎。
Hugging Face地址:
https://huggingface.co/inclusionAI/Ling-3.0-tiny
https://huggingface.co/inclusionAI/Ling-3.0-tiny-fp8
https://huggingface.co/inclusionAI/Ling-3.0-tiny-int4
ModelScope地址:
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-fp8
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-int4
一、1.3B激活参数“以小博大”,评分紧咬26B大模型
在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分。该指数从真实任务、工具使用、代码、科学推理、知识可靠性和长上下文等九个方向,综合衡量模型的跨任务能力。
百灵公布的对比结果显示,Ling-3.0-tiny的综合得分仅比Gemma-4-26B-A4B低1分,接近激活参数约4B的更大MoE模型,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。
Ling-3.0-tiny拥有7.9B总参数,但每个Token仅激活1.3B参数。这意味着,它以较低的实际计算规模,进入了主流4B至12B级模型的综合能力区间。
单项分数无法覆盖模型的全部能力,Tiny模型也无法取代所有大型模型。但从相关评测看,Ling-3.0-tiny已经具备进入代码辅助、知识工作流、工具调用和本地Agent应用的能力基础,其定位也超出了单纯追求“设备装得下”的小尺寸模型。
二、Agent评分超31B大模型,输出速度超160 tokens/s
Ling-3.0-tiny较突出的方向是真实任务与Agent执行。
其Artificial Analysis Agentic Index得分为16,高于Gemma-4-31B;其中,GDPval-AA v2取得772 Elo,τ³-Banking得分为20.80,体现了模型在任务理解、工具调用和流程推进方面的能力。
在百灵此次列出的对比模型中,Ling-3.0-tiny在IMO-AnswerBench和非幻觉率指标上取得领先成绩,在数学、科学推理、代码Agent、指令遵循和长上下文等任务上的表现也较为均衡。
在综合智能指数达到25分的同时,Ling-3.0-tiny输出速度超过160 tokens/s,输出500个Token的端到端用时约18秒,这一时间已经包含模型思考过程。
较小的激活规模由此转化为更短的任务等待时间,也有助于提升Agent连续执行任务时的响应效率。
三、站在DeepSeek、Kimi肩膀上创新架构,降低本地部署门槛
Ling-3.0-tiny延续Ling-3.0系列的原生混合线性注意力技术路线,并针对轻量化和低门槛部署进一步优化。其总参数量被控制在7.9B,每个Token的激活参数量为1.3B。
模型采用3:1 KDA-MLA架构,即每4层包含3层KDA和1层MLA,以提高长上下文处理效率。
在MoE部分,Ling-3.0-tiny设置了128个稀疏专家。每个Token会激活8个路由专家和1个共享专家,以较小的激活参数量承载更完整的模型能力。
该模型还采用原生混合推理机制,让常规任务的快速响应和复杂任务的多步思考由同一模型完成。Multi-Token Prediction训练目标则为更高效的Token预测及后续推理加速提供基础。
这些架构设计主要指向三项实际价值:减少推理所需的计算资源,降低本地部署和二次开发门槛,并让轻量模型具备接入真实Agent工作流的能力。
四、从DGX Spark到MacBook,三个精度版本覆盖不同设备
Ling-3.0-tiny此次同步开源BF16、FP8和INT4三个版本,开发者可以按照硬件条件、性能要求和成本选择部署方案。
其中,BF16版本适用于重视完整精度的研究评测和生产应用;FP8版本在模型效果、运行速度和资源占用之间寻求平衡;INT4版本进一步压低资源需求,面向算力和内存相对有限的本地环境。
三个版本的推出,使模型能够覆盖从专业级本地AI工作站到个人电脑的不同设备。开发者可以将其接入本地知识库、代码助手、UI自动化、企业任务智能体等工作流,并将模型和业务数据保留在本地环境中。
1、DGX Spark:单机可支撑小规模本地服务
Ling-3.0-tiny可在单台NVIDIA DGX Spark上运行FP8推理,模型权重文件约为7.85GB。
在2K输入测试中,单请求稳态解码速度约为100至105 tokens/s;两路请求并发时,聚合解码吞吐约为161 tokens/s。
按照上述测试结果,开发者和中小团队无需搭建大规模算力集群,仅使用一台DGX Spark便可搭建独立运行的本地模型服务,为小规模用户提供推理能力。潜在应用包括企业内部知识助手、研发团队代码助手和面向特定业务流程的任务智能体。
百灵还在DGX Spark上部署Ling-3.0-tiny,并用其驱动移动设备,演示模型理解任务、调用工具、执行自动化操作并完成验证的过程。该Demo面向开发测试中的批量试跑和回归验证场景,验证了本地模型在运行成本、数据可控性和执行可靠性方面的应用潜力。
2、MacBook:首Token响应低于100毫秒
目前,Ling-3.0-tiny已完成面向MacBook(Apple Silicon)的本地运行适配,BF16和FP8版本均可运行。
在MacBook上,该模型可以用于代码辅助、文档处理、本地知识问答和工作流自动化。由于模型与数据均留在本地,用户可以减少对云端模型服务的依赖,并在处理隐私敏感信息时拥有更可控的数据边界。
其中,FP8版本进一步降低了本地运行所需资源,并将持续生成速度提高约30%,以改善多轮交互和Agent运行体验。
正如前文提到,为验证本地高频交互能力,百灵在一台配备36GB内存的MacBook Pro上复刻了Infinite Wiki(无限百科)的核心体验。测试表明,Ling-3.0-tiny已经能够在Mac上承担高频本地交互任务,并以接近原生应用的响应速度充当本地知识引擎。
3、Mac mini:变身常驻式本地智能节点
Ling-3.0-tiny面向Apple Silicon的部署方案也可以延伸至Mac mini。
相比更侧重移动办公的MacBook,Mac mini更适合作为低功耗、常驻式的本地智能节点,为个人或小型团队持续提供知识库检索、文档分析、自动化任务和本地模型API服务。
在百灵展示的Demo中,Ling-3.0-tiny被部署在Mac mini上,用于划词翻译、语法纠错和文本改写。相关任务无需将数据上传云端,可以离线运行并提供低延迟响应,适用于个人及企业的本地阅读与写作场景。
至此,Ling-3.0-tiny已经完成从DGX Spark、MacBook到Mac mini的适配验证。不同精度版本与设备形态共同扩大了这款模型的部署范围,也让中小团队能够根据算力、数据边界和业务需求选择更合适的本地运行方式。
结语:下一步将补强事实准确性和长程Agent稳定性
百灵称,接下来其将继续增强Ling-3.0-tiny的长尾知识覆盖和事实准确性,提高复杂工具调用及长程Agent任务的稳定性,并优化代码、科学推理和长上下文能力。
团队还计划改善模型推理能力、响应时间和任务成本之间的平衡,完善FP8和INT4版本的硬件适配、推理框架支持与部署文档,并与硬件厂商、高校及开发者社区共同建设轻量模型生态。