蚂蚁百灵大模型开源7.9B参数混合推理MoE模型Ling-3.0-tiny,性能接近Gemma-4-26B,输出速度超160 tokens/s
本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。
蚂蚁百灵开源了一款轻量级混合推理MoE模型Ling-3.0-tiny。该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署设计,同步提供BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证。在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分,比Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。
Ling-3.0-tiny采用月之暗面自研的KDA(Kimi增量注意力)与DeepSeek自研的MLA(多头潜在注意力)以3:1比例交替堆叠,并配备由128个路由专家组成的稀疏MoE前馈网络。每个Token仅激活8个路由专家和1个共享专家,使其在长上下文建模能力、参数效率与计算成本之间取得平衡。模型支持原生混合推理,可通过enable_thinking参数在单次请求中灵活开启或关闭思考模式,适用于通用智能体任务、代码生成、数理科学推理和指令遵循等场景。
在部署方面,FP8精度下,Ling-3.0-tiny在DGX Spark上的推理吞吐量可达100至105 tokens/s,在M4 Pro MacBook上为86至90 tokens/s,8K上下文长度时峰值内存占用为8.34GiB。百灵在36GB内存MacBook Pro上复刻了Infinite Wiki核心体验,用户阅读时点击词语即可生成上下文解释卡片,支持多层知识下钻。该演示全程本地推理,首Token响应低于100毫秒,所有数据留存设备端,不产生云端API计费。
在Mac mini上,Ling-3.0-tiny被部署用于划词翻译、语法纠错和文本改写,相关任务可离线运行并提供低延迟响应。百灵计划继续增强该模型的长尾知识覆盖和事实准确性,提高复杂工具调用及长程Agent任务的稳定性,并优化代码、科学推理和长上下文能力。团队还计划完善FP8和INT4版本的硬件适配、推理框架支持与部署文档,并与硬件厂商、高校及开发者社区共同建设轻量模型生态。