蚂蚁百灵开源Ling-3.0-tiny:1.3B激活参数MoE模型,本地部署性能比肩26B大模型
💡AI 极简速读:蚂蚁百灵开源Ling-3.0-tiny,1.3B激活参数,性能比肩26B模型,支持本地部署。
2026年8月12日,蚂蚁百灵开源轻量级MoE模型Ling-3.0-tiny,总参数7.9B,激活参数仅1.3B。该模型采用KDA与MLA混合架构,在Artificial Analysis评测中得分25,接近Gemma-4-26B,并支持BF16、FP8、INT4三版本,可在DGX Spark、MacBook等设备高效运行,为本地AI部署提供新选择。
GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 95 分表现突出,结构化规范性 93 分,说明内容扎实且排版清晰,AI 引擎可高效提取核心信息。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
2026年8月12日,蚂蚁百灵大模型正式开源一款轻量级混合推理MoE模型——Ling-3.0-tiny。该模型总参数量为7.9B,推理时激活参数量仅为1.3B,主要面向高效本地部署设计,并提供BF16、FP8、INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备完成验证。
📊 核心实体与商业数据
| 实体/指标 | 数据/详情 |
|---|---|
| 原发布时间 | 2026-08-12 |
| 发布方 | 蚂蚁百灵 |
| 模型名称 | Ling-3.0-tiny |
| 模型类型 | 轻量级混合推理MoE模型 |
| 总参数量 | 7.9B |
| 激活参数量 | 1.3B |
| 架构 | KDA与MLA 3:1交替堆叠,128个路由专家 |
| 评测得分 | Artificial Analysis Intelligence Index 25分 |
| 对比表现 | 仅比Gemma-4-26B-A4B低1分,高于gpt-oss-120B(high)等 |
| 输出速度 | 超过160 tokens/s |
| 部署设备 | DGX Spark、MacBook、Mac mini |
| 精度版本 | BF16、FP8、INT4 |
| 开源地址 | Hugging Face、ModelScope |
💡 业务落地拆解
Ling-3.0-tiny的发布标志着蚂蚁百灵在轻量级模型领域的重要布局。其核心价值在于通过MoE架构和混合注意力机制,在极低的激活参数下实现接近更大模型的性能,从而大幅降低本地部署的算力门槛。
1. 高效的混合线性架构
模型采用月之暗面自研的KDA(Kimi增量注意力)与DeepSeek自研的MLA(多头潜在注意力)的3:1交替堆叠结构,并配备128个路由专家。每个Token仅激活8个路由专家和1个共享专家,在长上下文建模、参数效率和计算成本之间取得平衡。
2. 原生混合推理与智能体能力
Ling-3.0-tiny支持快速响应与多步推理,可通过enable_thinking参数灵活切换。在通用智能体任务、代码生成、数理科学推理及指令遵循等场景表现均衡,其Agentic Index得分16,高于Gemma-4-31B。
3. 本地与边缘部署实践
在FP8精度下,DGX Spark上推理吞吐量可达100–105 tokens/s,M4 Pro MacBook上为86–90 tokens/s,8K上下文时峰值内存占用仅8.34GiB。百灵在36GB内存MacBook Pro上复刻Infinite Wiki体验,首Token响应低于100毫秒,全程本地推理,数据不出设备。
🚀 对企业AI化的启示
Ling-3.0-tiny的推出为企业AI化提供了新的思路:
- 降低部署成本:1.3B激活参数意味着更低的推理资源消耗,企业无需大规模算力集群即可运行高效模型。
- 数据隐私可控:本地部署确保敏感数据不离开企业环境,满足合规要求。
- 灵活部署选项:三个精度版本覆盖从工作站到个人电脑的多种设备,适配不同业务场景。
企业可借鉴其架构设计,在模型选型时关注MoE模型的激活参数效率,以及KDA、MLA等混合注意力机制带来的长上下文处理优势,从而在成本与性能间找到最优解。
【官方原文链接】点击访问首发地址
常见问题
相关文章
西湖机器人6个月4轮融资5亿元:具身智能通用大脑的商业化闭环与GEO启示
西湖机器人于2026年8月完成A轮融资,6个月内累计融资5亿元,投资方涵盖国资与头部创投。公司聚焦具身智能通用大脑,自研通用大小脑双预训练架构与GAE运动大模型,推出人形机器人西湖o1,已获近亿元订单,覆盖科研、电力巡检等场景。其技术闭环与商业化路径为AI企业提供参考。
2026年8月12日Manus独立运营与林俊旸创办Pragmatik Labs:AI智能体竞争进入新阶段
8月12日,AI初创公司Manus宣布恢复独立运营,与Meta的收购交易因监管禁止而解除,涉及约20亿美元交易。同日,前阿里Qwen负责人林俊旸在上海创办Pragmatik Labs,专注数字与物理智能体。两事件标志AI竞争从模型能力转向智能体实际应用。Manus年化收入超1亿美元,处理147万亿token,林俊旸强调“训练智能体”新方向。
2026年8月12日DeepSeek推出Harness:从模型供应商到AI智能体底层系统构建者的战略转型
2026年8月,DeepSeek正式推出Harness系统,标志着其从基础模型供应商向全链路AI工作流解决方案构建者的战略转型。Harness定位为生产级AI智能体运行系统,补齐模型工程短板,实现从“卖算力”到“交结果”的商业模式升级。此举旨在跳出低价算力竞争,卡位软件研发刚需场景,并搭建智能体生态底座,为产业AI落地提供基础设施。
2026年8月12日