蚂蚁百灵(inclusionAI)于 2026-08-11 开源 Ling-3.0-tiny:轻量混合推理 MoE,总参 7.9B、每 token 仅激活 1.3B,MIT 许可证。采用 KDA+MLA 3:1 混合线性注意力 + 128 路由专家稀疏 MoE,原生支持"思考/快速"双模式(enable_thinking 按请求切换),提供 BF16/FP8/INT4 三套权重。官方在 M4 Pro MacBook(FP8、8K 上下文)测到 86–90 tok/s、峰值内存 8.34 GiB;社区在 3090 上用 MXFP4 量化跑出 225.7 tok/s。
一、模型速览
|
项目 |
规格 |
|
发布方 |
蚂蚁百灵 inclusionAI(Ant Group) |
|
发布时间 |
2026-08-11 |
|
参数量 |
7.9B 总参 / 每 token 激活 1.3B |
|
上下文长度 |
256K(YaRN 扩展;官方亦标注 131K 原生) |
|
许可证 |
MIT(可商用、可改、可 redistribution) |
|
模态 |
文本(text in / text out) |
|
定位 |
端侧/消费级 GPU 的轻量"思考型"小模型、路由与常驻小助手 |
|
架构 |
BailingMoEV3:3:1 KDA–MLA 混合线性注意力(每 4 层块 3 KDA + 1 MLA);128 路由专家 + 1 共享,每 token 激活 8 路由 + 1 共享;24 层 |
|
权重版本 |
BF16 / FP8 / INT4 |
|
推理模式 |
原生混合推理:enable_thinking 按请求开/关 |
|
验证设备 |
NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini |
一句话定位:Ling-3.0-tiny 用"7.9B 装知识、1.3B 算 token"的稀疏 MoE,把接近 8B 的能力压成 1.3B 的计算账单,让你在笔记本甚至 8GB 显卡上跑一个"会先想再答"的本地小助手。
二、核心亮点
三、部署实战
3.1 环境准备与模型下载
官方权重(需大显存,一般不本地直跑):inclusionAI/Ling-3.0-tiny。本地推荐社区 GGUF:
```bash
pip install -U "huggingface_hub[cli]"
# bartowski 社区量化(Q4_K_M 为多数默认)
hf download bartowski/Ling-3.0-tiny-GGUF –include "*.gguf" –local-dir ./ling-tiny
```
⚠️ 关键:BailingMoE3 架构在 2026-08-17 才合入 llama.cpp 主线(PR #26608,首个含该支持的发布为 b10470)。必须用 llama.cpp ≥ b10470,否则报 unknown model architecture: bailingmoe3。
3.2 启动本地推理服务
llama.cpp(社区 GGUF,最稳的本地路径):
./llama-server \\
-m ./ling-tiny/Ling-3.0-tiny-Q4_K_M.gguf \\
-ngl 99 -c 32768 –flash-attn on –jinja \\
–host 0.0.0.0 –port 8080
vLLM(用蚂蚁自建 fork,多卡/高吞吐):
VLLM_USE_PRECOMPILED=1 pip install git+https://github.com/inclusionAI/vllm-ling-v3@ling_3_0
vllm serve inclusionAI/Ling-3.0-tiny \\
–enable-prefix-caching –enable-auto-tool-choice \\
–chat-template-tokenizer inclusionAI/Ling-3.0-tiny
Ollama(注意:官方尚未合入,仅社区 PR ollama/ollama#17643,限 Apple Silicon MLX、需自编译;M4 Pro 48GB 验证):
# 自编译该 PR 后
echo 'FROM ./Ling-3.0-tiny-Q4_K_M.gguf' > Modelfile
ollama create ling-tiny -f Modelfile && ollama run ling-tiny
3.3 推理代码(复制即跑)
对接本地 OpenAI 兼容端点,演示"思考模式"开关:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8080/v1", api_key="sk-noauth")
# 思考模式(默认开):复杂推理
r1 = client.chat.completions.create(
model="ling-tiny",
messages=[{"role": "user",
"content": "用三种方法证明 √2 是无理数,并比较优劣。"}],
max_tokens=1024,
temperature=1.0, top_p=0.95, extra_body={"top_k": 20},
)
print("【思考模式】\\n", r1.choices[0].message.content)
# 快速模式:关掉 thinking,简单问答更省时(质量会下降)
r2 = client.chat.completions.create(
model="ling-tiny",
messages=[{"role": "user", "content": "把'今日天气晴'翻译成英文。"}],
max_tokens=128,
temperature=0.7, top_p=0.8,
extra_body={"top_k": 20, "enable_thinking": False},
)
print("【快速模式】\\n", r2.choices[0].message.content)
注:enable_thinking 为 Ling 系 chat-template 扩展字段,需 serving 框架支持(vLLM 蚂蚁 fork / SGLang 镜像已支持;Ollama 社区 PR 视构建而定)。
3.4 效果验证
curl http://localhost:8080/v1/chat/completions \\
-H "Content-Type: application/json" \\
-d '{"model":"ling-tiny","messages":[{"role":"user","content":"你好,介绍一下你自己"}],"max_tokens":128}'
成功判定:返回 OpenAI 格式 JSON 且 choices[0].message.content 非空。若报 bailingmoe3 未知架构,说明 llama.cpp 太旧,升级到 b10470+。
⚠️ 避坑提醒
- 架构太新:llama.cpp 必须 ≥ b10470(PR #26608),老版本/LM Studio 旧内核直接报错。
- Ollama 官方没合入:别等 ollama run inclusionAI/… 官方版,当前只能走社区 PR 自编译(且限 Apple Silicon)。
- 7.9B 总参 ≠ 小文件:原权 15.8GB,8GB 卡必须靠 IQ4_NL/Q4_K_S 级 GGUF(~4–5GB)。
- 思考默认开:简单任务会很啰嗦且慢,记得关 enable_thinking;关了质量会掉,生产前先测。
- 长上下文有退化:社区在 Orin Nano 上 96K 后注意力明显退化,别默认 128K 都稳定,按需上探。
- 社区 GGUF 是第三方:bartowski/NANI-Nithin 转换,非官方,量化质量以实测为准。
四、性能测评
4.1 推理速度与显存表

4.2 生成质量分维度
- 通用智能:AA Intelligence Index 25(第三方),编辑称接近 4B 激活模型水平;中文源称仅比 Gemma-4-26B-A4B 低 1 分。
- Agentic:AA Agentic Index 16,编辑评测"agent 分超过部分 30B+ 模型"(AIHOT 编辑观点,非统一结论)。
- 编码/终端:跑 Terminal-Bench 2.1(AA 协议,Terminus 2 harness),具体分项见官方模型卡图(官方未给纯文本数值)。
- 吞吐代价:AA 评测期间生成约 2.1 亿 token(同类中位 ~4200 万),即"跑得快也特别能想",思考模式输出量大。
4.3 同档模型对比表

数据来源:Artificial Analysis、官方模型卡;Ling 为 1.3B 激活口径,其余为厂商/第三方发布值,未做本机复测。
结论:Ling-3.0-tiny 的卖点不是"绝对最强",而是"在 1.3B 激活量上把单位算力智能拉满 + 端侧能跑"。显存紧、要常驻小助手/路由/简单工具调用,它是高性价比选择;复杂编码、精确计算、长程 Agent 仍建议上 27B+ 模型。
五、使用建议
适用场景
- 端侧/笔记本常驻小助手:文本整理、分类、翻译、短问答。
- 低显存(8–12GB)设备的本地推理与离线可用。
- 路由/调度节点:用极低成本判断该把任务派给哪个大模型。
- 简单工具调用与轻量 Agent 原型。
不适用场景
- 复杂编码/Coding Agent、精确数值计算 → 上 Qwen3.8-27B 级或更大。
- 严格格式遵循的生产任务 → 先拿自己任务测一轮(社区反馈指令遵循不够稳)。
- 超长稳定 128K+ 上下文 → 社区量化在深处有退化,谨慎。
调优提示
数据来源说明:本文性能数据来自蚂蚁百灵官方模型卡 / Hugging Face(inclusionAI/Ling-3.0-tiny)、Artificial Analysis 独立榜单、freeai.help 解析,以及 Reddit LocalLLaMA 社区实测(3090 / Orin Nano),均已在正文标注来源;官方速度/显存为厂商自报,社区数字非统一性能承诺,以独立第三方复测为准。部署命令引用官方仓库、bartowski 社区 GGUF 与蚂蚁 vLLM fork。
Ling-3.0-tiny 蚂蚁百灵 MIT 许可 端侧模型 混合推理 MoE 本地部署
