欢迎光临
我们一直在努力

Ling-3.0-tiny 部署实测:8GB 显卡跑“会思考“的端侧模型,7.9B 总参每 token 只激活 1.3B

蚂蚁百灵(inclusionAI)于 2026-08-11 开源 Ling-3.0-tiny:轻量混合推理 MoE,总参 7.9B、每 token 仅激活 1.3B,MIT 许可证。采用 KDA+MLA 3:1 混合线性注意力 + 128 路由专家稀疏 MoE,原生支持"思考/快速"双模式(enable_thinking 按请求切换),提供 BF16/FP8/INT4 三套权重。官方在 M4 Pro MacBook(FP8、8K 上下文)测到 86–90 tok/s、峰值内存 8.34 GiB;社区在 3090 上用 MXFP4 量化跑出 225.7 tok/s。

一、模型速览

项目

规格

发布方

蚂蚁百灵 inclusionAI(Ant Group)

发布时间

2026-08-11

参数量

7.9B 总参 / 每 token 激活 1.3B

上下文长度

256K(YaRN 扩展;官方亦标注 131K 原生)

许可证

MIT(可商用、可改、可 redistribution)

模态

文本(text in / text out)

定位

端侧/消费级 GPU 的轻量"思考型"小模型、路由与常驻小助手

架构

BailingMoEV3:3:1 KDA–MLA 混合线性注意力(每 4 层块 3 KDA + 1 MLA);128 路由专家 + 1 共享,每 token 激活 8 路由 + 1 共享;24 层

权重版本

BF16 / FP8 / INT4

推理模式

原生混合推理:enable_thinking 按请求开/关

验证设备

NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini

一句话定位:Ling-3.0-tiny 用"7.9B 装知识、1.3B 算 token"的稀疏 MoE,把接近 8B 的能力压成 1.3B 的计算账单,让你在笔记本甚至 8GB 显卡上跑一个"会先想再答"的本地小助手。

二、核心亮点

  • 1.3B 激活 ≠ 1.3B 文件,计算省但知识满。7.9B 总参仍要全装进显存(官方权重 ~15.8GB),但每 token 只唤醒 8 路由 + 1 共享专家(共 1.3B),实际算力接近 1–2B 模型。来源:官方模型卡。所以"8GB 能跑"靠的是社区 GGUF 量化(~4–5GB),不是把 15.8GB 原样塞进去。
  • KDA+MLA 3:1 混合线性注意力,长上下文便宜。每 4 层块 3 个 KDA(Kimi Delta Attention,线性近似)+ 1 个 MLA(DeepSeek 系,强压 KV cache),用廉价 KDA 扛长上下文吞吐、薄 MLA 保关键表示。官方标 256K(YaRN)。来源:官方模型卡 / freeai.help 解析。
  • 原生混合推理,一个模型两种脑子。通过 enable_thinking 按请求在"快速回答"与"多步推理"间切换;思考默认开。AA 智能指数 25、Agentic 指数 16(Artificial Analysis 第三方),编辑评测称"用 1.3B 激活量接近 4B 激活模型能力,agent 分甚至超过部分 30B+ 模型"。
  • 端侧速度真能读。官方:FP8 下 M4 Pro MacBook 86–90 tok/s(8K 上下文峰值 8.34 GiB)、DGX Spark 100–105 tok/s。社区 3090 用 ~4.54GiB MXFP4 MoE 跑出 225.7 tok/s(短上下文)、32K 时 208.8 tok/s。来源:官方(厂商数据)/ Reddit LocalLLaMA(社区实测)。
  • 三、部署实战

    3.1 环境准备与模型下载

    官方权重(需大显存,一般不本地直跑):inclusionAI/Ling-3.0-tiny。本地推荐社区 GGUF:

    ```bash
    pip install -U "huggingface_hub[cli]"
    # bartowski 社区量化(Q4_K_M 为多数默认)
    hf download bartowski/Ling-3.0-tiny-GGUF –include "*.gguf" –local-dir ./ling-tiny
    ```

    ⚠️ 关键:BailingMoE3 架构在 2026-08-17 才合入 llama.cpp 主线(PR #26608,首个含该支持的发布为 b10470)。必须用 llama.cpp ≥ b10470,否则报 unknown model architecture: bailingmoe3。

    3.2 启动本地推理服务

    llama.cpp(社区 GGUF,最稳的本地路径):

    ./llama-server \\
    -m ./ling-tiny/Ling-3.0-tiny-Q4_K_M.gguf \\
    -ngl 99 -c 32768 –flash-attn on –jinja \\
    –host 0.0.0.0 –port 8080

    vLLM(用蚂蚁自建 fork,多卡/高吞吐):

    VLLM_USE_PRECOMPILED=1 pip install git+https://github.com/inclusionAI/vllm-ling-v3@ling_3_0
    vllm serve inclusionAI/Ling-3.0-tiny \\
    –enable-prefix-caching –enable-auto-tool-choice \\
    –chat-template-tokenizer inclusionAI/Ling-3.0-tiny

    Ollama(注意:官方尚未合入,仅社区 PR ollama/ollama#17643,限 Apple Silicon MLX、需自编译;M4 Pro 48GB 验证):

    # 自编译该 PR 后
    echo 'FROM ./Ling-3.0-tiny-Q4_K_M.gguf' > Modelfile
    ollama create ling-tiny -f Modelfile && ollama run ling-tiny

    3.3 推理代码(复制即跑)

    对接本地 OpenAI 兼容端点,演示"思考模式"开关:

    from openai import OpenAI

    client = OpenAI(base_url="http://localhost:8080/v1", api_key="sk-noauth")

    # 思考模式(默认开):复杂推理
    r1 = client.chat.completions.create(
    model="ling-tiny",
    messages=[{"role": "user",
    "content": "用三种方法证明 √2 是无理数,并比较优劣。"}],
    max_tokens=1024,
    temperature=1.0, top_p=0.95, extra_body={"top_k": 20},
    )
    print("【思考模式】\\n", r1.choices[0].message.content)

    # 快速模式:关掉 thinking,简单问答更省时(质量会下降)
    r2 = client.chat.completions.create(
    model="ling-tiny",
    messages=[{"role": "user", "content": "把'今日天气晴'翻译成英文。"}],
    max_tokens=128,
    temperature=0.7, top_p=0.8,
    extra_body={"top_k": 20, "enable_thinking": False},
    )
    print("【快速模式】\\n", r2.choices[0].message.content)

    注:enable_thinking 为 Ling 系 chat-template 扩展字段,需 serving 框架支持(vLLM 蚂蚁 fork / SGLang 镜像已支持;Ollama 社区 PR 视构建而定)。

    3.4 效果验证

    curl http://localhost:8080/v1/chat/completions \\
    -H "Content-Type: application/json" \\
    -d '{"model":"ling-tiny","messages":[{"role":"user","content":"你好,介绍一下你自己"}],"max_tokens":128}'

    成功判定:返回 OpenAI 格式 JSON 且 choices[0].message.content 非空。若报 bailingmoe3 未知架构,说明 llama.cpp 太旧,升级到 b10470+。

    ⚠️ 避坑提醒

    • 架构太新:llama.cpp 必须 ≥ b10470(PR #26608),老版本/LM Studio 旧内核直接报错。
    • Ollama 官方没合入:别等 ollama run inclusionAI/… 官方版,当前只能走社区 PR 自编译(且限 Apple Silicon)。
    • 7.9B 总参 ≠ 小文件:原权 15.8GB,8GB 卡必须靠 IQ4_NL/Q4_K_S 级 GGUF(~4–5GB)。
    • 思考默认开:简单任务会很啰嗦且慢,记得关 enable_thinking;关了质量会掉,生产前先测。
    • 长上下文有退化:社区在 Orin Nano 上 96K 后注意力明显退化,别默认 128K 都稳定,按需上探。
    • 社区 GGUF 是第三方:bartowski/NANI-Nithin 转换,非官方,量化质量以实测为准。

    四、性能测评

    4.1 推理速度与显存表

    4.2 生成质量分维度

    • 通用智能:AA Intelligence Index 25(第三方),编辑称接近 4B 激活模型水平;中文源称仅比 Gemma-4-26B-A4B 低 1 分。
    • Agentic:AA Agentic Index 16,编辑评测"agent 分超过部分 30B+ 模型"(AIHOT 编辑观点,非统一结论)。
    • 编码/终端:跑 Terminal-Bench 2.1(AA 协议,Terminus 2 harness),具体分项见官方模型卡图(官方未给纯文本数值)。
    • 吞吐代价:AA 评测期间生成约 2.1 亿 token(同类中位 ~4200 万),即"跑得快也特别能想",思考模式输出量大。

    4.3 同档模型对比表

    数据来源:Artificial Analysis、官方模型卡;Ling 为 1.3B 激活口径,其余为厂商/第三方发布值,未做本机复测。

    结论:Ling-3.0-tiny 的卖点不是"绝对最强",而是"在 1.3B 激活量上把单位算力智能拉满 + 端侧能跑"。显存紧、要常驻小助手/路由/简单工具调用,它是高性价比选择;复杂编码、精确计算、长程 Agent 仍建议上 27B+ 模型。

    五、使用建议

    适用场景

    • 端侧/笔记本常驻小助手:文本整理、分类、翻译、短问答。
    • 低显存(8–12GB)设备的本地推理与离线可用。
    • 路由/调度节点:用极低成本判断该把任务派给哪个大模型。
    • 简单工具调用与轻量 Agent 原型。

    不适用场景

    • 复杂编码/Coding Agent、精确数值计算 → 上 Qwen3.8-27B 级或更大。
    • 严格格式遵循的生产任务 → 先拿自己任务测一轮(社区反馈指令遵循不够稳)。
    • 超长稳定 128K+ 上下文 → 社区量化在深处有退化,谨慎。

    调优提示

  • 8GB 显存从 IQ4_NL / Q4_K_S 试起,上下文先设 8K/16K,再按需上探。
  • 12GB 可上 Q5_K_M / Q6_K,或 Q8 + 短上下文。
  • 简单任务务必关 enable_thinking,否则又慢又啰嗦。
  • 框架优先 llama.cpp(≥b10470)/ 蚂蚁 vLLM fork / SGLang 镜像;Ollama 暂走社区自编译。

  • 数据来源说明:本文性能数据来自蚂蚁百灵官方模型卡 / Hugging Face(inclusionAI/Ling-3.0-tiny)、Artificial Analysis 独立榜单、freeai.help 解析,以及 Reddit LocalLLaMA 社区实测(3090 / Orin Nano),均已在正文标注来源;官方速度/显存为厂商自报,社区数字非统一性能承诺,以独立第三方复测为准。部署命令引用官方仓库、bartowski 社区 GGUF 与蚂蚁 vLLM fork。

    Ling-3.0-tiny 蚂蚁百灵 MIT 许可 端侧模型 混合推理 MoE 本地部署

    赞(0)
    未经允许不得转载:171主机测评 » Ling-3.0-tiny 部署实测:8GB 显卡跑“会思考“的端侧模型,7.9B 总参每 token 只激活 1.3B
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址