本文来自《AI实战90讲》——90个实战项目,跑出你的AI竞争力。
目录
一、硬件平台篇
- 1.1 瑞芯微 RK3588
- 1.2 NVIDIA Jetson系列
- 1.3 高通平台(Qualcomm Snapdragon)
- 1.4 联发科平台(MediaTek Dimensity)
- 1.5 RISC-V平台(进迭时空K1)
- 1.6 RK182X算力扩展卡
- 1.7 Apple Silicon平台
- 1.8 Intel平台
- 1.9 算能盒子(Sophon BM1684/BM1684X)
- 1.10 华为昇腾NPU平台
- 1.11 寒武纪MLU平台
二、推理框架篇
- 2.1 框架对比总览
- 2.2 框架分类与选择指南(通用框架vs专用框架区别、选择策略)
- 2.3 通用跨平台框架(ONNX Runtime、TensorFlow Lite、CoreML、OpenVINO、TVM、SITS 2026)
- 2.4 专用平台框架(TensorRT-LLM、RKLLM、MNN-LLM、MindSpore Lite、MagicMind、Tengine、Paddle Lite、NeuroPilot、SophonSDK、SNPE)
三、模型选择篇
- 3.1 模型性能对比
- 3.2 选型策略
四、部署实战篇
- 4.1 RK3588部署DeepSeek-R1-Distill-Qwen-1.5B
- 4.2 Jetson Orin Nano部署Qwen2.5-7B
- 4.3 Apple Silicon部署Llama 3.2 3B
- 4.4 Intel平台部署Qwen2 7B
- 4.5 算能盒子部署ChatGLM2-6B
- 4.6 华为昇腾部署Qwen2 7B
- 4.7 寒武纪MLU部署Llama 3.2 3B
五、优化策略篇
- 5.1 量化技术(FP16/BF16/INT8/INT4/W4A16/AWQ/GPTQ/QAT/FP8/GGUF)
- 5.2 量化工具详解(专用工具、通用工具、选择策略、使用示例)
- 5.3 专用工具与通用工具的关系
六、参考资源篇
- 6.1 官方文档
- 6.2 技术博客
- 6.3 工具链下载
七、选型建议
- 7.1 按场景选型
- 7.2 性能与成本权衡
文档概览:本指南涵盖 11种硬件平台、17种推理框架、7个部署实战案例,为大模型边缘部署提供全面参考。
一、硬件平台篇
1.1 瑞芯微 RK3588
核心参数:
| CPU | 4核Cortex-A76(2.4GHz)+ 4核Cortex-A55(1.8GHz) |
| NPU | 三核自研NPU,算力6 TOPS |
| GPU | Mali-G610 MP4 |
| 内存 | LPDDR4X/LPDDR5,最高32GB |
| 存储 | PCIe 3.0×4 NVMe SSD |
支持的大模型:
| DeepSeek-R1-Distill-Qwen-1.5B | Q4_K_M | 0.8GB | 22 tokens/s |
| DeepSeek-R1-Distill-Qwen-1.5B | FP16 | 3.0GB | 18 tokens/s |
| DeepSeek-R1 7B | W8A8量化 | – | 10 tokens/s |
| Qwen3/Qwen2.5-VL-3B-Instruct | INT8 | ~4GB | 12-15 tokens/s |
| ChatGLM3-6B | INT4 | ~3.5GB | 8-10 tokens/s |
开发工具链:
- RKLLM-Toolkit:PC端模型转换与量化工具
- RKLLM Runtime:板端C/C++推理库
- RKNN Toolkit:通用NPU推理框架
官方资源:
- 瑞芯微官方文档
- RKLLM GitHub
- 模型下载地址(提取码:rkllm)
适用推理框架:
RKLLM(瑞芯微专用LLM推理框架)
- 支持平台:RK3562、RK3566、RK3576、RK3588、RK3588S(按性能分级)
- 量化支持:W4A16(权重4bit/激活16bit)、W8A8(权重8bit/激活8bit)
- 核心特性:
- 支持500M~7B规模模型
- LongRoPE长上下文(16K+)
- KVCache管理优化
- 多实例并行推理
- 多模态协同能力(联合RKNN视觉模型)
- 工具链:RKLLM-Toolkit2(PC端转换)+ RKLLM Runtime(板端推理)
- 官方资源:RKNN-LLM GitHub
- 适用板卡:LubanCat-3/4/5系列、Firefly ROC-RK3588S-PC等
Tengine(国产跨平台边缘推理引擎)
- 支持平台:ARM CPU、Mali GPU、瑞芯微RK NPU
- 核心特性:轻量级、高性能、模块化设计
- 量化支持:INT8、FP16、FP32
- 支持框架:PyTorch、TensorFlow、ONNX、Caffe、MXNet
- 工具链:Convert Tool(模型转换)、Serializer(序列化)、Graph Partition(图分区)
- 官方资源:Tengine GitHub
Paddle Lite(百度飞桨端侧推理引擎)
- 支持平台:ARM CPU、Mali/Adreno GPU、瑞芯微NPU
- 核心特性:轻量级(ARMV7仅800K,ARMV8约1.3M)、高性能ARM CPU优化
- 量化支持:INT8、FP16
- 工具链:OPT离线优化工具、X2Paddle模型转换工具
- 官方资源:Paddle Lite官网
MindSpore Lite(华为端边云统一推理引擎)
- 支持平台:ARM CPU/GPU、瑞芯微RK3588等边缘芯片
- 核心特性:端边云统一、1MB级二进制体积、动态图/静态图统一
- 量化支持:INT8、FP16、QAT(量化感知训练)
- 官方资源:MindSpore官网
实际案例:
1.2 NVIDIA Jetson系列
1.2.1 Jetson Orin Nano
| AI算力 | 40 TOPS |
| 内存 | 4GB/8GB LPDDR5 |
| 功耗 | 7-15W |
| 价格 | ¥1200-2800 |
支持模型:Qwen2.5-7B(INT4)、Phi-3 Mini 3.8B、Llama 3.2 1B
性能数据:
- Qwen2.5-7B INT4:24.7 tokens/s
- 首token延迟:89ms
1.2.2 Jetson Orin NX
| AI算力 | 100-157 TOPS |
| 内存 | 8GB/16GB LPDDR5 |
| 功耗 | 10-25W |
| 价格 | ¥2500-5000 |
支持模型:Qwen2.5-14B(INT8)、Llama 3.3 7B
1.2.3 Jetson AGX Orin
| AI算力 | 275 TOPS |
| 内存 | 32GB/64GB LPDDR5 |
| 功耗 | 15-60W |
| 价格 | ¥30,000+ |
支持模型:Qwen2.5-72B(INT4)、Llama 3.3 70B
1.2.4 Jetson Xavier NX
| AI算力 | 21 TOPS |
| 内存 | 8GB/16GB LPDDR4x |
| 功耗 | 10-20W |
| 价格 | ¥3500 |
性能数据(Qwen-1.8B q4_0量化):
| Xavier NX | – | ~20 tokens/s | ~4GB |
开发工具链:
- TensorRT-LLM:官方LLM推理加速库,比llama.cpp快3-5倍
- JetPack SDK:完整开发套件
- CUDA-X:统一软件平台
官方资源:
- NVIDIA Jetson官网
- TensorRT-LLM文档
- Jetson Benchmarks
适用推理框架:
TensorRT(NVIDIA视觉推理框架)
- 支持平台:NVIDIA GPU(RTX 30/40/50系列)、Jetson系列(Nano/NX/AGX Orin)
- 量化支持:INT8、FP16
- 典型场景:视觉推理
- 成熟度:★★★★★
TensorRT-LLM(NVIDIA LLM推理加速库)
- 支持平台:NVIDIA GPU(Ampere/Turing/Hopper架构)、Jetson Orin系列
- 特点:NVIDIA官方LLM推理加速库,专为Transformer架构优化
- 性能:比llama.cpp快3-5倍,支持INT4_AWQ量化
- 量化支持:INT4、INT8、AWQ
- 适用场景:Jetson平台部署7B-72B模型
- 官方资源:TensorRT-LLM GitHub
- 成熟度:★★★★★
vLLM(高吞吐量LLM服务框架)
- 支持平台:NVIDIA GPU(A100/A800/H100/A10G等)、Jetson AGX Orin
- 特点:基于PagedAttention技术,实现高吞吐量LLM服务
- 量化支持:AWQ、SqueezeLLM等多种量化格式
- 性能:支持连续批处理,吞吐量提升显著
- 适用场景:高并发推理服务部署
- 官方资源:vLLM GitHub
- 成熟度:★★★★★
PowerInfer(CPU+GPU混合推理框架)
- 支持平台:x86/ARM CPU + NVIDIA GPU(RTX 20/30/40系列)
- 特点:上海交大IPADS实验室研发,CPU+GPU混合推理
- 性能:比llama.cpp加速11倍,2080Ti可运行70B模型
- 技术亮点:利用高局部性稀疏激活特性
- 量化支持:INT4、FP16
- 官方资源:PowerInfer GitHub
- 成熟度:★★★★
实际案例:
1.3 高通平台(Qualcomm Snapdragon)
核心参数:
| Snapdragon 8 Gen 3 | 1x Cortex-X4 + 3x Cortex-A720 + 4x Cortex-A520 | 45 TOPS | 高端手机 |
| Snapdragon 8cx Gen 3 | 4x Cortex-X2 + 4x Cortex-A710 | 30 TOPS | 骁龙本 |
| QCS8550 | 8核Kryo 680 | 29 TOPS | 边缘计算平台 |
支持模型:
- Qwen2 1.5B(INT4)、Llama 3.2 1B、Phi-3 Mini 3.8B
开发工具链:
- Qualcomm AI Engine Direct:底层NPU编程接口
- SNPE(Snapdragon Neural Processing Engine):神经网络推理引擎
- Hexagon SDK:Hexagon DSP/NPU开发工具
官方资源:
- Qualcomm AI Developer Center
- SNPE GitHub
适用推理框架:
Qualcomm SNPE(骁龙神经网络处理引擎)
- 支持平台:高通Snapdragon 8 Gen 3、8cx Gen 3、QCS8550等平台
- 量化支持:INT8、FP16
- 工具链:Qualcomm AI Engine Direct、SNPE、Hexagon SDK
- 适用场景:高端智能手机AI功能、边缘AI盒子、智能座舱
llama.cpp(端侧LLM推理框架)
- 支持平台:CPU(ARM/RISC-V)、GPU(OpenCL)
- 特点:跨平台端侧推理,支持多种量化格式
- 量化支持:INT4、INT8(GGUF格式)
- 官方资源:llama.cpp GitHub
应用场景:高端智能手机AI功能、边缘AI盒子、智能座舱
1.4 联发科平台(MediaTek Dimensity)
核心参数:
| Dimensity 9300 | 4x Cortex-X4 + 4x Cortex-A720 | 120 TOPS | 旗舰手机 |
| Dimensity 8300 | 4x Cortex-A715 + 4x Cortex-A510 | 80 TOPS | 中高端手机 |
支持模型:
- Qwen2 7B(INT4)、Llama 3.2 3B、DeepSeek-R1-1.5B
开发工具链:
- NeuroPilot SDK:联发科AI软件开发工具包
- 支持ONNX、TensorFlow Lite、PyTorch
官方资源:
- MediaTek Developer Center
适用推理框架:
MediaTek NeuroPilot(联发科AI软件开发工具包)
- 支持平台:Dimensity 9300、8300等联发科平台
- 量化支持:INT8、FP16
- 工具链:NeuroPilot SDK
- 支持框架:ONNX、TensorFlow Lite、PyTorch
- 适用场景:智能手机、智能电视、边缘AI设备
MNN-LLM(阿里巴巴移动端推理框架)
- 支持平台:手机(Android/iOS)、嵌入式设备、联发科芯片
- 特点:阿里巴巴开源移动端推理框架,不依赖厂商NPU
- 支持模型:各类LLM和Diffusion模型,支持多份LoRA同时加载
- 性能:8Gen1芯片上1.8B模型可达35 tokens/s
- 量化支持:INT4、INT8
- 适用场景:手机端本地部署
- 官方资源:MNN GitHub
应用场景:智能手机、智能电视、边缘AI设备
1.5 RISC-V平台(进迭时空K1)
核心参数:
- 8核RISC-V CPU(RV64)
- 标准256bit RVV向量指令
- 自定义AI指令集
支持模型:
- 通义千问0.5B、1.5B
- DeepSeek-R1-1.5B(4bit量化,4GB内存可运行)
系统支持:OpenHarmony 5.0
开发资源:
- 进迭时空开发者文档
- OHOS AI标准接口,支持JS/TS跨语言调用
应用场景:工业网关故障诊断、教育平板智能辅导、低功耗语音设备
1.6 RK182X算力扩展卡
核心参数:
| NPU算力 | 20 TOPS |
| 内存 | 3D堆叠高带宽DRAM |
| 接口 | PCIe、USB |
支持模型:0.5B-8B参数量区间大语言模型、图文多模态模型
软件生态:RKNN3 SDK V1.0.4
适用场景:储能监测、工业网关、自主机器人、边缘视频分析
1.7 Apple Silicon平台
核心参数:
| M1 | 8核(4性能+4能效) | 7核GPU + 16核NPU | 8GB/16GB | MacBook Air/Pro |
| M2 | 8核(4性能+4能效) | 10核GPU + 16核NPU | 8GB/24GB | MacBook Air/Pro |
| M3 | 8核(4性能+4能效) | 10核GPU + 16核NPU | 8GB/24GB | MacBook Air/Pro |
| M4 | 10核(4性能+6能效) | 10核GPU + 16核NPU | 16GB/32GB | MacBook Pro/iPad Pro |
| A17 Pro | 6核(2性能+4能效) | 6核GPU + 16核NPU | 8GB | iPhone 15 Pro |
NPU算力:M系列芯片NPU算力约11-38 TOPS,A17 Pro约35 TOPS
支持模型:
- Llama 3.2 1B/3B(INT4)
- Qwen2 1.5B/7B(INT4)
- Mistral 7B(INT4)
- Phi-3 Mini 3.8B
开发工具链:
- CoreML:Apple官方推理框架,深度集成Neural Engine
- CoreML Tools:模型转换工具,支持PyTorch/TensorFlow/ONNX
- Metal:GPU加速框架
- Xcode:集成开发环境
官方资源:
- CoreML官方文档
- CoreML Tools GitHub
适用推理框架:
CoreML(Apple生态推理框架)
- 支持平台:Apple设备(iPhone/iPad/Mac/Apple Silicon)
- 核心特性:
- 深度集成Apple硬件:充分利用Apple Silicon的神经引擎
- 自动优化:根据设备性能自动选择最优推理路径
- 隐私保护:模型运行在设备本地,数据不上传云端
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX(通过转换)
- 工具链:CoreML Tools、Xcode集成
- 官方资源:CoreML官网
- 适用场景:iOS/macOS应用、Apple生态设备
llama.cpp(Apple Metal加速)
- 支持平台:Apple Silicon(M1/M2/M3/M4/A系列)
- 特点:支持Metal GPU加速,充分利用Apple GPU
- 性能:M2 MacBook Air运行7B模型可达30+ tokens/s
- 量化支持:INT4、INT8(GGUF格式)
应用场景:iOS/macOS本地AI应用、隐私敏感场景、移动端智能助手
1.8 Intel平台
核心参数:
| Intel Core i9-14900K | 24核(8P+16E) | Intel UHD 770 | 高性能桌面 |
| Intel Xeon W系列 | 最多56核 | Intel UHD/Iris | 工作站/服务器 |
| Intel Arc A770 | – | 16GB显存,225 TOPS(INT8) | 独立GPU |
| Intel Movidius VPU | – | 1 TOPS | 边缘视觉AI |
支持模型:
- Llama 3.2 1B/3B(INT8)
- Qwen2 1.5B/7B(INT8)
- Stable Diffusion(FP16)
开发工具链:
- OpenVINO:Intel官方推理框架
- OpenVINO Model Optimizer:模型转换与优化工具
- Intel Extension for PyTorch:PyTorch Intel优化扩展
- oneDNN:深度神经网络库
官方资源:
- OpenVINO官网
- Intel AI开发者中心
适用推理框架:
OpenVINO(Intel推理引擎)
- 支持平台:Intel CPU(Xeon/Core)、Intel GPU(UHD/Iris)、Intel Movidius VPU
- 核心特性:
- 统一API:一套代码支持多种Intel硬件
- 自动优化:针对Intel架构优化推理性能
- 低功耗设计:适合边缘部署
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX、Caffe
- 工具链:OpenVINO Model Optimizer、Inference Engine
- 官方资源:OpenVINO官网
- 适用场景:工业边缘计算、智能摄像头、服务器端推理
ONNX Runtime(Intel优化版本)
- 支持平台:Intel CPU/GPU/VPU
- 特点:支持Intel DNNL加速,针对Intel架构优化
- 量化支持:INT8、FP16
应用场景:工业边缘服务器、智能摄像头、数据中心推理服务
1.9 算能盒子(Sophon BM1684/BM1684X)
核心参数:
| NPU算力 | 17.6 TOPS(INT8) | 32 TOPS(INT8) |
| FP16算力 | – | 16 TFLOPS |
| FP32算力 | 2.2 TOPS | 2 TFLOPS |
| 内存 | 8GB/16GB DDR4 | 8GB/16GB DDR4 |
| 功耗 | 15-30W | 20-35W |
| 代表设备 | AIBOX-1684 | AIO-1684XQ |
支持模型:
- LLaMA2-7B/13B(INT8)
- ChatGLM2-6B(INT8)
- Qwen-7B(INT8)
- Stable Diffusion(FP16)
- ViT、SAM视觉模型
性能数据:
- LLaMA2-7B INT8:约15 tokens/s
- ChatGLM2-6B INT8:约20 tokens/s
开发工具链:
- SophonSDK:算能官方开发套件
- TPU-NNTC编译器:模型编译与量化工具
- libsophon运行时:板端推理库
- BMNNSDK:神经网络软件开发包
官方资源:
- SophonSDK官方文档
- 算能开发者社区
适用推理框架:
SophonSDK(算能TPU平台推理框架)
- 支持平台:算能BM1684/BM1684X芯片,AIBOX-1684/AIO-1684XQ盒子
- 算力参数:
- BM1684:17.6 TOPS(INT8)、2.2 TOPS(FP32)
- BM1684X:32 TOPS(INT8)、16 TFLOPS(FP16/BF16)、2 TFLOPS(FP32)
- 核心特性:
- 支持LLM、视觉大模型、AIGC模型
- 多模型并行推理
- 低延迟推理优化
- 量化支持:INT8、FP16、FP32
- 支持模型:LLaMa2、ChatGLM2-6B、Qwen-7B、ViT、SAM、Stable Diffusion
- 工具链:TPU-NNTC编译器、libsophon运行时
- 官方资源:SophonSDK官方文档
- 适用场景:智能监控、AI教学、边缘计算、大模型私有化部署
应用场景:智能监控、AI教学实验、边缘计算节点、大模型私有化部署
1.10 华为昇腾NPU平台
核心参数:
| Atlas 200 DK | 8 TOPS(INT8) | 8GB | 开发者套件 |
| Atlas 200I A2 | 8 TOPS | 8GB | 边缘AI盒子 |
| Atlas 300I | 64 TOPS | 32GB | 推理加速卡 |
| Atlas 300V | 140 TOPS | 64GB | 视频分析卡 |
支持模型:
- Llama 3.2 1B/3B(INT8)
- Qwen2 1.5B/7B(INT8)
- ChatGLM3-6B(INT8)
- 华为盘古系列模型
开发工具链:
- MindSpore Lite:华为端边云统一推理引擎
- MindCompiler:模型编译与量化工具
- Ascend CL:底层NPU编程接口
- CANN:Compute Architecture for Neural Networks
官方资源:
- 华为昇腾开发者社区
- MindSpore官网
- CANN文档
适用推理框架:
MindSpore Lite(华为端边云统一推理引擎)
- 支持平台:ARM CPU/GPU、华为麒麟NPU、昇腾NPU、RK3588等边缘芯片
- 核心特性:
- 端边云统一:一套代码多端部署
- 1MB级二进制体积:极致轻量化
- 动态图/静态图统一:灵活切换
- 量化支持:INT8、FP16、QAT(量化感知训练)
- 工具链:MindCompiler、MindData、MindSpore Serving
- 官方资源:MindSpore官网
- 适用场景:华为生态设备、端边云协同、国产化部署
Tengine(支持华为Ascend)
- 支持平台:华为Ascend NPU
- 特点:国产跨平台推理引擎,支持华为NPU
- 量化支持:INT8、FP16、FP32
应用场景:国产化AI部署、政务边缘计算、智能安防、端边云协同
1.11 寒武纪MLU平台
核心参数:
| MLU220-M.2 | 8 TOPS(INT8) | 4GB | 边缘加速卡 |
| MLU270-S4 | 64 TOPS(INT8) | 16GB | 数据中心卡 |
| MLU290 | 128 TOPS(INT8) | 32GB | 高性能推理卡 |
支持模型:
- Llama 3.2 1B/3B(INT8)
- Qwen2 1.5B/7B(INT8)
- ResNet、YOLO视觉模型
开发工具链:
- Cambricon BANG:寒武纪底层编程架构
- CNCL:寒武纪计算库
- MagicMind:推理引擎
- CNRT:运行时库
官方资源:
- 寒武纪开发者社区
- 寒武纪官网
适用推理框架:
Tengine(支持寒武纪MLU)
- 支持平台:寒武纪MLU系列芯片
- 特点:国产跨平台推理引擎,支持寒武纪NPU
- 量化支持:INT8、FP16、FP32
- 官方资源:Tengine GitHub
MagicMind(寒武纪专用推理引擎)
- 支持平台:寒武纪MLU系列
- 特点:寒武纪官方推理引擎,深度优化
- 量化支持:INT8、FP16
应用场景:国产化AI部署、政务云、边缘推理加速
二、推理框架篇
2.1 框架对比总览
| TensorRT | NVIDIA GPU(RTX 30/40/50系列)、Jetson系列(Nano/NX/AGX Orin) | INT8/FP16 | ★★★★★ | 视觉推理 |
| TensorRT-LLM | NVIDIA GPU(Ampere/Turing/Hopper架构)、Jetson Orin系列 | INT4/INT8/AWQ | ★★★★★ | LLM推理加速(比llama.cpp快3-5倍) |
| ONNX Runtime | CPU(x86/ARM)、GPU(NVIDIA/AMD/Intel)、Edge TPU、FPGA | INT8/FP16/QInt8 | ★★★★★ | 跨平台部署 |
| TensorFlow Lite | Android/iOS手机、嵌入式Linux、MCU(STM32/ESP32)、Edge TPU | INT8全整数量化 | ★★★★★ | 手机APP + IoT |
| llama.cpp | CPU(x86/ARM/RISC-V)、NVIDIA GPU、Apple Metal、OpenCL | INT4/INT8 (GGUF) | ★★★★ | 端侧LLM推理 |
| vLLM | NVIDIA GPU(A100/A800/H100/A10G等)、Jetson AGX Orin | AWQ/SqueezeLLM | ★★★★★ | 高吞吐量LLM服务 |
| PowerInfer | x86/ARM CPU + NVIDIA GPU(RTX 20/30/40系列) | INT4/FP16 | ★★★★ | 消费级GPU运行70B模型(加速11倍) |
| MNN-LLM | 手机(Android/iOS)、嵌入式设备、RK3588等边缘芯片 | INT4/INT8 | ★★★★ | 手机端LLM推理(不依赖NPU) |
| CoreML | Apple设备(iPhone/iPad/Mac/Apple Silicon) | INT8/FP16 | ★★★★ | iOS/macOS应用 |
| OpenVINO | Intel CPU(Xeon/Core)、Intel GPU(UHD/Iris)、Intel Movidius VPU | INT8 | ★★★★ | 工业/边缘服务器 |
| RKLLM | 瑞芯微RK3562/RK3566/RK3576/RK3588/RK3588S系列芯片 | INT4/INT8/W4A16 | ★★★★ | 瑞芯微平台LLM |
| SophonSDK | 算能BM1684/BM1684X芯片(AIBOX-1684/AIO-1684XQ) | INT8/FP16/FP32 | ★★★★ | 算能TPU平台大模型部署 |
| Tengine | ARM CPU、Mali GPU、华为Ascend、RK NPU、寒武纪MLU | INT8/FP16/FP32 | ★★★★ | 国产跨平台边缘推理引擎 |
| Paddle Lite | ARM CPU、Mali/Adreno GPU、华为麒麟NPU、瑞芯微NPU | INT8/FP16 | ★★★★ | 百度飞桨端侧推理引擎 |
| TVM | CPU(x86/ARM/RISC-V)、GPU(NVIDIA/AMD)、FPGA、嵌入式设备 | INT8/FP16 | ★★★★★ | 跨平台自动优化编译器 |
| MindSpore Lite | ARM CPU/GPU、华为麒麟NPU、昇腾NPU、RK3588 | INT8/FP16/QAT | ★★★★ | 华为端边云统一推理引擎 |
| SITS 2026 | CPU(x86/ARM)、GPU(NVIDIA/AMD)、边缘NPU(RK/Qualcomm) | INT4/QAT | ★★★★ | 新一代原生压缩框架 |
2.2 框架分类与选择指南
通用跨平台框架 vs 专用平台框架:核心区别
| 硬件支持范围 | 广泛,跨多种硬件架构(CPU/GPU/NPU/DSP) | 特定,针对单一或少数硬件平台 |
| 优化策略 | 通用性优先,兼顾多种硬件性能 | 深度优化,压榨特定硬件极限性能 |
| 厂商归属 | 中立或开源社区维护 | 通常由硬件厂商提供 |
| 功能覆盖 | 全面,支持多种模型类型和推理模式 | 专注,针对特定场景深度优化 |
| 学习成本 | 较低,API统一通用 | 较高,需学习厂商特定API和工具链 |
| 性能表现 | 中等偏上,稳定可靠 | 极致性能(针对目标硬件) |
| 跨平台能力 | 强,一次开发多端部署 | 弱,代码与特定硬件绑定 |
| 生态成熟度 | 社区活跃,文档丰富 | 依赖厂商支持,生态规模较小 |
框架分类总结
通用跨平台框架(6种):
- ONNX Runtime:微软开源,支持ONNX格式,跨平台能力最强
- TensorFlow Lite:Google出品,移动端优化,支持多种量化
- CoreML:Apple官方,深度利用神经引擎
- OpenVINO:Intel官方,针对Intel硬件优化
- TVM:开源编译器框架,自动生成优化代码
- SITS 2026:新兴跨平台框架,支持最新硬件
专用平台框架(11种):
- TensorRT-LLM:NVIDIA官方LLM推理加速库
- RKLLM:瑞芯微专用LLM推理框架
- MNN-LLM:阿里巴巴移动端推理框架
- MindSpore Lite:华为端边云统一推理引擎
- MagicMind:寒武纪专用推理引擎
- Tengine:国产跨平台边缘推理引擎
- Paddle Lite:百度飞桨端侧推理引擎
- MediaTek NeuroPilot:联发科AI软件开发工具包
- SophonSDK:算能TPU平台推理框架
- Qualcomm SNPE:骁龙神经网络处理引擎
选择策略建议
开发阶段 → 通用框架(快速验证、跨平台测试)
↓
原型验证 → ONNX Runtime(统一API测试多硬件)
↓
性能优化 → 专用框架(针对目标硬件深度优化)
↓
生产部署 → 专用框架(极致性能和稳定性)
选择通用跨平台框架的场景:
- 需要跨平台部署(如同时支持iOS和Android)
- 快速原型开发,需要验证模型在不同硬件上的表现
- 企业级应用需要支持多种服务器硬件
- 研究阶段需要灵活切换硬件平台
选择专用平台框架的场景:
- 追求极致推理性能
- 目标硬件明确,需要充分利用硬件特性
- 生产环境部署,需要稳定的性能表现
- 需要使用厂商特有优化功能(如专用量化格式)
2.3 通用跨平台框架
ONNX Runtime(微软开源跨平台推理引擎)
- 支持平台:CPU(x86/ARM)、GPU(NVIDIA/AMD/Intel)、Edge TPU、FPGA
- 核心特性:
- 跨平台兼容性:支持多种硬件后端,一次开发多平台部署
- 高性能优化:自动图优化、算子融合、内存复用
- 灵活扩展:支持自定义算子、分布式推理
- 量化支持:INT8、FP16、QInt8
- 支持框架:PyTorch、TensorFlow、ONNX、MXNet
- 工具链:ONNX转换工具、ORT Training、ONNX Runtime Server
- 官方资源:ONNX Runtime GitHub
- 适用场景:跨平台部署、云边端协同、高性能推理服务
TensorFlow Lite(Google移动端推理框架)
- 支持平台:Android/iOS手机、嵌入式Linux、MCU(STM32/ESP32)、Edge TPU
- 核心特性:
- 极致轻量化:核心库仅几百KB
- 低延迟推理:针对移动设备优化
- 硬件加速:支持GPU、NPU、DSP
- 量化支持:INT8全整数量化、FP16、动态范围量化
- 支持框架:TensorFlow、Keras、ONNX(通过转换)
- 工具链:TensorFlow Lite Converter、Model Optimizer
- 官方资源:TensorFlow Lite官网
- 适用场景:手机APP、IoT设备、嵌入式系统
CoreML(Apple生态推理框架)
- 支持平台:Apple设备(iPhone/iPad/Mac/Apple Silicon)
- 核心特性:
- 深度集成Apple硬件:充分利用Apple Silicon的神经引擎
- 自动优化:根据设备性能自动选择最优推理路径
- 隐私保护:模型运行在设备本地,数据不上传云端
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX(通过转换)
- 工具链:CoreML Tools、Xcode集成
- 官方资源:CoreML官网
- 适用场景:iOS/macOS应用、Apple生态设备
OpenVINO(Intel推理引擎)
- 支持平台:Intel CPU(Xeon/Core)、Intel GPU(UHD/Iris)、Intel Movidius VPU
- 核心特性:
- 统一API:一套代码支持多种Intel硬件
- 自动优化:针对Intel架构优化推理性能
- 低功耗设计:适合边缘部署
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX、Caffe
- 工具链:OpenVINO Model Optimizer、Inference Engine
- 官方资源:OpenVINO官网
- 适用场景:工业边缘计算、智能摄像头、服务器端推理
TVM(Apache跨平台深度学习编译器)
- 支持平台:CPU(x86/ARM/RISC-V)、GPU(NVIDIA/AMD)、FPGA、嵌入式设备
- 核心特性:
- 自动优化:AutoTVM/AutoScheduler自动搜索最优算子实现
- 跨平台编译:一次编译处处运行
- 轻量级运行时:最小仅300KB
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX、MXNet
- 工具链:Relay IR、AutoTVM、RPC远程部署
- 官方资源:TVM GitHub
- 适用场景:跨平台部署、FPGA加速、嵌入式边缘设备
SITS 2026(新一代原生压缩框架)
- 支持平台:CPU(x86/ARM)、GPU(NVIDIA/AMD)、边缘NPU(RK/Qualcomm)
- 核心特性:
- 训练中压缩:支持结构化剪枝、量化感知训练
- 推理时动态稀疏化:根据输入动态调整计算图
- 知识蒸馏:梯度敏感知识蒸馏保留模型性能
- 压缩效果:Llama-3-8B从15.2GB压缩至1.25GB,推理延迟42.7ms
- 量化支持:INT4、QAT(量化感知训练)
- 适用场景:极致轻量化部署、资源受限设备
2.4 专用平台框架
TensorRT-LLM(NVIDIA LLM推理加速库)
- 支持平台:NVIDIA GPU(Ampere/Turing/Hopper架构)、Jetson Orin系列
- 特点:NVIDIA官方LLM推理加速库,专为Transformer架构优化
- 性能:比llama.cpp快3-5倍,支持INT4_AWQ量化
- 量化支持:INT4、INT8、AWQ
- 适用场景:Jetson平台部署7B-72B模型
- 官方资源:TensorRT-LLM GitHub
- 成熟度:★★★★★
RKLLM(瑞芯微专用LLM推理框架)
- 支持平台:瑞芯微RK3562、RK3566、RK3576、RK3588、RK3588S系列芯片
- 量化支持:W4A16(权重4bit/激活16bit)、W8A8(权重8bit/激活8bit)
- 核心特性:
- 支持500M~7B规模模型
- LongRoPE长上下文(16K+)
- KVCache管理优化
- 多实例并行推理
- 多模态协同能力(联合RKNN视觉模型)
- 工具链:RKLLM-Toolkit2(PC端转换)+ RKLLM Runtime(板端推理)
- 官方资源:RKNN-LLM GitHub
- 适用场景:瑞芯微平台LLM部署
MNN-LLM(阿里巴巴移动端推理框架)
- 支持平台:手机(Android/iOS)、嵌入式设备、RK3588等边缘芯片
- 特点:阿里巴巴开源移动端推理框架,不依赖厂商NPU
- 支持模型:各类LLM和Diffusion模型,支持多份LoRA同时加载
- 性能:8Gen1芯片上1.8B模型可达35 tokens/s
- 量化支持:INT4、INT8
- 适用场景:手机端本地部署
- 官方资源:MNN GitHub
CoreML(Apple生态推理框架)
- 支持平台:Apple设备(iPhone/iPad/Mac/Apple Silicon)
- 核心特性:
- 深度集成Apple硬件:充分利用Apple Silicon的神经引擎
- 自动优化:根据设备性能自动选择最优推理路径
- 隐私保护:模型运行在设备本地,数据不上传云端
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX(通过转换)
- 工具链:CoreML Tools、Xcode集成
- 官方资源:CoreML官网
- 适用场景:iOS/macOS应用、Apple生态设备
OpenVINO(Intel推理引擎)
- 支持平台:Intel CPU(Xeon/Core)、Intel GPU(UHD/Iris)、Intel Movidius VPU
- 核心特性:
- 统一API:一套代码支持多种Intel硬件
- 自动优化:针对Intel架构优化推理性能
- 低功耗设计:适合边缘部署
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX、Caffe
- 工具链:OpenVINO Model Optimizer、Inference Engine
- 官方资源:OpenVINO官网
- 适用场景:工业边缘计算、智能摄像头、服务器端推理
MindSpore Lite(华为端边云统一推理引擎)
- 支持平台:ARM CPU/GPU、华为麒麟NPU、昇腾NPU、RK3588等边缘芯片
- 核心特性:
- 端边云统一:一套代码多端部署
- 1MB级二进制体积:极致轻量化
- 动态图/静态图统一:灵活切换
- 量化支持:INT8、FP16、QAT(量化感知训练)
- 工具链:MindCompiler、MindData、MindSpore Serving
- 官方资源:MindSpore官网
- 适用场景:华为生态设备、端边云协同、国产化部署
MagicMind(寒武纪专用推理引擎)
- 支持平台:寒武纪MLU系列芯片(MLU220/MLU270/MLU290)
- 核心特性:
- 针对寒武纪MLU架构深度优化
- 支持多种精度推理
- 低延迟推理优化
- 量化支持:INT8、FP16
- 工具链:CNCL(寒武纪计算库)、CNRT(运行时库)
- 官方资源:寒武纪开发者社区
- 适用场景:国产化AI部署、政务云、边缘推理加速
Tengine(国产跨平台边缘推理引擎)
- 支持平台:ARM CPU、Mali GPU、华为Ascend、RK NPU、寒武纪MLU
- 核心特性:轻量级、高性能、模块化设计
- 量化支持:INT8、FP16、FP32
- 支持框架:PyTorch、TensorFlow、ONNX、Caffe、MXNet
- 工具链:Convert Tool(模型转换)、Serializer(序列化)、Graph Partition(图分区)
- 官方资源:Tengine GitHub
- 适用场景:国产跨平台边缘推理
Paddle Lite(百度飞桨端侧推理引擎)
- 支持平台:ARM CPU、Mali/Adreno GPU、华为麒麟NPU、瑞芯微NPU
- 核心特性:轻量级(ARMV7仅800K,ARMV8约1.3M)、高性能ARM CPU优化
- 量化支持:INT8、FP16
- 工具链:OPT离线优化工具、X2Paddle模型转换工具
- 官方资源:Paddle Lite官网
- 适用场景:百度飞桨端侧推理
MediaTek NeuroPilot(联发科AI软件开发工具包)
- 支持平台:Dimensity 9300、8300等联发科平台
- 量化支持:INT8、FP16
- 工具链:NeuroPilot SDK
- 支持框架:ONNX、TensorFlow Lite、PyTorch
- 官方资源:MediaTek Developer Center
- 适用场景:智能手机、智能电视、边缘AI设备
SophonSDK(算能TPU平台推理框架)
- 支持平台:算能BM1684/BM1684X芯片,AIBOX-1684/AIO-1684XQ盒子
- 算力参数:
- BM1684:17.6 TOPS(INT8)、2.2 TOPS(FP32)
- BM1684X:32 TOPS(INT8)、16 TFLOPS(FP16/BF16)、2 TFLOPS(FP32)
- 核心特性:
- 支持LLM、视觉大模型、AIGC模型
- 多模型并行推理
- 低延迟推理优化
- 量化支持:INT8、FP16、FP32
- 支持模型:LLaMa2、ChatGLM2-6B、Qwen-7B、ViT、SAM、Stable Diffusion
- 工具链:TPU-NNTC编译器、libsophon运行时
- 官方资源:SophonSDK官方文档
- 适用场景:智能监控、AI教学、边缘计算、大模型私有化部署
Qualcomm SNPE(骁龙神经网络处理引擎)
- 支持平台:高通Snapdragon 8 Gen 3、8cx Gen 3、QCS8550等平台
- 核心特性:
- 充分利用Hexagon DSP/NPU算力
- 支持多模型融合推理
- 低功耗优化
- 量化支持:INT8、FP16
- 支持框架:PyTorch、TensorFlow、ONNX、Caffe
- 工具链:Qualcomm AI Engine Direct、SNPE、Hexagon SDK
- 官方资源:Qualcomm AI Developer Center
- 适用场景:高端智能手机、边缘AI盒子、智能座舱
三、模型选择篇
3.1 模型性能对比
| Qwen2 0.5B | 0.5B | 0.35GB | 1GB | 60-80 tokens/s | 低端设备/IoT、RISC-V K1 |
| Llama 3.2 1B | 1B | 0.7GB | 2GB | 40-60 tokens/s | 入门手机/IoT、ESP32-S3 |
| DeepSeek-R1-Distill-Qwen-1.5B | 1.5B | 0.8GB | 4GB | 16-22 tokens/s | RK3588/Jetson Nano/高通8 Gen 3 |
| Qwen2 1.5B | 1.5B | 1.0GB | 4GB | 20-25 tokens/s | RK3588/Apple Silicon/A17 Pro |
| Llama 3.2 3B | 3B | 2.0GB | 6GB | 25-35 tokens/s | Apple M2/M3/高通8 Gen 3/联发科9300 |
| Gemma 2 2B | 2B | 1.4GB | 3GB | 30-50 tokens/s | 主流手机/Apple Silicon |
| Phi-3 Mini | 3.8B | 2.3GB | 4GB | 20-40 tokens/s | 中高端手机/Apple Silicon |
| Qwen2.5-7B | 7B | 4.5GB | 8GB | 10-24 tokens/s | Jetson Orin Nano/Apple M2/M3/Intel Arc |
| ChatGLM2-6B | 6B | 4.0GB | 8GB | 15-20 tokens/s | 算能BM1684X/华为昇腾Atlas |
| Qwen2.5-14B | 14B | 9GB | 16GB | 5-10 tokens/s | Jetson Orin NX/Intel Xeon |
| Llama 3.3 7B | 7B | 4.5GB | 8GB | 15-25 tokens/s | Jetson Orin Nano/Apple M3 |
3.2 选型策略
内存 ≤ 4GB → 选择 1.5B 以下模型(如DeepSeek-R1-Distill-Qwen-1.5B)
4GB < 内存 ≤ 8GB → 选择 7B 模型(如Qwen2.5-7B INT4)
8GB < 内存 ≤ 16GB → 选择 14B 模型(如Qwen2.5-14B INT8)
内存 > 16GB → 可尝试更大模型(需结合算力评估)
四、部署实战篇
4.1 RK3588部署DeepSeek-R1-Distill-Qwen-1.5B
步骤1:环境准备
# 硬件:Firefly ROC-RK3588S-PC(4GB LPDDR4X + Mali-G610 GPU)
# 系统:Ubuntu 22.04 Server(ARM64)
# 确认GPU可用
glxinfo | grep "OpenGL renderer"
# 应显示 "Mali-G610"
步骤2:下载模型
wget https://hf-mirror.com/DeepSeek-R1-Distill-Qwen-1.5B/resolve/main/qwen1.5-1.5b-deepseek-r1-distill-Q4_K_M.gguf \\
-O /data/models/deepseek-r1-qwen-1.5b.Q4_K_M.gguf
步骤3:使用llama.cpp推理
# 编译llama.cpp(ARM64优化)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make LLAMA_METAL=1
# 运行推理
./main -m /data/models/deepseek-r1-qwen-1.5b.Q4_K_M.gguf -p "你好,介绍一下你自己" -n 512
性能结果:
- Q4_K_M量化:0.8GB体积,GPU加速占比65%
- 1k token平均耗时:16.2秒(约22 tokens/s)
4.2 Jetson Orin Nano部署Qwen2.5-7B
步骤1:安装TensorRT-LLM
pip3 install tensorrt-llm==0.10.0 -f https://nvidia.github.io/TensorRT-LLM/whl/jetson
步骤2:模型转换
import tensorrt_llm as trtllm
from tensorrt_llm.models import QWenForCausalLM
# 加载并转换模型(INT4量化)
trt_model = QWenForCausalLM.from_hugging_face(
"Qwen/Qwen2.5-7B-Instruct",
dtype="float16",
quantization="INT4_AWQ"
)
# 构建引擎
engine = trt_model.to_trt()
engine.save("qwen2.5-7b-int4.engine")
步骤3:推理服务部署
from tensorrt_llm.runtime import ModelRunner
# 加载引擎
runner = ModelRunner.from_dir(engine_dir="./qwen2.5-7b-int4.engine")
# 推理
output = runner.generate("你好,介绍一下你自己", max_tokens=512)
性能结果:
- 显存占用:约3.8GB
- 推理速度:约24 tokens/s
- 首token延迟:< 90ms
4.3 Apple Silicon部署Llama 3.2 3B
步骤1:安装llama.cpp(Metal加速)
# 克隆llama.cpp仓库
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
# 编译(启用Metal GPU加速)
make LLAMA_METAL=1
步骤2:下载模型
# 下载Llama 3.2 3B GGUF格式模型
wget https://hf-mirror.com/meta-llama/Llama-3.2-3B-Instruct-GGUF/resolve/main/llama-3.2-3b-instruct-q4_k_m.gguf \\
-O ./models/llama-3.2-3b-q4_k_m.gguf
步骤3:运行推理
# 使用Metal GPU加速推理
./main -m ./models/llama-3.2-3b-q4_k_m.gguf \\
-p "你好,介绍一下你自己" \\
-n 512 \\
-ngl 99 \\
–color
性能结果(M2 MacBook Air):
- 模型大小:约2.3GB(Q4_K_M量化)
- 推理速度:约35 tokens/s
- 内存占用:约3.5GB
4.4 Intel平台部署Qwen2 7B
步骤1:安装OpenVINO
# 安装OpenVINO
pip install openvino-dev
# 安装OpenVINO LLM扩展
pip install openvino-genai
步骤2:模型转换
from optimum.intel import OVModelForCausalLM
# 加载并转换模型(INT8量化)
model = OVModelForCausalLM.from_pretrained(
"Qwen/Qwen2-7B-Instruct",
export=True,
load_in_8bit=True,
compile=True
)
# 保存转换后的模型
model.save_pretrained("./qwen2-7b-int8-openvino")
步骤3:推理
from openvino_genai import LLMPipeline
# 加载模型
pipe = LLMPipeline(
model_path="./qwen2-7b-int8-openvino",
device="CPU" # 或 "GPU"
)
# 推理
output = pipe.generate("你好,介绍一下你自己", max_new_tokens=512)
print(output)
性能结果(Intel Core i9-14900K):
- 模型大小:约8GB(INT8量化)
- 推理速度:约12 tokens/s(CPU)
- 推理速度:约25 tokens/s(Intel Arc A770 GPU)
4.5 算能盒子部署ChatGLM2-6B
步骤1:安装SophonSDK
# 下载SophonSDK
wget https://sophon-file.sophonai.com/release/release_pre/20240301/sophon_sdk_v23.03.01.tar.gz
# 解压安装
tar -xzf sophon_sdk_v23.03.01.tar.gz
cd sophon_sdk_v23.03.01
./install.sh
步骤2:模型转换
# 使用TPU-NNTC编译器转换模型
python3 -m bmnetc \\
–model ./chatglm2-6b.onnx \\
–target BM1684 \\
–outdir ./chatglm2-6b-bmodel \\
–enable_int8
步骤3:推理
import sophon.sail as sail
# 加载模型
engine = sail.Engine("./chatglm2-6b-bmodel", 0, sail.IOMode.SYSO)
# 准备输入
input_data = "你好,介绍一下你自己"
# 推理
output = engine.process(input_data)
print(output)
性能结果(AIBOX-1684):
- 模型大小:约6GB(INT8量化)
- 推理速度:约20 tokens/s
- 功耗:约20W
4.6 华为昇腾部署Qwen2 7B
步骤1:安装MindSpore Lite
# 安装MindSpore Lite
pip install mindspore-lite
# 安装MindSpore Lite转换工具
pip install mindconverter
步骤2:模型转换
# 使用MindCompiler转换模型(INT8量化)
mindconverter –model ./qwen2-7b \\
–output ./qwen2-7b-mindspore \\
–quantization int8 \\
–target ascend
步骤3:推理
import mindspore_lite as mslite
# 加载模型
context = mslite.Context()
context.target = ["ascend"]
model = mslite.Model()
model.build_from_file("./qwen2-7b-mindspore.mindir", mslite.ModelType.MINDIR, context)
# 推理
input_data = "你好,介绍一下你自己"
output = model.predict(input_data)
print(output)
性能结果(Atlas 300I):
- 模型大小:约7GB(INT8量化)
- 推理速度:约18 tokens/s
- 功耗:约25W
4.7 寒武纪MLU部署Llama 3.2 3B
步骤1:安装寒武纪工具链
# 安装CNRT运行时
pip install cnrt
# 安装MagicMind推理引擎
pip install magicmind
步骤2:模型转换
from magicmind.python.runtime import Builder, Network
# 创建网络
network = Network()
# 加载模型
network.parse_from_file("./llama-3.2-3b.onnx")
# 配置量化(INT8)
config = BuilderConfig()
config.precision = "int8"
# 编译模型
builder = Builder()
model = builder.build_model(network, config)
# 保存模型
model.serialize_to_file("./llama-3.2-3b-mm")
步骤3:推理
from magicmind.python.runtime import Engine, Context
# 加载模型
engine = Engine()
engine.deserialize_from_file("./llama-3.2-3b-mm")
# 创建推理上下文
context = Context(engine)
# 推理
input_data = "你好,介绍一下你自己"
output = context.infer(input_data)
print(output)
性能结果(MLU270-S4):
- 模型大小:约3GB(INT8量化)
- 推理速度:约22 tokens/s
- 功耗:约30W
五、优化策略篇
5.1 量化技术
| FP32 | 32位浮点 | 1x | 训练阶段,最高精度 | 原始精度,体积最大 |
| FP16 | 16位浮点 | 2x | 训练/推理,平衡精度与速度 | 常用训练精度,支持大部分GPU |
| BF16 | 16位脑浮点 | 2x | 训练阶段,动态范围大 | 适合Transformer训练,精度损失小 |
| INT8 | 8位整数 | 4x | 通用推理,平衡精度与性能 | 最常用量化方式,硬件支持广泛 |
| INT4 | 4位整数 | 8x | 资源受限设备,如IoT/边缘 | 极端压缩,需专用硬件支持 |
| W4A16 | 权重4位/激活16位 | ~8x | LLM专用,保持精度 | 权重压缩但激活保持FP16,精度损失小 |
| W8A8 | 权重8位/激活8位 | 4x | 通用LLM推理 | 平衡性能与精度 |
| AWQ | 自适应权重量化 | 4-8x | NVIDIA平台专用优化 | 按通道量化,精度优于普通INT4 |
| GPTQ | 梯度量化 | 4-8x | LLM推理,支持多平台 | 基于Hessian矩阵优化,精度高 |
| SmoothQuant | 平滑量化 | 4-8x | LLM推理,通用平台 | 激活量化前平滑处理,减少精度损失 |
| QAT | 量化感知训练 | 4-8x | 训练阶段量化 | 在训练中学习量化参数,精度最优 |
| FP8 | 8位浮点 | 4x | 下一代推理/训练 | 动态范围大,精度优于INT8 |
| GGUF | 多种精度 | 2-8x | llama.cpp专用 | 支持INT4/INT8/FP16混合量化 |
量化技术选择建议:
| 通用边缘推理 | INT8 | ONNX Runtime、TensorFlow Lite |
| LLM边缘部署 | W4A16/AWQ | llama.cpp、RKLLM |
| NVIDIA平台LLM | INT4_AWQ | TensorRT-LLM |
| 极致压缩IoT | INT4 | llama.cpp (GGUF) |
| 高精度要求 | QAT/FP8 | PyTorch/QAT、TensorRT |
量化工具推荐:
- llama.cpp:GGUF格式,支持多种量化方案
- AutoGPTQ:GPTQ量化,支持HuggingFace模型
- TensorRT-LLM:INT4_AWQ量化,NVIDIA平台最优
- AutoAWQ:AWQ量化,支持多种LLM模型
- SmoothQuant:平滑量化,减少精度损失
5.2 量化工具详解
平台专用量化工具
| RKLLM | RKLLM-Toolkit2 | W4A16/W8A8 | 专为瑞芯微NPU优化,性能最优 |
| TensorRT-LLM | TensorRT-LLM | INT4_AWQ/INT8 | NVIDIA官方,支持AWQ量化 |
| CoreML | CoreML Tools | INT8/FP16 | Apple官方,深度集成Neural Engine |
| OpenVINO | OpenVINO Model Optimizer | INT8/FP16 | Intel官方,支持Intel CPU/GPU/VPU |
| SophonSDK | TPU-NNTC编译器 | INT8/FP16/FP32 | 算能TPU专用,支持多精度 |
| MindSpore Lite | MindCompiler | INT8/FP16/QAT | 华为昇腾NPU专用,支持QAT |
| MagicMind | MagicMind | INT8/FP16 | 寒武纪MLU专用,深度优化 |
| Tengine | Convert Tool | INT8/FP16/FP32 | 支持多种国产芯片NPU量化 |
| Paddle Lite | OPT离线优化工具 | INT8/FP16 | 百度飞桨端侧专用 |
| Qualcomm SNPE | SNPE量化工具 | INT8/FP16 | 高通骁龙NPU专用 |
| MediaTek NeuroPilot | NeuroPilot SDK | INT8/FP16 | 联发科NPU专用 |
平台专用工具优势:
- 针对特定硬件深度优化,性能最佳
- 支持硬件特有的量化格式(如RKLLM的W4A16)
- 充分利用NPU/GPU的加速特性
- 官方维护,稳定性高
使用场景:
- 生产环境部署,追求最佳性能
- 使用NPU等专用硬件加速
- 平台官方推荐的工具链
通用量化工具
| llama.cpp | CPU/GPU/Metal | Q4_K_M/Q8_0/GGUF | 跨平台,支持多种量化方案 |
| AutoGPTQ | CPU/GPU | GPTQ | 支持HuggingFace模型,易用 |
| bitsandbytes | NVIDIA GPU | INT8/FP4 | 配合Transformers使用 |
| GPTQ-for-LLaMA | CPU/GPU | GPTQ | LLaMA系列模型专用 |
| AWQ | NVIDIA GPU | AWQ | 激活感知量化,精度损失小 |
| GGML | CPU/GPU | Q4_0/Q4_K/Q8_0 | llama.cpp的前身,支持广泛 |
通用工具优势:
- 跨平台兼容性好
- 开发便捷,上手快
- 社区活跃,文档丰富
- 支持多种模型格式
使用场景:
- 跨平台部署需求
- 快速原型开发
- 模型格式通用(如GGUF)
- 研发验证阶段
量化工具选择策略
性能对比(以DeepSeek-R1-Distill-Qwen-1.5B在RK3588上为例):
| RKLLM-Toolkit2 | W4A16 | 22 tokens/s | 1.2GB | NPU加速,性能最优 |
| llama.cpp (GPU) | Q4_K_M | 18 tokens/s | 2.0GB | GPU加速,通用性好 |
| llama.cpp (CPU) | Q4_K_M | 8 tokens/s | 1.5GB | CPU模式,兼容性强 |
| MNN-LLM | INT4 | 10 tokens/s | 1.8GB | 不依赖NPU,跨平台 |
选择决策树:
是否使用专用硬件(NPU/GPU)?
├─ 是 → 是否有官方专用工具?
│ ├─ 是 → 使用平台专用工具(如RKLLM、TensorRT-LLM)
│ └─ 否 → 使用通用工具(如llama.cpp、AutoGPTQ)
└─ 否 → 使用通用工具(如llama.cpp、AutoGPTQ)
是否需要跨平台部署?
├─ 是 → 使用通用工具(如TVM、ONNX Runtime)
└─ 否 → 使用平台专用工具以获得最佳性能
是否处于研发验证阶段?
├─ 是 → 使用通用工具快速验证
└─ 否 → 使用平台专用工具优化性能
量化工具使用示例
1. RKLLM-Toolkit2量化示例:
from rkllm.api import RKLLM
# 创建RKLLM对象
rkllm = RKLLM()
# 加载模型
rkllm.load_huggingface(model='Qwen/Qwen1.5-1.5B-Chat')
# 量化配置
rkllm.config(
quantized_dtype='w4a16', # 权重4位,激活16位
optimization_level=3
)
# 导出模型
rkllm.export_rkllm('qwen1.5-1.5b-w4a16.rkllm')
2. llama.cpp量化示例:
# 使用llama.cpp量化工具
./quantize /path/to/model.gguf /path/to/model-q4_k_m.gguf Q4_K_M
# 运行量化后的模型
./main -m /path/to/model-q4_k_m.gguf -p "你好" -n 512
3. AutoGPTQ量化示例:
from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig
from transformers import AutoTokenizer
# 配置量化参数
quantize_config = BaseQuantizeConfig(
bits=4, # 量化位数
group_size=128,
damp_percent=0.01,
desc_act=False,
sym=True,
true_sequential=True,
model_name_or_path="Qwen/Qwen1.5-1.5B-Chat"
)
# 加载模型
model = AutoGPTQForCausalLM.from_pretrained(
"Qwen/Qwen1.5-1.5B-Chat",
quantize_config=quantize_config
)
# 量化
model.quantize(examples)
# 保存量化模型
model.save_quantized("./qwen1.5-1.5b-gptq-4bit")
4. TensorRT-LLM量化示例:
import tensorrt_llm as trtllm
from tensorrt_llm.models import QWenForCausalLM
# 加载模型并量化
trt_model = QWenForCausalLM.from_hugging_face(
"Qwen/Qwen2.5-7B-Instruct",
dtype="float16",
quantization="INT4_AWQ" # AWQ量化
)
# 构建TensorRT引擎
engine = trt_model.to_trt()
engine.save("qwen2.5-7b-int4-awq.engine")
5. CoreML Tools量化示例:
import coremltools as ct
from transformers import AutoModelForCausalLM, AutoTokenizer
# 加载模型
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.2-3B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Llama-3.2-3B-Instruct")
# 转换为CoreML模型(INT8量化)
mlmodel = ct.convert(
model,
inputs=[ct.TensorType(shape=(1, 128), dtype=np.float32)],
minimum_deployment_target=ct.target.iOS17,
compute_precision=ct.precision.INT8
)
# 保存模型
mlmodel.save("llama-3.2-3b-int8.mlmodel")
6. OpenVINO Model Optimizer量化示例:
from optimum.intel import OVModelForCausalLM
# 加载并转换模型(INT8量化)
model = OVModelForCausalLM.from_pretrained(
"Qwen/Qwen2-7B-Instruct",
export=True,
load_in_8bit=True,
compile=True
)
# 保存转换后的模型
model.save_pretrained("./qwen2-7b-int8-openvino")
7. MindCompiler量化示例:
# 使用MindCompiler转换模型(INT8量化)
mindconverter –model ./qwen2-7b \\
–output ./qwen2-7b-mindspore \\
–quantization int8 \\
–target ascend
8. MagicMind量化示例:
from magicmind.python.runtime import Builder, Network
# 创建网络
network = Network()
# 加载模型
network.parse_from_file("./llama-3.2-3b.onnx")
# 配置量化(INT8)
config = BuilderConfig()
config.precision = "int8"
# 编译模型
builder = Builder()
model = builder.build_model(network, config)
# 保存模型
model.serialize_to_file("./llama-3.2-3b-mm")
5.3 专用工具与通用工具的关系
支持专用量化工具并不意味着不支持通用量化工具。大多数硬件平台都同时支持专用工具和通用工具,两者是互补关系,而非互斥关系。
以RK3588为例:
| 专用工具 | RKLLM-Toolkit2 | 生产环境,追求最佳性能 |
| 通用工具 | llama.cpp、MNN-LLM | 快速验证、跨平台部署 |
实际使用流程:
# 使用llama.cpp快速测试模型效果
./main -m model.gguf -p "测试问题"
# 使用RKLLM-Toolkit2量化优化
rkllm.load_huggingface(model='Qwen/Qwen1.5-1.5B-Chat')
rkllm.config(quantized_dtype='w4a16')
rkllm.export_rkllm('model.rkllm')
选择建议:
开发阶段 → 使用通用工具(llama.cpp/AutoGPTQ)
生产部署 → 使用专用工具(RKLLM/TensorRT-LLM)
跨平台需求 → 使用通用工具(llama.cpp/ONNX Runtime)
追求极致性能 → 使用专用工具
总结:专用工具和通用工具可以并存使用,你可以:
- 先用通用工具进行快速原型验证
- 再用专用工具进行性能优化
- 在同一项目中根据不同阶段和需求灵活选择
六、参考资源篇
6.1 官方文档
| RK3588 | 瑞芯微官网 |
| Jetson | NVIDIA Jetson开发者 |
| RKLLM | RKNN Toolkit GitHub |
| TensorRT-LLM | TensorRT-LLM文档 |
| Apple CoreML | CoreML官方文档 |
| Intel OpenVINO | OpenVINO官网 |
| 算能SophonSDK | SophonSDK文档 |
| 华为昇腾 | 昇腾开发者社区 |
| MindSpore | MindSpore官网 |
| 寒武纪 | 寒武纪开发者社区 |
| 高通SNPE | Qualcomm AI Developer Center |
| 联发科NeuroPilot | MediaTek Developer Center |
6.2 技术博客
6.3 工具链下载
| RKLLM-Toolkit | 网盘链接 | 提取码:rkllm |
| JetPack SDK | NVIDIA下载 | Jetson系统镜像 |
| llama.cpp | GitHub | 端侧LLM推理框架 |
| CoreML Tools | GitHub | Apple模型转换工具 |
| OpenVINO | 官网下载 | Intel推理框架 |
| SophonSDK | 官网下载 | 算能TPU开发套件 |
| MindSpore Lite | 官网下载 | 华为端侧推理引擎 |
| 寒武纪CNRT | 开发者社区 | 寒武纪运行时库 |
| Qualcomm SNPE | 官网下载 | 高通NPU推理引擎 |
| MediaTek NeuroPilot | 官网下载 | 联发科AI SDK |
七、选型建议
7.1 按场景选型
| 教育/入门学习 | Jetson Orin Nano / RK3588(4GB) | DeepSeek-R1-1.5B / Llama 3.2 1B |
| 工业视觉检测 | Jetson Orin NX / RK3588(8GB) | Qwen2.5-7B / Phi-3 Mini |
| 高端边缘计算 | Jetson AGX Orin | Qwen2.5-14B / Llama 3.3 7B |
| 低功耗IoT设备 | RISC-V K1 / ESP32-S3 | Qwen2 0.5B / TinyLlama |
| 移动端AI应用 | Apple Silicon(M2/M3) / 高通8 Gen 3 | Llama 3.2 3B / Qwen2 1.5B |
| 隐私敏感场景 | Apple Silicon / 华为昇腾Atlas | Llama 3.2 3B / Qwen2 7B |
| 国产化部署 | 华为昇腾Atlas / 算能BM1684X / 寒武纪MLU | Qwen2 7B / ChatGLM3-6B |
| 工业边缘服务器 | Intel Xeon + OpenVINO / 华为昇腾Atlas 300I | Qwen2 7B / Llama 3.3 7B |
| 智能监控 | 算能BM1684X / 华为昇腾Atlas 300V | Qwen2 7B / ViT视觉模型 |
| 端侧智能助手 | 高通8 Gen 3 / 联发科9300 / Apple A17 Pro | Llama 3.2 3B / Qwen2 1.5B |
7.2 性能与成本权衡
低成本入门 → RK3588(¥500-1500)→ 支持1.5B模型
性价比之选 → Jetson Orin Nano(¥1200-2800)→ 支持7B模型
高性能需求 → Jetson Orin NX(¥2500-5000)→ 支持14B模型
极致性能 → Jetson AGX Orin(¥30000+)→ 支持72B模型
移动端部署 → Apple M2/M3(¥6000-15000)→ 支持3B-7B模型
国产化方案 → 华为昇腾Atlas(¥5000-20000)→ 支持7B-14B模型
工业边缘 → 算能BM1684X(¥3000-8000)→ 支持7B模型
寒武纪方案 → 寒武纪MLU270(¥4000-10000)→ 支持7B模型
Intel方案 → Intel Xeon + Arc(¥8000-25000)→ 支持7B-14B模型
手机端部署 → 高通8 Gen 3(¥3000-6000)→ 支持1.5B-3B模型
本文整理了当前主流边缘AI硬件平台对大模型部署的支持情况,包括RK3588、NVIDIA Jetson系列、高通、联发科等平台,涵盖性能数据、支持模型、开发工具链、部署案例及优化策略,为大模型边缘部署提供全面参考。


