随着私有化大模型需求爆发,很多开发者会陷入两难:云端调用存在数据泄露、网络延迟、调用成本高的问题;本地 PC 显卡部署功耗高、无法适配工业现场、无人机柜等边缘场景。
国产端侧 NPU 硬件成为当下最优解,本文基于国科环宇土星云边缘计算设备完成Qwen3.5-4B 和Qwen3.6-35B-A3B大模型适配部署,经过量化、算子优化、推理引擎调优后,设备峰值跑出28 tokens/s(28 TPS) 的推理吞吐量,有效处理长文本,真正实现工业边缘本地高性能大模型落地。
本文完整记录性能测试数据,全程可复现,适合工控、智能制造、本地私有知识库、边缘 AI 网关开发人员参考。
土星云边缘设备实测Qwen3.5-4B模型
土星云边缘设备实测Qwen3.6-35B-A3B模型






