
大模型量化与部署完整指南
一、量化技术详解 1.1 什么是量化? 量化(Quantization)是将深度学习模型的权重从高精度浮点数转换为低精...

一、量化技术详解 1.1 什么是量化? 量化(Quantization)是将深度学习模型的权重从高精度浮点数转换为低精...
系列导读:上一篇讲了INT8量化的原理和校准集选择,这一篇聚焦\"量化后精度不达标怎么办\"——用 accuracy_analysi...
系列导读:上一篇打通了三大框架到 RKNN 的转换路径,过程中我们一直在用 do_quantizationTrue 做量化ÿ...
系列导读:上一篇打通了三大框架到 RKNN 的转换路径,过程中我们一直在用 do_quantizationTrue 做量化ÿ...
系列导读:上一篇打通了三大框架到 RKNN 的转换路径,过程中我们一直在用 do_quantizationTrue 做量化ÿ...
把一个近 400B 的模型塞进单卡,这事儿放在两年前还得堆 10 张 H100。如今一张 192GB 显存,理论上就能装下 NVFP4 量化后的 Qwen 3....
第一章 从两个电机故障说起:为什么TinyML不是你理解的“魔改远程监控” 那天晚上,我正盯着泰凌微的开发板调蓝牙,某工业物联网群突然有人发出灵魂拷问:“客户...

引言 在当今大语言模型(LLM)快速发展的时代,Ollama作为一款优秀的本地模型运行框架,为用户提供了便捷的模型部署和运行能力。然而,随着模型...
GLM-4.6V-Flash-WEB模型量化压缩技术实践 在如今多模态AI应用加速落地的背景下,一个现实问题日益凸显:大模型虽强...
本文由【成都无形者科技】技术团队原创,专注 DeepSeek 私有化部署与制造业 AI 落地。 1. 项目背景与痛点 最近 DeepSeek-...