MTP在vLLM与llama.cpp上的性能对比:Qwen3.6与Gemma4实测
MTP(Multi-Token Prediction,多Token预测)是一项新兴的大模型推理优化技术。本文基于完整测...
MTP(Multi-Token Prediction,多Token预测)是一项新兴的大模型推理优化技术。本文基于完整测...
本文系统性梳理当前主流的大模型推理部署框架,包括vLLM、SGLang、TensorRT-LLM、Ollama、XInference等。随着大语言...
vLLM部署实战:从Docker镜像拉取到模型加载的完整流程(附最新镜像源推荐) 最近在折腾大模型本地推理,发现了一个绕不开的坎:部署效率。很多朋友兴致勃勃地...
声明: 纯兴趣爱好,如有疏漏敬请谅解。 源码版本: v0.21.0 学习相关源码路径: https://github.com/...
DeepSeek-OCR-2代码实例:Python调用vLLM后端Gradio前端联动开发 1. 项目概述 DeepSeek-OCR-2是De...
DeepAgents简介 这是开始构建由大型语言模型(LLM)驱动的智能体和应用程序的最简单方法,它内置了任务规划功能...
高效推理新选择:基于 SGLang 框架本地部署小米 MiMo-7B-RL 大模型实战 在当今的大模型落地应用中,如何实现高吞吐、低...
本文系统性梳理当前主流的大模型推理部署框架,包括vLLM、SGLang、TensorRT-LLM、Ollama、XInference等。随着大语言...
国产AI芯片实战:海光DCU K100-AI服务器部署DeepSeek-R1-Distill全指南 在国产化AI基础设施建设的浪潮中,海光DCU K100-A...
vLLM-v0.17.1保姆级教程:vLLM WebUI界面部署与模型管理功能详解 1. vLLM框架简介 vLLM是一个专为大型语言模型(L...